¿Cómo explicaría la ciencia de los datos a alguien que nunca había oído hablar del campo antes?

En los últimos años, ha habido mucha propaganda en los medios de comunicación sobre “ciencia de datos” y “Big Data”. Una primera reacción razonable a todo esto podría ser una combinación de escepticismo y confusión; de hecho, nosotros, Cathy y Rachel, tuvimos esa reacción exacta.

Y nos dejamos consentir en nuestro desconcierto por un tiempo, primero por separado, y luego, una vez que nos reunimos, juntos durante muchos desayunos matutinos del miércoles. Pero no pudimos deshacernos de la sensación de que había algo real allí, tal vez algo profundo y profundo que representa un cambio de paradigma en nuestra cultura en torno a los datos. Tal vez, consideramos, es incluso un cambio de paradigma que juega a nuestras fortalezas. En lugar de ignorarlo, decidimos explorarlo más.

Pero antes de entrar en eso, primero ahondemos en lo que nos pareció confuso y vago, tal vez usted haya tenido inclinaciones similares. Después de eso explicaremos lo que nos hizo superar nuestras propias preocupaciones, hasta el punto en que Rachel creó un curso sobre ciencia de datos en la Universidad de Columbia, Cathy blogueó el curso, y ahora estás leyendo un libro basado en él.

Vamos a sacar esto del camino a la derecha del bate, porque muchos de ustedes son probablemente escépticos de la ciencia de datos ya por muchas de las razones que fuimos. Queremos abordar esto por adelantado para hacerle saber: Estamos ahí contigo. . Si usted es un escéptico también, probablemente significa que usted tiene algo útil para contribuir a hacer de la ciencia de datos en un campo más legítimo que tiene el poder de tener un impacto positivo en la sociedad.

Entonces, ¿qué es lo que levanta las cejas sobre los Big Data y la ciencia de los datos? Contemos las maneras:

Hay una falta de definiciones en torno a la terminología más básica. ¿Qué es “Big Data” de todos modos? ¿Qué significa “ciencia de datos”? ¿Cuál es la relación entre el Big Data y la ciencia de los datos? ¿Es la ciencia de los datos la ciencia del Big Data? ¿La ciencia de los datos es sólo lo que sucede en empresas como Google y Facebook y las empresas de tecnología? ¿Por qué muchas personas se refieren a los Big Data como disciplinas de cruce (astronomía, finanzas, tecnología, etc.) y a la ciencia de los datos como sólo ocurre en la tecnología? ¿Cómo? grande ¿Es grande? ¿O es sólo un término relativo? Estos términos son tan ambiguos, que casi carecen de sentido.

Hay una clara falta de respeto por los investigadores en el mundo académico y laboratorios de la industria que han estado trabajando en este tipo de cosas durante años, y cuyo trabajo se basa en décadas (en algunos casos, siglos) de trabajo de estadísticos, científicos informáticos, matemáticos, ingenieros y científicos de todo tipo. Desde el camino de la medios de comunicación lo describe, algoritmos de aprendizaje automático fueron inventados la semana pasada y los datos nunca fueron “grandes” hasta que Google llegó. Este no es el caso. Muchos de los métodos y técnicas que estamos utilizando —y los desafíos a los que nos enfrentamos ahora— son parte de la evolución de todo lo que ha venido antes. Esto no significa que no haya cosas nuevas y emocionantes pasando, pero creemos que es importante mostrar un poco de respeto básico por todo lo que vino antes .

El bombo es una locura: la gente lanza frases cansadas directamente fuera del apogeo de la era de crisis prefinanciera como “Maestros del Universo” para describir a los científicos de datos, y eso no presagia bien. En general, el bombo enmascara la realidad y aumenta la relación ruido-señal. Cuanto más tiempo siga el bombo, más muchos de nosotros seremos desconectados por él, y más difícil será ver lo que está bien debajo de todo, si es que hay algo.

Los estadísticos ya sienten que están estudiando y trabajando en la “Ciencia de los Datos”. Ese es su pan y mantequilla. Tal vez usted, querido lector, no es un estadístico y no le importa, pero imagine que para el estadístico, esto se siente un poco como cómo el robo de identidad podría sentirse para usted. Aunque vamos a hacer el caso de que la ciencia de los datos es no sólo un cambio de imagen de las estadísticas o el aprendizaje automático, sino más bien un campo en sí mismo, los medios de comunicación a menudo describe la ciencia de los datos de una manera que lo hace sonar como si se tratase simplemente de estadísticas o aprendizaje automático en el contexto de la industria de la tecnología.

La gente nos ha dicho: “Todo lo que tiene que llamarse ciencia no lo es”. Aunque podría haber verdad allí, eso no significa que el término “ciencia de datos” a sí mismo no representa nada, pero, por supuesto, lo que representa puede no ser ciencia, sino más bien un arte.

La experiencia de Rachel pasar de obtener un doctorado en estadística a trabajar en Google es un gran ejemplo para ilustrar por qué pensamos, a pesar de las razones antes mencionadas para ser dudoso, podría haber algo de carne en el sándwich de ciencia de datos. En sus palabras:

Estaba claro para mí muy rápidamente que las cosas en las que estaba trabajando en Google eran diferentes de cualquier cosa que había aprendido en la escuela cuando recibí mi doctorado en estadística. Esto no quiere decir que mi título fuera inútil; lejos de eso, lo que había aprendido en la escuela proporcionaba un marco y una forma de pensar en la que confiaba diariamente, y gran parte del contenido actual proporcionaba una sólida base teórica y práctica necesaria para hacer mi trabajo.

Pero también había muchas habilidades que tuve que adquirir en el trabajo en Google que no lo había hecho Aprendió en la escuela. Por supuesto, mi experiencia es específica para mí en el sentido de que tenía un fondo de estadísticas y recogió más habilidades de computación, codificación y visualización, así como experiencia de dominio mientras que en Google. Otra persona que viene como un científico de la computación o un científico social o un físico tendría diferentes lagunas y los llenaría en consecuencia. Pero lo que es importante aquí es que, como individuos, cada uno tenía diferentes fortalezas y brechas, sin embargo, fuimos capaces de resolver problemas al ponernos juntos en un equipo de datos adecuado para resolver los problemas de datos que vinieron a nuestro camino.

Aquí hay una respuesta razonable que usted podría tener a esta historia. Es una verdad general que, cada vez que vas de la escuela a un trabajo real, te das cuenta de que hay una brecha entre lo que aprendiste en la escuela y lo que haces en el trabajo. En otras palabras, simplemente se enfrentaba a la diferencia entre las estadísticas académicas y las estadísticas de la industria.

Tenemos un par de respuestas a esto:

Claro, hay es una diferencia entre la industria y el mundo académico. ¿Pero realmente tiene que ser así? ¿Por qué muchos cursos en la escuela tienen que estar tan intrínsecamente fuera de contacto con la realidad?

Aun así, la brecha no representa simplemente una diferencia entre las estadísticas de la industria y las estadísticas académicas. La experiencia general de los científicos de datos es que, en su trabajo, tienen acceso a un conjunto más amplio de conocimientos y metodología , así como un proceso, que ahora definimos como el proceso de ciencias de los datos (detalles en Capítulo 2 ), que tiene bases tanto en la estadística como en la informática.

Alrededor de todo el bombo, en otras palabras, hay un anillo de verdad: es Algo nuevo. Pero al mismo tiempo, es una idea frágil y naciente que corre el riesgo real de ser rechazada prematuramente. En primer lugar, se está desfilando como una bala mágica, lo que suscita expectativas poco realistas que seguramente se sentirán decepcionadas.

Rachel dio la tarea de comprender el fenómeno cultural de la ciencia de los datos y cómo otros lo están experimentando. Comenzó a reunirse con personas en Google, en startups y empresas tecnológicas, y en universidades, principalmente de departamentos de estadística.

De esas reuniones comenzó a formar una imagen más clara de lo nuevo que está surgiendo. Finalmente decidió continuar la investigación dando un curso en Columbia llamado “Introducción a la Ciencia de Datos”, que Cathy cubrió en su blog. Pensamos que para el final del semestre, nosotros, y esperamos que los estudiantes, sabríamos lo que realmente significa todo esto. Y ahora, con este libro, esperamos hacer lo mismo por muchas más personas.

Tenemos cantidades masivas de datos sobre muchos aspectos de nuestras vidas, y, simultáneamente, una abundancia de poder informático barato. Compras, comunicación, lectura de noticias, escuchar música, buscar información, expresar nuestras opiniones, todo esto está siendo rastreado en línea, como la mayoría de la gente sabe.

Lo que la gente Es posible que no sepa que la “datificación” de nuestro comportamiento fuera de línea también ha comenzado, reflejando la revolución de la recopilación de datos en línea (más sobre esto más adelante). Junta los dos, y hay mucho que aprender sobre nuestro comportamiento y, por extensión, quiénes somos como especie.

No es sólo Sin embargo, los datos de Internet son las finanzas, la industria médica, los productos farmacéuticos, la bioinformática, el bienestar social, el gobierno, la educación, el comercio minorista y la lista continúa. Hay una creciente influencia de los datos en la mayoría de los sectores y la mayoría de las industrias. En algunos casos, la cantidad de datos recopilados podría ser suficiente para ser considerado “grande” (más sobre esto en el siguiente capítulo); en otros casos, no lo es.

Pero no es solo la masivaidad lo que hace que todos estos nuevos datos sean interesantes (o planteen desafíos). Es que los datos en sí, a menudo en tiempo real, se convierte en los bloques de construcción de los datos Productos . En Internet, esto significa Amazonia sistemas de recomendación, recomendaciones de amigos en Facebook, recomendaciones de cine y música, etc. En finanzas, esto significa calificaciones crediticias, algoritmos de negociación y modelos. En educación, esto está empezando a significar aprendizaje dinámico personalizado y evaluaciones que salen de lugares como Knewton y Khan Academy. En el gobierno, esto significa políticas basadas en datos.

Estamos presenciando el comienzo de un masivo bucle de retroalimentación culturalmente saturado donde nuestro comportamiento cambia el producto y el producto cambia nuestro comportamiento. La tecnología hace esto posible: infraestructura para el procesamiento de datos a gran escala, mayor memoria y ancho de banda, así como una aceptación cultural de la tecnología en el tejido de nuestras vidas. Esto no era cierto hace una década.

Teniendo en cuenta el impacto de este ciclo de retroalimentación, debemos empezar a pensar seriamente en cómo se está llevando a cabo, junto con las responsabilidades éticas y técnicas de las personas responsables del proceso. Un objetivo de este libro es una primera puñalada en esa conversación.

Datafication

En el Número de mayo/junio de 2013 Relaciones Exteriores Kenneth Neil Cukier y Viktor Mayer-Schoenberger escribieron un artículo llamado “El auge del Big Data” . En él discuten el concepto de datadicación, y su ejemplo es cómo cuantificamos las amistades con “me gusta”: es el camino todo lo hacemos, en línea o de otro modo, termina grabado para su posterior examen en las unidades de almacenamiento de datos de alguien. O tal vez varias unidades de almacenamiento, y tal vez también para la venta.

Ellos definen datafication como un proceso de “tomar todos los aspectos de la vida y convertirlos en datos”. Como ejemplos, mencionan que “las gafas de realidad aumentada de Google datafy la mirada. Twitter datafies pensamientos desviados. LinkedIn datafies redes profesionales.”

La datadicación es un concepto interesante y nos llevó a considerar su importancia con respecto a las intenciones de las personas de compartir sus propios datos. Estamos siendo datafied, o más bien nuestras acciones son, y cuando “nos gusta” alguien o algo en línea, estamos pretendiendo ser datafied, o al menos deberíamos esperar serlo. Pero cuando simplemente navegamos por la Web, estamos involuntariamente, o al menos pasivamente, siendo datafied a través de cookies que podríamos o no ser conscientes de. Y cuando caminamos en una tienda, o incluso en la calle, estamos siendo datafied de una manera completamente involuntaria, a través de sensores, cámaras o gafas de Google.

Este espectro de intencionalidad abarca desde que participamos alegremente en un experimento en las redes sociales del que estamos orgullosos, hasta la vigilancia y el acecho. Pero todo es datafication. Nuestras intenciones pueden correr la gama, pero los resultados no.

Siguen su definición en el artículo con una línea que habla mucho sobre su perspectiva:

Una vez que nos datafy cosas, podemos transformar su propósito y convertir la información en nuevas formas de valor.

He aquí una pregunta importante a la que volveremos en todo el libro: ¿quién es “nosotros” en ese caso? ¿Qué tipo de valor ¿Se refieren a? Principalmente, dados sus ejemplos, el “nosotros” es los modelistas y emprendedores que ganan dinero al hacer que la gente compre cosas, y el “valor” se traduce en algo como una mayor eficiencia a través de la automatización.

Si queremos pensar más grande, si queremos que nuestro “nosotros” nos refieramos a la gente en general, estaremos nadando contra la marea.

Entonces, ¿qué es la ciencia de los datos? ¿Es nuevo, o es sólo estadística o analítica rebautizada? ¿Es real, o es pura propaganda? Y si es nuevo y si es real, ¿qué significa eso?

Este es un proceso en curso. discusión, pero una manera de entender lo que está pasando en esta industria es mirar en línea y ver lo que las discusiones actuales están teniendo lugar. Esto no nos dice necesariamente qué es la ciencia de los datos, pero al menos nos dice lo que otras personas piensan que es, o cómo lo están percibiendo. Por ejemplo, en Quora hay una discusión de 2010 sobre “¿Qué es la ciencia de datos?” y aquí Respuesta del CEO de Metamarket Mike Driscoll :

La ciencia de los datos, como se practica, es una mezcla de hacking alimentado por Red-Bull y estadísticas inspiradas en el expreso.

Pero la ciencia de los datos no se limita a hackear, porque cuando los hackers terminan de depurar sus guiones de Bash One-lines y Pig, a pocos de ellos les importan las métricas de distancia no euclidianas.

Y la ciencia de los datos no es meramente estadística, porque cuando los estadísticos terminan de teorizar el modelo perfecto, pocos podrían leer un archivo delimitado por pestañas en R si su trabajo dependiera de ello.

La ciencia de los datos es la ingeniería civil de los datos. Sus acólitos poseen un conocimiento práctico de herramientas y materiales, junto con una comprensión teórica de lo que es posible.

Pero espera, ¿la ciencia de los datos es sólo una bolsa de trucos? ¿O es la extensión lógica de otros campos como la estadística y el aprendizaje automático?

Por uno. argumento, ver los posts de Cosma Shalizi aquí y aquí , y los puestos de Cathy aquí y aquí , que constituyen una discusión continua de la diferencia entre un estadístico y un científico de datos. Cosma argumenta básicamente que cualquier departamento de estadística que vale la pena su sal hace todo el material en las descripciones de la ciencia de los datos que él ve, y por lo tanto la ciencia de los datos es sólo una remarcación y adquisición no deseada de las estadísticas.

Por un poco diferente perspectiva, ver ASA Presidente Nancy Geller 2011 Amstat News artículo, “No evites la palabra ‘S’” , en la que defiende las estadísticas:

Tenemos que decirle a la gente que los Estadísticos son los que tienen sentido del diluvio de datos que ocurre en la ciencia, la ingeniería y la medicina; que las estadísticas proporcionan métodos para el análisis de datos en todos los campos, desde la historia del arte hasta la zoología; que es emocionante ser un Estadístico en el siglo XXI debido a los muchos desafíos causados por la explosión de datos en todos estos campos.

Aunque entendemos su punto de vista —la frase “historia del arte a la zoología” se supone que representa el concepto de A a Z— ella se dispara a sí misma en el pie con estos ejemplos porque no corresponden al mundo de alta tecnología de donde viene gran parte de la explosión de datos. Gran parte del desarrollo del campo está ocurriendo en la industria, no en el mundo académico. Es decir, hay personas con el título de trabajo científico de datos en las empresas, pero no profesores de ciencia de datos en el mundo académico. (Aunque esto puede estar cambiando.)

No mucho. hace, DJ Patil descrita cómo él y Jeff Hammerbacher —entonces en LinkedIn y Facebook, respectivamente—coinó el término “científico de datos” en 2008. Así es cuando el “científico de datos” surgió como un título de trabajo. (Wikipedia finalmente obtuvo una entrada en ciencia de datos en 2012.)

Hace sentido para nosotros que una vez que el conjunto de habilidades necesarias para prosperar en Google —trabajando con un equipo en problemas que requerían un conjunto híbrido de habilidades estadísticas y ciencias de la computación emparejadas con características personales, incluyendo curiosidad y persistencia— se extendió a otras compañías de tecnología de Silicon Valley, requirió un nuevo título de trabajo. Una vez que se convirtió en un patrón, merecía un nombre. Y una vez que consiguió un nombre, todos y su madre querían ser uno. Se puso aún peor cuando Harvard Business Review científico de datos declarado ser el “El trabajo más sexy del siglo XXI” .

El papel del científico social en la ciencia de los datos

Tanto LinkedIn como Facebook son empresas de redes sociales. A menudo una descripción o definición de científico de datos incluye estadístico híbrido, ingeniero de software y científico social. Esto tenía sentido en el contexto de las empresas en las que el producto era social producto y todavía tiene sentido cuando estamos tratando con el comportamiento humano o del usuario. Pero si usted piensa en el diagrama de Drew Conway Venn, los problemas de ciencia de datos cruzan las disciplinas, a eso se refiere la experiencia sustantiva.

En otras palabras, depende del contexto de los problemas que estás tratando de resolver. Si son problemas de ciencias sociales como recomendaciones de amigos o personas que conoces o segmentación de usuarios, entonces por todos los medios, ¡traiga al científico social! Los científicos sociales también tienden a ser buenos interrogadores y tienen otras buenas cualidades de investigación, por lo que un científico social que también tiene los cortes cuantitativos y de programación hace un gran científico de datos.

Pero es casi un artefacto “histórico” (histórico está entre comillas porque 2008 no es hace mucho tiempo) para limitar su concepción de un científico de datos a alguien que trabaja sólo con datos de comportamiento de usuario en línea. Hay otro campo emergente por ahí llamado ciencias sociales computacionales, que podría ser considerado como un subconjunto de ciencia de datos.

Pero podemos volver. Incluso más lejos. En 2001, William Cleveland escribió un posición acerca de la ciencia de los datos llamada “Ciencia de los datos: un plan de acción para ampliar el campo de la estadística”.

¿Así que la ciencia de los datos existía antes de los científicos de datos? ¿Es esto semántica, o tiene sentido?

Todo esto plantea algunas preguntas: ¿puede definir la ciencia de los datos por lo que los científicos de datos @info: tooltip ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ¿Quién puede definir el campo, de todos modos? Hay un montón de zumbido ¿Los medios de comunicación pueden definirlo, o deberíamos confiar en los practicantes, los científicos de datos autodesignados? ¿O hay alguna autoridad real? Dejemos estas preguntas como preguntas abiertas por ahora, aunque volveremos a ellas en todo el libro.

Y aquí hay una cosa que notamos sobre la mayoría de las descripciones de trabajo: piden a los científicos de datos que sean expertos en informática, estadística, comunicación, visualización de datos, y tener una amplia experiencia en el ámbito. Nadie es un experto en todo, por lo que tiene más sentido crear equipos de personas que tengan diferentes perfiles y diferentes conocimientos, juntos, como equipo, pueden especializarse en todas esas cosas. Hablaremos más de esto después de examinar el conjunto compuesto de habilidades en la demanda de los científicos de datos de hoy en día.

En la clase, Rachel repartió tarjetas de índice y pidió a todos que se perfilaran a sí mismos (en una escala relativa en lugar de absoluta) con respecto a sus niveles de habilidad en los siguientes dominios:

Figura 1-2. El perfil científico de datos de Rachel, que creó para ilustrar tratando de visualizarse a sí misma como científica de datos; quería que los estudiantes y los profesores invitados “se burlaran” de esto: agregar cubos o eliminar habilidades, utilizar una escala o método de visualización diferente, y pensar en los inconvenientes de la auto-reportación

Grabamos las tarjetas de índice a la pizarra y llegamos a ver cómo todos los demás pensaban en sí mismos. Hubo bastante variación, lo cual es genial: muchas personas de la clase venían de las ciencias sociales, por ejemplo.

¿Dónde está tu perfil de ciencia de datos en este momento, y dónde te gustaría que estuviera en unos meses, o años?

Como hemos mencionado antes, un equipo de ciencia de datos funciona mejor cuando diferentes habilidades (perfiles) están representados entre diferentes personas, porque nadie es bueno en todo. Nos hace preguntarnos si podría ser más útil definir un “equipo de ciencia de datos”—como se muestra en Figura 1-3 —que definir a un científico de datos.

Figura 1-3. Los perfiles del equipo de ciencia de datos pueden ser construidos a partir de perfiles científicos de datos; debe haber alineación entre el perfil del equipo de ciencia de datos y el perfil de los problemas de datos que tratan de resolver

Cada clase tenía al menos un experimento de pensamiento que los estudiantes debatidas en grupos. La mayoría de los experimentos de pensamiento eran muy abiertos, y la intención era provocar discusiones sobre una amplia variedad de temas relacionados con la ciencia de datos. Para la primera clase, el experimento inicial del pensamiento fue: ¿Podemos utilizar la ciencia de datos para definir la ciencia de datos?

La clase se dividió en pequeños grupos para pensar y discutir esta cuestión. He aquí algunas cosas interesantes que surgieron de esas conversaciones:

Podríamos hacerlo. a Google busca “ciencia de datos” y realiza un modelo de extracción de texto. Pero eso dependería de que fuéramos un Usagist en lugar de un prescriptist con respecto al idioma. Un usagista permitiría a las masas definir la ciencia de los datos (donde “las masas” se refiere a lo que sea que el motor de búsqueda de Google encuentra). ¿Sería mejor ser un prescriptor y referirse a una autoridad como la Oxford English Dictionary ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ Por desgracia, la OED probablemente no tiene una entrada todavía, y no tenemos tiempo para esperar por ella. Concordemos en que hay un espectro, que una autoridad no se siente bien, y que “las masas” tampoco.

¿Qué tal miramos a los profesionales de la ciencia de los datos y vemos cómo ellos describir lo que hacen (tal vez en una palabra nube para empezar)? Entonces podemos ver cómo las personas que dicen ser otras cosas como estadísticos o físicos o economistas describen lo que hacen. A partir de ahí, podemos tratar de utilizar un algoritmo de agrupamiento (que vamos a utilizar en Capítulo 3 ) o algún otro modelo y ver si, cuando se obtiene como entrada “las cosas que alguien hace,” da una buena predicción sobre el campo en el que esa persona está.

Figura 1-4. La agrupación y visualización de los subcampos de la ciencia de los datos de Harlan Harris Análisis de los analizadores (O’Reilly) de Harlan Harris, Sean Murphy y Marck Vaisman basado en una encuesta de varios cientos de profesionales de la ciencia de datos a mediados de 2012

Tal vez el enfoque más concreto es definir la ciencia de los datos es por su uso, por ejemplo, lo que los científicos de datos reciben por hacer. Con eso como motivación, describiremos lo que hacen los científicos de datos. Y vamos a engañar un poco al hablar primero sobre los científicos de datos en el mundo académico.

En la Academia

La realidad es que en la actualidad, nadie se llama científico de datos en el mundo académico, excepto tomar un título secundario por ser parte de un “instituto de ciencia de datos” en una universidad, o por solicitar una subvención que suministra dinero para la investigación en ciencia de datos.

En su lugar, vamos a hacer una pregunta relacionada: ¿quién en el mundo académico planea llegar a ser ¿Un científico de datos? Había 60 estudiantes en la clase de Introducción a la Ciencia de Datos en Columbia. Cuando Rachel propuso el curso, asumió que la composición de los estudiantes sería principalmente estadísticos, matemáticos aplicados, y científicos informáticos. En realidad, sin embargo, terminó siendo esa gente más sociólogos, periodistas, científicos políticos, estudiantes de informática biomédica, estudiantes de agencias gubernamentales de Nueva York y organizaciones sin fines de lucro relacionadas con el bienestar social, alguien de la escuela de arquitectura, otros de ingeniería ambiental, matemáticos puros, estudiantes de marketing de negocios, y estudiantes que ya trabajaban como científicos de datos. Todos estaban interesados en encontrar formas de resolver problemas importantes, a menudo de valor social, con datos.

Para que el término “ciencia de datos” pueda adquirirse en el mundo académico a nivel de la facultad, y como título primario, el área de investigación debe definirse de manera más formal. Note que ya hay un rico conjunto de problemas que podrían traducirse en muchas tesis de doctorado.

Aquí hay una puñalada en lo que esto podría parecer: un científico de datos académico es un científico, entrenado en cualquier cosa, desde ciencias sociales hasta biología, que trabaja con grandes cantidades de datos, y debe lidiar con problemas computacionales planteados por la estructura, tamaño, desorden, y la complejidad y la naturaleza de los datos, mientras que al mismo tiempo la solución de un problema del mundo real.

El caso para articularlo así es el siguiente: a través de las disciplinas académicas, los problemas computacionales y de datos profundos tienen mayores similitudes. Si los investigadores de todos los departamentos unen fuerzas, pueden resolver múltiples problemas del mundo real desde diferentes dominios.

En la industria

¿Qué aspecto tienen los científicos de datos en la industria? Depende del nivel de antigüedad y si se habla de la industria de Internet/online en particular. El papel del científico de datos no tiene que ser exclusivo del mundo de la tecnología, pero ahí es donde se originó el término; así que para los propósitos de la conversación, digamos lo que significa allí.

Un científico jefe de datos debe establecer la estrategia de datos de la empresa, que implica una variedad de cosas: configurar todo, desde la ingeniería y la infraestructura para recopilar datos y registrar, a preocupaciones de privacidad, a la decisión de qué datos estarán orientados al usuario, cómo se van a utilizar los datos para tomar decisiones, y cómo se va a incorporar de nuevo en el producto. Ella debe manejar un equipo de ingenieros, científicos , y los analistas y deben comunicarse con el liderazgo de toda la empresa, incluyendo el CEO, CTO, y el liderazgo de productos. También se preocupará por patentar soluciones innovadoras y establecer objetivos de investigación.

De manera más general, un científico de datos es alguien que sabe cómo extraer significado e interpretar datos, lo que requiere tanto herramientas y métodos de la estadística y el aprendizaje automático, así como ser humano. Ella pasa mucho tiempo en el proceso de recopilar, limpiar y munging datos, porque los datos nunca están limpios. Este proceso requiere persistencia, estadísticas y habilidades de ingeniería de software—habilidades que también son necesarias para entender los sesgos en los datos, y para depurar la salida de registro de código.

Una vez que ella consigue los datos en forma, una parte crucial es el análisis de datos exploratorios, que combina visualización y sentido de los datos. Encontrará patrones, modelos de construcción y algoritmos, algunos con la intención de entender el uso del producto y la salud general del producto, y otros para servir como prototipos que finalmente se vuelven a hornear en el producto. Ella puede diseñar experimentos, y ella es una parte crítica de la toma de decisiones basada en datos. Se comunicará con los miembros del equipo, ingenieros y líderes en un lenguaje claro y con visualizaciones de datos para que incluso si sus colegas no están inmersos en los datos mismos, entiendan las implicaciones.

Esa es la imagen de alto nivel, y este libro se trata de ayudarle a entender la gran mayoría de ella. Hemos terminado con hablando acerca de la ciencia de los datos; vamos a seguir y @info: tooltip ¡Un poco!

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +