¿Es el científico de datos un trabajo flexible?
Hace diez años, los autores postularon que ser un científico de datos era el “trabajo más sexy del siglo XXI”. Una década más tarde, ¿se levanta la demanda? El trabajo ha crecido en popularidad y es generalmente bien pagado, y se proyecta que el campo experimentará más crecimiento que casi cualquier otro para 2029. Pero el trabajo ha cambiado, tanto en grandes como en pequeños aspectos. Se ha institucionalizado mejor, se ha redefinido el alcance del trabajo, la tecnología en la que se basa ha dado grandes pasos y ha aumentado la importancia de la experiencia no técnica, como la ética y la gestión del cambio. La forma en que opera en las empresas —y cómo los ejecutivos necesitan pensar en la gestión de los esfuerzos de ciencia de datos— también ha cambiado, ya que las empresas ahora necesitan crear y supervisar diversos equipos de ciencia de datos en lugar de buscar unicornios científicos de datos. Por último, las empresas tienen que pensar en lo que viene a continuación, y cómo pueden empezar a pensar en la democratización de la ciencia de los datos.
Hace diez años publicamos el artículo “ Data Scientist: El trabajo más sexy de los 21 st Siglo La mayoría de los lectores casuales probablemente recuerden sólo el modificador “más sexy” — un comentario sobre su demanda en el mercado. El papel era relativamente nuevo en ese momento, pero a medida que más empresas intentaban dar sentido al big data, se dieron cuenta de que necesitaban personas que pudieran combinar habilidades de programación, análisis y experimentación. En ese momento, esa demanda se restringía en gran medida al Área de la Bahía de San Francisco y a algunas otras ciudades costeras. Startups y las empresas de tecnología en esas áreas parecían querer todos los científicos de datos que podían contratar. Sentimos que la necesidad se expandiría a medida que las principales empresas abrazaran tanto análisis de negocios como nuevas formas y volúmenes de datos.
En ese momento, definimos al científico de datos como “un profesional de alto nivel con la formación y la curiosidad para hacer descubrimientos en el mundo del big data”. Las empresas estaban empezando a analizar datos voluminosos y menos estructurados como las secuencias de clics en línea, las redes sociales y las imágenes y el habla. Debido a que todavía no había una trayectoria profesional bien definida para las personas que podían programar y analizar esos datos, los científicos de datos tenían diversos antecedentes educativos. La calificación más común en nuestra encuesta informal de 35 científicos de datos en ese momento fue un doctorado en física experimental, pero también encontramos astrónomos, psicólogos y meteorólogos. La mayoría tenía doctorados en algún campo científico, eran excepcionales en matemáticas, y sabían cómo codificar. Dada la ausencia de herramientas y procesos en ese momento para desempeñar sus funciones, también eran buenos en la experimentación y la invención. No es que un doctorado en ciencias fuera realmente necesario para hacer el trabajo, sino que estos individuos tenían la rara capacidad de desbloquear el potencial de los datos, vadeando a través de conjuntos de datos complejos y desordenados y construir algoritmos de recomendación.
Una década más tarde, el trabajo está más demandado que nunca con los empleadores y reclutadores. La IA es cada vez más popular en los negocios, y las empresas de todos los tamaños y ubicaciones sienten que necesitan científicos de datos para desarrollar modelos de IA. En 2019, las publicaciones para los científicos de datos en aumento del 256%, y la Oficina de Estadísticas Laborales de EE.UU., predice que la ciencia de los datos verá más crecimiento que casi cualquier otro campo entre ahora y 2029. El trabajo buscado se paga generalmente bastante bien; el salario medio para un científico de datos experimentado en California se acerca a $200,000.
Muchos de los mismos dolores de cabeza permanecen, también. En nuestra investigación para el artículo original, muchos científicos de datos señalaron que dedican gran parte de su tiempo a la limpieza y forcejeo de datos, y eso sigue siendo el caso a pesar de algunos avances en el uso de la propia IA para mejoras en la gestión de datos. Además, muchas organizaciones no tienen culturas basadas en datos y no aprovechar los conocimientos proporcionados por los científicos de datos. Ser contratado y bien pagado no significa que los científicos de datos serán capaces de hacer una diferencia para sus empleadores. Como resultado, muchos se sienten frustrados, lo que lleva a un alto volumen de negocios.
Aun así, el trabajo ha cambiado, tanto en grandes como en pequeños aspectos. Se ha institucionalizado mejor, se ha redefinido su alcance, la tecnología en la que se basa ha dado grandes pasos y ha aumentado la importancia de la experiencia no técnica, como la ética y la gestión del cambio. Los muchos ejecutivos que reconocen que la ciencia de datos es importante para sus negocios ahora necesitan crear y supervisar diversos equipos de ciencia de datos en lugar de buscar unicornios científicos de datos. También pueden empezar a pensar en la democratización de la ciencia de los datos, aún con la ayuda de los científicos de datos, sin embargo.
Mejor institucionalización
En 2012, la ciencia de los datos fue una función incipiente incluso en startups orientadas a la IA. Hoy en día está bastante bien establecido, al menos en las empresas con un gran compromiso con los datos y la IA. Bancos, compañías de seguros, minoristas e incluso proveedores de atención médica, e incluso agencias gubernamentales tienen importantes grupos de ciencia de datos; las grandes empresas de servicios financieros pueden tener cientos de científicos de datos. La ciencia de los datos también ha sido eficaz para hacer frente a las crisis sociales, contar y predecir los casos y muertes de Covid-19, ayudar a hacer frente a los desastres meteorológicos, e incluso luchar contra la desinformación y los ciberhacks relacionados con la invasión de Ucrania.
Un factor importante que ha facilitado la institucionalización ha sido el aumento de las ofertas educativas orientadas a la ciencia de los datos. En 2012, efectivamente no había programas de grado en ciencias de datos; los científicos de datos fueron reclutados de otros campos de orientación cuantitativa. Ahora hay cientos de programas de grado en la ciencia de los datos o los campos relacionados de la analítica y la IA. La mayoría son máster programas, pero también hay licenciaturas y programas de doctorado en ciencias de datos. También hay un enorme número de certificados, ofertas de cursos en línea, y campos de arranque en campos relacionados con la ciencia de datos. Incluso hay escuela secundaria cursos y programas de ciencias de los datos. Está claro que cualquier persona que desee ser entrenado en capacidades de ciencia de datos tendrá un montón de opciones para hacerlo. Sin embargo, es poco probable que un solo programa pueda inculcar todas las habilidades necesarias para concebir, construir e implementar análisis, experimentos y modelos de ciencia de datos eficaces y éticos. De hecho, dar sentido a las diversas opciones educativas, incluso en una sola institución, es un reto para los futuros científicos de datos y para las empresas que desean emplearlos.
Científicos de datos en relación con otros papeles
El papel de la ciencia de los datos también se complementa ahora con una variedad de otros puestos de trabajo. El supuesto en 2012 era que los científicos de datos podían hacer todas las tareas necesarias en una aplicación de ciencia de datos, desde conceptualizar el caso de uso hasta interactuar con las partes interesadas de las empresas y la tecnología, hasta desarrollar el algoritmo y ponerlo en producción. Ahora, sin embargo, ha habido una proliferación de trabajos relacionados para manejar muchas de esas tareas, incluyendo ingeniero de aprendizaje automático, ingeniero de datos, especialista en IA, análisis y traductores de IA, y gerentes de productos orientados a los datos. LinkedIn informó que algunos de estos trabajos son más populares que los científicos de datos en su “ Los puestos de trabajo en ascenso ” informa para 2021 y 2022 para los Estados Unidos.
Parte de la proliferación se debe al hecho de que ningún titular de un solo trabajo puede poseer todas las habilidades necesarias para implementar con éxito un complejo sistema de inteligencia artificial o de análisis. Hay un reconocimiento creciente de que muchos algoritmos son nunca desplegados , lo que ha llevado a muchas organizaciones a tratar de mejorar las tasas de despliegue. Además, los problemas que plantea la gestión del aumento de los sistemas y tecnologías de datos han dado lugar a un entorno técnico más complejo. Ha habido algunos intentos de certificación de los científicos de datos y puestos de trabajo conexos, pero éstos todavía no son ampliamente buscados o reconocidos. Algunas empresas, como TD Bank , han desarrollado estructuras de clasificación para las muchas carreras y habilidades relacionadas con la ciencia de datos, pero estas no son lo suficientemente comunes en las organizaciones.
Como resultado de esta proliferación de habilidades, las empresas necesitan identificar todas las diferentes funciones necesarias para implementar eficazmente modelos de ciencia de datos en sus negocios, y asegurarse de que están presentes y colaborando en equipos.
Cambios en la tecnología
Una razón por la que el trabajo científico de datos sigue cambiando es porque las tecnologías que utilizan los científicos de datos están cambiando. Algunas tendencias tecnológicas son la continuación de las direcciones presentes en 2012, como el uso de herramientas de código abierto y el paso al procesamiento basado en la nube y el almacenamiento de datos. Pero algunos afectan el núcleo del trabajo de la ciencia de los datos. Por ejemplo, algunos aspectos de la ciencia de los datos son cada vez más automatizados (utilizando el aprendizaje automático automático o AutoML ), que puede mejorar la productividad de los profesionales de la ciencia de los datos y abrir la posibilidad de “científicos de datos ciudadanos” con sólo cierta formación cuantitativa. Estas herramientas automatizadas no han atenuado el atractivo de los científicos de datos profesionales todavía, pero pueden en el futuro.
Las empresas deben comenzar a democratizar el análisis avanzado y la IA dentro de sus organizaciones, confiando en los científicos de datos para asegurar que los modelos desarrollados por los ciudadanos sean exactos y que se empleen todos los datos relevantes.
Los científicos de datos se han dado cuenta de que sus modelos pueden “gotear” en entornos empresariales turbulentos como la pandemia de Covid-19, por lo que hay un nuevo énfasis en monitorear su precisión después del despliegue. Las operaciones de aprendizaje automático, o “MLOps”, herramientas proporcionan monitoreo continuo de los modelos; readiestramiento automatizado de los modelos a la deriva apenas está empezando a ser empleado. Algunos AutoML y MLOps herramientas incluso prueba de sesgo algorítmico.
Estos avances significan que la codificación, que tal vez era el requisito de trabajo más común cuando escribimos hace una década, es algo menos esencial en la ciencia de los datos. Ha migrado a otros puestos de trabajo o se está automatizando cada vez más. (Sin embargo, la limpieza de datos es una excepción notable a esta tendencia.) El principal objetivo de la labor sigue siendo la elaboración de modelos predictivos y la capacidad de traducir en modelos las cuestiones y los requisitos de las empresas. Se trata de actividades de colaboración, pero lamentablemente todavía no existen grandes herramientas para estructurar y apoyar las actividades de colaboración en materia de ciencia de datos.
La ética de la ciencia de los datos
Un cambio importante en la ciencia de los datos en la última década es que la necesidad de dimensión ética al campo es ahora ampliamente reconocido, aunque el tema fue raramente mencionado en 2012. El punto de inflexión para la ética de la ciencia de los datos fue probablemente la elección presidencial de EE.UU. 2016, en la que los científicos de datos en las redes sociales ( Cambridge Analytica y Facebook en particular ) intento de influir en los votantes y polarizó aún más la política electoral. Desde entonces, se ha dedicado considerable atención a cuestiones de sesgo algorítmico, transparencia y uso responsable de análisis e IA.
Algunas empresas ya han establecido grupos y procesos de IA responsables. Una función clave de ellos es educar a los científicos de datos sobre las cuestiones relacionadas con la IA ética. Y hay un aumento de la regulación que se está instituyendo en respuesta a fallos éticos.
...
Hemos visto tanto la continuidad como el cambio en el papel de la ciencia de los datos. Ha tenido un éxito notable de muchas maneras, y algunos de sus desafíos —la proliferación de funciones conexas, la necesidad de una perspectiva ética— resultan en parte de la adopción generalizada de la ciencia de los datos. La cantidad de datos, análisis y IA en los negocios y la sociedad parece poco probable que disminuya, por lo que el trabajo de los científicos de datos sólo continuará creciendo en su importancia en el panorama empresarial.
Sin embargo, también seguirá cambiando. Esperamos ver una diferenciación continua de responsabilidades y roles que una vez cayeron dentro de la categoría de científicos de datos. Las empresas necesitarán procesos detallados de clasificación y certificación de aptitudes para estos diversos puestos de trabajo, y deben asegurarse de que todas las funciones necesarias estén presentes en proyectos de ciencia de datos a gran escala. Los propios científicos de datos profesionales se centrarán en la innovación algorítmica, pero también tendrán que ser responsables de asegurar que los aficionados no se metan sobre sus cabezas. Lo que es más importante, los científicos de datos deben contribuir a la recopilación adecuada de datos, el análisis responsable, los modelos plenamente desplegados y los resultados empresariales satisfactorios.
Artículos Relacionados: