¿Qué hace un científico de datos en IBM?

Echa un vistazo a todas las sesiones bajo demanda de la Cumbre de Seguridad Inteligente aquí .

Los buscadores de empleo a veces preguntan cómo IBM define “científico de datos”. Es una pregunta importante ya que más y más científicos de datos potenciales están luchando por la atención en un cada vez más lucrativo El mercado laboral.

El primer paso es distinguir entre lo que vemos como científicos de datos verdaderos y otros profesionales que trabajan en roles adyacentes (por ejemplo, ingenieros de datos, analistas de negocios y desarrolladores de aplicaciones de IA). Para hacer esa distinción, primero definamos lo que entendemos por ciencia de datos.

En su esencia, la ciencia de los datos está aplicando el método científico para resolver problemas empresariales.

Usted puede ampliar aún más la definición al entender que resolvemos esos problemas de negocio usando inteligencia artificial para crear predicciones y recetas y optimizar procesos.

Acontecimiento

La definición demuestra que para alcanzar el verdadero potencial de la ciencia de datos, necesitamos científicos de datos con experiencias y habilidades muy particulares; específicamente, necesitamos personas con las experiencias y habilidades necesarias para ejecutar y completar proyectos de ciencia de datos:

1. Formación como científico, con una maestría o un doctorado 2. Experiencia en machine learning y estadística, con énfasis en la optimización de decisiones 3. Experiencia en R, Python o Scala 4. Capacidad de transformar y gestionar grandes conjuntos de datos 5. Capacidad probada para aplicar las habilidades anteriores a los problemas de negocios del mundo real 6. Capacidad de evaluar el rendimiento del modelo y ajustarlo en consecuencia

Veamos esas calificaciones en el contexto de nuestra definición de ciencia de datos.

1. Formación como científico, con un Máster en Ciencias o Doctorado

Esto es menos sobre el grado en sí mismo y más sobre lo que aprendes cuando obtienes un grado avanzado. En resumen, se aprende el método científico, que comienza con la capacidad de tomar un problema complejo pero abstracto y dividirlo en un conjunto de hipótesis probables. Esto continúa con lo bien que diseñas experimentos para probar tus hipótesis, y cómo analizas los resultados para ver si las hipótesis están confirmadas o contradichas. Una persona determinada puede aprender estas habilidades fuera de la academia o a través de la combinación correcta de formación y práctica en línea — así que hay cierta flexibilidad en torno a tener el grado real — pero la experiencia directa de aplicar el método científico es una necesidad.

Otra ventaja de un grado avanzado es el rigor del proceso de revisión por pares y los requisitos de publicación que los programas de grado imparten. Para ser publicados, los candidatos tienen que presentar su trabajo de una manera que permita a otros revisarlo y reproducirlo. También debe proporcionar pruebas de que los resultados son válidos y los métodos son sólidos. Hacer esto requiere una comprensión profunda de la diferencia entre factores probabilísticos y deterministas, así como el valor y la maldición de la correlación. Es posible obtener un sentido abstracto de esos valores, pero no hay sustituto para el refuerzo negativo y positivo de los mentores o el rechazo o aceptación de revistas y reseñas.

2. Experiencia en machine learning y estadística, con énfasis en la optimización de decisiones

La aplicación del método científico a los problemas empresariales nos permite tomar mejores decisiones prediciendo lo que sucederá a continuación. Esas predicciones son el producto de la inteligencia artificial y más específicamente el aprendizaje automático. Para un verdadero científico de datos, las competencias técnicas básicas del aprendizaje automático y las estadísticas son simplemente no negociables.

Además, la optimización de decisiones (también conocida como investigación de operaciones) es un aspecto de rápido crecimiento de la ciencia de los datos. De hecho, el objetivo de la ciencia de los datos es ayudar a tomar mejores decisiones al estimar probabilísticamente lo que es probable que ocurra en el futuro. Aplicando cuidadosamente la optimización de decisiones permite a los científicos de datos prescribir o determinar la siguiente mejor acción para el mejor resultado de negocio.

3. Experiencia en R, Python o Scala

Ser un científico de datos no requiere que usted sea tan bueno en la programación como los desarrolladores profesionales, pero la capacidad de crear y ejecutar código que apoya el proceso de ciencia de datos es obligatoria, y eso incluye la capacidad de utilizar paquetes de aprendizaje automático y estadístico en uno de los lenguajes populares de ciencia de datos.

Python, R, y Scala son los lenguajes de más rápido crecimiento para la ciencia de datos, junto con Julia, otro lenguaje próximo en el espacio, aunque Julia todavía no está completamente madura. Como Python, R, y Scala, el núcleo de Julia es de código abierto. Pero es importante tener en cuenta que la razón para usar estos idiomas no es que sean libres, sino por la innovación y la libertad de llevarlos a donde quieras ir.

4. Capacidad de transformar y gestionar grandes conjuntos de datos

La cuarta habilidad a veces se llama big data. Aquí, la capacidad de utilizar marcos de procesamiento de datos distribuidos como Apache Spark es clave. El verdadero científico de datos sabrá cómo reunir conjuntos de datos de múltiples fuentes y múltiples tipos de datos con la ayuda de su equipo de ciencia de datos. Los datos en sí pueden ser una combinación de datos estructurados, semiestructurados y no estructurados que viven en múltiples nubes.

El proceso de gestión de datos consiste en encontrar y recoger los datos, explorar los datos, transformar los datos, identificar las características (elementos de datos importantes en la predicción), diseñar las características y hacer que los datos sean accesibles al modelo para la formación. Una prioridad para cualquier científico de datos será la racionalización de este proceso, que fácilmente puede consumir hasta el 80 por ciento de su tiempo.

5. Capacidad probada para aplicar las habilidades anteriores a los problemas de negocios del mundo real

Quinto en la lista es un conjunto de habilidades suaves. Es la capacidad de comunicarse con científicos no-datos con el fin de asegurarse de que los equipos de ciencia de datos tienen los recursos de datos que necesitan y que están aplicando la ciencia de datos a los problemas de negocios adecuados. Dominar esta habilidad también significa asegurar que los resultados de los proyectos de ciencia de datos —por ejemplo, las predicciones sobre la evolución probable del negocio— sean plenamente entendidos y procesables por los empresarios. Esto requiere buenas habilidades de narración, y en particular, la capacidad de mapear conceptos matemáticos al sentido común.

6. Capacidad de evaluar el rendimiento del modelo y ajustarlo en consecuencia

Para algunos, este sexto conjunto de competencias es un aspecto del segundo conjunto de competencias: la experiencia en el aprendizaje automático en general. Queríamos llamarlo por separado porque, con demasiada frecuencia, es lo que distingue a un buen científico de datos de uno peligroso. Los científicos de datos que carecen de esta habilidad pueden creer fácilmente que han creado e implementado modelos eficaces cuando, de hecho, sus modelos están mal adaptados a los datos de entrenamiento disponibles.

Ser un verdadero científico de datos

Si quieres ser un verdadero científico de datos —en lugar de un aspirante a científico de datos o un científico de datos en título solamente— te animamos a dominar cada una de estas seis competencias. Un científico de datos es fundamentalmente diferente de un analista de negocios o analista de datos, que a menudo sirven como propietarios de productos en equipos de ciencia de datos, con el importante papel de proporcionar conocimientos temáticos a los propios científicos de datos.

Eso no quiere decir que los analistas de negocios, los analistas de datos y otros no puedan pasar a ser verdaderos científicos de datos, sino que entiendan que toma tiempo, compromiso, tutoría y aplicación una y otra vez a problemas reales y difíciles.

Seth Dobrin es vicepresidente y director de datos de IBM Analytics.

Jean-François Puget es un distinguido ingeniero de IBM en aprendizaje automático y optimización.

Misión de VentureBeat va a ser una plaza urbana digital para que los responsables técnicos de la toma de decisiones adquieran conocimientos sobre la tecnología y la transacción de las empresas transformadoras. Descubra nuestras reuniones informativas.

Cumbre de Seguridad Inteligente en Demanda

¿Te perdiste una sesión en Intelligent Security Summit? Diríjase a la biblioteca bajo demanda para escuchar información de expertos y aprender la importancia de la ciberseguridad en su organización.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +