¿La carrera de la ciencia de los datos está sobrecargada?
La gente ha estado delirando por la ciencia de los datos desde hace unos 10 años, desde que Harvard Business Review lo llamó el “trabajo más sexy del siglo XXI”. Me sumergí en el bombo yo mismo, razón por la cual perseguí un título en el tema hace 4 años.
Con el tiempo, sin embargo, me di cuenta de que la ciencia de los datos estaba demasiado promocionada para su propio bien. El campo es tan glamourizado que el término es lanzado alrededor por personas que no entienden realmente lo que implica.
Usted debe haber escuchado la frase “ El 85% de todos los modelos de aprendizaje automático producidos fracasarán. ” Esta fue una predicción hecha por la firma de investigación Gartner , y honestamente, no me sorprendería si el número fuera más alto. Personalmente, yo mismo he trabajado en múltiples proyectos de ciencia de datos fallidos en el pasado.
Y una inversión de ciencia de datos fallida puede incurrir en gastos masivos para las organizaciones, especialmente si una decisión de negocio incorrecta se hace basado en la salida de un algoritmo predictivo.
En este artículo, voy a destacar algunos de los principales problemas que se derivan de que hay tanta publicidad en torno a la ciencia de los datos y cómo se pueden superar.
El aprendizaje automático no es una solución única para cada problema, lo cual es necesario para que las partes interesadas y los gerentes no técnicos lo comprendan. No todos los problemas se pueden resolver con el aprendizaje automático, y no todos los problemas deben ser .
Una vez trabajé con un profesor senior (que no se especializaba en ciencias de datos) para completar mi proyecto capstone. Nuestra facultad se asoció con una empresa que quería implementar una solución de ciberseguridad en su lugar para filtrar el tráfico malicioso de entrar en el sistema.
Los datos estaban disponibles en forma de archivos de registro, que no nos enviaron suficiente de.
Lo limpiamos e intentamos construir un tablero para analizar los puntos de datos. Nuestro profesor insistió en que usamos un modelo de aprendizaje automático. Dijo que impresionaría al cliente.
Dijimos que no funcionaría. No había suficientes datos.
Él no escuchó.
Pedimos más datos.
Dijo que no era posible, y que teníamos que trabajar con lo que teníamos.
Construimos el modelo y lo presentamos, y él estaba contento con la puntuación de alta precisión que vio durante la presentación. El conjunto de datos estaba desequilibrado, así que nuestro modelo sólo estaba prediciendo una clase. Él no lo sabía. Tratamos de explicarlo, pero no parecía importarle.
Cualquier persona que ha trabajado en la industria de los datos durante más de un mes probablemente ha experimentado una situación como la anterior, aunque probablemente menos extrema.
La alta dirección, las partes interesadas y los equipos empresariales a menudo son personas que no provienen de una formación técnica. Al escuchar términos como “ ciencias de los datos ” y “ aprendizaje automático ,” sus expectativas tienden a aumentar. Corresponde al científico de los datos devolverlos a la realidad y explicar claramente la diferencia entre lo que es posible y lo que no lo es.
Lo entiendo. Puede ser tentador sugerir la construcción de un modelo de aprendizaje automático, incluso cuando no es realmente necesario. Yo también lo hago. Y muchas personas, especialmente las no técnicas, a menudo equiparan la ciencia de los datos con el aprendizaje automático.
Sin embargo, como científico de datos, no empiece a construir un algoritmo predictivo hasta que esté seguro de que el modelado de aprendizaje automático es su mejor opción.
Construir modelos de aprendizaje automático, especialmente en grandes cantidades de datos es computacionalmente pesado y puede incurrir en gastos innecesarios para la organización.
Y si el problema se puede resolver con lógica codificada o cálculos simples en una hoja de cálculo, ¿por qué perder el tiempo construyendo un modelo de aprendizaje automático?
Aquí está un ejemplo de un científico de datos que utiliza el aprendizaje automático para resolver un problema no ML:
Hiren fue contratado recientemente como científico de datos en uno de los principales bancos de la India. Construyó un algoritmo KNN para identificar los segmentos industriales más rentables en los que el banco debería centrarse. Hizo hincapié en que deberían tener como objetivo 2 de las 33 industrias de su cartera.
El resultado abatió a los miembros del equipo de negocios, ya que ya lo sabían. Fueron capaces de llegar a la misma conclusión con simples cálculos de la parte posterior de la cubierta.
Era innecesario para él perder el tiempo construyendo un modelo de aprendizaje automático que les proporcionaba exactamente los mismos resultados.
Hiren entonces decidió profundizar y aprender más sobre las necesidades del negocio, para que pudiera contribuir mejor al equipo utilizando su experiencia en ciencia de datos. Después de adquirir algunos conocimientos de dominio, se dio cuenta de que la empresa se beneficiaría de las recomendaciones a nivel del cliente en lugar de a nivel de la industria.
En lugar de simplemente decirle a la empresa a qué industrias dirigirse, él podría identificar a los clientes más rentables dentro de estas industrias. Estas eran ideas que el equipo de negocios no poseía ya, ya que era mucho más complejo para ellos derivar significado de un gran conjunto de datos a nivel de cliente.
La historia anterior nos enseña dos lecciones cruciales al intentar construir una solución de ciencia de datos:
- No utilice el aprendizaje automático si hay una solución más simple disponible.
- Sólo comience a construir modelos predictivos una vez que entienda el requisito de negocio. De lo contrario, terminarás pasando tiempo en un algoritmo elegante que nadie más usa.
Cuando la ciencia de los datos se disparó en popularidad en 2012, las empresas comenzaron a contratar en masa a científicos de datos. La mayoría de ellos no tenían una tubería de datos en su lugar, pero esperaban que los científicos de datos entraran y comenzaran a agregar valor.
El científico de datos llegó listo para comenzar a construir modelos de aprendizaje automático, y no pudo hacerlo. La compañía había invertido mucho en su equipo de ciencia de datos, de los cuales no recibían ninguna ganancia comercial.
Al decidir saltar al carro de la ciencia de los datos sólo debido al bombo, estas organizaciones perdieron una enorme cantidad de tiempo y dinero.
Los problemas sobre todo se derivan de que hay demasiada publicidad en torno a la ciencia de los datos. Los estudiantes tienden a apresurarse en el campo demasiado rápido porque quieren aprender una habilidad que es altamente demandada. Los empleadores comienzan la contratación masiva de científicos de datos sin entender completamente el papel.
Estas expectativas desalineadas provocan mucha frustración en ambas partes.
Los científicos de datos también tienen la tendencia a poner demasiado énfasis en la modelización predictiva cuando en la mayoría de los casos, un simple análisis de datos sería suficiente.
Y cuando el algoritmo de aprendizaje automático no está a la altura de las expectativas del empleador, esto de nuevo conduce a una situación de trabajo muy incómoda.
Sin embargo, si las expectativas están alineadas en todas las partes, seguir una carrera en la ciencia de los datos puede ser extremadamente valioso y satisfactorio . Si usted es alguien con habilidades de ciencia de datos, aquí hay algunos consejos para encontrar una empresa adecuada para unirse:
- Asegúrese de que la compañía tiene un equipo de datos en su lugar. Esto significa que la alfabetización de datos organizacionales es alta, y las posibilidades de que te pidan que cumplas expectativas extrañas son más bajas.
- Entrevista a tu empleador. Pregunte a su gerente de contratación sobre lo que el papel realmente implica; la cantidad de datos que la empresa tiene, cómo los datos se están almacenando en el momento, y el valor que se espera que traiga a la tabla.
" Tenga en cuenta que el consejo anterior se aplica principalmente a los científicos de datos junior. Se podría contratar a científicos, consultores o gerentes de datos para ayudar a implementar los procesos de ciencia de datos de la empresa, incluso en una etapa en la que no haya una tubería de datos estructurada. "
Una vez que consigas un trabajo en una empresa con la que te sientas cómodo, asegúrate de siempre cuestionar si el aprendizaje automático realmente es el enfoque correcto. Comprender el problema del negocio lo mejor que puedas antes de llegar a una solución, que de otro modo sería irrelevante para las partes interesadas.
Artículos Relacionados: