¿Qué datos científicos pasan la mayor parte del tiempo haciendo?
De acuerdo con el Harvard Business Review , un científico de datos tiene el trabajo más sexy del siglo XXI. En el mundo del big data, adoptan métodos de IA/aprendizaje profundo y descubren insights empresariales invaluables.
Para mí, tener eso “ científico de datos ” título de trabajo durante los últimos cinco años, todavía no he descubierto completamente qué parte de mí es sexy. Excepto tal vez mi cabello recién permeado que me hace parecer un Oppa coreano ( normalmente se utiliza para referirse al drama coreano protagonista masculino ).
De hecho, la aparición de la nube y el movimiento de las empresas a Internet ha permitido una explosión de datos. Esto ha impulsado la demanda y la escasez de científicos de datos en algunos sectores.
Pero, ¿qué implica un trabajo de científicos de datos en el día a día?
Podemos encontrar nuestra respuesta a esta pregunta analizando las publicaciones de trabajo en LinkedIn. Permítanme resumir los populares para usted:
- experimentar e investigar nuevas tecnologías y métodos para mejorar las capacidades técnicas
Estos suenan sexy, ¿no?
A menos que su trabajo consiste en trabajar en conjuntos de datos de Kaggle, estas descripciones de trabajo son sólo una pequeña parte de ser un científico de datos.
Los siguientes resultados de la encuesta de CrowdFlower resumen un día típico para un científico de datos:
Como se puede ver en el gráfico anterior, la mayor parte del tiempo de un científico de datos es en la recopilación de conjuntos de datos y la limpieza y organización de datos.
Los lagos de datos son repositorios centralizados que almacenan todos los datos de la empresa. Permiten a las organizaciones utilizar esos datos para construir modelos de aprendizaje automático y tableros de instrumentos. Desafortunadamente, algunas personas asumen que los lagos de datos son campos de dumping de datos — o un disco duro súper grande.
Muchas organizaciones comenzaron a implementar lagos de datos sin una idea clara de qué hacer con los datos recopilados. “............................................................................................................... Vamos a recoger todo “, dijeron. Mientras que el punto de un lago de datos es tener todos los datos de la empresa en un solo lugar, sigue siendo vital para diseñarlo con necesidades específicas de proyectos . No planificar es casi como crear un nuevo “ Carpeta sin título ” y luego copiar y pegar la totalidad de los datos de la empresa allí.
Históricamente, la mala planificación ha dado lugar a poco o ningún metadatos bien definidos, lo que ha hecho difícil que alguien busque (y encuentre) los datos que necesita. Los científicos de datos a menudo se encuentran en contacto con diferentes departamentos para obtener datos. Es posible que tengan que buscar información sobre los datos de una variedad de propietarios de datos. Simplemente almacenar datos sin catalogarlos es un gran error. Los clave para tener un lago de datos útil es asegurarse de que los metadatos están bien definidos .
Debido a la gobernanza de los datos o a la ocupación de los propietarios de datos, que a menudo son partes interesadas de diferentes departamentos, puede tomar semanas para obtener datos vitales. Después del juego de espera, los científicos de datos podrían terminar encontrando que los datos no son relevantes o tienen problemas de calidad graves.
Cuando los científicos de datos finalmente ponen sus manos en los datos, necesitan pasar mucho tiempo explorándolos y familiarizándose con ellos. Tienen que reorganizar ese pedazo desordenado de datos en nuevas tablas que se ajusten a sus necesidades de proyecto.
Todos los que se ocupan de los datos deberían haber oído hablar del término “ datos sucios” . Los datos sucios quitan la integridad del conjunto de datos. Algunas características de los datos sucios son incompleto , inexacto , inconsistente y duplicados datos.
Datos incompletos es cuando algunas características esenciales están vacías. Por ejemplo, digamos que su tarea es predecir los precios de la vivienda . Asumamos que el “ área de la casa ” es fundamental para hacer una buena predicción, pero falta. Eso podría ser un reto para usted y su modelo podría no funcionar bien.
Datos inexactos e incoherentes es cuando los valores son técnicamente correctos, pero incorrectos en función del contexto. Por ejemplo, cuando un empleado cambió su dirección, y no se actualizó. O cuando hay muchas copias de los datos y el científico de datos tiene una versión anticuada.
Duplicar los datos es un problema común. Permítanme compartir con ustedes una historia que me ha pasado mientras trabajaba en una empresa de comercio electrónico. Por diseño, cuando un visitante hizo clic en un “ Recaudación de vales ” botón, el sitio web envió una respuesta al servidor. Esto nos permitió medir el número de usuarios que han recogido vales.
El sitio estaba funcionando bien, hasta que un día algo ha cambiado y yo no lo sabía. El desarrollador de frontend añadió otra respuesta para cuando alguien recopiló los vales con éxito. La razón era que algunos vales podían estar agotados. Querían rastrear a los visitantes que hicieron clic en el botón y a los que han recogido los vales.
En ese momento, se enviaron dos respuestas a la misma tabla de registro. Mirando mi herramienta de reporte, ¡el número de vales recogidos parecía haberse duplicado de la noche a la mañana! Como había desplegado un modelo el día anterior, asumí que mi nuevo modelo era tan impresionante. Recuerdo haberle dado una ovación mental a mi pequeña modelo, pero más tarde, me di cuenta de que era solo un doble conteo.
Además, en los últimos cinco años como científico de datos, algunos de los datos que he recibido son entradas manuales por parte del personal corporativo. Estos datos están en hojas de cálculo Excel; muchos son inexactos, incompletos e inconsistentes.
Si los datos provienen de entradas humanas manuales o registros de máquinas, forcejeo de datos es una gran parte de lo que sucede en el mundo real . Los científicos de datos tienen que lidiar con ello. Para que el aprendizaje supervisado funcione, necesitamos datos fiables y etiquetados. No se puede construir un modelo predictivo a menos que los datos estén correctamente etiquetados. Pero a nadie le gustan los datos de etiquetado.
Muchos describen esto como el Regla 80/20 . Los científicos de datos dedican solo el 20 por ciento de su tiempo a construir modelos y el 80 por ciento restante a recopilar, analizar, limpiar y reorganizar datos. Los datos sucios son el aspecto más lento del trabajo típico de los científicos de datos.
Es necesario señalar que limpieza de datos es increíblemente esencial ; datos desordenados no producirán buenos resultados. Usted podría haber oído la frase, “ basura dentro, basura fuera ”.
Los científicos de datos hacen descubrimientos mientras nadan en los datos, pero antes de que los científicos de datos puedan comenzar a entrenar cualquier modelo, primero deben convertirse en conserjes de datos. Los datos necesitan limpieza, los datos necesitan etiquetado.
Artículos Relacionados: