¿Puede todo el mundo ser un científico de datos?
El campo de datos es bastante competitivo, y su escenario está compuesto por candidatos inexpertos y salarios que son demasiado altos; además, aquellos candidatos que en realidad eran buenas opciones para nuestro equipo estaban buscando convertirse en científicos de datos. Desde entonces, cada vez que hablo de Esto, yo digo:
La verdad es que para ser un verdadero talento científico de datos Tienes que ser tan fantástico siendo todo el mundo sigue hablando de: alguien que tiene habilidades de hackeo, conocimientos de matemáticas y estadísticas, y dominio de los negocios. Un verdadero ¡Unicornio!
Los Unicornios no nacen unicornios
Sí, los unicornios existen. Los verdaderos talentos de la ciencia de los datos existen. Las personas que dominan todo lo necesario para impactar el negocio mediante el uso de datos, desde la concepción de la cuestión del negocio hasta la entrega del modelo de producción, sí existen. Pero no empezaron sus carreras así. Simplemente no es posible reunir suficiente experiencia para desempeñar un papel tan complejo después de sólo unos pocos años de carrera.
Estudiar duro, dedicación, tomar cursos en línea sobre todo tipo de algoritmos y técnicas parece ser la estrategia estándar para convertirse en un unicornio. Pero la verdad es que se necesita mucho más que eso para llegar a ser relevante en la solución de problemas reales. Usted necesita experiencia, y sólo puede obtener experiencia con el tiempo y el trabajo.
En ella “ La ciencia de los datos es diferente ahora ", Vicki Boykis, un científico de datos desde 2012, dice que el mercado de trabajo actual está lleno de candidatos para puestos de trabajo junior en la ciencia de datos, la competencia puede ser de hasta 100 candidatos para un puesto de trabajo. Ella aconseja a aquellos que desean convertirse en científicos de datos que utilicen el siguiente plan de carrera:
1. No dispares por un trabajo de ciencia de datos 2. Esté preparado para la mayoría de su trabajo científico de datos para no ser ciencia de datos. Ajusta tus habilidades para eso.
... el número de Se estima que las posiciones en ciencias de los datos son de 50k. El número de puestos de ingeniería de datos es de 500k . El número de analistas de datos es de 125k.
Es mucho más fácil entrar en una carrera de ciencia y tecnología de datos a través de la “puerta trasera”...
Y esa es exactamente la realidad que vemos en las aplicaciones a las posiciones de Creditas Data Scientist y Data Engineering. Las posiciones DS reciben muchas más aplicaciones, mientras que tenemos muchas más posiciones DE abiertas.
Ya no necesitamos unicornios, queremos caballos de carreras.
Aunque los unicornios son extremadamente valiosos para nuestros equipos, entendemos que esta no es la mejor manera de trabajar. Los tiempos han cambiado. Creditas ahora desea especializar sus equipos de Ciencia e Ingeniería de Datos. De esta manera, podemos mejorar la eficiencia de ambos equipos.
Es un hecho bien conocido que 70 a 80 % o más del tiempo pasado por los científicos de datos es en realidad sólo en la preparación de los datos. Esta es una tarea que es claramente responsabilidad de un Ingeniero de Datos.
Otros ejemplos son la organización de datos en el lago de datos, los rastreadores para la captura de datos o el despliegue y embalaje de los modelos generados (una posición hoy más conocida como ingeniero de aprendizaje automático ).
No necesitamos unicornios capaces de resolver problemas por sí solos porque ese modelo no es sostenible ni escalable. Lo que más necesitamos hoy en día son ingenieros de datos que puedan crear infraestructuras que maximicen la cantidad de tiempo que los científicos de datos pueden centrarse en el análisis de datos y la formación de modelos.
La relación entre Ingeniería de Datos y Ciencia de Datos
Ingeniería de Datos es la parte de la Ciencia de Datos centrada principalmente en infraestructura tecnológica y analítica , con el fin de recopilar, organizar y permitir los análisis necesarios. Para explicar mejor esto, he creado una nueva versión del diagrama de Venn para las habilidades necesarias para un científico de datos, dividiendo “hacking skills” en “programación” y “base de datos” , que son específicos y presentes en la rutina de Ingeniería de Datos.
Cuando miramos el diagrama, vemos que la única habilidad no utilizada en Ingeniería de Datos es la matemática y la estadística. Lo que hacemos todos los días es codificar tuberías para mover, preparar y transformar datos; buscando democratizar el acceso a datos dentro de la organización de manera simple e instintiva.
Como dije antes, la necesidad de acelerar la entrega requiere que nuestros equipos sean especializados, y la uso de las matemáticas y los modelos estadísticos se han convertido en un Bueno... límite definido entre las responsabilidades de DE y DS; y es probable que se trate de una tendencia para el mercado en su conjunto.
Además, para ser justos, hay que señalar que un Ingeniero de Datos no es un Científico de Datos que no conoce las matemáticas; esto no es una cuestión de calificación, sino de especialización. El ingeniero de datos se centra en la infraestructura para que el científico de datos pueda centrarse en la investigación y la modelización. Un buen equipo de ingeniería de datos desbloquea la productividad de toda la empresa en el uso de datos, incluyendo, obviamente, el equipo de ciencia de datos. (Este párrafo fue sugerido por Jéssika Darambaris , ¡gracias!)
¡Bien! Ahora, ¿puedes explicar un poco más sobre lo que hiciste en Ingeniería de Datos?
En resumen, todo lo relacionado con programas que manipulan bases de datos (crear, migrar, transformar, convertir, etc.)), como por ejemplo, pero no exclusivamente:
- construcción de tuberías de datos (pitón, flujo de aire, chispa, pandas);
- los rastreadores para la captura de datos (scrapy);
- ingestión de datos por streaming (kafka);
- construcción y organización de lagos de datos (S3, Athena);
- modelización y construcción del almacén de datos (modelo de kymball, Redshift);
- Implementación de modelos de ciencia de datos;
En la lista anterior, las tecnologías entre paréntesis son las que usamos aquí en Creditas.
Perfiles que queremos para nuestro equipo de Ingeniería de Datos
Los profesionales de diferentes orígenes pueden ser valiosos para nuestro equipo de muchas maneras, y los más comunes son:
- Los desarrolladores de programas informáticos interesados en los datos y el procesamiento distribuido;
- Analistas de datos y BI con conocimiento e interés en la programación;
- d) Los bancos de desarrollo con conocimientos e interés en la programación;
- Ingenieros de datos experimentados;
- Profesionales que desean convertirse en científicos de datos un día y quieren comenzar su carrera trabajando con Data Engineering. ...........................................................................................................................
Si este artículo le parece interesante y desea solicitar un puesto de trabajo en nuestro equipo de Ingeniería de Datos, haga clic aquí .
Artículos Relacionados: