¿Cuánto dura la ciencia de los datos?
En la próxima década, el papel del científico de datos como lo conocemos se verá muy diferente al de hoy. Pero no te preocupes, nadie está prediciendo trabajos perdidos, sólo cambiado trabajos.
Los científicos de datos estarán bien — de acuerdo con la Oficina de Estadísticas Laborales, el papel sigue siendo se proyecta que crezca en un clip superior a la media hasta 2029. Pero los avances en tecnología serán el impulso para un gran cambio en las responsabilidades de un científico de datos y en la forma en que las empresas se aproximan a la analítica en su conjunto. Y Herramientas AutoML , que ayudan a automatizar la tubería de aprendizaje automático de datos brutos a un modelo utilizable, conducirá esta revolución.
En 10 años, los científicos de datos tendrán conjuntos completamente diferentes de habilidades y herramientas, pero su función seguirá siendo la misma: servir como guías tecnológicas seguras y competentes que puedan dar sentido a datos complejos para resolver problemas empresariales.
AutoML democratiza la ciencia de los datos
Hasta hace poco, algoritmos de aprendizaje automático y los procesos eran casi exclusivamente el dominio de los roles más tradicionales de la ciencia de los datos, los que tenían educación formal y títulos avanzados, o trabajaban para grandes corporaciones tecnológicas. Los científicos de datos han desempeñado un papel invaluable en cada parte del espectro de desarrollo del aprendizaje automático. Pero con el tiempo, su papel se volverá más colaborativo y estratégico. Con herramientas como AutoML para automatizar algunas de sus habilidades más académicas, los científicos de datos pueden enfocarse en guiar a las organizaciones hacia soluciones a problemas empresariales a través de datos.
En muchos sentidos, esto se debe a que AutoML democratiza el esfuerzo de poner en práctica el aprendizaje automático. Los vendedores de startups a hiperescaladores en la nube han lanzado soluciones lo suficientemente fáciles para que los desarrolladores las usen y experimenten sin una gran barrera educativa o experiencial para la entrada. De manera similar, algunas aplicaciones de AutoML son intuitivas y lo suficientemente simples como para que los trabajadores no técnicos puedan probar sus manos para crear soluciones a problemas en sus propios departamentos, creando una especie de “científico de datos ciudadanos” dentro de las organizaciones.
Para explorar las posibilidades de desbloquear este tipo de herramientas tanto para desarrolladores como para científicos de datos, primero tenemos que entender el estado actual de la ciencia de datos en lo que se refiere al desarrollo del aprendizaje automático. Es más fácil de entender cuando se coloca en una escala de madurez.
Organizaciones y empresas más pequeñas con funciones más tradicionales a cargo de la transformación digital (es decir, no científicos de datos de formación clásica) típicamente caen en este extremo de esta escala. En este momento, son los mayores clientes para las aplicaciones de aprendizaje automático fuera de la caja, que están más orientados hacia un público desconocido con las complejidades del aprendizaje automático.
- Pros: Estas aplicaciones llave en mano tienden a ser fáciles de implementar, y relativamente baratas y fáciles de implementar. Para las empresas más pequeñas con un proceso muy específico para automatizar o mejorar, es probable que haya varias opciones viables en el mercado. La baja barrera a la entrada hace que estas aplicaciones perfectas para los científicos de datos vadeando en el aprendizaje automático por primera vez. Debido a que algunas de las aplicaciones son tan intuitivas, incluso permiten a los empleados no técnicos la oportunidad de experimentar con la automatización y capacidades avanzadas de datos, introduciendo potencialmente una valiosa caja de arena en una organización.
- Contras: Esta clase de aplicaciones de aprendizaje automático es notoriamente inflexible. Aunque pueden ser fáciles de implementar, no son fáciles de personalizar. Como tal, ciertos niveles de precisión pueden ser imposibles para ciertas aplicaciones. Además, estas aplicaciones pueden verse gravemente limitadas por su dependencia de modelos y datos previamente entrenados.
Ejemplos de estas aplicaciones incluyen Amazon Comprehend, Amazon Lex y Amazon Forecast de Amazon Web Services y Azure Speech Services y Azure Language Understanding (LUIS) de Microsoft Azure. Estas herramientas suelen ser suficientes para que los científicos de datos puedan dar los primeros pasos en el aprendizaje automático e introducir a sus organizaciones en el espectro de madurez.
- Pros: Las aplicaciones AutoML permiten ejecutar más experimentos con datos en un espacio más amplio. Pero la verdadera superpotencia de AutoML es la accesibilidad: las configuraciones personalizadas se pueden construir y las entradas se pueden refinar con relativa facilidad. Lo que es más, AutoML no se hace exclusivamente con los científicos de datos como una audiencia. Los desarrolladores también pueden jugar fácilmente dentro de la caja de arena para traer elementos de aprendizaje automático a sus propios productos o proyectos.
- Contras: Si bien se acerca, las limitaciones de AutoML significan precisión en las salidas será difícil de perfeccionar. Debido a esto, los científicos que llevan tarjetas con datos suelen mirar hacia abajo sobre las aplicaciones construidas con la ayuda de AutoML, incluso si el resultado es lo suficientemente preciso como para resolver el problema que nos ocupa.
Ejemplos de estas aplicaciones incluyen: Amazon SageMaker AutoPilot o Google Cloud AutoML . Los científicos de datos de una década a partir de ahora sin duda tendrán que estar familiarizados con herramientas como estas. Al igual que un desarrollador que es competente en varios lenguajes de programación, los científicos de datos tendrán que tener competencia con múltiples entornos AutoML para ser considerados talentos superiores.
Soluciones de aprendizaje automático “laminadas a mano” y hechas en casa
Las empresas más grandes a escala empresarial y las compañías Fortune 500 están donde se están desarrollando la mayoría de las aplicaciones de aprendizaje automático avanzadas y patentadas. Los científicos de datos de estas organizaciones forman parte de grandes equipos que perfeccionan algoritmos de aprendizaje automático utilizando troves de datos históricos de la empresa, y construyen estas aplicaciones desde cero. Aplicaciones personalizadas como estas sólo son posibles con recursos y talento considerables, por lo que la rentabilidad y los riesgos son tan grandes.
- Pros: Como cualquier aplicación construida desde cero, el aprendizaje automático personalizado es “el estado de la técnica” y se construye sobre la base de una comprensión profunda del problema en cuestión. También es más preciso, aunque sólo sea por pequeños márgenes, que AutoML y las soluciones de aprendizaje automático fuera de la caja.
- Contras: Conseguir una aplicación de aprendizaje automático personalizada para alcanzar ciertos umbrales de precisión puede ser extremadamente difícil, y a menudo requiere el levantamiento pesado por equipos de científicos de datos. Además, las opciones de aprendizaje automático personalizadas son las más prolongadas y costosas de desarrollar.
Un ejemplo de una solución de aprendizaje automático laminado a mano es comenzar con un cuaderno Jupyter en blanco, importar manualmente datos, y luego realizar cada paso del análisis de datos exploratorios a través de ajuste de modelos a mano. Esto se logra a menudo escribiendo código personalizado utilizando marcos de aprendizaje automático de código abierto, tales como Scikit-learn , TensorFlow , PyTorch , y muchos otros. Este enfoque requiere un alto grado de experiencia e intuición, pero puede producir resultados que a menudo superan a los servicios de aprendizaje automático llave en mano y AutoML.
Herramientas como AutoML cambiarán los roles y responsabilidades de la ciencia de datos en los próximos 10 años. AutoML asume la carga de desarrollar el aprendizaje automático desde cero de los científicos de datos, y en su lugar pone las posibilidades de la tecnología de aprendizaje automático directamente en manos de otros solucionadores de problemas. Con el tiempo libre para centrarse en lo que ellos saben —los datos y los insumos mismos— los científicos de datos dentro de una década servirán como guías aún más valiosas para sus organizaciones.
Eric Miller se desempeña como director senior de estrategia técnica en Rackspace , donde proporciona liderazgo de consultoría estratégica con un historial probado de construcción de prácticas en el ecosistema Amazon Partner Network (APN). Un líder tecnológico con 20 años de éxito demostrado en TI empresarial, Eric ha liderado varias iniciativas de arquitectura de soluciones y AWS, incluyendo el Programa de Socios de Evaluación de Marco Bien Architecido (WAF), Amazon EC2 para Windows Server AWS Service Delivery Program, y una amplia gama de reescrituras de AWS para organizaciones multimillonarias.
—
Artículos Relacionados: