Jerarquía de las necesidades en materia de ciencia de los datos
La jerarquía de las necesidades de Maslow
Como científicos de datos a menudo buscamos ideas en otras disciplinas para resolver nuestros problemas. Hoy, estamos viendo un concepto interesante que tomamos prestado de la psicología: la Jerarquía de las Necesidades de Maslow (1943). Lo que se reduce a es lo siguiente:
“Alcanzar todo tu potencial es sólo posible si usted tiene sus necesidades básicas cubiertas primero.” # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # #
La tradicional jerarquía de las necesidades de la ciencia de los datos
Hace unos años, Monica Rogati publicó un post en hackernoon (2017) haciendo una bonita analogía entre La jerarquía de las necesidades de Maslow y la ciencia de los datos. Antes de que pueda hacer cualquier IA o aprendizaje profundo, será mejor que se ocupe primero de la alfabetización de datos, la recopilación de datos y la infraestructura. Esto dio origen a la Jerarquía de las Necesidades de la Ciencia de los Datos:
Como todos sabemos, los algoritmos de IA requieren ejemplos de los que aprender. No seríamos capaces de hacer mucho entrenamiento de IA sin los datos recopilados del pasado. Eso nos lleva al nivel más bajo de la jerarquía que es adquisición de datos . Ya sean datos del cliente, datos abiertos o externos, datos generados a partir de sensores o dispositivos IoT, la recopilación consistente de datos es una necesidad. En la parte superior, una rica variedad de fuentes de datos densas con las que jugar es literalmente el sueño de cada científico de datos. Sin embargo, a medida que nos obsesionamos con ejecutar experimentos confiables, reproducibles y escalables rápidamente, tener accesibilidad de datos sin fricción no parece una mala idea.
Ahí es donde entra en juego nuestra segunda capa: Ingeniería de datos . La ingeniería de datos consiste en procesar, almacenar y exponer datos históricos en tiempo real de manera eficiente. Es una tarea desalentadora establecer tuberías de datos escalables y construir infraestructuras de macrodatos robustas y eficaces. Aún más si lo desea completamente automatizado a través de código (DevOps). Estas son las cosas de las que se ocupan nuestros muy buscados colegas de ingeniería de datos. Los flujos de datos bien orquestados y las interfaces de datos amigables simplifican nuestras subsiguientes tareas de ciencia de datos por orden de magnitud.
Las etapas posteriores de la jerarquía forman la columna vertebral para entrenar con éxito modelos de IA. Pueden agruparse en ciencias de los datos . Comenzamos con EDA (análisis exploratorio de datos): evaluar la pertinencia de las fuentes de datos accesibles, definir el objetivo, averiguar cómo se relacionan las diversas características entre sí y establecer un modelo de referencia. Esto nos ayudará a verificar la viabilidad de nuestro enfoque de solución mientras fallamos rápidamente. Preferiblemente, sólo después de haber recopilado esta retroalimentación, deberíamos centrarnos en la preparación y modelado de datos más avanzados. Esto abarca extensas discusiones de datos, inteligente partición de datos, ingeniería de características complejas, diseños de experimentos elaborados, y la construcción elegante de la arquitectura de modelos. Todo esto, para que podamos decir que estamos haciendo IA y aprendizaje profundo, ¿verdad?
Las piezas que faltan
Una base de datos sólida es vital para el proceso de maduración de la IA. Sin embargo, faltan algunas cosas en el marco actual.
En primer lugar, demos un paso atrás y veamos la jerarquía con la meta final en mente. ¿Estamos realmente alcanzando todo nuestro potencial como empresa si estamos haciendo IA y aprendizaje profundo? ¿Ese es realmente el final de todo? La tecnología en sí nunca es la solución: es simplemente un medio para un fin, no un fin en sí mismo. Por lo tanto, tenemos que preguntarnos: ¿qué estamos realmente tratando de lograr usando IA? Nuestro objetivo es automatizar los procesos de negocio y tomar decisiones críticas informadas más rápido. Al hacerlo, queremos que nuestros sistemas de IA sean impactantes y ofrezcan valor comercial. Esto es algo que no se refleja en los niveles más altos del marco actual.
En segundo lugar, Maslow describió inicialmente en su Jerarquía de las necesidades que sólo se puede mover hacia arriba a través de las diversas etapas consecutivas después de que los anteriores están completamente satisfechos. En la ciencia de los datos, ese no es el caso. Podemos cosechar el valor de pequeños experimentos de IA sin tener la mejor arquitectura de datos o infraestructura en su lugar. Algunas empresas quieren iniciar su viaje de datos con un POC centrado en los niveles superiores. Desde el punto de vista de los negocios, esto tiene sentido. Como la mayoría del valor de negocio tangente reside en la parte superior de la Jerarquía. Además, tener una comprensión más profunda de los trabajos de nivel superior reducirá el conocimiento al resto de la organización sobre cómo diseñar mejor los niveles de datos más bajos. Está perfectamente bien usar a Maslow como inspiración, pero no tenemos que copiar este principio de jerarquía. Además, la mayoría de la gente ya visualiza el Jerarquía de las necesidades como una pirámide en lugar de una jerarquía. En la parte superior, cuando avanzamos para construir un MVP, cortamos esta pirámide verticalmente. Lo que significa que sólo construimos la funcionalidad mínima requerida para cada capa, lo que nos permite iterar y recoger retroalimentación más rápido.
Por último, la pirámide necesita un buen terreno para mantenerse en pie. Es evidente que cuando iniciamos un nuevo proyecto de ciencia de datos, comenzamos por entender el problema que estamos tratando de resolver y comprender el contexto empresarial que lo rodea. Tratamos de hacer las preguntas correctas, definir los objetivos de negocio y determinar los criterios de éxito relevantes. Luego trazamos el curso de acción y sólo después de eso, empezamos a desarrollar cosas. Deberíamos aplicar el mismo principio a nivel organizativo cuando empecemos a construir nuestra pirámide. Lo que falta en el marco actual es una IA y estrategia de datos .
Hacia una Pirámide de Necesidades de AI más completa
Tenemos una expresión en nuestra empresa en cuanto a ventas y financiación: “el dinero sólo es real cuando llega a las cuentas”. Lo mismo se aplica a la IA, siendo real sólo cuando se despliega. Se trata de crear valor de negocio a través del despliegue y asegurarse de que IA sigue ofreciendo valor de negocio a través de la observabilidad. Y al hacerlo, hacer que IA sea confiable y confiable. Debemos actualizar nuestra pirámide para incluir esos dos niveles y cambiar nuestro enfoque en generar valor de negocio con IA, en lugar de simplemente hacer IA.
En nuestra nueva Pirámide de las Necesidades de AI, Observabilidad de la IA reside en la cima, cumpliendo el papel de protector vigilante. Jeff Bezos probablemente estaría de acuerdo en tratar cada día de ser desplegado como “primer día” ya que según él: “El segundo día es la estasis. Seguida por la irrelevancia. Seguida por una declinación insoportable y dolorosa. Seguida por la muerte”. Describiendo con bastante precisión algoritmos de IA que se vuelven locos debido a la falta de supervisión. No olvidemos que los modelos de IA son piezas frágiles de software. No es raro verlos perder el 20% de su valor en los primeros 6 meses de despliegue. Mientras que, si no se monitoriza correctamente, falla completamente en silencio. Una buena pila de observabilidad detecta y alerta la deriva de datos, gestiona la salud del aprendizaje automático y rastrea el impacto del negocio. Mantener esto bajo control le ayudará a prevenir, exponer y manejar correctamente defectos algorítmicos en la producción.
Sin embargo, no se trata sólo de la vigilancia del rendimiento. Comprender cómo, por qué y cuándo están cambiando los datos, las decisiones empresariales y los modelos de IA permite comprender fundamentalmente lo que está sucediendo sobre el terreno. De esta manera cerramos un importante bucle en el ciclo de vida de la ciencia de datos: el de la comprensión empresarial. En otras palabras, el sofisticado monitoreo de IA nos permite extraer información de negocios.
El despliegue de modelos de IA se ha vuelto significativamente más estandarizado en los últimos años con el aumento de MLOps. Que aplica las mejores prácticas de DevOps y Software Engineering a un contexto de aprendizaje automático en un esfuerzo por aumentar la eficiencia. Sin embargo, Despliegue de IA es muy merecedor de su lugar en la pirámide. Como literalmente no hay creación de valor empresarial sin poner en funcionamiento modelos de aprendizaje automático en la producción. Además, el servicio escalable de modelos, la gestión del ciclo de vida del modelo, las soluciones de IA de prueba A/B, CI/CD y el entrenamiento continuo (CT) no son triviales.
# # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # #
Para evitar que los modelos de aprendizaje automático fallen silenciosamente, hemos construido una herramienta de monitoreo de código abierto. Compruebe nuestro GitHub y apóyanos si te parece útil.
# # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # # #
Conclusión
Una sólida base de datos y una sólida estrategia de IA y datos son absolutamente necesarios para aprovechar el valor comercial con IA a escala. Sin embargo, ¿necesitan ser completamente exhibidos desde el principio? Por supuesto que no. Podemos empezar pequeños y construir nuestra pirámide a medida que avanzamos, o cortarla verticalmente y tomarla desde allí. Al final del día, lo más importante es que durante nuestro viaje de datos nos centramos en el objetivo final correcto, que es aprovechar la IA para generar valor de negocio. Y para que eso suceda, necesitamos desplegar nuestra IA y tenerla adecuadamente monitoreada. Nuestra nueva Pirámide de Necesidades de AI refleja estas ideas, y nos permite concentrarnos en ejecutar la mejor estrategia de negocio para hacer frente a nuestros flujos de datos siempre cambiantes.
Artículos Relacionados: