¿Cuáles son los pasos en un ciclo de vida de la ciencia de datos?

A ciclo de vida de la ciencia de datos es un conjunto iterativo de pasos de ciencia de datos que usted toma para entregar un proyecto o análisis. Debido a que cada proyecto y equipo de ciencia de datos son diferentes, cada ciclo de vida específico de ciencia de datos es diferente. Sin embargo, la mayoría de los proyectos de ciencia de datos tienden a fluir a través del mismo ciclo de vida general de los pasos de la ciencia de datos.

Un ciclo de vida de la ciencia de datos generales

Algunos ciclos de vida de la ciencia de datos se centran estrictamente en los pasos de datos, modelado y evaluación. Otros son más completos y comienzan con la comprensión de negocios y terminan con el despliegue.

Y la que vamos a recorrer es aún más extensa para incluir las operaciones. También enfatiza la agilidad más que otros ciclos de vida.

Este ciclo de vida tiene cinco pasos:

  • Definición del problema
  • Investigación y limpieza de datos
  • Modelo mínimo viable
  • Despliegue y mejoras
  • Operaciones de ciencia de datos

Estos no son pasos de ciencia de datos lineales. Comenzarás con el paso uno y luego procederás al paso dos. Sin embargo, desde allí, usted debe fluir naturalmente entre los pasos según sea necesario.

Varios pequeños pasos iterativos son mejores que unas pocas fases más amplias.

Tenga en cuenta que el ciclo de vida se centra en los pasos del proyecto. Para obtener una visión más amplia que incorpore un marco de colaboración, véase la proceso de ciencias de los datos .

Estudio de caso del ciclo vital de la ciencia de los datos en ACME

Con la ayuda de nuestros amigos de ACME, Inc, vamos a ilustrar cómo un proyecto hipotético progresa a través del ciclo de vida de la ciencia de datos en texto púrpura.

Imagínese que usted es el Director del Centro de Excelencia de Ciencia de Datos de ACME, Inc., una gran empresa de fabricación de yunques. Un Director de Recursos Humanos pregunta si usted puede ayudar a reducir los crecientes costos de contratación de la compañía.

Veamos si puedes. Pero primero, definamos el problema.

Capacitación en el ciclo vital de la ciencia de los datos

¿Buscando aprender acerca de los ciclos de vida de la ciencia de datos en mayor profundidad? ¿Y cómo puede aplicarlos y marcos de colaboración ágiles para ofrecer resultados eficaces en ciencia de datos? Echa un vistazo a la Jefe del equipo de ciencia de datos curso o seguir leyendo para una visión general de alto nivel...

I. Definición del problema

¿Qué realiza esta fase?

Al igual que cualquier buen negocio o ciclo de vida centrado en TI, un buen ciclo de vida de la ciencia de datos comienza con “por qué”. Si usted está preguntando “¿Por qué empezar con por qué?” (bueno para usted), a continuación, lea el punto superior en Cómo dirigir equipos de ciencia de datos .

En general, la dirección del proyecto o Gestor de productos gestiona esta fase. No obstante, esta fase inicial debería:

* Identificar el tipo de problema que se está resolviendo. Muchos asumen que los métodos avanzados de ciencia de datos son la solución. A menudo no es así. Por lo tanto, una pregunta clave que usted debe hacer durante todo el proyecto (y especialmente en las primeras fases) es: “¿Es el problema mejor resuelto por el aprendizaje automático o algo más?” Las limitaciones del aprendizaje automático para sumergirse más profundamente en esto.

Iniciando el Ciclo de Vida de la Ciencia de Datos en ACME

De vuelta a ACME. Tú:

  • Reunir la solicitud de la Directora de Recursos Humanos y su personal
  • Tomar opiniones de otros líderes de la empresa
  • Obtener asesoramiento de algunas empresas de contratación
  • Leer varias revistas de negocios relevantes
  • Analizar algunos de los informes financieros de gestión de la empresa

En pocos días, se supone que el problema subyacente no es con los costos de contratación directamente. Por el contrario, la mejor manera de reducir los costes de contratación es reducir el número de empleados existentes.

Usted consigue buy-in para desarrollar un modelo que predice quién es probable que deje su empresa. Con una alerta temprana, los gerentes pueden intervenir, lo que a su vez reducirá los costes de contratación de los empleados, y proporcionará muchos otros beneficios.

II. Investigación y limpieza de datos

Sin datos, no tienes nada. Por lo tanto, el equipo necesita identificar qué datos se necesitan para resolver el problema subyacente. A continuación, determinar cómo obtener los datos:

  • ¿Se dispone de los datos internamente? -> Obtener acceso a él
  • ¿Los datos se pueden recopilar fácilmente? -> Empieza a capturarlo
  • ¿Los datos están disponibles para la compra? -> Comprarlo

Una vez que tengas los datos, comienza a explorarlos. Sus científicos de datos o analistas de negocios/datos dirigirán varias actividades tales como:

  • Documentar la calidad de los datos
  • Limpiar los datos
  • Combina varios conjuntos de datos para crear nuevas vistas
  • Cargar los datos en la ubicación de destino (a menudo en una plataforma en la nube)
  • Visualizar los datos
  • Presentar las conclusiones iniciales a las partes interesadas y solicitar información al respecto *

¿Qué es único en este ciclo de vida?

Casi todos los marcos del ciclo de vida de la ciencia de los datos incluyen estos puntos anteriores, excepto para este último a menudo se deja de lado. Sin embargo, es clave.

* Al presentar los hallazgos iniciales en forma de estadísticas descriptivas, ideas interesantes, un informe o un tablero, las partes interesadas pueden proporcionar un contexto adicional sobre cosas que el equipo de datos podría haber pasado por alto.

Igual de importante, las partes interesadas aprenden más acerca de lo que está sucediendo y pueden ayudar a reformular el problema empresarial para centrarse en los puntos clave existentes o nuevos.

Después de todo, lo que se define en la fase “Definición del problema” no es de oro. Es un punto de partida. Y su equipo debe girar lo antes posible si es necesario.

No subestime el tiempo requerido para estos pasos (especialmente la limpieza de datos). Pero sin esto, usted será víctima de “basura-en-basura-fuera”.

Sin embargo, no te exageres. Si pasas demasiado tiempo en esta fase, estás invirtiendo mucho tiempo en un proyecto sin valor probado.

Investigación de datos en ACME

Afortunadamente, la compañía tiene la mayoría de los datos necesarios disponibles. Desafortunadamente, los conjuntos de datos viven en varios sistemas dispares, muchos de los cuales su equipo tiene que obtener HR signoff para acceder. Este proceso es frustrantemente lento. Así que para no perder tiempo, su científico de datos y analista de datos identifican cinco conjuntos de datos útiles a los que ya puede acceder.

Usando cuadernos Python, ellos:

  • combinar estos conjuntos de datos
  • calcular diversas estadísticas descriptivas
  • búsqueda de valores atípicos
  • imputar los valores que faltan (es decir, tomar conjeturas educadas para valores nulos)
  • y preguntar qué es único acerca de los empleados que churn?

Luego, para que las partes interesadas en recursos humanos entiendan lo que están viendo, su analista de negocios construye un tablero de Tableau.

A través de conversaciones, las partes interesadas en recursos humanos y su equipo descubren algunas ideas interesantes. En particular, el volumen de negocios es particularmente alto en la División de Dinamitas de ACME, y estos puestos tienen altos costos de contratación

Su equipo también sospecha que los factores que conducen a involuntarios churn son muy diferentes de voluntarios Churn. Y al centrarse en involuntarios churn, pueden simplificar el modelo.

Por lo tanto, usted y las partes interesadas están de acuerdo en que el modelo inicial debe predecir voluntarios empleado churn en la División de Dinamita.

III. Modelo mínimo viable

Todos los marcos del ciclo de vida de la ciencia de datos tienen algún tipo de fase de modelado. Sin embargo, quiero hacer hincapié en la importancia de obtener algo útil tan pronto como sea posible. Este concepto se basa en la idea de un Producto mínimo viable .

¿Qué es un Producto Mínimo Viable?

“El producto mínimo viable es la versión de un nuevo producto que permite a un equipo recoger la máxima cantidad de aprendizaje validado sobre los clientes con el menor esfuerzo”.

Eric Ries

O más simplemente: no empieces a construir un producto completo y luego lo lances. Más bien, obtener algo de valor y recibir retroalimentación sobre si está en el camino correcto. Y si no, cambiar de dirección.

¿Qué es un Modelo Mínimo Viable?

Al extender este concepto al modelado, defino:

“La modelo mínimo viable es la versión de un nuevo modelo que permite a un equipo recoger la máxima cantidad de aprendizaje validado sobre la eficacia del modelo con el menor esfuerzo”

Romper esto:

  • Mínimo: El modelo está estrechamente enfocado. No es el mejor modelo posible, pero es suficiente para hacer un impacto medible en un subconjunto del problema general.
  • Recoger la cantidad máxima de aprendizaje validado sobre la eficacia del modelo: Desarrolle una hipótesis y pruébela. Este aprendizaje validado confirma o niega las hipótesis iniciales de su equipo. Tiene dos partes principales:
  • ¿El modelo funciona técnicamente mejor que la línea de base?
  • ¿Es el modelo capaz de tener un impacto significativo en el problema de negocio subyacente?
  • Menos esfuerzo: Los despliegues completos suelen ser costosos y llevar mucho tiempo. Por lo tanto, encontrar la manera más simple de sacar el modelo.

¿Cómo se construye el Modelo Mínimo Viable?

Hay demasiados enfoques de modelado para cubrir aquí, pero en general pueden caer en dos fases.

1. Validación “Lab”: ¿Funciona el modelo en un entorno controlado?

Por ejemplo, divida los datos históricos en conjuntos de entrenamiento, validación y pruebas. Capacitar algoritmos sobre los datos de formación, medir su eficacia en el conjunto de validación y realizar una comprobación final de los datos de validación.

Después de probablemente varios intentos, viene la parte más difícil...

2. Validación “In the Wild”: Sólo porque los científicos de datos validen un modelo en sus computadoras o en la nube, no significa que funcionará en la naturaleza. Más bien, vea cómo el modelo realmente funciona en el mundo real.

Puede ver cómo funciona el modelo en los datos actuales, sin intervenir realmente en el problema subyacente. O puede hacer un despliegue simple a las partes interesadas. Esto podría ser una aplicación básica Shiny o Flask, una herramienta de búsqueda en Excel, o un informe diario.

A menudo se divide a los sujetos en dos grupos: un grupo de prueba (impactado por el modelo) y un grupo de control (no afectado). A continuación, mida si los miembros del grupo de ensayo funcionan de manera diferente a los del grupo de control.

Decisiones sobre los resultados

Independientemente de cómo se desarrolle el modelo, la idea es examinar tres cosas:

  • ¿El modelo funciona mejor que el rendimiento basal?
  • ¿Vale la pena implementar el modelo en la producción?
  • ¿Hay consecuencias no deseadas?

Entre las medidas que podrían adoptarse a continuación figuran las siguientes:

  • Cambiar el enfoque del modelo a un tema diferente (es decir. volver a “Definición del problema”)
  • Añadir más o más conjuntos de datos más limpios (es decir, volver a “Investigación de datos y limpieza”)

El modelo mínimo viable de ACME

Aunque tuvieron acceso a los conjuntos de datos adicionales solicitados, necesitarían semanas para limpiarlos e integrarlos con los cinco conjuntos de datos existentes. Para obtener algo rápidamente, se procede sólo con los cinco conjuntos existentes.

Se dividieron aleatoriamente los datos en tres grupos: un grupo de entrenamiento, un grupo de validación y un grupo de prueba. Luego, entrenan un modelo en los empleados del grupo de formación mediante el uso de datos hasta hace seis meses. Y luego, ven si el modelo puede predecir con precisión el churn voluntario durante los seis meses anteriores.

El mejor modelo funcionó significativamente mejor (estadística y gerencialmente) que el modelo de base que fue un analista de RRHH ejecutado en Excel.

Para probarlo en la naturaleza, los científicos de datos toman los datos más actuales y anotar cada empleado actual en la División de Dynamite con una probabilidad de churn. En lugar de esperar seis meses, encontraron pruebas suficientes de que el modelo estaba haciendo su trabajo prediciendo el churn voluntario después de sólo tres meses.

¡El Director de Recursos Humanos está impresionado! Ahora ha validado su modelo en la práctica. Ahora es el momento de implementar el modelo en la producción y mejorar su rendimiento.

IV. Despliegue y mejoras

Despliegue

Muchos ciclos de vida de la ciencia de los datos incluyen el “desplazamiento” o un término similar. Este paso crea el mecanismo de entrega que necesita para llevar el modelo a los usuarios o a otro sistema. Es clave porque:

Este paso significa muchas cosas diferentes para diferentes proyectos. Podría ser tan simple como obtener la salida de tu modelo en un tablero de tablero. O tan complejo como escalarlo a la nube a millones de usuarios.

Los atajos tomados anteriormente en la fase mínima viable del modelo se actualizan a los sistemas de grado de producción.

Típicamente, los miembros del equipo más “enfocados en la ingeniería” como ingenieros de datos, ingenieros de nube, ingenieros de aprendizaje automático, desarrolladores de aplicaciones e ingenieros de garantía de calidad ejecutan esta fase.

Mejoras

La porción de “Aumento” no es tan común en otros marcos del ciclo de vida de la ciencia de los datos. Pero estoy tratando de enfatizar la importancia de sacar algo básico y luego mejorarlo.

Recordemos que en la etapa anterior se presentó el “Modelo Minimal Viable”. Aunque grande como punto de partida, el modelo probablemente no es tan bueno como debería ser. Así que utilice el tiempo que los ingenieros necesitan para entregar el modelo para mejorar los modelos. Conceptualmente, esta fase de “Aumento” significa:

  • Extienda el modelo a casos de uso similares (es decir. una nueva fase de “Definición del problema”)
  • Añadir y limpiar conjuntos de datos (es decir, una nueva fase de “Investigación y limpieza de datos”)
  • Pruebe nuevas técnicas de modelado (es decir, desarrollo del siguiente “modelo viable”)

Despliegue y mejoras en ACME

Juntos, usted, los ingenieros de sistemas de RRHH y las partes interesadas de RRHH identifican que la mejor manera de sacar el modelo es construir una interfaz de programación de aplicaciones (API). La API se integra con los sistemas de recursos humanos para comunicar la probabilidad de que cada empleado se mueva en su perfil de recursos humanos.

Debido a que la puntuación de churn de un empleado por lo general no fluctúa mucho hora a hora, todos están de acuerdo en anotar cada empleado cada noche. Su ingeniero de la nube se pone a trabajar para hacer que esto suceda en coordinación con un líder de software del equipo de sistemas de RRHH.

Mientras tanto, el Director de Recursos Humanos dice que un modelo para toda la empresa es más importante que mejorar el modelo específico para la División Dynamite

Por lo tanto, los científicos de datos comienzan a experimentar con algunas nuevas técnicas de modelado para generalizar el modelo al universo más amplio de empleados. Mientras tanto, su ingeniero de datos comienza a integrar nuevos conjuntos de datos que los científicos pueden utilizar.

Los resultados son prometedores y, después de algunas pruebas de software adicionales, el Director de Recursos Humanos da la aprobación para activar las API para los sistemas de recursos humanos.

V. Operaciones de ciencia de los datos

La mayoría de otros ciclos de vida de la ciencia de datos terminan con un Despliegue fase o incluso antes de que con Evaluación .

Sin embargo, a medida que la ciencia de los datos se transforma en operaciones convencionales, las empresas deben centrarse más en los productos, lo que incluye planes para mantener los sistemas implementados a largo plazo. Hay tres facetas principales de la gestión que se superponen a esto.

Gestión de programas informáticos

Una solución de ciencia de datos producida finalmente forma parte de un sistema de software más amplio. Y como todos los sistemas de software, la solución necesita ser mantenida. Entre las prácticas comunes figuran las siguientes:

  • Mantenimiento de los diversos entornos del sistema
  • Gestión del control de acceso
  • Activación de las notificaciones de alerta para incidentes graves
  • Ejecutar scripts de prueba con cada nueva implementación
  • Acuerdos sobre el nivel de los servicios de reuniones
  • Implementación de parches de seguridad

Para ayudar a salvar la brecha de desarrollo a la producción, las organizaciones están adoptando rápidamente una DevOps cultura que incluye principios generales que también pueden guiar muchos aspectos de las operaciones de ciencia de datos.

Sin embargo, el mantenimiento del sistema de software es necesario pero no suficiente para la ciencia de los datos. Hay un conjunto más amplio (y más complicado) de consideraciones...

Modelo y gestión de datos

  • Monitoriza los datos: Los datos provienen del “mundo real” que está más allá de su control y presenta desafíos únicos. Por lo tanto, validar que los conjuntos de datos entrantes son de formato esperado y que los datos vienen en rangos aceptables.
  • Rendimiento del modelo de monitor: La funcionalidad del software tiende a ser binaria — funciona o no. Sin embargo, los modelos son probabilísticos. Así que a menudo no se puede decir definitivamente si el modelo “está funcionando”. Sin embargo, usted puede obtener una buena sensación al monitorear el rendimiento del modelo para comprobar contra oscilaciones inaceptables en las métricas del núcleo tales como desviación estándar o error promedio del porcentaje.
  • Ejecutar pruebas A/B: Los modelos pueden llegar a ser peores que el ruido aleatorio. También pueden (casi) ser siempre mejorados. Por lo tanto, durante las operaciones, continúe sosteniendo rutinariamente pequeñas porciones de su población como grupo de control para probar el rendimiento contra el modelo en ejecución. Ocasionalmente, desarrollar e implementar nuevos modelos de prueba para medir su rendimiento frente al modelo de producción tradicional.
  • Garantizar la adecuada gobernanza del modelo: Las regulaciones en ciertas industrias requieren que las empresas puedan explicar por qué un modelo tomó ciertas decisiones. E incluso si usted no está en una de estas industrias reguladas, usted querrá ser capaz de rastrear el conjunto específico de datos y el modelo específico utilizado para evaluar resultados específicos.

Gestión continua de las partes interesadas

No soy consciente de otro ciclo de vida de la ciencia de datos publicado que llama esto específicamente. Sin embargo, en realidad, la gestión continua de las partes interesadas es fundamental para el éxito de su producto.

Continúe educando a sus partes interesadas y establezca expectativas de que el modelo no es mágico. Para impulsar la adopción, comunicar beneficios realistas y, si es necesario, proporcionar capacitación a los usuarios finales. Asimismo, advertir a las partes interesadas de los riesgos y deficiencias de los modelos y de cómo mitigarlos.

Operaciones de ciencia de datos en ACME

¡Modelo desplegado! ¿Misión cumplida?

Tú lo sabes mejor. Pero muchas partes interesadas no lo hacen, por lo que se les educa continuamente sobre el modelo y sus implicaciones.

Mientras tanto, sus científicos de datos se esfuerzan por generalizar el modelo en todos los departamentos. Sin embargo, los resultados son cortos y usted no lanza este modelo todavía como ellos trabajan para mejorarlo.

Afortunadamente, el modelo específico para el equipo de Dynamite hace su trabajo y predice con precisión churn voluntario.

Sin embargo, los recursos humanos y los gerentes luchan para encontrar formas eficaces de mitigar el churn de los empleados en riesgo. HR pregunta si su equipo puede identificar una intervención efectiva personalizada para cada empleado en riesgo.

Y por lo tanto, se inicia otra iteración del ciclo de vida de la ciencia de los datos ...

¿Cuáles son otros ciclos de vida de la ciencia de datos populares?

El ciclo de vida genérico anterior es una de las docenas (¿cientos?) Puedes encontrar en línea. Vamos a explorar algunos de los más populares.

Ciclos de vida de la minería de datos

Estos tres procesos clásicos de extracción de datos han sido lanzados bajo el paraguas general de los ciclos de vida de la ciencia de los datos. Todos ellos provienen de los años 90. Estos tienden a ser más miopes. Concretamente, el Proceso de KDD y SEMMA se centran en el problema de los datos y no en el de las empresas. Sólo CRISP-DM tiene una fase de despliegue. Ninguno de ellos tiene una fase de operaciones.

  • Descubrimiento de Conocimientos en Base de Datos Proceso (KDD) : Este es el proceso general de descubrir el conocimiento en los datos a través de extracción de datos, o la extracción de patrones e información de grandes conjuntos de datos utilizando sistemas de aprendizaje automático, estadísticas y bases de datos.
  • CRISP-DM : Los Proceso estructurado de la industria de Cross para la minería de datos es la metodología más popular para la ciencia de datos y proyectos de análisis avanzados. Tiene seis pasos: Comprensión de Negocios, Comprensión de Datos, Preparación de Datos, Modelado, Validación e Implementación. Tiene un enfoque más amplio que SEMMA y el Proceso KDD, pero también carece de los aspectos operacionales de un ciclo de vida del producto de ciencia de datos.

Ciclos de vida de la ciencia de los datos modernos

Los ciclos de vida inferiores son enfoques más modernos que son específicos de la ciencia de los datos. Al igual que los procesos de extracción de datos, la OSEMN se centra más en el problema de los datos básicos. La mayoría de los demás, especialmente los de Domino, tienden a centrarse en la solución más completa.

  • Osemn: Fecha en que debe presentarse la solicitud Obtener, barrer, explorar, modelar e iNterpret , Osemn es un ciclo de vida de cinco fases. Ve a esto. Hacia la ciencia de los datos para aprender más.
  • Microsoft TDSP: Los Equipo de Proceso de Ciencia de Datos combina muchas prácticas ágiles modernas con un ciclo de vida similar al CRISP-DM. Tiene cinco pasos: Comprensión de Negocios, Adquisición y Comprensión de Datos, Modelado, Implementación y Aceptación de Clientes.
  • Ciclo de vida de los laboratorios de datos Domino : Este ciclo de vida es quizás más similar a mi ciclo de vida genérico, en parte porque incluye una etapa final de operaciones. Sus seis pasos son: Ideación, Adquisición y Exploración de Datos, Investigación y Desarrollo, Validación, Entrega y Monitoreo.
  • Ciclos de vida menos conocidos: Jeff encontró varios ciclos de vida interesantes pero menos conocidos descritos en varios posts de blog. Ver su post en Flujos de trabajo de ciencia de datos para aprender más.

Consejos de separación

Hay numerosos ciclos de vida de la ciencia de datos para elegir. La mayoría comunica los mismos pasos básicos necesarios para realizar un proyecto de ciencia de datos, pero a menudo tienen un ángulo distinto.

El ángulo de este ciclo de vida subraya la necesidad de agilidad y la ciencia de datos más amplia producto ciclo de vida.

Independientemente del ciclo de vida que utilice, combínelo con un proceso de colaboración para que su equipo pueda coordinarse eficazmente entre sí y las partes interesadas.

Buena suerte. Este viaje es un reto. Pero puede ser divertido. ¡Diviértete en tu próximo proyecto de ciencia de datos!

Conviértete en un líder del equipo de ciencia de datos

Aprender a ejecutar eficazmente proyectos de ciencia de datos y a dirigir equipos de ciencia de datos con la Alianza para el Proceso de Ciencia de los Datos .

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +