¿Qué fase de la ciencia de los datos a menudo toma más tiempo?
En este artículo, vamos a discutir el ciclo de vida de la ciencia de datos, varios enfoques para la gestión de un proyecto de ciencia de datos, mirar a un ciclo de vida típico, y explorar cada etapa en detalle con sus objetivos, cómo, y entregables esperados. No profundizaremos en los detalles de los marcos o lenguajes, sino que cubriremos la estructura teórica básica de un ciclo de vida típico del proyecto de ciencia de datos.
¿Qué es la ciencia de los datos?
Ciencia de datos (DS, el tema que hemos tratado ampliamente en nuestro blog anterior, Resumen de la ciencia de los datos ) es un campo multidisciplinario que utiliza métodos científicos para extraer información a partir de datos estructurados y no estructurados. La ciencia de los datos es un campo y concepto tan enorme que a menudo se mezcla con otras disciplinas, pero en general, DS unifica estadísticas, análisis de datos, aprendizaje automático y campos relacionados.
¿Cuál es el ciclo de vida de la ciencia de los datos?
El ciclo de vida de Data Science proporciona la estructura para el desarrollo de un proyecto de ciencia de datos. El ciclo de vida describe los principales pasos, de principio a fin, que suelen seguir los proyectos. Ahora, hay varios enfoques para la gestión de proyectos de DS, entre los que se encuentran el proceso estándar interindustrial para la minería de datos (alias CRISP-DM), el proceso de descubrimiento de conocimiento en bases de datos (alias KDD), cualquier procedimiento personalizado basado en propiedad invocado por una empresa, y algunos otros procesos simplificados, que cubriremos en un momento.
Una visión general de cinco minutos de lo que vamos a discutir con mayor detalle a continuación:
Ciclo de vida del proyecto de ciencia de datos
Ahora vamos a esbozar los pasos involucrados en un ciclo de vida del proyecto DS, como se indica en los enfoques antes mencionados.
CRISP-DM
CRISP-DM es un modelo de proceso estándar abierto que describe los enfoques comunes utilizados por los científicos mineros de datos. En 2015, fue refinado y ampliado por IBM, que lanzó una nueva metodología llamada Analytics Solutions Unified Method for Data Mining/Predictive Analytics (también conocida como ASUM-DM).
Este video, por ejemplo, discute once pasos que entran en el ciclo de vida de un proyecto de Ciencia de Datos:
Por supuesto, dependiendo del tamaño de una organización y proyecto específico, la madurez de la gestión de macrodatos y ciencia de datos dentro de la empresa, el ciclo de vida del proyecto DS diferirá significativamente. En la práctica, el ciclo de vida típico DS se asemeja a un proceso de ingeniería (ver nuestro artículo en ciclo de vida del desarrollo de software ) que tenga en cuenta las limitaciones de recursos y las consideraciones relativas al tiempo de comercialización.
Supongamos que tenemos un proyecto estándar de DS (sin particularidades específicas de la industria), entonces el ciclo de vida normalmente incluiría:
El ciclo de vida del proyecto DS es un proceso iterativo de investigación y descubrimiento que proporciona orientación sobre las tareas necesarias para utilizar modelos predictivos. El objetivo de este proceso es trasladar un proyecto de DS a un punto final de compromiso proporcionando medios para una comunicación más fácil y clara entre equipos y clientes con un conjunto bien definido de artefactos y plantillas estandarizadas para homogeneizar los procedimientos y evitar malentendidos.
Cada etapa tiene la siguiente información:
- Metas y objetivos específicos de la etapa
- Una descripción clara de las tareas e instrucciones específicas sobre cómo completarlas
- Los productos previstos (artefactos)
Ahora veamos cada uno de esos pasos con mayor detalle a continuación:
Comprensión empresarial
Comprensión de negocios y datos
Antes incluso de embarcarse en un proyecto DS, usted necesita entender el problema que está tratando de resolver y definir los objetivos centrales de su proyecto mediante la identificación de las variables para predecir.
Objetivos:
- Identificar variables clave que sirvan como objetivos modelo y sirvan como métricas para definir el éxito del proyecto
- Identificar las fuentes de datos a las que la empresa ya tiene acceso o necesita obtener dicho acceso
Directrices:
Trabaje con los clientes y las partes interesadas para definir problemas empresariales y formular preguntas que la ciencia de los datos necesita responder.
El objetivo aquí es identificar las variables clave del negocio (también conocidas como metas modelo) que su análisis necesita predecir y el éxito del proyecto sería evaluado. Por ejemplo, las previsiones de ventas. Esto es lo que necesita ser predicho, y al final de su proyecto, comparará sus predicciones con el volumen real de ventas.
Construya un equipo DS, especifique los roles y responsabilidades de cada miembro, desarrolle un plan de acción detallado con hitos medibles y claros que puedan ser alterados o iterados tan pronto como descubra más información.
Encuentre las fuentes de datos que le ayudarán a responder a las preguntas que definen los objetivos del proyecto
Ahora, usted necesita encontrar las fuentes de datos que contienen ejemplos de respuestas a algunas de sus preguntas planteadas anteriormente:
- Encuentre los datos relevantes que tienen medidas de su objetivo o características relacionadas con el objetivo
- Encuentre los datos que son una medida precisa de su objetivo de modelo
- Vea si sus datos necesitan ser actualizados con datos externos o nuevos datos deben ser recopilados
Artefactos:
Los entregables que se espera que presente en esta etapa incluyen:
- Documento de la Carta , que es un documento vivo que se actualiza a lo largo del proyecto, a medida que surgen nuevos datos o requisitos.
- Fuentes de datos , un documento que especifica la ubicación original y de destino de los datos brutos
- Diccionarios de datos proporcionar descripciones de los datos suministrados por el cliente, incluyendo información sobre el esquema y los diagramas de relación de entidad
Adquisición y comprensión de datos
Cuando usted ha terminado con la definición de sus objetivos de negocio, es el momento de recoger realmente los datos, el proceso más conocido como la minería de datos.
Consejo técnico: Necesitará bases de datos de consultas, usando MySQL para procesar datos. Utilizando Python o R con los paquetes específicos, puede recuperar datos de archivos recibidos en Microsoft Excel. Algunas otras bases de datos que puede encontrar incluyen PostgreSQL, Oracle o MongoDB. Para obtener datos de la web, es posible que tenga que utilizar API Web o raspado de telas herramientas como Beautiful Soup. La obtención de datos directamente de archivos en formato CVS o TSV requerirá el uso de un analizador especial.
Por lo general, la adquisición y el procesamiento de datos toma mucho tiempo y esfuerzo, aún más, cuando usted comienza a limpiar y preparar sus datos para etapas posteriores porque podría haber múltiples escenarios que necesitan ser limpiados o los datos pueden hacer inconsistencias o conjunto de datos pueden faltar valores o hay algunos datos que son innecesarios y así sucesivamente.
Consejo técnico: Herramientas de Python, R o Open Source como OpenRefine le ayudará a borrar los datos. De lo contrario, puede utilizar soluciones empresariales personalizadas como SAS Enterprise Miner . Para conjuntos de datos más grandes, se le pedirá que tenga habilidades en MapReduce, Hadoop o Spark.
Después de limpiar sus datos, puede comenzar un análisis, también conocido como exploración de datos, que implica entender los patrones en los datos y recuperar cualquier información útil de ellos. En esta etapa, también es crucial establecer la tubería de datos para anotar los datos nuevos o actualizados regularmente.
Consejo técnico: para la exploración de datos y si estás usando Python, necesitarás tener una buena comprensión de Numpy, así como Matplotlib, Scipy, o Pandas, si estás usando R, el conocimiento de GGplot2 o Dplyr será esencial. La visualización de datos y las estadísticas inferenciales son imprescindibles.
Este video del Dr. Mike Pound podría ser muy útil para entender los datos y el proceso de visualización de datos:
Objetivos:
- Producir un conjunto de datos de alta calidad con relaciones claras y comprensibles con las variables de destino y localizar ese conjunto de datos en el entorno de análisis adecuado
- Construir una arquitectura de solución de una tubería de datos que refresque y califique los datos de forma regular
Directrices:
Esto es lo que tienes que hacer:
Ingerir los datos en el entorno analítico de destino
La ingestión de datos implica configurar el proceso de traslado de datos de sus ubicaciones de origen a las ubicaciones de destino donde se ejecutan operaciones de análisis.
Explore los datos y ver si es adecuado para responder a sus preguntas
Desarrolle una comprensión sólida de sus datos mediante la auditoría de la calidad de los datos con la síntesis y visualización de datos y hágalos listos para el modelado. Utilice utilidades automatizadas para ayudarle a explorar, visualizar o resumir los datos o, si puede, crear una solución personalizada que se adapte a sus objetivos y a los de su organización.
Una vez más un gran tutorial del Dr. Mike Pound sobre datos de limpieza:
Después de haber limpiado sus datos, es hora de entender mejor mediante el establecimiento de los patrones que más tarde le ayudará a desarrollar un modelo predictivo para su objetivo. En este paso, que a menudo es iterativo, es posible que tenga que añadir nuevos datos, encontrar nuevas fuentes de datos, aumentar el conjunto de datos que se definió previamente.
Configure una tubería de datos para anotar los datos nuevos o actualizados regularmente
En este sentido, se construye una arquitectura de solución de la tubería de datos que generalmente se logra simultáneamente con otras etapas del ciclo de vida del proyecto DS. Dependiendo de sus necesidades, la naturaleza del negocio, las limitaciones del sistema, su tubería puede ser por lotes, streaming o en tiempo real, o híbrido. Aquí hay un ejemplo de cómo establecer un gasoducto con Fábrica de datos de Azure .
Artefactos:
En esta etapa se espera obtener estos resultados:
- Informe sobre la calidad de los datos incluye resúmenes de datos, la relación entre atributo y destino, clasificación de variables, etc. Utilice cualquier herramienta disponible (por ejemplo, IDEAR ) que puede generar tal informe para usted.
- La arquitectura de la solución puede ser en forma de diagrama/descripción de su tubería de datos
- Se utiliza una decisión de control para determinar si el valor esperado es suficiente para continuar su búsqueda.
Modelado
Modelar implica la creación de características de datos a partir de los datos tratados para llevar a cabo la formación de datos. La formación de datos, a su vez, implica una serie de pasos iterativos, tales como dividir los datos de entrada al azar para modelar en un conjunto de datos de entrenamiento y un conjunto de datos de prueba; construir modelos con un conjunto de datos de prueba; evaluar los conjuntos de datos de entrenamiento y prueba utilizando algoritmos de aprendizaje automático; encontrar la mejor solución comparando las métricas de éxito entre métodos alternativos; y finalmente determinar si el modelo es adecuado para la producción. Ahora, veamos esta etapa a través del prisma de la información requerida definida anteriormente, tales como metas, directrices y entregables esperados.
Objetivos
- Determinar las características óptimas de los datos para el modelo de aprendizaje automático
- Crear el modelo de aprendizaje automático que prediga con mayor precisión el objetivo
- Asegúrese de que el modelo de aprendizaje automático es adecuado para la producción
Directrices
Crear características de datos para facilitar la formación de modelos
Durante este paso, que se conoce mejor como ingeniería de características, tendrá que incluir, agregar y transformar las variables en bruto para crear características distintivas utilizadas en el análisis. La ingeniería de características es un sutil y equilibrado acto de encontrar información y descartar variables no informativas, así como generar características para cualquier nueva variable que se obtengan durante la puntuación.
Esta es una gran explicación del Dr. Mike sobre la transformación de datos:
Encuentre el modelo que responda a la pregunta con más precisión
Dependiendo de qué tipo de problema está tratando de resolver, habrá numerosos algoritmos de modelado disponibles a su disposición, y se espera que elija un algoritmo apropiado para su problema particular. Para entender cómo abordar un problema de este tipo, tendrá que hacer lo siguiente:
- Dividir los datos de entrada en un conjunto de datos de entrenamiento y un conjunto de datos de ensayo
- Construir los modelos utilizando un conjunto de datos de entrenamiento
- Evaluar los conjuntos de datos de entrenamiento y pruebas utilizando una serie de algoritmos de aprendizaje automático y afinando los parámetros (mejor conocidos como barrido de parámetros)
- Descubra la mejor solución comparando las métricas de éxito
Para el aprendizaje automático Azure, hay un herramienta automatizada de modelado y presentación de informes que se ejecuta a través de múltiples algoritmos y barridos de parámetros para producir un modelo de base junto con un informe de modelo de base que resume el rendimiento de cada combinación de modelo y parámetro.
Determinar si el modelo es adecuado para la producción
Artefactos
- Se generaron conjuntos de características que contienen punteros al código que generó las características y una descripción de esas características
- El informe modelo contiene los detalles de cada experimento
- La decisión del punto de control evalúa si el modelo funciona lo suficientemente bien como para implementarse
Despliegue
El objetivo es finalmente implementar su modelo en un entorno similar a la producción para la aceptación posterior del usuario.
Directrices
Operacionalice el modelo
Para implementar modelos, los expones con una interfaz API abierta, que permite que el modelo sea fácilmente consumido por varias aplicaciones, como sitios web en línea, hojas de cálculo, paneles de control, aplicaciones de back-end, etc.
Artefactos
- Un panel de estado que muestra la salud del sistema y las métricas clave
- Informe final de modelado con detalles de despliegue
- El documento de arquitectura de la solución final
Esta es la charla de DataWorks Summit en la que el orador aborda diversas posibilidades y mejores prácticas para introducir modelos de aprendizaje automático en los entornos de producción:
Aceptación del cliente
Objetivos
Lo obvio y el objetivo principal aquí es finalizar los entregables del proyecto, confirmar la tubería, el modelo, el despliegue en un entorno de producción con los clientes y garantizar su satisfacción.
Directrices
Confirmar el modelo desplegado y la tubería con el cliente
Durante esta etapa, se examina y finaliza toda la documentación.
Entregar el proyecto a la entidad responsable de la producción
La entidad podría ser un equipo informático o un equipo científico de datos del cliente o cualquier otro agente del cliente responsable de la producción.
Artículos Relacionados: