¿Qué es el flujo de trabajo de la ciencia de datos?

A flujo de trabajo de la ciencia de los datos define las fases (o pasos) en un proyecto de ciencia de datos. El uso de un flujo de trabajo de ciencia de datos bien definido es útil en el sentido de que proporciona una manera sencilla de recordar a todos miembros del equipo de ciencia de datos del trabajo a hacer para hacer un proyecto de ciencia de datos.

Una manera de pensar en el beneficio de tener un flujo de trabajo de ciencia de datos bien definido es que es como un conjunto de barandillas para ayudarle a planificar, organizar e implementar su proyecto de ciencia de datos.

Flujos de trabajo existentes

El concepto de flujo de trabajo de ciencia de datos no es nuevo, y hay muchos marcos que un equipo puede utilizar. Para mostrar la diversidad de posibles marcos de trabajo, este post describe:

  • Un flujo de trabajo utilizado en un curso de ciencias de datos en Harvard
  • Tres flujos de trabajo definidos dentro de blogs donde discuten su flujo de trabajo específico utilizado
  • Dos marcos más conocidos utilizados por numerosos equipos.

Formación sobre el flujo de trabajo en ciencias de los datos

El resto de este artículo explora estos marcos de flujo de trabajo existentes, y al final, proporciona una visión integrada de ellos. Si desea más detalles sobre los flujos de trabajo y cómo integrarlos en su proyecto, explore la Jefe del equipo de ciencia de datos Por supuesto.

Flujo de trabajo de ciencia de datos enseñado en Harvard

Vamos a empezar con Flujo de trabajo de Blitzstein & Pfister , que se utiliza en el curso introductorio de Harvard sobre ciencia de los datos. Tiene un marco de cinco fases y el proceso reconoce que hay iteraciones entre las fases. Las cinco fases son las siguientes:

  • Haga una pregunta interesante
  • Obtener los datos
  • Explore los datos
  • Modelar los datos
  • Comunicar y visualizar los resultados

Blogs Describiendo un flujo de trabajo de ciencia de datos

Tal vez no es sorprendente, hay numerosas publicaciones de blog, donde la gente ha explicado su propio flujo de trabajo.

El flujo de trabajo de Aakash Tandel

Por ejemplo, a flujo de trabajo descrito por Aakash Tandel proporciona un flujo de trabajo científico de datos de alto nivel, con el objetivo de servir como ejemplo para los nuevos científicos de datos. Incluye los siguientes cinco pasos lógicos:

  • Comprender el objetivo
  • Importar los datos
  • Explorar y limpiar los datos
  • Modelar los datos
  • Comunicar los resultados.

El flujo de trabajo de Aakanksha Joshi

En una diferente blog , Aakanksha Joshi discutió el uso de un flujo de trabajo de ciencia de datos aprovechando Watson Studio Cloud de IBM, pero el flujo de trabajo podría ser útil independientemente de la pila de tecnología utilizada. En su blog, Joshi describe cinco fases lineales:

  • Conectar datos de & acceso
  • Buscar y encontrar datos relevantes
  • Prepararse para el análisis de datos
  • Construir/entrenar/desplegar modelos
  • Monitor/analizar/manejar modelos

El flujo de trabajo de Philip Guo

Un marco más avanzado fue descrito por Philip Guo . Como se muestra a continuación, tiene cuatro fases principales.

  • Preparación de los datos, luego alternando entre
  • Análisis
  • Reflexión para interpretar los resultados, y finalmente
  • Difusión los resultados en forma de informes escritos y/o código ejecutable.

Tenga en cuenta que el flujo de trabajo de Guo tiene pasos más detallados, e igualmente importantes, reconoce explícitamente que hay “loops” dentro de un proyecto.

Flujos de trabajo de ciencia de datos bien conocidos

Además de los blogs, hay varios marcos de trabajo que se han vuelto bastante conocidos, por lo que dos se revisan a continuación (CRISP-DM y OSEMN).

CRISP-DM

CRISP-DM : Definido para estandarizar un proceso de extracción de datos en todas las industrias, Cross-Industria Standard Process for Data Mining (CRISP-DM) es el marco más conocido utilizado para definir un flujo de trabajo de ciencia de datos. Como se muestra en el flujo de trabajo visual estándar CRISP-DM, describe seis fases iterativas.

Cada fase (comprensión empresarial, comprensión de datos, preparación de datos, modelado, evaluación e implementación) tiene sus propias tareas definidas y un conjunto de entregables tales como documentación e informes. Cada fase tiene sus propias tareas definidas y un conjunto de entregables (incluyendo documentación e informes). Los proyectos pueden “regresar” según sea necesario a una fase anterior.

Osemn

OSEMN (Rhymes with possum) fue descrito por primera vez en 2010. Tiene cinco fases para un proyecto de ciencia de datos: O btain, S crub, E xplore, M odel, y i N terpret. Como señaló uno de los autores de ese blog, Osemn:

Documenta el proceso de la ciencia de los datos... esto parece completamente obvio para aquellos de nosotros en esta sala hoy, cierto. Obtienes algunos datos, los limpias, juegas con ellos, construyes un modelo robusto y, ya sabes, haces un gráfico, o escribes sobre él. Esto no era obvio en 2010.

Este es un buen punto: los flujos de trabajo de la ciencia de datos suelen parecer “obvios” para los científicos de datos, pero todavía hay valor en definir un flujo de trabajo para su proyecto, ya que ayuda a asegurar que todos en el equipo entiendan el trabajo que se debe hacer y también ayuda a asegurarse de que un paso no se salte ni se olvide.

Comparando los diferentes flujos de trabajo

Por lo tanto, ¿cuáles son las similitudes y diferencias entre estos marcos de flujo de trabajo?

Estos marcos generalmente se centran en los pasos en un proyecto de ciencia de datos (o habilidades necesarias para un científico de datos). Tal vez la diferencia más significativa es que algunos discuten explícitamente la necesidad de volver a una fase anterior. Otra diferencia es que algunos se centran más en la comprensión del contexto empresarial, y otra diferencia es que algunos se centran en el despliegue de modelos.

Para explorar los diferentes flujos de trabajo, la siguiente tabla muestra los marcos discutidos, y compara y contrasta las diferentes fases definidas dentro de cada marco de flujo de trabajo. Esta tabla puede ayudarle a decidir qué fases son las mejores para su equipo, y si desea utilizar uno de estos flujos de trabajo previamente definidos o definir el suyo propio, basado en la selección de las fases que tienen más sentido para su equipo.

Más información

Si bien muchos de estos flujos de trabajo señalan la necesidad de volver a una fase anterior, ninguno de estos flujos de trabajo describe explícitamente cómo un equipo debe determinar cuándo volver (o cuándo avanzar a la siguiente fase).

Es por eso que un flujo de trabajo es sólo parte del marco de proceso general de un equipo. Para obtener más información, estos son dos buenos puntos de partida:

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +