Diagrama del proceso de ciencia de datos
Guía visual de procedimientos estándar en ciencia de datos
Suponga que se le ha dado un problema de datos para resolver y se espera que produzca información única a partir de los datos que se le dan. Así que la pregunta es, ¿qué hace exactamente para transformar un problema de datos a través de la finalización y generar información basada en datos? Y lo más importante de todo, ¿Por dónde empiezas?
Usemos alguna analogía aquí, en la construcción de una casa o en la construcción de la pieza guía de la información utilizada es el plano. Entonces, ¿qué tipo de información hay dentro de estos planos? Información relativa a la infraestructura del edificio, el diseño y las dimensiones exactas de cada habitación, la ubicación de tuberías de agua y cables eléctricos, etc.
Continuando desde donde lo dejamos antes, así que, ¿dónde empezamos cuando se le da un problema de datos? Ahí es donde el Proceso de ciencia de datos Pasa. Como se discutirá en las próximas secciones de este artículo, el proceso de ciencia de datos proporciona un enfoque sistemático para abordar un problema de datos. Al seguir estas directrices recomendadas, usted podrá hacer uso de un flujo de trabajo probado y verdadero para abordar proyectos de ciencia de datos. Así que sin más preámbulos, ¡empecemos!
Este proceso o flujo de trabajo de obtención de información a partir de datos se describe mejor en CRISP-DM y Osemn. Cabe señalar que ambos se componen esencialmente de los mismos conceptos básicos, mientras que cada marco se publicó en un momento diferente. En particular, CRISP-DM fue lanzado en un momento (1996) en que la extracción de datos ha comenzado a ganar tracción y faltaba un protocolo estándar para llevar a cabo las tareas de extracción de datos de una manera sólida. Catorce años después (2010), se introdujo el marco de la OSEMN y resume las tareas clave de un científico de datos.
Personalmente, habiendo comenzado mi propio viaje al mundo de los datos en 2004 y el campo era conocido en aquel entonces como Minería de datos . Gran parte del énfasis en ese momento se puso en traducir los datos al conocimiento donde otro término común que también se utiliza para referirse a la minería de datos es Descubrimiento de Conocimientos en Datos .
A lo largo de los años, el campo ha madurado y evolucionado para abarcar otras habilidades que llevaron a la eventual acuñación del término Ciencia de los datos que va más allá de la mera construcción de modelos, pero también abarca otras competencias tanto técnicas como blandas. Anteriormente, he dibujado una infografía que resume estos 8 conjuntos de habilidades esenciales de la ciencia de datos como se muestra a continuación. También echa un vistazo al vídeo de YouTube que acompaña en Cómo convertirse en un científico de datos (se necesitan caminos de aprendizaje y conjuntos de habilidades) .
El acrónimo CRISP-DM significa Proceso estándar de la industria cruzada para la minería de datos y CRISP-DM se introdujo en 1996 en los esfuerzos por estandarizar el proceso de extracción de datos (también conocido como descubrimiento de conocimientos en los datos) de manera que pueda servir como un flujo de trabajo estándar y fiable que pueda ser adoptado y aplicado en diversas industrias. Este proceso estándar serviría como un “mejores prácticas” que cuenta con varios beneficios.
Además de proporcionar un proceso fiable y coherente para seguir en la ejecución de proyectos de extracción de datos, también infundiría confianza a los clientes y a las partes interesadas que buscan adoptar la minería de datos en sus organizaciones.
Cabe señalar que en 1996 la minería de datos acababa de recibir atención general y se encontraba en las primeras etapas y la formulación de un proceso estándar ayudaría a sentar las bases y las bases sólidas para los primeros adoptantes. Una mirada histórica más profunda de CRISP-DM se proporciona en el artículo por Wirth e Hipp (2000) .
Los Marco CRISP-DM se compone de seis etapas principales:
- Comprensión empresarial — Esto implica la comprensión de los objetivos y requisitos de un proyecto desde el punto de vista empresarial. Tales perspectivas de negocio se utilizan para averiguar qué problemas empresariales resolver a través del uso de la minería de datos.
- Comprensión de los datos — Esta fase nos permite familiarizarnos con los datos y esto implica realizar un análisis exploratorio de los datos. Tal exploración inicial de datos puede permitirnos averiguar qué subconjuntos de datos usar para seguir modelando, así como ayudar en la generación de hipótesis a explorar.
- Preparación de datos — Esta puede considerarse la fase más prolongada del proceso de extracción de datos, ya que implica una limpieza rigurosa de los datos y su preprocesamiento, así como la manipulación de los datos que faltan.
- Modelización — Los datos preprocesados se utilizan para la construcción de modelos en los que se utilizan algoritmos de aprendizaje para realizar análisis multivariables.
- Evaluación — Al llevar a cabo las cuatro etapas mencionadas, es importante evaluar los resultados acumulados y revisar el proceso realizado hasta ahora para determinar si se cumplen o no los objetivos empresariales establecidos inicialmente. Si se considera apropiado, es posible que sea necesario realizar de nuevo algunos pasos. Enjuaga y repite. Una vez que se considere que los resultados y el proceso son satisfactorios, entonces estamos dispuestos a pasar al despliegue. Además, en esta fase de evaluación, algunos hallazgos pueden encender nuevas ideas de proyectos para explorar.
- Despliegue — Una vez que el modelo es de calidad satisfactoria, se implementa el modelo, que puede ir desde un simple informe, una API a la que se puede acceder a través de llamadas programáticas, una aplicación web, etc.
En un puesto de 2010 “Una taxonomía de la ciencia de los datos” en el blog dataists, Hilary Mason y Chris Wiggins introdujeron el marco Osemn que constituye esencialmente una taxonomía del flujo de trabajo general que los científicos de datos normalmente realizan como se muestra en el diagrama a continuación. Poco después, en 2012, Davenport y Patil publicaron su artículo histórico “Data Scientist: El trabajo más sexy del siglo XXI” en el Harvard Business Review que ha atraído aún más la atención en el creciente campo de la ciencia de los datos.
Los Marco de la Oficina de la Condición Jurídica y Social de la Mujer se compone de cinco etapas principales y puede resumirse de la siguiente manera:
- Obtención de datos — Los datos forman el requisito del proceso de la ciencia de los datos y los datos pueden provenir de datos preexistentes o de datos recién adquiridos (de encuestas), de datos recientemente consultados (de bases de datos o API), descargados de Internet (por ejemplo. de repositorios disponibles en la nube como GitHub) o extraídos
- Datos de Scrub — La depuración de los datos es esencialmente una limpieza de los datos y esta fase se considera la más lenta, ya que supone la manipulación de los datos que faltan, así como su preprocesamiento lo más libre de errores y uniforme posible.
- Explorar datos — Se trata esencialmente de un análisis exploratorio de los datos y esta fase nos permite comprender los datos de manera que podamos determinar el curso de las acciones y las áreas que podemos explorar en la fase de modelización. Esto implica el uso de estadísticas descriptivas y visualizaciones de datos.
- Datos del modelo — A este respecto, utilizamos algoritmos de aprendizaje automático para dar sentido a los datos y obtener información útil que son esenciales para la adopción de decisiones basadas en los datos.
- Resultados de interpretación — Esta es quizás una de las fases más importantes y, sin embargo, la menos técnica en lo que se refiere a dar sentido a los datos al averiguar cómo simplificar y resumir los resultados de todos los modelos construidos. Esto implica sacar conclusiones significativas y racionalizar los conocimientos prácticos que, en esencia, nos permitirían determinar cuál es el próximo curso de acción. Por ejemplo, cuáles son las características más importantes que influyen en las etiquetas de clase ( Y variables).
En resumen, hemos cubierto el proceso de ciencia de datos mostrándole el ciclo de vida de la ciencia de datos altamente simplificado junto con los ampliamente populares marcos CRISP-DM y Osemn. Estos marcos proporcionan una orientación de alto nivel sobre el manejo de un proyecto de ciencia de datos de extremo a extremo en el que todos abarcan los mismos conceptos básicos de recopilación de datos, preprocesamiento, exploración, modelización, evaluación, interpretación y despliegue. Cabe señalar que el flujo entre estos procesos no es lineal y que en la práctica el flujo puede ser no lineal y puede re-iterar hasta que se cumpla una condición satisfactoria.
Trabajo a tiempo completo como Profesor Asociado de Bioinformática y Jefe de Minería de Datos e Informática Biomédica en una Universidad de Investigación en Tailandia. En mis horas después del trabajo, soy un YouTuber (AKA el Data Professor ) hacer videos en línea sobre ciencia de datos. En todos los videos tutoriales que hago, también comparto cuadernos Jupyter en GitHub ( Página del profesor GitHub ).
Artículos Relacionados: