¿Cuál de los siguientes pasos del proyecto de ciencia de datos es el más crítico para el éxito del proyecto?
A menudo, cuando hablamos de proyectos de ciencia de datos, nadie parece ser capaz de llegar a una explicación sólida de cómo va todo el proceso. Desde la recolección de los datos, hasta el análisis y la presentación de los resultados
En este post, descompongo el marco de la ciencia de los datos, llevándolos a través de cada paso del ciclo de vida del proyecto, mientras discuto cuáles son las habilidades y requisitos clave.
Les guiaré a través de este proceso utilizando el marco Osemn, que cubre cada paso del ciclo de vida del proyecto de ciencia de datos de extremo a extremo.
El primer paso de un proyecto de ciencia de datos es sencillo. Obtenemos los datos que necesitamos de las fuentes de datos disponibles.
En este paso, tendrá que consultar las bases de datos, utilizando habilidades técnicas como MySQL para procesar los datos. También puede recibir datos en formatos de archivo como Microsoft Excel. Si está utilizando Python o R , tienen paquetes específicos que pueden leer datos de estas fuentes de datos directamente en sus programas de ciencia de datos.
Los diferentes tipos de bases de datos que puede encontrar son como PostgreSQL , Oráculo , o incluso bases de datos no relacionales (NoSQL) como MongoDB . Otra manera de obtener datos es raspar de los sitios web utilizando herramientas de raspado web como Hermosa sopa .
Otra opción popular para recopilar datos es conectarse a las API web. Sitios web como Facebook y Twitter permiten a los usuarios conectarse a sus servidores web y acceder a sus datos. Todo lo que necesitas hacer es usar su API web para rastrear sus datos.
Y por supuesto, la forma más tradicional de obtener datos es directamente de archivos, como descargarlos de Kaggle o datos corporativos existentes que se almacenan en formato CSV (valor separado de comas) o TSV (valores separados de pestañas). Estos archivos son archivos de texto plano. Necesitará utilizar un formato especial de Parser, ya que un lenguaje de programación regular como Python no lo entiende de forma nativa.
Capacidades requeridas
Para realizar las tareas anteriores, necesitará ciertas habilidades técnicas. Por ejemplo, para la gestión de bases de datos, tendrá que saber cómo utilizar MySQL , PostgreSQL o MongoDB (si está utilizando un conjunto de datos no estructurado).
Si usted está buscando para trabajar en proyectos en un conjunto de datos mucho más grandes, o big data, entonces usted necesita aprender cómo acceder a través de almacenamiento distribuido como Apache Hadoop , Chispa o Flink .
Después de obtener datos, lo siguiente que hay que hacer es limpiar los datos. Este proceso es para “limpiar” y filtrar los datos. Recuerde el “ basura dentro, basura fuera ” filosofía, si los datos no son filtrados e irrelevantes, los resultados del análisis no significará nada.
En este proceso, es necesario convertir los datos de un formato a otro y consolidar todo en un formato estandarizado a través de todos los datos. Por ejemplo, si sus datos se almacenan en varios archivos CSV, usted consolidará estos datos CSV en un solo repositorio, para que pueda procesarlos y analizarlos.
En algunas situaciones, también tendremos que filtrar las líneas si está manejando archivos bloqueados. Los archivos bloqueados se refieren a los archivos bloqueados web donde se llega a entender datos tales como la demografía de los usuarios, hora de entrada en sus sitios web, etc.
Además de eso, el lavado de datos también incluye la tarea de extraer y reemplazar valores. Si se da cuenta de que faltan conjuntos de datos o que podrían parecer no-valores, este es el momento de reemplazarlos en consecuencia.
Por último, también tendrá que dividir, fusionar y extraer columnas. Por ejemplo, para el lugar de origen, usted puede tener tanto “Ciudad” como “Estado”. Dependiendo de sus requisitos, es posible que necesite fusionar o dividir estos datos.
Piense en este proceso como organizar y ordenar los datos, eliminando lo que ya no es necesario, reemplazando lo que falta y estandarizando el formato en todos los datos recopilados.
Habilidades requeridas
Necesitarás herramientas de scripting como Python o R para ayudarte a borrar los datos. De lo contrario, puede utilizar una herramienta de código abierto como OpenRefine o comprar software empresarial como SAS Enterprise Miner para ayudarle a facilitar a través de este proceso.
Para manejar conjuntos de datos más grandes se requiere que usted tenga habilidades en Hadoop, Mapa Reducir o Spark. Estas herramientas pueden ayudarle a borrar los datos mediante scripting.
Una vez que sus datos estén listos para ser utilizados, y justo antes de entrar en IA y Machine Learning, tendrá que examinar los datos.
Por lo general, en un entorno corporativo o empresarial, su jefe sólo le lanzará un conjunto de datos y depende de usted para darle sentido. Así que le corresponderá a usted ayudarles a averiguar la cuestión del negocio y transformarlos en una cuestión de ciencia de datos.
Para lograrlo, tendremos que explorar los datos. En primer lugar, tendrá que inspeccionar los datos y sus propiedades. Diferentes tipos de datos como datos numéricos, datos categóricas, datos ordinales y nominales, etc. requieren diferentes tratamientos.
Entonces, el siguiente paso es calcular estadísticas descriptivas para extraer características y probar variables significativas. La prueba de variables significativas a menudo se hace con correlación. Por ejemplo, explorar el riesgo de que alguien tenga presión arterial alta en las relaciones con su altura y peso. Note que algunas variables están correlacionadas, pero no siempre implican causalidad.
Término “ Característica ” utilizado en Machine Learning o Modelling, son las características de los datos que nos ayudan a identificar las características que representan los datos. Por ejemplo, “ Nombre ”, “ Edad ”, “ Género ” son características típicas del conjunto de datos de miembros o empleados.
Por último, utilizaremos la visualización de datos para ayudarnos a identificar patrones y tendencias significativos en nuestros datos. Podemos obtener una mejor imagen a través de gráficos simples como gráficos de líneas o gráficos de barras para ayudarnos a entender la importancia de los datos.
Habilidades requeridas Si está usando Python, necesitará saber cómo usar Numpy, Matplotlib, Pandas o Scipy; si está usando R, necesitará usar GGplot2 o el cuchillo suizo de exploración de datos Dplyr. Además de eso, necesitas tener conocimientos y habilidades en estadísticas inferenciales y visualización de datos.
Por mucho que no necesites un Master o Ph.D. para hacer ciencia de datos, estas habilidades técnicas son cruciales para llevar a cabo un diseño experimental, por lo que eres capaz de reproducir los resultados.
Consejos adicionales:
- Sé curioso. Esto te puede ayudar a desarrollar tus sentidos spidey para detectar patrones y tendencias extrañas.
- Concéntrate en tu audiencia, y entiende sus antecedentes y jerga. Así que usted es capaz de presentar los datos de una manera que tiene sentido para ellos.
Esta es la etapa en la que la mayoría de la gente considera interesante. Como mucha gente lo llama “ donde sucede la magia ”.
Una vez más, antes de llegar a esta etapa, tenga en cuenta que la etapa de lavado y exploración es igualmente crucial para la construcción de modelos útiles. Así que tómese su tiempo en esas etapas en lugar de saltar directamente a este proceso.
Una de las primeras cosas que necesita hacer en el modelado de datos es reducir la dimensión de su conjunto de datos. No todas sus características o valores son esenciales para predecir su modelo. Lo que tienes que hacer es seleccionar los relevantes que contribuyen a la predicción de resultados.
Hay algunas tareas que podemos realizar en el modelado. También podemos entrenar modelos para realizar la clasificación para diferenciar los correos electrónicos que recibió como “ Bandeja de entrada ” y “ Spam ” utilizando regresiones logísticas. También podemos predecir valores usando regresiones lineales. También podemos utilizar la modelización para agrupar datos para entender la lógica detrás de esos clusters. Por ejemplo, agrupamos a nuestros clientes de comercio electrónico para que comprendan su comportamiento en su sitio web. Esto requiere que identifiquemos grupos de puntos de datos con algoritmos de clustering como k-means o clustering jerárquico.
En resumen, utilizamos regresión y predicciones para predecir valores futuros, y clasificación para identificar y agrupar los valores de grupo.
Habilidades requeridas
En Machine Learning, las habilidades que necesitarás son algoritmos supervisados y no supervisados. Para bibliotecas, si está usando Python, necesitará saber cómo usar Aprender a la ciencia-kit ; y si está usando R, tendrá que utilizar CUIDADO .
Después del proceso de modelado, tendrá que ser capaz de calcular los puntajes de evaluación tales como precisión, memoria y puntuación F1 para la clasificación. Para las regresiones, es necesario estar familiarizado con R2 para medir la bondad de ajuste, y utilizando puntuaciones de error como MAE (Error medio medio), o RMSE (Error cuadrado medio de root) para medir la distancia entre los puntos de datos predichos y observados.
Estamos en el paso final y más crucial de un proyecto de ciencia de datos, interpretando modelos y datos. El poder predictivo de un modelo reside en su capacidad de generalizar. ¿Cómo explicamos un modelo depende de su capacidad para generalizar datos futuros invisibles.
La interpretación de los datos se refiere a la presentación de sus datos a un lego no técnico. Entregamos los resultados para responder a las preguntas de negocios que hicimos cuando iniciamos el proyecto, junto con los conocimientos prácticos que encontramos a través del proceso de ciencia de datos.
La perspicacia procesable es un resultado clave que mostramos cómo la ciencia de los datos puede producir análisis predictivos y luego análisis prescriptivos. En el cual, aprendemos a repetir un resultado positivo, o prevenir un resultado negativo.
Además de eso, tendrá que visualizar sus hallazgos en consecuencia, manteniéndolo impulsado por sus preguntas de negocio. Es esencial presentar sus hallazgos de tal manera que sea útil para la organización, o de lo contrario sería inútil para sus partes interesadas.
En este proceso, los conocimientos técnicos no son suficientes. Una habilidad esencial que usted necesita es ser capaz de contar una historia clara y procesable. Si su presentación no desencadena acciones en su audiencia, significa que su comunicación no fue eficiente. Recuerde que se presentará a una audiencia sin antecedentes técnicos, por lo que la forma en que comunica el mensaje es clave.
Habilidades requeridas
En este proceso, las habilidades clave para tener están más allá de las habilidades técnicas. Usted necesitará un conocimiento sólido del dominio de negocio para presentar sus hallazgos de una manera que pueda responder a las preguntas de negocio que usted se propuso responder, y traducirlos en pasos procesables.
Aparte de las herramientas necesarias para la visualización de datos como Matplotlib, ggplot, Nacida en el mar , Tableau , d3js etc., necesitará habilidades suaves como habilidades de presentación y comunicación, emparejadas con un estilo para informar y habilidades de escritura sin duda le ayudará en esta etapa del ciclo de vida del proyecto.
Lo que he presentado aquí son los pasos que los científicos de datos siguen cronológicamente en un proyecto típico de ciencia de datos. Si se trata de un proyecto completamente nuevo, por lo general pasamos entre el 60 y el 70% de nuestro tiempo sólo en la recopilación y limpieza de los datos. Dado que es un marco, puede usarlo como guía con sus herramientas favoritas.
El verdadero norte es siempre que las preguntas de negocios que definimos, antes incluso de iniciar el proyecto de ciencia de datos. Siempre recuerde que las preguntas de negocios sólidas, los datos limpios y bien distribuidos siempre vencen a los modelos de lujo.
Espero que hayas aprendido algo hoy. Siéntete libre de dejar un mensaje si tienes algún feedback, y comparte con cualquiera que pueda encontrar esto útil.
Artículos Relacionados:
- ¿Cuál es el primer paso en un proyecto de ciencia de datos?
- ¿Cuáles son los 6 pasos típicamente involucrados en el proceso de ciencia de datos?
- ¿Cuáles son las 5 etapas del proceso de ciencia de datos?
- ¿Qué paso en el proceso de ciencia de datos es el más importante qué paso toma el tiempo más largo para completar?