¿Cuáles son las 5 etapas del proceso de ciencia de datos?

¿Y por qué son importantes para un lanzamiento exitoso

Los flujos de trabajo de Data Science tienden a ocurrir en una amplia gama de dominios y áreas de especialización como biología, geografía, finanzas o negocios, entre otros. Esto significa que los proyectos de Data Science pueden asumir retos y enfoques muy diferentes, resultando en métodos y conjuntos de datos muy diferentes que se utilizan. Sin embargo, esto no significa que no exista un flujo de trabajo común en la mayoría de estos proyectos. En la mayoría de los casos, un proyecto de Ciencia de Datos tendrá que pasar por cinco etapas clave: la definición de un problema, el procesamiento de datos, la modelización, la evaluación y el despliegue. Aquí voy a cubrir lo que cada una de estas etapas a menudo contiene y por qué son importantes para tener como parte de un exitoso proyecto de Ciencia de Datos.

Definir un problema

La primera etapa de cualquier proyecto de Ciencia de Datos es identificar y definir un problema por resolver. Sin un problema claramente definido para resolver, puede ser difícil saber cómo abordar el problema. Para un proyecto de Data Science esto puede incluir qué método usar, como clasificación, regresión o agrupación. Además, sin un problema claramente definido, puede ser difícil determinar cuál sería su medida del éxito. Sin una medida definida de éxito, nunca se puede saber cuándo su proyecto está completo o es lo suficientemente bueno para ser utilizado en la producción. Esto puede llevar a la pérdida de recursos y tiempo, como cuando una regresión logística simple habría alcanzado el objetivo en lugar de una complicada red neuronal de clasificación.

Un reto con esto es ser capaz de definir un problema lo suficientemente pequeño como para que pueda ser resuelto/abordado individualmente. En muchos casos un problema o tarea se puede dividir en muchos más pequeños que cuando se definen sería más fácil de resolver y medir. Un ejemplo de esto sería una empresa manufacturera que no es rentable. Tratar de abordar esto como un proyecto de Ciencia de Datos en su conjunto puede ser muy difícil. En realidad, esto podría dividirse en problemas más pequeños, como un cinturón de transporte lento, lo que significa que los productos no se arman lo suficientemente rápido, retrasos en las piezas críticas que ralentizan ciertas etapas de la construcción o la programación ineficiente de los trabajadores que llevan a muy pocos trabajadores en la planta. Cada uno de estos problemas podría entonces abordarse dentro de su propio proyecto de Ciencia de Datos, ya que podrían definirse claramente, medirse y tener una definición clara de éxito. Si no ha definido correctamente un pequeño problema, entonces no puede abordarlo correctamente.

Una vez que usted tiene un problema de negocio que necesita ser resuelto, usted puede entonces identificar cómo usted va a hacer frente a él y cómo definir el éxito. Esto es importante como si usted salta en un problema sin establecer una hoja de ruta potencial o una medida de éxito que a menudo se puede dejar con una solución que no resuelve su problema original o incluso crea uno más grande. Esto podría deberse a la pérdida de tiempo y recursos en una solución excesivamente diseñada o a una medida incorrecta del éxito que conduce a más problemas. En el caso de la planta de fabricación de arriba entonces, esto sólo conduciría a un aumento de los costos e incluso menores beneficios! Un proyecto infructuoso de Ciencia de Datos.

Procesamiento de datos

Una vez que usted tiene su problema, cómo va a medir el éxito, y una idea de los métodos que va a utilizar, entonces usted puede ir sobre la realización de la tarea de todo importante del procesamiento de datos. Esta es a menudo la etapa que tomará más tiempo en cualquier proyecto de Ciencia de Datos y puede ser regularmente la etapa más importante. Esto se debe a que no importa lo complicado o elegante que sea tu solución definitiva, si pones basura, conseguirás basura. Esto significa que tiene que asegurarse de que tiene todos los datos que necesita, que los datos son precisos y que lo tiene en el formato correcto para cualquier método que se propone utilizar.

Hay una variedad de tareas que tienen que ocurrir en esta etapa dependiendo de qué problema vas a abordar. La primera es a menudo encontrar maneras de crear o capturar datos que no existen todavía. Esto puede incluir encontrar maneras de medir la velocidad de la correa transportadora a través de la planta de fabricación y qué etapas se detiene y cuánto tiempo para identificar bloqueos, o la velocidad y/o orientación de un dispositivo de salud basado en la muñeca para identificar cuando alguien ha caído. Muchos proyectos de Data Science tendrán que hacer frente a este desafío, ya que a pesar de que hay muchas, muchas, muchas fuentes de datos por ahí, a veces es necesario encontrar una solución innovadora para crear y recopilar más.

Una vez que haya creado estos datos, tendrá que recogerlos en algún lugar y en un formato que sea útil para su modelo. Esto dependerá del método que utilices en la fase de modelado, pero implicará averiguar cómo introducirás los datos en tu modelo. Esto determinará si está utilizando streaming o procesamiento por lotes y qué formato se necesita. En el caso de la clasificación de imágenes, las imágenes a menudo tendrán que introducirse en el modelo en alguna forma de array, mientras que en regresión necesitará una columna Y y una columna X.

La parte final de esto es realizar cualquier paso de preprocesamiento para asegurar que los datos estén lo suficientemente limpios como para que el método de modelado funcione. Esto puede implicar eliminar valores atípicos, o elegir mantenerlos, manipular valores nulos, si un valor nulo es una medida o si debe imputarse a la media, o estandarizar las medidas. Visualizar los datos es a menudo clave en esta etapa para que usted tenga una buena comprensión de los datos con los que está trabajando y puede sugerir preliminarmente cuáles pueden ser los resultados de su modelo. De esta manera usted puede sentir sus resultados finales para ver si algo ha ido mal. A continuación, puede crear una tubería de sus datos a su modelo!

Modelización

La siguiente parte, y a menudo la parte más divertida y emocionante, es la fase de modelado del proyecto Data Science. El formato que tome dependerá principalmente de cuál es el problema y cómo definiste el éxito en el primer paso, y secundariamente de cómo procesaste los datos. Desafortunadamente, esta es a menudo la parte que tomará la menor cantidad de tiempo de cualquier proyecto de Ciencia de Datos, especialmente cuando hay muchos marcos o bibliotecas que existen, tales como sklearn, modelos de estadísticas, tensorflow y que se pueden utilizar fácilmente.

Debería haber seleccionado el método que utilizará para modelar sus datos en la etapa de definición de un problema, y esto puede incluir una simple exploración gráfica, regresión, clasificación o agrupación. En cualquier caso, la mayor parte del trabajo aquí será simplemente la elección de los métodos más relevantes, asegurando que los datos están en el formato correcto para ese método, y luego la formación del modelo. En el caso de la agrupación esto puede implicar el uso de K-Means, DB-Scan o Clustering Jerárquico, mientras que en el caso de la regresión esto puede implicar regresión lineal, bosques aleatorios y redes neuronales.

A menudo es mejor utilizar varios modelos en esta etapa para poder compararlos y contrastarlos cuando se trata de evaluación. Esto se debe a que si bien usted puede pensar que sabe la mejor solución, cuando se trata de proyectos de Ciencia de Datos el método más óptimo puede sorprenderle y necesita entender por qué. En este punto es necesario tener las habilidades y los conocimientos para seleccionar los modelos adecuados que deben aplicarse, especialmente en el caso de los recursos limitados, pero a menos que usted está utilizando los modelos más avanzados o crear el suyo propio, a menudo no tendrá que aventurarse demasiado lejos de los marcos existentes.

Evaluación

Una vez que hayas creado e implementado tus modelos, entonces necesitas saber cómo evaluarlos. Una vez más, esto se remonta a la etapa de formulación de problemas en la que habrás definido tu medida de éxito, pero esta es a menudo una de las etapas más importantes. Si usted no evalúa su modelo correctamente, entonces usted puede terminar con un modelo efectivamente inútil que usted no sabe si se está realizando como se pretende o no.

Dependiendo de cómo procesaste tus datos y configuraste tu modelo, es posible que tengas un conjunto de datos de espera o un conjunto de datos de prueba que se puedan utilizar para evaluar tu modelo. En este conjunto de datos, usted está tratando de ver lo bien que su modelo funciona en términos de precisión y fiabilidad. El primero es lo bien que su modelo se comporta en términos de la meta que usted estableció, mientras que el segundo es cómo consistentemente su modelo puede lograr, o no lograr, este objetivo. En este caso, un modelo sobrecapacitado puede funcionar bien en la formación, pero mal en las pruebas y la evaluación, mientras que un modelo poco entrenado puede funcionar mal en ambos. Su objetivo es tener un modelo que sea a la vez preciso y fiable.

La métrica que utilices para evaluar tu modelo dependerá de su propósito. En algunos casos, querrá centrarse exclusivamente en la precisión de su modelo, que puede medirse mediante métricas tales como R2, precisión, AUC o puntuación F1. En otros es posible que desee cambiar de precisión por alguna otra característica, como reducir la probabilidad de un error de tipo 1 o tipo 2. Por ejemplo, donde el costo de un falso positivo es alto, como en medicina, usted estaría dispuesto a tener un alto nivel de errores tipo 2 en lugar de error tipo 1. En otros sectores, donde el costo de un falso negativo es alto, entonces usted estaría dispuesto a aceptar algún error tipo 1 si reduce sus errores tipo 2. En algunos casos, la métrica de evaluación no es necesariamente numérica, sino si puede extraer los hallazgos que desea o ver el patrón de lo que desea. Si el modelo no encaja con su medida de éxito, es posible que tenga que volver a la etapa 1 y empezar de nuevo.

Despliegue

Finalmente, una vez que haya evaluado robustamente su modelo y esté satisfecho con los resultados, podrá implementarlo en la producción. Esto puede significar una variedad de cosas como si utiliza las ideas del modelo para hacer cambios en su negocio, si utiliza su modelo para comprobar si los cambios que se han hecho han tenido éxito, o si el modelo se implementa en algún lugar para recibir y evaluar continuamente datos en vivo.

El despliegue a menudo no es el final de la línea para el viaje de sus proyectos, sin embargo, como usted necesita prestar atención continuamente a cómo su modelo está funcionando. Esto se debe a que los datos en vivo que ingresa en el modelo pueden ser diferentes a los datos de formación o evaluación que utilizó, o si el modelo está aprendiendo continuamente, su comportamiento puede cambiar. Esto puede deberse a cambios sutiles de comportamiento a lo largo del tiempo, como en respuesta a su modelo, o cambios dramáticos en el comportamiento que ocurren de repente. El primero puede ocurrir cuando la gente ve la salida de su proyecto y así cambiar su comportamiento como usted esperaba o porque el tema que usted está mirando se hace más viejo y cambia. Esto último puede ocurrir cuando ocurren grandes acontecimientos como la pandemia y el uso de máscaras. En estos casos, usted necesita monitorear continuamente sus resultados para cualquier desviación o cambio y usted puede necesitar reentrenar su modelo en nuevos datos o incluso cambiar el modelo completamente para asegurarse de que todavía está resolviendo el problema de negocio original.

Conclusiones

Aunque cada proyecto de Ciencia de Datos puede ser diferente en términos de su enfoque o materia, hay etapas que son consistentes con la mayoría de los proyectos de Ciencia de Datos. Esto incluye: la definición de un problema, el procesamiento de datos, la modelización, la evaluación y el despliegue a la producción. Si un proyecto carece de uno de estos pasos a menudo puede significar que usted puede llegar a conclusiones equivocadas o puede estar mal diseñado. Pero no siempre es así, ya que hay excepciones a la regla. Tampoco significa que estas etapas procedan de una manera necesariamente lineal. De hecho, cada etapa puede alimentarse entre sí y usted puede moverse de ida y vuelta entre etapas, especialmente cuando el proyecto no siempre procede como se esperaba. El siguiente diagrama a menudo puede representar cómo estas diferentes etapas interactúan a veces

Aunque este no es un diagrama exhaustivo que muestra todas las interacciones, a menudo es uno de los más comunes.

Teniendo esto en cuenta, es importante ser flexible a la hora de abordar un problema de ciencia de datos y reconocer cómo interactúan las diferentes etapas. Un Proyecto de Ciencia de Datos nunca es completamente lo mismo que otro, pero todos deberían tener alguna forma de elementos reconocibles para ellos. ¡Buena suerte!

Si te gustó lo que leíste y aún no eres un miembro medio, ¡no dudes en inscribirte en Medium usando mi enlace de referencia a continuación para apoyarme a mí y a otros escritores increíbles en esta plataforma! Gracias por adelantado.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +