¿Cuál es el ciclo de vida del proyecto de ciencia de datos?
La primera vez que escuché la palabra ciencia de los datos fue en la universidad cuando mis mentores — la profesora Francisca Oladipo y Dayo Akinbami, tomaron un curso titulado “Introducción a la ciencia de los datos”.
Antes de entrar en la universidad, no sabía qué carrera elegir en Ciencias de la Computación ( ya que tenía varias opciones en mente ). Pero, me alegro de haber tomado ese curso introductorio de ciencia de datos. Lo menos que puedo decir es que me motivó a encontrar un mejor camino e iniciar una carrera en ciencias de datos, y estoy agradecido por lo lejos que he llegado.
Aunque no soy el tema de este artículo, creo que es bueno que entiendas cómo me metí en la ciencia de los datos. También quiero usar mi historia para motivarte que si pudiera llegar tan lejos, tú puedes hacer más. Cuidado, estoy empezando, y mi visión es convertirme en un profesional de datos de clase mundial (según todos los estándares) en los próximos años.
Mi principal objetivo para escribir este artículo es desmitificar la palabra “ ciencias de los datos “, ayudando tanto a individuos como a empresas a entender lo que significa y las diferentes etapas involucradas en la construcción de modelos de ciencia de datos. En artículos posteriores, voy a discutir los roles basados en la ciencia de datos y las habilidades que necesita para convertirse en un científico de datos de primera clase.
Lo sé. no todos debemos convertirnos en científicos de datos . Sin embargo, mi alegría será completa si este artículo ayuda al menos a una sola persona a encontrar el pie derecho en la ciencia de datos, al igual que el curso de ciencia de datos me inspiró a empezar.
Vamos a entrar en esto juntos.
El término “Ciencia de datos” es una de las palabras de moda más comunes que se pueden encontrar en Internet hoy en día, pero tiende a ser un concepto difícil de entender. Si le pides a tres expertos que expliquen lo que significa Ciencia de Datos, es más probable que obtengas cuatro definiciones diferentes.
A los efectos de este artículo, prefiero ceñirme a esta definición:
“D ata Science es un campo de estudio multidisciplinar que combina habilidades de programación, conocimientos de dominio y conocimientos de estadística y matemáticas para extraer información útil y conocimientos a partir de datos”. Los que practican la ciencia de los datos se llaman “ científicos de datos ”. Combinan una amplia gama de habilidades y tecnologías modernas para analizar los datos recopilados de sensores, clientes, teléfonos inteligentes, la web y otras fuentes.
Vamos a descomponerlo un poco. ¿Te acuerdas de aquellos tiempos cuando navegas por un producto en una plataforma de comercio electrónico, y finalmente ves una tira de productos relacionados colocados debajo de los detalles del producto con el título “............................................................................................................... Los clientes que compraron este producto también compraron... ” o “............................................................................................................... comprados juntos con frecuencia ” ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ Esa es una gran técnica de ciencia de datos utilizada por grandes minoristas como Amazon para descubrir la asociación entre los artículos y la venta cruzada a clientes nuevos y existentes.
Me gusta pensar que la ciencia de los datos es uno de los campos más emocionantes en existencia hoy en día, y hay tantas razones por las que se ha convertido en una palabra de moda en casi todas las industrias o nichos. Uno de los principales contribuyentes es que cada organización está sentada en un tesoro de datos que pueden proporcionar beneficios masivos . La segunda razón es que la ciencia de los datos es una tecnología transformadora e invaluable que alimenta la economía digital, al igual que el petróleo alimentaba la economía industrial.
Cuando se hace correctamente, la ciencia de los datos produce información valiosa y revela tendencias que las empresas pueden aprovechar para planificar estratégicamente, optimizar los procesos empresariales, tomar decisiones mejor informadas, crear servicios y productos más innovadores, y más. Un ciclo de vida típico de la ciencia de los datos comprende varias etapas. En la siguiente sección, les mostraré las diferentes fases y lo que cada etapa implica.
Muchas organizaciones e individuos hablan de proyectos y productos de ciencia de datos, pero sólo un puñado entiende los pasos involucrados en la construcción de un producto o modelo de ciencia de datos. Una cosa que he llegado a descubrir hasta ahora es que sólo unas pocas organizaciones tienen la infraestructura adecuada para la ciencia de datos. La mayoría de las empresas modernas necesitan experimentar transformaciones significativas para beneficiarse de la ciencia de los datos.
En la sección restante de este post, voy a discutir los diferentes pasos que necesita para construir un modelo de ciencia de datos o producto. Cada organización puede adoptar la metodología, independientemente de su nicho o tamaño.
Lo primero que tienes que hacer antes de empezar a recopilar datos y construir un modelo de aprendizaje automático es definir y entender el problema que estás tratando de resolver . Usted necesita ser capaz de transformar las necesidades del negocio en preguntas de ciencia de datos y pasos procesables. Una buena manera de abordar esto es mediante el compromiso con las personas adecuadas cuyo negocio o proceso que desea mejorar o optimizar y hacer las preguntas apropiadas.
Creo que los productos o modelos de ciencia de datos no deberían existir de forma aislada. En su lugar, deberían ayudar a las empresas a transformar las operaciones comerciales existentes, mejorar los procesos comerciales o identificar las causas y posibles soluciones a los malos comentarios de los clientes y las ventas deficientes, etc. Por lo tanto, es útil para entender realmente el problema de negocios y evaluar si se puede resolver utilizando la ciencia de datos. Eso es porque no todos los problemas de negocios pueden ser resueltos usando la ciencia de datos. Una mejor comprensión del problema del negocio aumenta sus posibilidades de construir grandes productos basados en datos que pueden impactar positivamente a una organización.
El siguiente paso después de la comprensión de los problemas es: recoger el conjunto adecuado de datos . La recopilación de datos es esencial, y es prácticamente difícil o (casi imposible) construir un buen modelo sin datos de calidad o el mecanismo para recopilar los datos.
Basándome en mi investigación e interacciones con varios profesionales de la ciencia de los datos, puedo decir categóricamente que muchas organizaciones recopilan datos poco fiables e incompletos, y todo lo que hacen después es un desastre. Algunas organizaciones ni siquiera saben qué tipo de datos recopilar o dónde residen los datos.
Creo que los datos a recopilar depende del problema de negocio que está tratando de resolver. Por ejemplo, los datos perfectos para el análisis del riesgo de crédito de los clientes normalmente deben incluir datos demográficos, información sobre préstamos y datos de reembolso, estados de transacciones o datos de telecomunicaciones. Será bastante inapropiado recoger datos sobre la altura del cliente, el tamaño del zapato o la longitud del pantalón para este mismo problema.
Con la aparición de tecnologías modernas como el raspado web, herramientas de recopilación de datos en la nube y APIs web; sistemas de bases de datos como MongoDB, PostgreSQL y MySQL; y herramientas como SQL, Python, R, Beautiful Soup, Scrapy, Spark, Apache, e.t.c, puede extraer datos valiosos de cualquier lugar en cualquier momento.
No es suficiente recopilar datos sin procesarlos. Al igual que el oro puro, los datos en bruto apenas son utilizables e inútiles en su forma pura. Una vez recopilado el conjunto de datos adecuado, necesita limpiar adecuadamente y procesar los datos antes de proceder al siguiente paso.
En un mundo ideal, es más probable que recopile datos no estructurados, irrelevantes y no filtrados. Si usted procede a construir un modelo ML sin tratamiento de datos y limpieza, sus resultados de análisis definitivamente no tendrán ningún sentido. Es así de simple: malos datos producen modelos terribles , no importa cuánto afinas los parámetros o optimizas los hiperparametros de tu modelo. En gran medida, la precisión y eficacia de su análisis dependen en gran medida de la calidad de sus datos.
Trabajando como científico de datos, he encontrado varias formas de problemas de datos, incluyendo valores duplicados y nulos, tipos de datos inconsistentes, datos faltantes, entradas inválidas, formato incorrecto e.t.c que tuve que resolver antes de proceder.
Es importante señalar que la mayoría de los científicos de datos dedican tiempo a la recopilación, limpieza y procesamiento de datos. Algunos profesionales de datos incluso argumentan que se necesita 80% del tiempo dedicado a un proyecto de datos . Si quieres construir grandes modelos de ciencia de datos, necesitas encontrar y resolver defectos e inconsistencias en el conjunto de datos. Aunque la limpieza de datos es dolorosa y engorrosa, usted conseguirá a través y beneficiarse de ella siempre y cuando permanezca enfocado en el objetivo final.
En este punto, usted tiene una gran cantidad de datos. Usted ha sido capaz de limpiar y procesar los datos para ser lo más organizado posible. Es hora de Inspeccione profundamente todas las características de los datos, propiedades de los datos, cree confianza en los datos, obtenga intuición sobre los datos, realice un chequeo de la cordura, averigüe cómo manejar cada característica. t.c.p. Todo este proceso se denomina análisis de datos exploratorios (EDA) — una de las palabras comunes en la ciencia de los datos.
Una de las razones por las que me gusta EDA es que me ayuda a hacer varias preguntas sobre los datos, explorar y visualizar mejor diferentes conjuntos de datos para identificar patrones, y descubrir información valiosa útil en los siguientes pasos del ciclo de vida del ML. También me expone a pensar de manera innovadora y analítica.
La fase de construcción y evaluación del modelo es donde se realiza el modelado real de los datos. De hecho, muchos científicos de datos creen que la “magia real sucede” en esta fase. Lo primero que tienes que hacer en esta etapa es dividir el conjunto de datos limpiado del paso anterior en trenes y conjuntos de pruebas.
Usted debe utilizar el conjunto de entrenamiento para construir modelos predictivos y evaluar el rendimiento de su modelo en los puntos de datos invisibles (conjunto de pruebas). Los problemas de ML se clasifican generalmente como supervisados o no supervisados. El aprendizaje supervisado implica la construcción de un modelo que pueda predecir con precisión la variable objetivo utilizando un conjunto de características conocidas como predictores. Mientras que el aprendizaje no supervisado es un enfoque de autoaprendizaje donde el modelo tiene que encontrar todo tipo de patrones desconocidos y relaciones entre todos los predictores.
Usted puede utilizar varias métricas de evaluación para examinar lo bien que funciona su modelo, y la elección de métricas para utilizar depende del tipo de problema que está tratando de resolver. No te molestaré con esos términos técnicos de aprendizaje automático. Tal vez, voy a escribir un artículo sobre algunas métricas de evaluación comunes para problemas supervisados y no supervisados pronto.
Sobre la base de los resultados de la evaluación, es posible que tenga que ajustar los parámetros del modelo para asegurarse de que generaliza bien y puede funcionar bien cuando se expone a datos previamente invisibles. Este proceso se conoce como afinación hiperparamétrica, y creo que se mejora a medida que se construyen más modelos y se practica utilizando varios valores de parámetros.
Después de construir y evaluar el modelo, usted necesita comunicar los resultados del modelo y presentar sus hallazgos a las partes interesadas.
B Ased en mi experiencia, He descubierto que los ejecutivos de alta dirección no están interesados en el algoritmo de fantasía que utilizaste para construir el modelo o el número de hiperparametros utilizados. Están principalmente interesados en entender lo que pueden hacer con su modelo y cómo impulsará su negocio hacia adelante.
Como tal, cada científico de datos necesita tener buenas habilidades de presentación y narración de datos para mostrar cómo un modelo ayuda a abordar los problemas empresariales identificados en la primera fase del ciclo de vida. El uso de redacción sofisticada y poner fórmulas complejas en su diapositiva de presentación no le llevará lejos. Pero al mostrar el valor real de su modelo de una manera precisa y concisa, se hace más fácil para los ejecutivos adoptar el modelo.
La comunicación no suele ser la última fase del ciclo de vida del proyecto de ciencia de datos. Una vez que las partes interesadas estén satisfechas con los resultados de su modelo, el siguiente paso es implementar el modelo. Un modelo de aprendizaje automático no está construido para residir en una máquina local para siempre . Necesita generar valor para las organizaciones, y la única manera de utilizar el modelo para tomar decisiones prácticas basadas en datos es entregándolo a los usuarios finales. Me gusta la forma en que Luigi Patruno lo pone en esto artículo -”.............................................................................................................................................................................................. Ningún modelo de aprendizaje automático es útil a menos que se despliegue a la producción ”.
Realmente no me gusta el proceso de despliegue del modelo debido a lo engorroso que puede llegar a ser a veces. Además, involucra muchos back-and-forths entre científicos de datos, profesionales de negocios, ingenieros de software y equipos de TI. Lo último que mencionaré en esta sección es el mantenimiento del modelo. Cuando me metí por primera vez en la ciencia de datos, siempre pensé que un científico de datos sólo puede construir un modelo, implementarlo y luego relajarse mientras el modelo sigue trabajando para siempre. Pero, no pasó mucho tiempo antes de descubrir que al igual que las máquinas necesitan mantenimiento, los modelos de aprendizaje de máquina necesitan ser mantenidos también .
Los " desplegar una vez y ejecutar para siempre ” la práctica es mala porque varios factores podrían afectar el poder predictivo de un modelo de ML con el tiempo. La pandemia de Covid-19 es un buen ejemplo de un acontecimiento impredecible . Yo esperaría que todas las organizaciones han actualizado o ya están planeando actualizar todos los modelos de ML que construyeron antes de la pandemia para capturar los nuevos patrones de clientes y comportamientos expuestos durante la pandemia. En general, cada organización debe tener una estrategia modelo de actualización para actualizar constantemente sus datos y readiestrar su modelo de ML: puede ser a intervalos de 3, 6 ó 9 meses .
En este post, fui capaz de explicar lo que significa ciencia de datos. Después, me adelanté a describir las diferentes etapas de un ciclo de vida de un proyecto de ciencia de datos, incluyendo la comprensión de problemas empresariales, recolección de datos, limpieza y procesamiento de datos, análisis de datos exploratorios, construcción y evaluación de modelos, comunicación de modelos, implementación de modelos y evaluación.
Asumo que ahora entiendes cómo funciona la ciencia de los datos y los pasos que necesitas para construir un modelo de ciencia de los datos. Si usted tiene más preguntas o necesita algunas aclaraciones más, por favor no dude en dejar sus comentarios a continuación. En mis posts posteriores, discutiré los diferentes roles de la ciencia de datos en la industria y las habilidades que necesitas para convertirte en un científico de datos de primera categoría.
Gracias por leer. Usted puede compartir el post con sus amigos y la red también.
Artículos Relacionados: