¿Cuál es el primer paso en un proyecto de ciencia de datos?
Muchos de los proyectos de ciencia de datos se lanzan con buenas intenciones, pero no se cumplen porque no se entiende el proceso correcto. Para lograr un buen desempeño y resultados en este trabajo, los primeros pasos deben incluir definir claramente los objetivos y resultados, recopilar datos y preparar y explorar los datos. Se trata de resolver problemas, lo que requiere un proceso sistemático.
La ciencia de los datos debe ser implementada de manera que permita que la toma de decisiones siga un proceso sistemático . Para poder tener eso, necesitamos un plan y una metodología para hacer un proyecto de ciencia de datos. Lamentablemente, la mayoría de los proyectos de ciencia de datos fracasan porque las personas involucradas no entienden claramente lo que tienen que hacer, o cuáles son las cosas más importantes para una empresa. Su solución debe estar ligada a las metas y objetivos de la empresa o sus departamentos.
En este artículo, voy a hablar de los primeros pasos de un proyecto de ciencia de datos y qué hacer para lograr un buen rendimiento y resultados en su trabajo. Este es un primer enfoque a la imagen completa de un proyecto de ciencia de datos que voy a estar hablando en artículos posteriores.
Pero primero, les contaré una pequeña historia sobre cómo la ciencia de los datos se desarrolla en una empresa (en un escenario común). Esto es lo que sucede:
- Tienes muchos datos que has estado recopilando durante meses o años, y alguien dice: “Tenemos muchos datos, tenemos que hacer algo al respecto”.
- La compañía decide crear nuevas áreas para empezar a pensar en cómo utilizar los datos para tomar decisiones. Se contrata a gente nueva para trabajar en estos campos recién creados.
- Los problemas de negocios se están transformando en problemas de ciencia de datos, y usted quiere utilizar los datos para resolverlos. La empresa contrata a “científicos de datos” y personas para recopilar y analizar datos. Alguien tiene que priorizar los problemas, y luego pasarlos a los equipos.
- Con la práctica de ciencia de datos en su lugar, usted comienza a resolver problemas con los datos, usando el aprendizaje automático, el análisis estadístico, y más. Hay muchos casos de uso para los departamentos de ciencia de datos, y todo el mundo quiere unirse a la revolución.
Como se puede ver, el proceso viene de las necesidades, pero no siempre es así. Hay empresas que comienzan con una mentalidad de ciencia de datos, por lo que el proceso podría ser un poco diferente.
Para empezar, necesitamos definir los primeros pasos de un proyecto de ciencia de datos:
Comprensión empresarial
Un paso crucial en el proceso de cualquier proyecto de ciencia de datos es conseguir el contexto de una empresa y un proyecto. En el contexto, me refiero a todos los detalles sobre cómo una empresa dirige sus proyectos, cómo se establece la empresa, sus competidores, cuántos departamentos existen, los diferentes objetivos y metas que tienen, y cómo miden el éxito o el fracaso.
Para un proyecto, es el mismo proceso. Usted tiene que saber todo lo anterior y también las expectativas, lo que cada persona en él hará, y cómo el proyecto encaja dentro del departamento que lo ejecuta, también cuántas personas están involucrados y lo que se espera de usted.
Recolección e ingestión de datos
La recolección de datos es el proceso sistemático de recolección y medición de información sobre variables de interés que permite responder a preguntas de investigación, probar hipótesis y evaluar resultados.
Hay varias formas de trabajar en el espacio de datos y también varias funciones. Pero lo común que tienen es que todos usan datos. Y usted quiere ser capaz de tener los mejores datos posibles al resolver problemas de negocio.
La recopilación de datos necesita un proceso. No es sólo obtener datos de la nada, tenemos que hacerlo consistentemente, no es aleatorio, tenemos que planificar para ello, y también depende de los ingenieros, arquitectos de datos, DataOps y más personas que sólo el científico de datos.
Una de las cosas más difíciles, cuando estás trabajando con un nuevo conjunto de datos, es descubrir las características más importantes para predecir tu objetivo, y también, donde puedes encontrar nuevas fuentes de información que puedan mejorar tu comprensión de los datos y tus modelos.
Una cantidad increíble de datos está por ahí sólo esperando por ti, listo para ir, y es lo que se llama datos abiertos. Ahora, la idea con datos abiertos es esta. Son datos que son gratuitos, fácilmente accesibles, y se pueden descargar en formas convenientes como, por ejemplo, un CSV o valores separados por comas, que es una forma común de datos de hoja de cálculo.
Análisis y preparación de datos exploratorios
Después de recopilar sus datos, necesita entenderlos y analizarlos. El proceso de análisis de datos y preparación es donde usted puede comprobar si los pasos anteriores se hicieron correctamente, o tal vez usted necesita pensar en el caso de negocio de nuevo, o tal vez usted necesita más datos o diferentes datos.
Aquí es donde se aplicará una gran cantidad de conceptos de análisis estadístico y también álgebra para sacar el máximo provecho de sus datos. Hay grandes herramientas para analizar datos de forma gratuita como SQL, Python o R, o puedes hacerlo incluso con herramientas como Excel, o si tienes las posibilidades, puedes usar plataformas como Tableau, PowerBI y Explorium.
Usted necesita recordar que la ciencia de los datos no se trata de software, saber cómo codificar, o ser capaz de leer datos de diferentes bases de datos. Se trata de resolver problemas. Una analogía sería decir que la física no se trata de cálculo, objetos en movimiento, álgebra; se trata de estudiar la naturaleza, entenderla y modelarla.
Además, la ciencia de los datos es un proceso iterativo. Iterando, una y otra vez, repensando el proceso y las necesidades del negocio, experimentando mucho, escuchando lo que los datos tienen que decir, entendiendo y animando al negocio a entender que la opinión de los datos siempre debe ser incluida en las discusiones del producto, encontrando un camino crítico para resolver el problema y luego organizando al equipo alrededor de completarlo y yendo más allá, dejando que los modelos resuelvan los problemas, por supuesto utilizando nuestra experiencia para ayudarlos, pero no sesgándolos.
La ciencia de los datos va de los datos al valor, pero necesitamos tener un buen punto de partida. Si usted tiene una mala comprensión del contexto empresarial, incluso si usted es un experto en el aprendizaje automático, usted no será capaz de resolver el problema. Si no recopilas los datos siguiendo un proceso sistemático que te permite obtener las mejores fuentes de información y utilizar los datos que ya tienes, es imposible lograr tus objetivos, y finalmente, si no te tomas el tiempo para analizar y preparar los datos, no serás capaz de validar los últimos pasos y llegar a hipótesis para los conductores de los problemas identificados.
Hay un montón de lugares para encontrar este tipo de datos, pero puede ser complicado reunirlo algunas veces. Por suerte tenemos herramientas como Explorium que hacen todo fácil - aprender más sobre Aquí Explorium. .
Artículos Relacionados:
- ¿Cuáles son los pasos del proceso de ciencia de datos?
- ¿Cómo debería empezar con la ciencia de datos?
- ¿Cuál es la mejor manera de iniciar la ciencia de los datos?
- ¿Cómo estructura un proyecto de ciencia de datos?
- ¿Cuál de los siguientes pasos del proyecto de ciencia de datos es el más crítico para el éxito del proyecto?