¿Qué toma más tiempo en un proyecto de ciencia de datos?

Este post puede contener vínculos de pago a mis recomendaciones personales que ayudan a apoyar el sitio!

Todavía recuerdo la primera vez que tuve la idea de iniciar un proyecto de ciencia de datos por mi cuenta y mi primer pensamiento fue: ¿Cuánto tiempo me llevaría un proyecto de ciencia de datos?

He hecho la investigación y Aquí hay un resumen:

Tomará entre 2 semanas y 6 meses completar un proyecto típico de ciencia de datos. La duración del proyecto puede variar en gran medida en función del volumen de datos, el tiempo de procesamiento y el tamaño del equipo del proyecto. Por lo tanto, la duración de los proyectos de ciencia de datos puede variar según los recursos y necesidades del proyecto.

Los proyectos de ciencia de datos suelen incluir varias etapas que varían en duración dependiendo de varios factores. Estos factores suelen acortar o alargar el proyecto en general. Echemos un vistazo a cada etapa y cuánto tiempo puede tomar cada una de ellas.

¿Cuáles son las etapas de un proyecto de ciencia de datos y cuánto tiempo tardan?

Etapa 1. Recopilación de datos

Para empezar con cualquier Proyecto de ciencia de los datos , tendría que empezar a recoger algunos datos de varias fuentes de datos. Yo diría que esto puede potencialmente ser el paso más largo pero más crucial de su proyecto de ciencia de datos. Porque lo que es ciencia de datos sin datos, ¿verdad?

¿Por qué tomaría mucho tiempo la colección? Eso es porque esta etapa requiere un una fuerte comprensión de las bases de datos y cómo se almacenan sus datos. Dependiendo de las bases de datos con las que trabaje, puede estar trabajando con archivos de texto planos como archivos CSV (valor separado de coma) y archivos de Microsoft Excel a bases de datos relacionales en MySQL . Otras fuentes de datos comunes incluyen datos no relacionados MongoDB así como las API Web.

Estas bases de datos requieren el conocimiento de una pila de datos variada, que puede ser un problema al iniciar su primer proyecto de ciencia de datos. En esta etapa, la mezcla de datos y la unión a través de Structure Query Language (SQL) es común. Dependiendo del nivel de habilidad de SQL, este proceso puede prolongar la duración de su proyecto de ciencia de datos.

Además, si los conjuntos de datos son grandes (decenas de millones de filas), entonces el proceso de recopilación de datos podría ampliarse.

Tiempo requerido: 2 semanas O 20% de la cronología de su proyecto

Etapa 2. Limpieza de datos

El siguiente paso en su proyecto de ciencia de datos es procesar los datos asegurándose de que estén limpios. Y por limpio, quiero decir que los datos deben ser de formatos consistentes, libres de registros duplicados, libres de valores perdidos, y colocados en una forma estructurada. ¿A quién no le gusta cuando las cosas están limpias y ordenadas? Ok, algunos pueden disfrutar de desordenes organizados pero por favor recuerden la regla número uno de la ciencia de datos.

“La basura dentro, la basura fuera”

Cada científico de datos exitoso

Este proceso de ordenar los datos puede ser muy Consumiendo mucho tiempo , así que espera La mayor parte de tu tiempo que se dediquen a realizar trabajos durante este período. Datos desordenados pueden afectar realmente cuánto tiempo puede durar su proyecto de ciencia de datos. Esto es probablemente debido al ruido de la combinación de múltiples fuentes de datos dispares.

A pesar de tomar la duración más larga de su proyecto, este esencial etapa es lo que haría de su proyecto un impacto que puede traer verdadera visión de sus modelos más adelante.

Como esta etapa requiere una gran cantidad de habilidades técnicas, yo diría que Este proceso de limpieza puede tomar fácilmente la mitad del tiempo de su proyecto.

Tiempo requerido: 5 semanas O 50% de la cronología de su proyecto

Etapa 3. Exploración de datos

Para esta etapa, todos sus datos deben estar limpios y ordenados, excepto que aún no están listos para su interpretación. De aquí viene la ciencia de la ciencia de los datos. A través de la exploración de datos, podemos descubrir tendencias útiles que puede conducir a una hipótesis a ser probado en contra.

La exploración debe consumir mucho menos tiempo que antes, con análisis descriptivo simple y visualizaciones de paquetes comunes como ggplot2 o Matplotlib. Esto se puede mejorar mediante el uso de herramientas de inteligencia de negocios (BI) como Tableau y Microsoft Power BI proporcionar un análisis y detección rápidos de las tendencias. Por lo tanto, usted debe esperar un periodo de tiempo mucho más corto para su exploración de datos.

Tiempo requerido: 1.5 Semanas OR 15% de la cronología de su proyecto

Etapa 4. Modelado de datos

Esta es la etapa para la que la mayoría de la gente viene a la ciencia de datos. ¡Aquí es donde algunos pueden decir que las matemáticas pueden convertirse en magia! El primer paso en esta etapa es: seleccionar todas las características (o puntos de datos) que realmente necesita para empezar a construir su modelo de ciencia de datos.

Este proceso de selección de características puede ser la la parte más larga de esta etapa .

Una vez que haya terminado con la selección, un modelo es típicamente entrenado en un conjunto de datos de entrenamiento. Este modelo entonces hace predicciones basadas en el modelo que usted ha construido.

Aunque esta etapa puede requerir más conocimientos técnicos , no consumiría mucho tiempo una vez que las características se seleccionan cuidadosamente. A menudo, uno sólo necesitaría ejecutar un algoritmo de un paquete como el cuidado en R o Tensorflow en Python. La ejecución está hecha. mayormente a través de medios computacionales y velocidad de automatización variará dependiendo de los recursos del procesador disponibles.

Tiempo requerido: 1 semana O 10% de la cronología de su proyecto

Etapa 5. Interpretación de datos

Ahora que nuestro modelo ha hecho algunas predicciones sustanciales, usted necesita compartir esta visión con alguien! La interpretación de datos es la etapa final de nuestro proyecto, donde se presentarán los hallazgos y posibles mejoras a modelos anteriores. En un entorno de análisis de negocios, un científico de datos compartir los resultados de su modelo e interpretarlos de una manera que un lego entendería.

Como esta etapa no requiere ninguna habilidad técnica , no debe haber ninguna razón por la que debería tomar una gran parte de su línea de tiempo del proyecto. A la mayoría del tiempo que se pasa en esta etapa es armar visualizaciones basado en las predicciones del modelo.

Tiempo requerido: 0,5 semanas O 5% de la cronología de su proyecto

Etapas de un proyecto de ciencia de datos

1. Recopilación de datos

2. Limpieza de datos

3. Exploración de datos

4. Modelado de datos

5. Interpretación de datos

Después de correr a través de las etapas, usted debe ahora tener una imagen más grande de qué parte de un proyecto de ciencia de datos debe tomarle el tiempo más largo. Sin embargo, los proyectos se realizan a niveles muy diferentes: algunos se centran en el análisis y otros en el análisis. pesado en el aprendizaje automático .

Ahora, echemos un vistazo a qué factores afectarían cuánto tiempo puede durar su proyecto de ciencia de datos .

¿Qué factores pueden afectar la duración de un proyecto de ciencia de datos?

1. Volumen de datos

Si los datos son grandes y vienen en unos pocos cientos de millones de filas, uno debe esperar más tiempo para que las consultas se ejecuten durante la etapa de recolección de datos, así como los algoritmos durante la etapa de limpieza de datos.

Esencialmente, más datos significa más tiempo de procesamiento, que realmente puede añadir semanas adicionales a su proyecto.

2. Tidiness of Data

Si usted ha tenido un vistazo a una hoja de Excel desordenado antes, usted ha visto probablemente esto venir. Si los datos provienen de múltiples fuentes variadas, los datos desordenados pueden ser una pesadilla para resolver. Naturalmente, se dedicaría más tiempo a organizar y organizar estos datos, lo que añadiría a la duración del proyecto.

3. Nivel de conocimientos técnicos

Esto se aplica a casi todos los proyectos relacionados con los datos. Si los científicos de datos pueden escribir código eficiente, menos intensivo en memoria, pueden potencialmente acelerar los tiempos de procesamiento.

Por otro lado, alguien relativamente nuevo en los datos como yo, se esforzaría por manejar un trabajo de depuración de datos más complejo.

4. Recursos disponibles

Al igual que en cualquier proyecto, los recursos son siempre la clave de lo rápido que un proyecto puede avanzar. Para el caso de la ciencia de datos, puede requerirse suficiente potencia informática para algoritmos computacionalmente intensivos.

Un proyecto con menos presupuesto sufriría carreras más lentas de formación modelo y alargaría la duración del proyecto.

Como ya se puede ver en el diagrama anterior, la línea de tiempo para entrenar un modelo de aprendizaje automático puede variar enormemente entre diferentes individuos. Esto demuestra que los proyectos de ciencia de datos realmente pueden tener duraciones de todas las longitudes!

Pregunta relacionada

¿Dónde puedo encontrar buenos proyectos científicos de datos para aprender?

La mayoría de los principiantes en ciencias de datos buscarían proyectos y conjuntos de datos interesantes en Kaggle. Kaggle es un gran recurso que proporciona problemas de ciencia de datos, así como los conjuntos de datos que acompañan a whizzes de datos como usted para jugar con. Estos problemas son grandes para el auto-aprendizaje y desarrollo de nuevas competencias en ciencias de los datos .

Conclusión

Los proyectos de ciencia de datos son siempre diferentes y cambian en las demandas dependiendo del problema que usted está buscando resolver. Por lo tanto, estos proyectos pueden variar en duración por un margen bastante justo. Espero que esto le ayude a iniciar un proyecto de ciencia de datos por su cuenta!

Mis Recursos de Aprendizaje Favoritos:

Aquí están algunos de los recursos de aprendizaje que he Personalmente se ha encontrado que es útil como analista de datos y espero que les resulte útil también!

Estos pueden contener enlaces de afiliados y gano una comisión de ellos si los utilizas.

Sin embargo, honestamente los recomendaría a mi juniors , amigos , o incluso mi familia ¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡

El campo de la bioinformática es bastante pequeño, con científicos trabajando en datos biológicos para obtener información. Con un poco de experiencia en bioinformática yo mismo, estas preguntas me llegaron a la cabeza – puede ser bioinformática...

Estás aquí porque has oído hablar del Certificado Profesional de Ciencias de Datos de IBM, pero todavía no estás seguro de una cosa: ¿Vale la pena el Certificado Profesional de Ciencias de Datos de IBM? He hecho un poco de investigación y...

Python es un lenguaje de programación ampliamente utilizado y está empezando a tener más aplicaciones en la industria de la salud. Voy a compartir con ustedes por qué Python es ideal para la atención médica y algunas aplicaciones comunes que...

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +