¿Cómo empiezo a aprender ciencias de datos para principiantes?

Paso 0: Averigua lo que necesitas aprender

La ciencia de los datos puede ser un campo abrumador. Muchas personas te dirán que no puedes convertirte en un científico de datos hasta que domines lo siguiente: estadística, álgebra lineal, cálculo, programación, bases de datos, computación distribuida, aprendizaje automático, visualización, diseño experimental, agrupación, aprendizaje profundo, procesamiento de lenguaje natural, y más. Eso simplemente no es cierto.

Entonces, ¿qué es exactamente ciencia de datos? Es el proceso de hacer preguntas interesantes, y luego responder a esas preguntas usando datos. En términos generales, el flujo de trabajo de la ciencia de datos se ve así:

  • Haga una pregunta
  • Reúne datos que podrían ayudarte a responder a esa pregunta.
  • Limpiar los datos
  • Explore, analice y visualice los datos
  • Construir y evaluar un modelo de aprendizaje automático
  • Comunicar los resultados

Este flujo de trabajo no requiere necesariamente matemáticas avanzadas, un dominio del aprendizaje profundo, o muchas de las otras habilidades enumeradas anteriormente. Pero sí requiere Conocimiento de un lenguaje de programación y el capacidad de trabajar con datos en ese idioma . Y aunque se necesita fluidez matemática para ser realmente bueno en la ciencia de datos, sólo se necesita un comprensión básica de las matemáticas para empezar.

Es cierto que las otras habilidades especializadas enumeradas anteriormente pueden algún día ayudarle a resolver problemas de ciencia de datos. Sin embargo, usted No lo hagas. necesidad de dominar todas esas habilidades para comenzar su carrera en la ciencia de los datos. Puedes empezar hoy. ¡Y estoy aquí para ayudarte!

Paso 1: Ponte cómodo con Python

Python y R son ambos grandes opciones como lenguajes de programación para la ciencia de datos. R tiende a ser más popular en la academia, y Python tiende a ser más popular en la industria, pero ambos idiomas tienen una gran cantidad de paquetes que apoyan el flujo de trabajo de la ciencia de datos. He enseñado ciencia de datos en ambos idiomas, y generalmente prefiero Python. ( Aquí está el por qué. )

No necesitas aprender Python y R para empezar. En lugar de eso, deberías centrarse en el aprendizaje de un idioma y su ecosistema de paquetes de ciencia de datos . Si ha elegido Python (mi recomendación), es posible que desee considerar la instalación de la Distribución de Anaconda porque simplifica el proceso de instalación y gestión de paquetes en Windows, OSX y Linux.

Tampoco necesitas convertirte en un Experto en Python pasar al paso 2. En su lugar, debe centrarse en dominar los siguientes: tipos de datos, estructuras de datos, importaciones, funciones, declaraciones condicionales, comparaciones, bucles y comprensiones. ¡Todo lo demás puede esperar hasta más tarde!

Si no estás seguro de si sabes "suficiente" Python, escanea a través de mi Referencia rápida de Python . Si la mayor parte de ese material es familiar para usted, usted puede pasar al paso 2!

Si estás buscando un curso para ayudarte a aprender Python, aquí tienes algunas recomendaciones:

  • Python Essentials para Científicos de Datos ¡Es un curso amigable para principiantes que creé para ayudarte a construir una base sólida en Python sin ser abrumado! Incluye ejercicios, cuestionarios y un certificado de finalización.

Para trabajar con datos en Python, debe aprender a usar el biblioteca pandas .

pandas proporciona una estructura de datos de alto rendimiento (llamada "DataFrame") que es adecuada para datos tabulares con columnas de diferentes tipos, similares a una hoja de cálculo Excel o tabla SQL. Incluye herramientas para leer y escribir datos, manejar datos perdidos, filtrar datos, limpiar datos desordenados, fusionar conjuntos de datos, visualizar datos y mucho más. En resumen, aprender pandas aumentará significativamente su eficiencia cuando se trabaja con datos.

Sin embargo, pandas incluye una cantidad abrumadora de funcionalidad, y (argumentablemente) proporciona demasiadas maneras de lograr la misma tarea. Esas características pueden hacerlo. difícil de aprender pandas y descubrir las mejores prácticas.

Es por eso que creé un series de vídeo pandas (36 vídeos) que enseña la biblioteca pandas desde cero. Cada vídeo responde a una pregunta utilizando un conjunto de datos real, y los conjuntos de datos se publican en línea para que pueda seguir en casa. (También creé un Cuaderno Jupyter que incluye el código de cada vídeo.)

"Tus videos son extremadamente útiles. Me gusta que usted utiliza conjuntos de datos reales y probar un montón de diferentes aplicaciones del concepto que se discute en lugar de simplemente ejemplos demasiado simplistas. ¡Tu contenido me ha ayudado inmensamente!" - ¡No! - ¡No! Sean Montague

Paso 3: Aprender el aprendizaje automático con scikit-learn

Construcción de "modelos de aprendizaje automático" para predecir el futuro o extraer información automáticamente de los datos es la parte sexy de la ciencia de los datos. scikit-learn es la biblioteca más popular para el aprendizaje automático en Python, y por una buena razón:

  • Proporciona una interfaz limpia y consistente a toneladas de diferentes modelos.
  • Ofrece muchos parámetros de ajuste para cada modelo, pero también elige predeterminados sensibles.
  • Su documentación es excepcional, y le ayuda a entender los modelos, así como cómo utilizarlos correctamente.

Sin embargo, el aprendizaje automático sigue siendo un campo muy complejo y en rápida evolución, y el aprendizaje scikit tiene una curva de aprendizaje pronunciada. Es por eso que creé un curso gratuito de scikit-learn (4 horas), lo que le ayudará a obtener una comprensión completa de ambos fundamentales del aprendizaje automático y el flujo de trabajo scikit-learn . La serie no presume ninguna familiaridad con el aprendizaje automático o las matemáticas avanzadas. (Se puede encontrar todo el código del curso en GitHub .)

"Tus videos son absolutamente increíbles. Acabo de completar el curso sobre aprendizaje automático con Python y puedo decir que entendí cada cosa gracias a su excelente estilo de enseñanza y habilidades." - ¡No! - ¡No! Guillaume B

Si prefieres un recurso no video para aprender scikit-learn, te recomiendo cualquiera Python Machine Learning ( Amazonia / GitHub ) o Introducción al aprendizaje automático con Python ( Amazonia / GitHub ).

Paso 4: Comprender el aprendizaje automático en mayor profundidad

El aprendizaje automático es un campo complejo. Aunque scikit-learn proporciona las herramientas que necesita para hacer el aprendizaje automático eficaz, no responde directamente a muchas preguntas importantes:

  • ¿Cómo sé qué modelo de aprendizaje automático funcionará mejor con mi conjunto de datos?
  • ¿Cómo interpreto los resultados de mi modelo?
  • ¿Cómo puedo evaluar si mi modelo se generalizará a datos futuros?
  • ¿Cómo puedo seleccionar qué características deben incluirse en mi modelo?
  • Y así sucesivamente...

Si quieres ser grande en el aprendizaje automático , usted necesita ser capaz de responder a esas preguntas, lo que requiere tanto experiencia y estudio adicional. Aquí están algunos recursos para ayudarle en ese camino:

  • Mi recomendación principal es leer Introducción al aprendizaje estadístico ( PDF / Amazonia ). Le ayudará a obtener tanto una comprensión teórica y práctica de muchos métodos importantes para la regresión y la clasificación, sin requerir un fondo en matemáticas avanzadas. Los autores también fueron puestos en libertad 15 horas de vídeos de alta calidad para complementar el libro.
  • Si necesitas un repaso sobre probabilidad o estadísticas, te recomiendo que leas Estadísticas de OpenIntro ( PDF / Amazonia ).

Paso 5: Seguir aprendiendo y practicando

Aquí está mi mejor consejo para mejorar sus habilidades en ciencia de datos: Encuentra "lo que te motiva" practicar lo que aprendiste y aprender más, y luego hacer esa cosa. ¡Eso podría ser proyectos de ciencia de datos personales, competiciones de Kaggle, cursos en línea, libros de lectura, blogs de lectura, asistir a reuniones o conferencias, o algo más!

  • Concursos de kaggle son una gran manera de practicar la ciencia de los datos sin venir con el problema usted mismo. No te preocupes por lo alto que pones, solo concéntrate en aprender algo nuevo con cada competencia. (Tenga en cuenta que no practicará partes importantes del flujo de trabajo de la ciencia de datos: hacer preguntas, recopilar datos y comunicar resultados.)
  • Si realmente quieres experimentar el Comunidad de Python , Recomiendo altamente asistir PyCon US . (También hay conferencias más pequeñas de PyCon en otros lugares.) Como científico de datos, usted también debe considerar asistir a la más cercana PyData conferencia.

Su viaje de la ciencia de los datos sólo ha comenzado! Hay tanto que aprender en el campo de la ciencia de los datos que tomaría más de una vida al amo. Sólo recuerda: no tienes que dominarlo todo para lanzar tu carrera en ciencias de datos, ¡Sólo tienes que empezar!

Únete a Data School (gratis!)

Mi nombre es Kevin Markham , y yo soy el fundador de la Escuela de Datos. Sería un honor si se uniera a la comunidad de la Escuela de Datos suscribiéndose al boletín de correo electrónico:

Como suscriptor , usted recibirá acceso prioritario a mi Cursos en línea y transmisiones web en vivo , y recibirás notificaciones sobre nuevos tutoriales y vídeos de Data School.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +