¿Cuál es la manera más rápida de aprender ciencia de datos?
Consejos para ser un estudiante eficiente y rápido
Quería escribir este artículo porque he recibido un montón de preguntas acerca de cómo abordar el aprendizaje de la ciencia de datos, y entiendo la lucha. Es ¿En serio? abrumador al principio, especialmente cuando descubres que tienes que aprender programación, estadísticas, matemáticas, y así sucesivamente. Parece que la lista es interminable, pero créeme cuando digo que no es tan malo como piensas.
Mi meta es doble:
- Quiero suavizar tu viaje de aprendizaje dando alguna dirección y consejos
- Quiero compartir con ustedes mis consejos que me ayudaron a aprender a un ritmo más rápido
Con eso dicho, vamos a sumergirnos en él!
En primer lugar, usted debe saber que “aprendizaje” se refiere a la adquisición de ambos conocimientos y habilidades. Así que cuando digo "aprender", me refiero a la teoría del aprendizaje (conocimiento) y aprender a aplicar ese conocimiento (habilidades).
Esto no es ciencia de cohetes, pero hay dos factores principales que juegan en cuánto se aprende en un período de tiempo determinado:
- Tiempo invertido: De nuevo, esto no es ciencia de cohetes. Si usted está pasando 2 horas al día aprender ciencia de datos en lugar de 1 hora al día, usted puede tamizar a través del doble de material y pasar el doble de tiempo aplicando sus habilidades (es decir. programación).
- Cantidad retenida: Aprender habilidades es una cosa, pero retenerlas es otra. Usted podría haber oído hablar de la curva del olvido . En pocas palabras, usted necesita ser consistente en el aprendizaje de la ciencia de los datos y la práctica de lo que aprende.
Personalmente, creo que una de las mejores decisiones que tomé fue comprometerme a aprender y escribir sobre cualquier cosa relacionada con la ciencia de datos una vez a la semana durante 52 semanas porque me obligó a invertir una buena cantidad de tiempo y ser consistente.
Si usted ha leído mis artículos anteriores, probablemente suene como un disco roto en este punto, pero comenzando con los fundamentos será un largo camino. Puede parecer que es la ruta más lenta, pero esto le permitirá aprender conceptos más complejos que se basan en estos fundamentos en el futuro.
Los fundamentos que recomiendo aprender son:
- Estadísticas y probabilidad: La ciencia de los datos y el aprendizaje automático son esencialmente una versión moderna de las estadísticas. Al aprender las estadísticas primero, usted tendrá un tiempo mucho más fácil cuando se trata de aprender conceptos y algoritmos de aprendizaje automático.
- Cálculo y álgebra lineal: Al igual que las estadísticas, muchos conceptos de ciencia de datos se basan en conceptos matemáticos fundamentales. Para entender las funciones de costo, es necesario conocer el cálculo diferencial. Para entender las pruebas de hipótesis, es necesario entender la integración. Y para dar más un ejemplo más, el álgebra lineal es esencial para aprender conceptos de aprendizaje profundo, sistemas de recomendación y análisis de componentes principales.
- Programación (Python, SQL): SQL es sin duda la habilidad más importante para aprender a través de cualquier tipo de profesión relacionada con los datos, si usted es un científico de datos, ingeniero de datos, analista de datos, analista de negocios, la lista continúa. En cuanto a Python, parece ser el lenguaje de scripting principal utilizado por los científicos de datos (y no sé nada sobre R).
No tienes que aprender todo sobre los temas anteriores, pero definitivamente debe saber los fundamentos antes de sumergirse en el aprendizaje automático y el aprendizaje profundo. Esto me lleva a mi siguiente punto...
Echa un vistazo a mi artículo a continuación si quieres algunos recursos para aprender estos:
Una cosa es entender lo que aprendes, pero otra es tratar de memorizar todo. Especialmente cuando se trata de SQL, Python y Pandas, no sientas que tienes que aprender cada función y método que tienen para ofrecer. En su lugar, enfóquese en aprender a Google las preguntas correctas al programar.
He hablado con veteranos en la comunidad de ciencia de datos y no he conocido a una sola persona que haya memorizado cada función SQL y Python. ¡Es un uso ineficiente del tiempo y puede gastar mejor en otras cosas como proyectos de construcción!
Como aludí antes, aprenderás y conservarás más conocimientos y habilidades por haciendo en lugar de simplemente Estudiando. Similar a cómo haces los deberes después de aprender un nuevo concepto en la escuela, necesitas aplicar constantemente lo que aprendes a los proyectos.
Y no te preocupes por completar proyectos complejos. Incluso algo tan simple como realizar análisis exploratorios de datos en un conjunto de datos le ayudará a acelerar sus aprendizajes.
Idea 1: Estudio de caso SQL
El objetivo de este caso es determinar la causa de una caída en el compromiso de los usuarios para una red social llamada Yammer. Antes de sumergirse en los datos, usted debe leer la visión general de lo que hace Yammer aquí . Hay 4 mesas con las que debe trabajar.
El enlace al caso anterior le proporcionará mucho más detalles relacionados con el problema, los datos y las preguntas que deben ser contestadas.
Echa un vistazo a cómo me acerqué a este estudio de caso aquí si desea guía.
Idea 2: Raspador web piloto de confianza
Aprender a descifrar datos web es fácil de aprender y extremadamente útil, especialmente cuando se trata de recopilar datos para proyectos personales. Raspar un sitio web de revisión de clientes, como Trustpilot, es valioso para una empresa, ya que le permite entender las tendencias de revisión (mejor o peor) y ver lo que los clientes están diciendo a través de NLP.
Primero me familiarizaría con cómo Trustpilot está organizado, y decidiría qué tipo de negocios analizar. Entonces echaría un vistazo a este recorrido de cómo raspar las revisiones de Trustpilot .
Idea 3: Concurso de aprendizaje automático de Titanic
En mi opinión, no hay mejor manera de demostrar que usted está listo para un trabajo de ciencia de datos que para mostrar su código a través de competiciones. Kaggle alberga una variedad de competiciones que implica la construcción de un modelo para optimizar una cierta métrica, una de ellas es la Titanic Machine Learning Competition .
Espero que encuentre estos consejos útiles! El consejo más importante es que usted es consistente en sus aprendizajes - creo que prevalece sobre su metodología de aprendizaje y los recursos que utiliza para aprender. Considere todo lo demás como hiper-parámetros más pequeños que usted puede sintonizar ;).
Artículos Relacionados: