¿Los principiantes pueden aprender ciencias de datos?

  • Algoritmos de aprendizaje automático (asegúrese de probar casos de uso en el dominio donde desea experiencia en, ventas, finanzas, recursos humanos, operaciones, etc. Los casos de uso serán diferentes para todos)
  • Práctica y aplicación

a) Idioma de consulta

Tipos de lenguajes de consulta que puede aprender: SQL es la mejor mano del mercado y no va a ninguna parte.

Un lenguaje de consulta más que puedes aprender es elasticsearch. Está muy en uso hoy en día. Lo aprendí a través de un curso de Udemy. La diferencia entre SQL y elasticsearch es que en elasticsearch, tienes un marco de datos donde no todas las filas tienen los mismos valores de columna. Por ejemplo. un coche de base de datos. Digamos que para algunos coches sólo tenemos el nombre del modelo, el precio y la información de color. Para algunos, podemos tener color, modelo, precio, número de modelos hasta la fecha, empresa matriz, etc., para otro tipo de coche que puede tener información sobre sólo modelo y nombre, etc. En SQL esto se captura poniendo valores NAN donde faltan campos. En la búsqueda elástica, no existe el concepto de NAN.

Fuentes de aprendizaje: Usted puede aprender de W3Schools/Tutorialspoint o en cualquier lugar realmente ya que apenas tomará una semana para aprender SQL. Si no tienes acceso a bases de datos para practicar, puedes cargar cualquier archivo csv como base de datos y practicar.

Elasticsearch / Kibana se puede aprender a través de los mismos sitios web. Además, usted puede tomar un curso de Udemy en el mismo puesto que esto es más difícil de aprender en comparación con SQL.

Medio ambiente: En caso de que esté aprendiendo SQL, puede instalar MySQL/PostGRESQL e iniciar la práctica. Para la búsqueda elástica se puede instalar Kibana y practicar.

¿Por qué es importante el lenguaje de consulta para la ciencia de datos?

Tenemos enormes conjuntos de datos en la ciencia de los datos que tienen millones de filas y millones de columnas. Para el análisis, usted no necesita todos los datos. Necesitamos extraer los datos relevantes usando un lenguaje de consulta y luego proceder con el análisis.

Big Data: También puedes aprender lenguajes o técnicas de macrodatos como Scala y Hadoop/MapReduce, etc. Sin embargo, eso es bueno para la mayoría de D.S. trabajos y no un deber-tener. Es más como una guinda en el pastel. Big data es una parte de la ingeniería de datos y generalmente implica codificación mayormente a diferencia de la ciencia de datos que es una mezcla de estadísticas, matemáticas, codificación y conocimiento de dominio. Los grandes datos deben ser aprendidos después de que usted es minucioso con la ciencia de datos.

b) Lenguaje de programación

Idiomas en boga: Hay 2 idiomas principales: R y python. R es un lenguaje diseñado por estadísticos y matemáticos. Python es un lenguaje de codificadores. Ambos son buenos. Sin embargo, hoy en día Python está más en boga debido a su gran soporte eco-sistema del mundo de la programación, mejor escalabilidad y mejor integración con APIs y otros códigos para el producto completo.

Fuente de aprendizaje: Aprendí Python a través de Coursera. El nombre del curso era “Python for data science”. También se puede aprender a través de tutorialspoint y W3schools. Más que el curso, aprendí a través de proyectos mayores y menores que se suponía que debíamos hacer como parte de nuestro certificado.

Aprendí R a través de Udemy. Curso avanzado de R para ciencias de datos. Es bueno aprender un idioma en profundidad y tener una visión general de otro idioma junto con él. Eso es porque en un equipo trabajarás con muchos científicos de datos. Algunos estarán cómodos con R, y otros con Python.

Un entorno es un lugar donde codificas básicamente e implementas tus códigos.

Mi ambiente favorito personal son los cuadernos Jupyter. Los cuadernos Jupyter te permiten escribir R/Python/HTML, etc., para que puedas utilizar las mejores bibliotecas o técnicas de un idioma en particular y utilizarlo en Jupyter. También si dos personas están usando diferentes idiomas, entonces usted puede colaborar fácilmente usando cuadernos Jupyter.

Resolución de las consultas: Stackoverflow y Stackexchange son grandes lugares para preguntar sobre cuestiones de idioma. La gente generalmente responde dentro de 5 minutos a 24 horas.

c) Herramientas de visualización

Herramientas que puedes aprender: Tableau/PowerBI/Qliksense/Qlikview son las herramientas más comunes. PowerBI y Tableau son los más utilizados.

PowerBI es casi como una versión avanzada de Excel y muy fácil de aprender. El único problema con la excelencia es que se bloquea y se vuelve lento con datos enormes. Tampoco hay demasiadas opciones disponibles para visualizaciones increíbles. Todo esto es posible en PowerBI. Otra cosa buena es que PowerBI es libre. Para Tableau, puede descargar una versión de prueba de 30 días, pero en el caso de PowerBI, puede utilizarla todo el tiempo que desee (la mayoría de las funciones están disponibles en la versión gratuita de PowerBI). PowerBI/Qliksense/Qlikview no son compatibles con Apple, aunque son productos basados en ventanas.

Fuentes de aprendizaje: He aprendido PowerBI a través de Udemy. Elegí el curso en base a las calificaciones. Cualquier curso con una calificación superior a 4.3 es genial. Aprendí Tableau a través del sitio web de Tableau.

Introducción al aprendizaje estadístico en R es bueno para los fundamentos de las estadísticas y aplicaciones en ML

Cómo decidir qué algos implementar:

Primero, conozca el caso de los usos de su problema. ¿Qué quieres hacer? ¿Su salida es una variable continua? (tomando valores de 1,3,10, etc.) básicamente cualquier valor) o ¿es un tipo binario de decisión o quieres atraer a la gente y tomar algunas decisiones para un montón de gente?

Por ejemplo. para un proyecto, tuve que trabajar en el análisis de riesgo de crédito en finanzas. Usted tiene que decidir si una persona será capaz de pagar un préstamo o no. Así que es una decisión binaria. En este caso, necesita un algo de clasificación porque desea clasificar a una persona como un defaulter o un no-defaulter. Así que utilizo la regresión logística (utilizada cuando la salida es binaria sí/no, etc), árboles XGBoost o Decisión. Básicamente puedes usar cualquier algo de clasificación. Otras cosas de clasificación que se pueden utilizar aquí son SVN, Naive Bayes, etc. (puede googlear algunos de la clasificación para la lista completa).

Si en un proyecto, tengo que predecir el valor de un stock o casa, entonces puede tomar cualquier valor a partir de Rs.10 a Rs.1.000.000 o más, etc. (variable continua). Aquí usaré la regresión. La regresión puede ser de muchos tipos, lineal simple, lineal múltiple, polinomio, SVR, etc. El tipo correcto de técnica de regresión se puede encontrar comprobando el error r cuadrado (hasta qué punto los valores predichos se encuentran del real).

Del mismo modo, si necesito averiguar los segmentos de destino, voy a necesitar utilizar clustering algo. K medios y clustering jerárquico son ejemplos de clustering algos.

Así que primero aprende acerca de los algoritmos (al menos una clasificación de algo, una agrupación de algo, una regresión de algo para comenzar) y luego ver qué algo se necesita para el problema a mano y luego iniciar el análisis.

Lo que todo tipo de proyectos y algos debo aprender:

Primero, elige tu dominio. Mi dominio, por ejemplo, era Finanzas y marketing. Así que puedo hablar de eso aquí. Aunque la lista es interminable, voy a escribir los algo más importantes aquí aprendí

Comercialización : Modelado de series temporales (Modelo ARIMA principalmente) para predecir futuras ventas, volumen y valor. Modelado de series temporales significa que usted tiene datos para una cosa, digamos datos de ventas para una empresa por un período de tiempo (podría ser meses, años, días, etc) y usted predice ventas para la empresa para los próximos años / meses / días.

Agrupación de logos a los grupos destinatarios de los grupos y diseño de categorías separadas para cada grupo.

Churn modelando para decidir cuántos miembros del personal sobre el terreno permanecerán y cuántos dejarán para gestionar el flujo de trabajo.

Financiación: Clasificación algos como regresión logística (regresión logística y regresión lineal o múltiple son completamente diferentes, sólo el nombre es similar), SVN, Naive Bayes, XGBoost etc. para el análisis de riesgo de crédito para averiguar quién se default.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +