¿Cuáles son los niveles de la ciencia de los datos?

Este artículo discutirá lo que considero que son los tres niveles de competencia en ciencia de datos, a saber: nivel 1 (nivel básico); nivel 2 (nivel intermedio); y l evel 3 (nivel avanzado). La competencia aumenta del nivel 1 al 3. Usaremos Python como lenguaje predeterminado, aunque otras plataformas como R, SAS y Matlab podrían usarse como lenguajes de programación para la ciencia de datos.

Las opiniones aquí proporcionadas son mis opiniones y se basan en mi propio viaje a la ciencia de los datos.

En el nivel uno, un aspirante a ciencia de datos debería poder trabajar con conjuntos de datos presentados generalmente en formato de archivo de valores separados por comas (CSV). Deben tener competencia en datos básicos; visualización de datos; y regresión lineal.

1.1 Datos básicos

Ser capaz de manipular, limpiar, estructurar, escalar y diseñar datos. Deben ser expertos en el uso de pandas y NumPy bibliotecas. Deben tener las siguientes competencias:

  • Saber importar y exportar datos almacenados en formato de archivo CSV
  • Ser capaz de limpiar, disputar y organizar datos para análisis o construcción de modelos adicionales
  • Ser capaz de lidiar con los valores que faltan en un conjunto de datos
  • Comprender y ser capaz de aplicar técnicas de imputación de datos tales como media o mediana imputación
  • Ser capaz de manejar datos categóricos
  • Saber cómo particionar un conjunto de datos en conjuntos de entrenamiento y pruebas
  • Ser capaz de escalar datos utilizando técnicas de escalado tales como normalización y estandarización
  • Ser capaz de comprimir datos a través de técnicas de reducción de dimensionalidad como el análisis de componentes principales (PC)

1.2. Visualización de datos

Ser capaz de entender los componentes esenciales de una buena visualización de datos. Ser capaz de utilizar herramientas de visualización de datos, incluyendo los paquetes matplotlib y seaborn de Python; y el paquete ggplot2 de R. Debe entender los componentes esenciales de la buena visualización de datos:

  • Componente de datos : Un primer paso importante para decidir cómo visualizar los datos es saber qué tipo de datos son, por ejemplo, datos categóricas, datos discretos, datos continuos, datos de series temporales, etc.
  • Componente de cartografía: Aquí, usted necesita decidir qué variable utilizar como su X-variable y qué utilizar como su Y-variable . Esto es importante especialmente cuando su conjunto de datos es multidimensional con varias características.
  • Componente ético : Aquí, usted quiere asegurarse de que su visualización cuenta la historia verdadera. Usted necesita ser consciente de sus acciones al limpiar, resumir, manipular y producir una visualización de datos y asegurarse de que no está utilizando su visualización para engañar o manipular a su audiencia.

1.3 Aprendizaje supervisado (predecir variables de objetivo continuas)

Esté familiarizado con la regresión lineal y otros métodos avanzados de regresión. Ser competente en el uso de paquetes como scikit-learn y caret para la construcción de modelos de regresión lineal. Tener las siguientes competencias:

2.2 Evaluación de modelos y ajuste del hiperparametro

  • Saber cómo depurar algoritmos de clasificación con curvas de aprendizaje y validación
  • Ser capaz de diagnosticar problemas de sesgo y varianza con las curvas de aprendizaje
  • Capaz de abordar la sobreadaptación y subadaptación con curvas de validación
  • Saber cómo ajustar los modelos de aprendizaje automático a través de la búsqueda en cuadrícula
  • Comprender cómo sintonizar hiperparametros a través de la búsqueda de cuadrícula
  • Ser capaz de leer e interpretar una matriz de confusión
  • Ser capaz de trazar e interpretar una curva de características operativas del receptor (ROC)

2.3 Combinación de diferentes modelos para el aprendizaje en conjunto

  • Ser capaz de utilizar el método de conjunto con diferentes clasificadores
  • Ser capaz de combinar diferentes algoritmos para la clasificación
  • Saber cómo evaluar y afinar el clasificador de conjuntos

Puede trabajar con conjuntos de datos avanzados como texto, imágenes, voz y videos. Además de las competencias básicas e intermedias, deben tener las siguientes competencias:

  • Algoritmo de agrupación (aprendizaje no supervisado)
  • Significa K
  • Aprendizaje profundo
  • Redes neuronales
  • Keras
  • TensorFlow
  • Theano
  • Sistemas de nube (AWS, Azure)

En resumen, hemos discutido los 3 niveles de ciencia de datos. Nivel 1 la competencia puede alcanzarse en un plazo de 6 a 12 meses. Nivel 2 las competencias pueden alcanzarse en un plazo de 7 a 18 meses. Nivel 3 las competencias pueden alcanzarse en un plazo de 18 a 48 meses. Todo depende de la cantidad de esfuerzo invertido.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +