¿Cuáles son los 3 conceptos principales de la ciencia de los datos?

Con tanto que aprender y tantos avances que seguir en el campo de la ciencia de los datos, hay un conjunto básico de conceptos fundacionales que siguen siendo esenciales. Veinte de estas ideas se destacan aquí que son clave para revisar cuando se prepara para una entrevista de trabajo o simplemente para refrescar su apreciación de lo básico.

1. Conjunto de datos

Así como el nombre lo indica, la ciencia de los datos es una rama de la ciencia que aplica el método científico a los datos con el objetivo de estudiar las relaciones entre las diferentes características y extraer conclusiones significativas basadas en estas relaciones. Por lo tanto, los datos son el componente clave de la ciencia de los datos. Un conjunto de datos es una instancia particular de datos que se utiliza para el análisis o construcción de modelos en un momento dado. Un conjunto de datos viene en diferentes sabores como datos numéricos, datos categóricas, datos de texto, datos de imagen, datos de voz y datos de vídeo. Un conjunto de datos podría ser estático (no cambiante) o dinámico (cambios con el tiempo, por ejemplo, los precios de las acciones). Además, un conjunto de datos también podría depender del espacio. Por ejemplo, los datos de temperatura en los Estados Unidos diferirían significativamente de los datos de temperatura en África. Para los proyectos de ciencia de datos iniciales, el tipo más popular de conjunto de datos es un conjunto de datos que contiene datos numéricos que normalmente se almacenan en un formato de archivo separado por comas (CSV).

2. Rastreo de datos

El forcejeo de datos es el proceso de conversión de datos de su forma en bruto a una forma ordenada lista para el análisis. El forcejeo de datos es un paso importante en el preprocesamiento de datos e incluye varios procesos como la importación de datos, la limpieza de datos, la estructuración de datos, el procesamiento de cadenas, el análisis de HTML, el manejo de fechas y tiempos, el manejo de datos faltantes y la extracción de texto.

Gráfico 1 : Proceso de disputa de datos. Imagen de Benjamin O. Tayo

El proceso de disputa de datos es un paso crítico para cualquier científico de datos. Muy raramente los datos son fácilmente accesibles en un proyecto de ciencia de datos para su análisis. Es más probable que los datos estén en un archivo, una base de datos o extraídos de documentos como páginas web, tuits o PDF. Saber cómo discutir y limpiar los datos le permitirá obtener información crítica de sus datos que de otro modo se ocultarían.

3. Visualización de datos

La visualización de datos es una de las ramas más importantes de la ciencia de los datos. Es una de las principales herramientas utilizadas para analizar y estudiar las relaciones entre diferentes variables. Visualización de datos (por ejemplo, gráficos de dispersión, gráficos de líneas, gráficos de barras, histogramas, qqplots, densidades suaves, boxplots, gráficos de pares, mapas de calor, etc.) puede ser utilizado para análisis descriptivo. La visualización de datos también se utiliza en el aprendizaje automático para el procesamiento y análisis de datos, selección de características, construcción de modelos, pruebas de modelos y evaluación de modelos. Al preparar una visualización de datos, tenga en cuenta que la visualización de datos es más bien un Arte que Ciencia . Para producir una buena visualización, es necesario poner varias piezas de código juntos para un resultado final excelente. Un tutorial sobre visualización de datos se encuentra aquí: Tutorial sobre visualización de datos usando dataset meteorológico

4. Atípicos

Un atípico es un punto de datos que es muy diferente del resto del conjunto de datos. Los valores atípicos son a menudo sólo datos incorrectos, por ejemplo, debido a un sensor defectuoso, experimentos contaminados o errores humanos en el registro de datos. A veces, los valores atípicos podrían indicar algo real como un mal funcionamiento en un sistema. Los valores atípicos son muy comunes y se esperan en grandes conjuntos de datos. Una manera común de detectar valores atípicos en un conjunto de datos es usando un gráfico de caja. Gráfico 3 muestra un modelo de regresión simple para un conjunto de datos que contiene un montón de valores atípicos. Los valores atípicos pueden degradar significativamente el poder predictivo de un modelo de aprendizaje automático. Una manera común de lidiar con los valores atípicos es simplemente omitir los puntos de datos. Sin embargo, la eliminación de datos atípicos reales puede ser demasiado optimista, lo que conduce a modelos no realistas. Los métodos avanzados para hacer frente a los valores atípicos incluyen el método RANSAC.

5. Imputación de datos

La mayoría de los conjuntos de datos contienen valores que faltan. La forma más fácil de lidiar con los datos que faltan es simplemente tirar el punto de datos. Sin embargo, la eliminación de muestras o la caída de columnas de características enteras simplemente no es factible porque podríamos perder demasiados datos valiosos. En este caso, podemos utilizar diferentes técnicas de interpolación para estimar los valores que faltan de las otras muestras de entrenamiento en nuestro conjunto de datos. Una de las técnicas de interpolación más comunes es imputación media , donde simplemente reemplazamos el valor que falta por el valor medio de toda la columna de características. Otras opciones para imputar los valores que faltan son: mediana o la mayoría frecuentes (modo) , donde estos últimos sustituyen los valores faltantes por los valores más frecuentes. Cualquiera que sea el método de imputación que utilice en su modelo, tiene que tener en cuenta que la imputación es sólo una aproximación, y por lo tanto puede producir un error en el modelo final. Si los datos suministrados ya estaban preprocesados, tendría que averiguar cómo se consideraron los valores faltantes. ¿Qué porcentaje de los datos originales fue descartado? ¿Qué método de imputación se utilizó para estimar los valores faltantes?

6. Escalado de datos

El escalado de sus características ayudará a mejorar la calidad y el poder predictivo de su modelo. Por ejemplo, suponga que desea construir un modelo para predecir una variable de destino solvencia basado en variables predictoras tales como: Ingresos y puntuación de crédito . Debido a que los puntajes de crédito oscilan entre 0 y 850 mientras que los ingresos anuales pueden oscilar entre $25.000 a $500.000, sin escalar sus características, el modelo estará sesgado hacia el Ingresos función. Esto significa el factor de peso asociado a la Ingresos el parámetro será muy pequeño, lo que hará que el modelo predictivo sea predictivo solvencia basado únicamente en el Ingresos parámetro.

Con el fin de llevar las características a la misma escala, podríamos decidir utilizar la normalización o la estandarización de las características. La mayoría de las veces, suponemos que los datos se distribuyen normalmente y por defecto hacia la estandarización, pero no siempre es así. Es importante que antes de decidir si utilizar la estandarización o la normalización, primero eche un vistazo a cómo sus características se distribuyen estadísticamente. Si la característica tiende a ser distribuida uniformemente, entonces podemos utilizar la normalización ( MinMaxScale r). Si la característica es aproximadamente gaussiano, entonces podemos utilizar la estandarización ( Escalador estándar ). Una vez más, tenga en cuenta que si se utiliza normalización o estandarización, estos también son métodos aproximativos y están obligados a contribuir al error general del modelo.

7. Análisis de componentes principales (PCA)

Grandes conjuntos de datos con cientos o miles de características a menudo conducen a la redundancia, especialmente cuando las características se correlacionan entre sí. El entrenamiento de un modelo en un conjunto de datos de alta dimensión que tiene demasiadas características a veces puede conducir a un exceso de ajuste (el modelo captura tanto efectos reales como aleatorios). Además, un modelo demasiado complejo que tenga demasiadas características puede ser difícil de interpretar. Una manera de resolver el problema de la redundancia es a través de la selección de características y técnicas de reducción de dimensionalidad como PCA. El análisis de componentes principales (PCA) es un método estadístico que se utiliza para la extracción de características. El PCA se utiliza para datos de alta dimensión y correlacionados. La idea básica del PCA es transformar el espacio original de características en el espacio del componente principal. Una transformación del PCA logra lo siguiente:

a) Reducir el número de características que se utilizarán en el modelo final centrándose únicamente en los componentes que representan la mayor parte de la varianza en el conjunto de datos.

8. Análisis lineal discriminante (LDA)

PCA y LDA son dos técnicas de transformación lineal de preprocesamiento de datos que a menudo se utilizan para reducir la dimensión para seleccionar características relevantes que pueden utilizarse en el algoritmo de aprendizaje automático final. PCA es un algoritmo no supervisado que se utiliza para la extracción de características en datos de alta dimensión y correlacionados. El PCA logra la reducción de la dimensión transformando las características en ejes de componentes ortogonales de máxima varianza en un conjunto de datos. El objetivo de LDA es encontrar el subespacio de características que optimice la separabilidad de clases y reduzca la dimensionalidad (ver figura abajo). Por lo tanto, LDA es un algoritmo supervisado. Una descripción detallada de PCA y LDA se puede encontrar en este libro: Python Machine Learning by Sebastian Raschka, Capitulo 5.

9. Partición de datos

En el aprendizaje automático, el conjunto de datos a menudo se divide en conjuntos de entrenamiento y pruebas. El modelo se forma en el conjunto de datos de formación y luego se prueba en el conjunto de datos de pruebas. El conjunto de datos de prueba actúa así como el conjunto de datos invisible, que se puede utilizar para estimar un error de generalización (el error esperado cuando el modelo se aplica a un conjunto de datos del mundo real después de que el modelo ha sido desplegado). En scikit-learn, el estimador de división tren/prueba se puede utilizar para dividir el conjunto de datos de la siguiente manera:

11. Aprendizaje no supervisado

En el aprendizaje no supervisado, estamos tratando con datos sin etiqueta o datos de estructura desconocida. Utilizando técnicas de aprendizaje no supervisadas, podemos explorar la estructura de nuestros datos para extraer información significativa sin la guía de una variable de resultado conocida o función de recompensa. K-means clustering es un ejemplo de un algoritmo de aprendizaje no supervisado.

12. Aprendizaje de refuerzo

En el aprendizaje de refuerzo, el objetivo es desarrollar un sistema (agente) que mejore su rendimiento basado en interacciones con el medio ambiente. Dado que la información sobre el estado actual del entorno típicamente también incluye una llamada señal de recompensa, podemos pensar en el aprendizaje de refuerzo como un campo relacionado con el aprendizaje supervisado. Sin embargo, en el aprendizaje del refuerzo, este feedback no es la etiqueta o valor correcto de la verdad del terreno, sino una medida de lo bien que la acción fue medida por una función de recompensa. A través de la interacción con el entorno, un agente puede utilizar el aprendizaje de refuerzo para aprender una serie de acciones que maximicen esta recompensa.

13. Parámetros modelo e hiperparametros

En un modelo de aprendizaje automático, hay dos tipos de parámetros:

a) Parámetros modelo: Estos son los parámetros del modelo que deben determinarse utilizando el conjunto de datos de entrenamiento. Estos son los parámetros ajustados. Por ejemplo, supongamos que tenemos un modelo como precio de la casa = a + b*(edad) + c*(tamaño), estimar el costo de las casas en función de la edad de la casa y su tamaño (pies cuadrados) , entonces a , b , y c será nuestro modelo o parámetros ajustados.

b) Hiperparametros: Estos son parámetros ajustables que se deben ajustar para obtener un modelo con un rendimiento óptimo. Un ejemplo de un hiperparametro se muestra aquí:

KNeighborsClassifier(n_neighbors = 5, p = 2, métrica ='minkowski')

Es importante que durante el entrenamiento, los hiperparametros se ajusten para obtener el modelo con el mejor rendimiento (con los parámetros mejor ajustados).

14. Validación cruzada

La validación cruzada es un método para evaluar el rendimiento de un modelo de aprendizaje automático en muestras aleatorias del conjunto de datos. Esto asegura que cualquier sesgo en el conjunto de datos sea capturado. La validación cruzada puede ayudarnos a obtener estimaciones fiables del error de generalización del modelo, es decir, lo bien que el modelo se comporta en datos no vistos.

En la validación cruzada de k-fold, el conjunto de datos se divide aleatoriamente en conjuntos de entrenamiento y pruebas. El modelo se forma en el conjunto de entrenamiento y se evalúa en el conjunto de pruebas. El proceso se repite k-times. Las puntuaciones medias de entrenamiento y pruebas se calculan luego promediando sobre los k-folds.

15. Rebaja de la variación de las diferencias entre los tipos de interés y los tipos de interés (Bias-variance Tradeoff)

En estadística y aprendizaje automático, la compensación entre sesgo y variación es la propiedad de un conjunto de modelos predictivos en los que los modelos con un sesgo menor en la estimación de parámetros tienen una mayor varianza de las estimaciones de parámetros entre muestras y viceversa. El dilema o problema de sesgo-varianza es el conflicto al tratar de minimizar simultáneamente estas dos fuentes de error que impiden que algoritmos de aprendizaje supervisados generalicen más allá de su conjunto de entrenamiento:

  • Los parcialidad es un error de suposiciones erróneas en el algoritmo de aprendizaje. Sesgo alto ( demasiado simple ) puede hacer que un algoritmo se pierda las relaciones pertinentes entre las características y las salidas de destino ( subadefitting ).
  • Los variación es un error de sensibilidad a pequeñas fluctuaciones en el conjunto de entrenamiento. Variante elevada ( demasiado complejo ) puede hacer que un algoritmo modele el ruido aleatorio en los datos de entrenamiento en lugar de las salidas previstas ( sobreadaptación ).

16. Métricas de evaluación

En el aprendizaje automático (análisis predictivo), hay varias métricas que se pueden utilizar para la evaluación de modelos. Por ejemplo, un modelo de aprendizaje supervisado (objetivo continuo) se puede evaluar utilizando métricas como la puntuación R2, el error cuadrado medio (MSE) o el error absoluto medio (MAE). Además, un modelo de aprendizaje supervisado (objetivo discreto), también conocido como modelo de clasificación, se puede evaluar utilizando métricas tales como precisión, precisión, memoria, puntuación f1, y el área bajo la curva ROC (AUC).

17. Cuantificación de incertidumbre

Es importante construir modelos de aprendizaje automático que produzcan estimaciones imparciales de las incertidumbres en los resultados calculados. Debido a la aleatoriedad inherente en el conjunto de datos y el modelo, los parámetros de evaluación como la puntuación R2 son variables aleatorias, por lo que es importante estimar el grado de incertidumbre en el modelo. Para un ejemplo de cuantificación de la incertidumbre, véase este artículo: Cuantificación aleatoria de errores en el aprendizaje automático

18. Conceptos matemáticos

a) Cálculo básico: La mayoría de los modelos de aprendizaje automático se construyen con un conjunto de datos con varias características o predictores. Por lo tanto, la familiaridad con el cálculo multivariable es extremadamente importante para la construcción de un modelo de aprendizaje automático. Estos son los temas con los que debes estar familiarizado:

b) Álgebra lineal básica: El álgebra lineal es la habilidad matemática más importante en el aprendizaje automático. Un conjunto de datos se representa como una matriz. El álgebra lineal se utiliza en el preprocesamiento de datos, la transformación de datos, la reducción de la dimensión y la evaluación de modelos. Estos son los temas con los que debes estar familiarizado:

Vectores; Norma de un vector; Matrices; Transposición de una matriz; La inversa de una matriz; El determinante de una matriz; Rastro de una matriz; Producto de punto; Valores propios; Eigenvectores

c) Métodos de optimización: La mayoría de los algoritmos de aprendizaje automático realizan un modelado predictivo minimizando una función objetiva, aprendiendo así los pesos que deben aplicarse a los datos de prueba para obtener las etiquetas previstas. Estos son los temas con los que debes estar familiarizado:

20. Herramientas de productividad

Un proyecto típico de análisis de datos puede incluir varias partes, cada una de las cuales incluye varios archivos de datos y diferentes scripts con código. Mantener todo esto organizado puede ser un reto. Las herramientas de productividad le ayudan a mantener los proyectos organizados y a mantener un registro de sus proyectos terminados. Algunas herramientas esenciales de productividad para la práctica de los científicos de datos incluyen herramientas como Unix/Linux, git y GitHub, RStudio y Jupyter Notebook. Obtenga más información sobre las herramientas de productividad aquí: Herramientas de productividad en el aprendizaje automático

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +