¿Cuál es una de las tareas más importantes que realizan los algoritmos de ciencia de datos?
A continuación se describen las principales tareas de aprendizaje automático que se informan más adelante en este artículo:
- Regresión
- Clasificación
- Agrupación
- Transcripción
- Traducción automática
- Detección de anomalías
- Síntesis y muestreo
- Estimación de la densidad de probabilidad y función de masa de probabilidad
- Coincidencia de similitudes
- Agrupación de co-ocurrencia
- Modelado causal
- Perfil de enlaces
A continuación se indican las fases clave de desarrollo que se utilizan para resolver las diferentes tareas enumeradas anteriormente. Estas son las fases clave del ciclo de desarrollo de los modelos de aprendizaje automático (MLM).
Tareas de aprendizaje automático
Las siguientes son algunas de las tareas clave que se pueden realizar utilizando modelos de aprendizaje automático:
- Regresión : Las tareas de regresión se ocupan principalmente de la estimación de los valores numéricos ( variables continuas ). La tarea de regresión en el aprendizaje automático es una técnica de aprendizaje automático supervisada que se utiliza para predecir los valores de una variable diana determinada sobre la base de la entrada de una o más variables independientes. Es una tarea de ajuste de un modelo matemático a puntos de datos observados, donde el objetivo es minimizar la suma de errores al cuadrado entre los datos observados y los valores predichos. En tareas de regresión, utilizamos modelos lineales y no lineales para construir nuestros modelos predictivos. Los modelos lineales tienen una suposición básica de que existe una relación lineal entre las variables de entrada y salida, mientras que los modelos no lineales no se basan en tales suposiciones. El objetivo de la regresión lineal es encontrar la línea más adecuada para nuestros datos, mientras que en la regresión no lineal, tratamos de identificar relaciones complejas dentro de nuestro conjunto de datos. Además de los problemas de predicción, las tareas de regresión también se pueden utilizar para problemas de inferencia donde queremos entender cómo las variables interactúan entre sí. Por ejemplo, puede utilizar un modelo de regresión lineal para investigar cómo dos o más variables independientes influyen en una variable dependiente, como el salario o la satisfacción laboral. Esto nos permite obtener información sobre cómo los cambios en una variable independiente afectan a otra variable independiente o incluso a la variable dependiente sin tener que hacer ningún cambio directamente nosotros mismos. Algunos de los ejemplos incluyen la estimación del precio de la vivienda, el precio del producto, el precio de las acciones, etc. Algunos de los siguientes métodos de ML podrían utilizarse para resolver problemas de regresión:
- Regresión del núcleo (Precisión más alta)
- Regresión del proceso gaussiano (Precisión más alta)
- Árboles de regresión
- Regresión lineal
- Soporte de regresión vectorial
- LASSO / Ridge
- Aprendizaje profundo
- Bosques aleatorios
- Clasificación : Las tareas de clasificación están simplemente relacionadas con la predicción de una categoría de datos ( variables discretas ). La clasificación es un tipo de tarea de aprendizaje automático que implica identificar a qué grupo o categoría pertenece un elemento, basado en ciertas características o características. Es uno de los tipos más comunes de técnicas de aprendizaje supervisado y se utiliza para todo, desde la detección de fraude bancario hasta el reconocimiento. En esencia, la clasificación es el proceso de clasificar los artículos en dos o más grupos mutuamente excluyentes, a menudo llamados clases. El objetivo es asignar correctamente un elemento dado a la clase correcta en función de sus características. Así que para hacer esto, la máquina debe aprender a diferenciar entre diferentes clases usando estas características. Esto se puede hacer mediante el pre-etiquetado de datos para que el equipo sepa a qué clase pertenece cada elemento, luego entrenándolo con diferentes algoritmos hasta que aprenda a identificar con precisión cada clase. En pocas palabras, una tarea de clasificación resulta en el modelo que, dado un nuevo individuo, determina a qué clase pertenece ese individuo. Una tarea estrechamente relacionada es Puntuación o clase estimación de probabilidad . Un modelo de puntuación aplicado a un individuo produce, en lugar de una predicción de clase, una puntuación que representa la probabilidad (o alguna otra cuantificación de probabilidad) de que ese individuo pertenece a cada clase. Uno de los ejemplos más comunes es predecir si un correo electrónico o no si spam o jamón. Algunos de los casos de uso común se pueden encontrar en el área de la atención médica, como si una persona está sufriendo de una enfermedad en particular o no. También tiene su aplicación en casos de uso financiero, como determinar si una transacción es o no un fraude. Es posible que desee revisar esta página en ejemplos del mundo real de modelos de clasificación, modelos de clasificación de aprendizaje automático ejemplos de la vida real . Los métodos del ML, como los siguientes, podrían aplicarse para resolver las tareas de clasificación:
- Análisis de discriminantes Kernel (Precisión más alta)
- Vecinos de K-Nearest (Precisión más alta)
- Redes neuronales artificiales (ANN) (Precisión más alta)
- Máquina vectorial de soporte (SVM) (Precisión más alta)
- Bosques aleatorios (Precisión más alta)
- Árboles de decisión
- Árboles potenciados
- Regresión logística
- ingenua Bayes
- Aprendizaje profundo
- Agrupación : El agrupamiento es una tarea de aprendizaje automático de uso común en la que los puntos de datos se agrupan en clusters, o grupos de puntos de datos estrechamente relacionados. Es un enfoque no supervisado que no requiere datos etiquetados y puede ser utilizado para identificar patrones o similitudes dentro de un conjunto de datos. El agrupamiento tiene muchas aplicaciones que van desde la segmentación del cliente, la segmentación del mercado, la segmentación de imágenes, la clasificación de documentos y más. En su núcleo, la agrupación es un proceso de partición de un conjunto de objetos en grupos distintos de tal manera que los elementos en cada grupo son similares entre sí, mientras que los que pertenecen a diferentes grupos son muy diferentes. Los siguientes son cuatro tipos diferentes de algoritmos de agrupamiento:
- Agrupación basada en prototipos (K-medias)
- Agrupación jerárquica
- DBSCAN (agrupación espacial basada en la densidad de aplicaciones con ruido)
- Agrupación basada en la distribución
- Coincidencia de similitudes : La tarea de emparejamiento de similitudes en el aprendizaje automático es una tarea en la que las máquinas están entrenadas para emparejar elementos basados en su similitud. Este tipo de tareas se pueden utilizar para una amplia gama de aplicaciones, como el procesamiento de lenguaje natural, reconocimiento de imágenes y sistemas de recomendación. Para que un sistema de aprendizaje automático pueda funcionar bien en este tipo de tareas, necesita ser capaz de aprender a distinguir entre elementos similares y diferentes. Esto se puede hacer mediante la creación de vectores de características a partir de ejemplos de puntos de datos conocidos, a continuación, utilizando esa información como datos de entrenamiento para que la máquina puede hacer predicciones precisas cuando se presenta con nuevos puntos de datos. Una vez entrenados, los algoritmos de coincidencia de similitudes se pueden utilizar de muchas maneras, como proporcionar recomendaciones o ayudar con la optimización de motores de búsqueda. Por ejemplo, si usted estaba buscando un producto en línea en particular, pero no podía encontrarlo a través de los métodos de búsqueda tradicionales, emparejamiento similitud podría ayudar presentando otros productos que se ajustan estrechamente a su artículo deseado en función de sus características y características. Del mismo modo, los sistemas de recomendación utilizan este tipo de sistemas. algoritmos para sugerir elementos que los usuarios pueden gustar en función de sus preferencias pasadas o de otros usuarios con intereses similares.
- Agrupación de co-ocurrencia : Las tareas de agrupación de co-ocurrencia también se llaman minería frecuente de ítems, descubrimiento de reglas de asociación y tareas de análisis de mercados. En esta tarea, la asociación entre entidades se encuentra basada en transacciones que las involucran. por ejemplo, w los artículos del sombrero se compran comúnmente juntos ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ La diferencia entre el agrupamiento y el agrupamiento de co-ocurrencia es que en el agrupamiento, la similitud entre objetos se encuentra basada en los atributos de los objetos, mientras que en el agrupamiento de co-ocurrencia, la similitud de objetos se encuentra basada en que aparecen juntos en transacciones. Por ejemplo, los registros de compra de un supermercado pueden descubrir la asociación de que el pan se compra junto con huevos con mucha más frecuencia de lo esperado.
- Consulta multivariada : La consulta multivariada es sobre la consulta o la búsqueda de objetos similares. Algunos de los siguientes métodos de ML podrían utilizarse para estos problemas:
- Vecinos más cercanos
- Búsqueda de rango
- Vecinos más lejanos
- Densidad de probabilidad y estimación de la función de masa : Los problemas de estimación de la función de densidad de probabilidad están relacionados con encontrar la probabilidad o frecuencia de los objetos. En probabilidad y estadística, la estimación de densidad es la construcción de una estimación, basada en datos observados, de una función de densidad de probabilidad subyacente inobservable. Algunos de los siguientes métodos de ML podrían utilizarse para resolver las tareas de estimación de densidad:
- Estimación de la densidad del núcleo (Precisión más alta)
- Mezcla de gaussianos
- Árbol de estimación de densidad
- Traducción automática : Traducción automática es el proceso de traducción de texto de un idioma a otro utilizando algoritmos de aprendizaje automático. Hay muchas tareas diferentes de traducción automática, tales como traducción automática de documentos, traducción automática del discurso, y traducción automática de páginas web. Los modelos de aprendizaje profundo han logrado resultados de última generación en muchas tareas de traducción automática. Por ejemplo, se han utilizado modelos de aprendizaje profundo para traducir automáticamente páginas web del inglés al chino con una precisión cercana al nivel humano. Además, se han utilizado modelos de aprendizaje profundo para traducir el habla del inglés al francés con una precisión cercana al nivel humano. La traducción automática es una aplicación importante del aprendizaje automático que tiene el potencial de cambiar la forma en que las personas se comunican entre sí.
- Detección de anomalías : La detección de anomalías es el proceso de identificar patrones inusuales en datos que no se ajustan al comportamiento esperado. A menudo se utiliza en una amplia gama de aplicaciones, como la detección de actividades fraudulentas en los datos financieros, la detección de comportamientos maliciosos en los datos de tráfico de red, y la identificación de mal funcionamiento del equipo en los datos de los sensores. La detección de anomalías se puede realizar utilizando una variedad de modelos de aprendizaje automático, tales como métodos basados en la densidad, métodos basados en clústeres y métodos basados en reglas. Cada uno de estos métodos tiene sus propias fortalezas y debilidades, por lo que es importante seleccionar el modelo adecuado para la aplicación en particular. La detección de anomalías mediante el aprendizaje automático es un proceso complejo, pero puede ser extremadamente eficaz para identificar eventos raros que de otro modo serían pasados por alto.
- Síntesis y muestreo : La síntesis y el muestreo son tareas esenciales en el aprendizaje profundo y el aprendizaje automático. Se utilizan para generar nuevos datos a partir de datos existentes o para seleccionar un subconjunto representativo de datos para su análisis ulterior. La síntesis y el muestreo se utilizan a menudo juntos, con el fin de crear un conjunto de datos más diverso y representativo. La síntesis puede utilizarse para generar nuevos puntos de datos, extrapolando los puntos de datos existentes. Por ejemplo, si tenemos un conjunto de imágenes de animales, podemos utilizar la síntesis para generar nuevas imágenes de animales que son similares a las del conjunto de datos. El muestreo se puede utilizar para seleccionar un subconjunto de datos que es representativo de todo el conjunto de datos. Por ejemplo, si tenemos un conjunto de imágenes de animales, podemos usar el muestreo para seleccionar un subconjunto de imágenes que represente todos los diferentes tipos de animales en el conjunto de datos.
- Transcripción : Las tareas de transcripción son aquellas que implican convertir grabaciones de audio o vídeo o imágenes con texto en texto escrito. Se utilizan comúnmente en campos como el periodismo, el mundo académico y la medicina. En los últimos años, las tareas de transcripción se han automatizado hasta cierto punto utilizando algoritmos de aprendizaje automático. Los modelos de aprendizaje profundo pueden ser entrenados para transcribir grabaciones de audio con un alto grado de precisión. Sin embargo, estos modelos requieren una gran cantidad de datos para entrenarse, y a menudo luchan con el ruido de fondo y los acentos. Como resultado, la transcripción sigue siendo en gran medida una tarea manual. Los transcripcionistas profesionales utilizan su conocimiento del idioma y su atención al detalle para producir servicios de transcripción precisos.
- Modelado causal : El modelado causal es un tipo de tarea de aprendizaje automático que tiene como objetivo inferir las causas y efectos de ciertas condiciones o variables. Es una herramienta importante para investigadores en campos como la epidemiología, la economía, la psicología, el marketing y la ciencia política. En el modelado causal, los datos se utilizan para hacer inferencias sobre las relaciones entre variables. El objetivo es identificar qué variables están causando ciertos resultados y cómo se relacionan. Por ejemplo, un investigador puede querer determinar la relación causal entre fumar cigarrillos y el cáncer de pulmón. ¿El fumar cigarrillos está relacionado con el cáncer de pulmón?
- Reducción de la dimensionalidad (extracción de características) : De acuerdo con la Página de Wikipedia sobre Reducción de Dimensiones , Reducción de dimensión es el proceso de reducir el número de variables aleatorias en consideración, y se puede dividir en selección de características y extracción de características. A continuación se indican algunos métodos de ML que podrían utilizarse para la reducción de dimensiones:
- Aprendizaje Manifold/KPCA (Precisión más alta)
- Análisis de los componentes principales
- Análisis independiente de los componentes
- Modelos gráficos gaussianos
- Factorización matricial no negativa
- Detección comprimida
- Previsión de enlaces : La tarea de predicción de enlaces en el aprendizaje automático es una tarea que se centra en identificar posibles conexiones entre entidades que aún no están conectadas. Se utiliza para predecir las relaciones entre entidades, como clientes, productos, autores y más. El objetivo de la predicción de enlaces es construir un modelo que pueda identificar con precisión las conexiones entre entidades en un conjunto de datos. En el pasado, la predicción de enlaces se ha utilizado principalmente para el análisis de redes sociales donde a menudo se utiliza para sugerir amigos o seguidores para los usuarios de una plataforma de redes sociales. Sin embargo, también puede aplicarse a otros tipos de datos, como datos de transacciones de clientes o documentos de investigación científica. Los modelos de predicción de enlaces también se utilizan a menudo en sistemas de recomendación para recomendar artículos a los clientes basados en su comportamiento pasado o preferencias. La predicción del enlace también puede estimar la fuerza de un enlace. Por ejemplo, para recomendar películas a los clientes, la predicción de enlaces se puede utilizar para crear un gráfico entre los clientes y las películas que han visto o calificado. Dentro del gráfico, se buscan los enlaces potenciales (enlace fuerte) que deberían existir entre los clientes y las películas.
Fases de desarrollo del ciclo de vida del MLM
A continuación se presentan las fases de desarrollo de modelos de aprendizaje automático más comunes que se podrían encontrar con mayor frecuencia al resolver diferentes tareas de aprendizaje automático:
- Reunión de datos : Cualquier problema de aprendizaje automático requiere una gran cantidad de datos para fines de entrenamiento/prueba. Identificar las fuentes de datos correctas y recopilar datos de estas fuentes de datos es la clave. Los datos pueden encontrarse en bases de datos, organismos externos, Internet, etc.
- Preprocesamiento de datos : Antes de comenzar a entrenar los modelos, es de suma importancia preparar los datos adecuadamente. Como parte del preprocesamiento de datos, se realizan algunas de las siguientes actividades:
- Limpieza de datos : La limpieza de datos requiere uno para identificar atributos que no tienen suficientes datos o atributos que no tienen varianza. Estos datos (filas y columnas) deben ser eliminados del conjunto de datos de entrenamiento.
- Análisis de datos exploratorios (EDA) : Una vez que los datos están preprocesados, el siguiente paso es realizar análisis exploratorios de datos para entender la distribución de datos y las relaciones entre/dentro de los datos. Algunos de los siguientes se realizan como parte de la EDA:
- Análisis de la correlación
- Análisis de multicolinealidad
- Análisis de la distribución de datos
- Ingeniería de Característica : La ingeniería de características es una de las tareas críticas que se utilizarían en la construcción de modelos de aprendizaje automático. La ingeniería de características es importante porque seleccionar las características correctas no sólo ayudaría a construir modelos de mayor precisión, sino que también ayudaría a lograr objetivos relacionados con la construcción de modelos más simples, reduciendo el exceso de ajuste, etc. Ingeniería de largometrajes incluye tareas como: derivando características de características crudas, identificando características importantes, extracción de características y selección de características . Las siguientes son algunas de las técnicas que se podrían utilizar para la selección de características:
- Los métodos de filtrado ayudan a seleccionar características basadas en los resultados de las pruebas estadísticas. Las siguientes son algunas de las pruebas estadísticas que se utilizan:
- Correlación de Pearson
- Análisis lineal discriminante (LDA)
- Análisis de la variación (ANOVA)
- Ensayos de Chi-cuadrado
- Los métodos Wrapper ayudan en la selección de características mediante el uso de un subconjunto de características y la determinación de la precisión del modelo. Los siguientes son algunos de los algoritmos utilizados:
- Selección anticipada
- Eliminación hacia atrás
- Eliminación de características recursivas
- Las técnicas de regularización penalizan una o más características apropiadamente para llegar a las características más importantes. Los siguientes son algunos de los algoritmos utilizados:
- Regularización LASSO (L1)
- Regularización de Ridge (L2)
- Regularización neta elástica
- Regularización con algoritmos de clasificación como regresión logística, SVM, etc.
- Modelos de formación: Una vez determinadas algunas de las características, vienen los modelos de entrenamiento con datos relacionados con esas características. Un algoritmo popular utilizado para mientras que los modelos de regresión de entrenamiento es Descenso gradual que nos ayuda a encontrar valores de parámetros óptimos con el fin de minimizar nuestra función de costo (también conocido como tasa de error). En este método, empezamos con valores de parámetros iniciales aleatorios y luego los actualizamos gradualmente dando pequeños pasos hasta llegar a una solución óptima. Este proceso iterativo nos ayuda a reducir las tasas de error con el tiempo y, en última instancia, proporcionar mejores predicciones para nuestra variable objetivo.
- Selección de modelos / Selección de algoritmos : Muchas veces, hay varios modelos que se entrenan utilizando diferentes algoritmos. Una de las tareas importantes es seleccionar los modelos más óptimos para su despliegue en la producción. Ajuste del hiperparametro es la tarea más común realizada como parte de la selección del modelo. Además, si hay dos modelos entrenados usando diferentes algoritmos que tienen un rendimiento similar, entonces uno también necesita realizar la selección de algoritmos.
- Ensayo y emparejamiento : Las tareas de prueba y emparejamiento se relacionan con la comparación de conjuntos de datos. A continuación se indican algunos de los métodos que podrían utilizarse para este tipo de problemas:
- Árbol de extensión mínima
- Coincidencia cruzada bipartita
- Correlación de puntos N
- Supervisión de modelos : Una vez que los modelos son entrenados y desplegados, requieren ser monitoreados a intervalos regulares. Los modelos de monitoreo requieren los valores reales de procesamiento y los valores predichos y la medición del rendimiento del modelo basado en las métricas apropiadas.
- Modelo de readiestramiento : En caso de que el rendimiento del modelo se degrade, los modelos deben ser readiestrados. Lo siguiente se hace como parte del readiestramiento modelo:
Artículos Relacionados: