Preguntas de la entrevista de ciencia de datos
Introducción
Ciencias de los datos es un campo interdisciplinario que extrae datos en bruto, los analiza y crea patrones que se utilizan para extraer información valiosa de él. Estadísticas, informática, aprendizaje automático , aprendizaje profundo , el análisis de datos, la visualización de datos y otras tecnologías forman la base de la ciencia de los datos.
A lo largo de los años, la ciencia de los datos ha adquirido gran importancia debido a la importancia de los datos. Los datos se consideran como el nuevo aceite del futuro que cuando se analizan y aprovechan adecuadamente pueden resultar muy beneficiosos para las partes interesadas. No sólo esto, un científico de datos obtiene la exposición al trabajo en diversos dominios, resolviendo problemas prácticos de la vida real todo mediante el uso de tecnologías de moda. La aplicación más común en tiempo real es la entrega rápida de alimentos en aplicaciones como Uber Eats al ayudar a la persona de entrega muestra la ruta más rápida posible para llegar al destino desde el restaurante. Data Science también se utiliza en sistemas de recomendación de artículos en sitios de comercio electrónico como Amazon, Flipkart, etc que recomienda al usuario qué artículo pueden comprar en función de su historial de búsqueda. No solo sistemas de recomendación, Data Science es cada vez más popular en aplicaciones de detección de fraudes para detectar cualquier fraude relacionado con aplicaciones financieras basadas en el crédito. Un científico de datos exitoso puede interpretar datos, realizar innovación y generar creatividad al tiempo que resuelve problemas que ayudan a impulsar los negocios y los objetivos estratégicos. Esto lo convierte en el trabajo más lucrativo del siglo XXI.
En este artículo, vamos a explorar lo que son los más comúnmente pedido Preguntas de Entrevista Técnica de Ciencia de Datos que ayudará tanto a aspirantes como a científicos de datos experimentados.
Preguntas de la entrevista de ciencia de datos para los estudiantes de primer año
1. ¿Qué se entiende por ciencia de datos?
Un campo interdisciplinario que constituye varios procesos científicos, algoritmos, herramientas y técnicas de aprendizaje automático que trabajan para ayudar a encontrar patrones comunes y reunir ideas sensatas de los datos de entrada en bruto dados mediante el análisis estadístico y matemático se llama Ciencia de Datos.
La siguiente figura representa el ciclo de vida de la ciencia de los datos.
- Comienza con la recopilación de los requisitos de negocio y datos relevantes.
- Una vez que los datos se adquieren, se mantiene mediante la limpieza de datos, almacenamiento de datos, estadificación de datos y arquitectura de datos.
- El procesamiento de datos hace la tarea de explorar los datos, extrayéndolos, analizándolos que finalmente pueden ser utilizados para generar el resumen de los conocimientos extraídos de los datos.
- Una vez completados los pasos exploratorios, los datos limpiados son sometidos a varios algoritmos como análisis predictivo, regresión, extracción de texto, patrones de reconocimiento, etc., dependiendo de los requisitos.
- En la etapa final, los resultados se comunican al negocio de una manera visualmente atractiva. Aquí es donde entran en escena las habilidades de visualización de datos, reportes y diferentes herramientas de inteligencia empresarial.
2. ¿Cuál es la diferencia entre análisis de datos y ciencia de datos?
- La ciencia de los datos implica la tarea de transformar los datos mediante el uso de varios métodos de análisis técnico para extraer información significativa utilizando la cual un analista de datos puede aplicar a sus escenarios de negocio.
- El análisis de datos trata de verificar la hipótesis existente y la información y respuestas a las preguntas para un mejor y eficaz proceso de toma de decisiones relacionadas con las empresas.
- La ciencia de los datos puede ser considerada como un tema amplio que hace uso de diversas herramientas y algoritmos matemáticos y científicos para resolver problemas complejos, mientras que la analítica de datos puede ser considerada como un campo específico que se ocupa de problemas específicos concentrados utilizando menos herramientas de estadística y visualización.
3. ¿Cuáles son algunas de las técnicas utilizadas para el muestreo? ¿Cuál es la principal ventaja del muestreo?
El análisis de datos no se puede hacer en un volumen completo de datos en un momento especialmente cuando se trata de conjuntos de datos más grandes. Se convierte en crucial tomar algunas muestras de datos que se pueden utilizar para representar a toda la población y luego realizar análisis sobre ella. Al hacer esto, es muy necesario tomar cuidadosamente los datos de muestra de los enormes datos que realmente representan todo el conjunto de datos.
Existen principalmente dos categorías de técnicas de muestreo basadas en el uso de estadísticas, a saber:
Descargar PDF
4. Enumere las condiciones para Sobreajustar y Ajustar.
Sobreadaptación: El modelo funciona bien sólo para los datos de entrenamiento de la muestra. Si algún dato nuevo se da como entrada al modelo, no proporciona ningún resultado. Estas condiciones se producen debido a un sesgo bajo y una alta varianza en el modelo. Los árboles de decisión son más propensos a sobreajustarse.
Adecuado: Aquí, el modelo es tan simple que no es capaz de identificar la relación correcta en los datos, y por lo tanto no funciona bien incluso en los datos de prueba. Esto puede ocurrir debido a un alto sesgo y baja varianza. La regresión lineal es más propensa a Underfitting.
5. Diferenciar entre los datos de formato largo y amplio.
La siguiente imagen representa la representación de datos de formato amplio y formato largo:
6. ¿Qué son Eigenvectors y Eigenvalues?
Los autovectores son vectores de columna o vectores unitarios cuya longitud/magnitud es igual a 1. También se les llama vectores correctos. Los valores propios son coeficientes que se aplican a los vectores propios que dan a estos vectores diferentes valores de longitud o magnitud.
Una matriz se puede descomponer en Eigenvectors y Eigenvalues y este proceso se llama Eigen descomposición. Estos se utilizan finalmente en métodos de aprendizaje automático como PCA (Análisis de Componentes Principales) para reunir información valiosa de la matriz dada.
7. ¿Qué significa cuando los valores p son altos y bajos?
Un valor p es la medida de la probabilidad de tener resultados iguales o superiores a los resultados obtenidos bajo una hipótesis específica asumiendo que la hipótesis nula es correcta. Esto representa la probabilidad de que la diferencia observada ocurra aleatoriamente por casualidad.
- Valor p bajo que significa valores ≤ 0,05 significa que la hipótesis nula puede ser rechazada y los datos son poco probables con verdadero null.
- Valor p alto, es decir, valores ≥ 0,05 indica la fuerza a favor de la hipótesis nula. Significa que los datos son como con true null.
- p-valor = 0,05 significa que la hipótesis puede ir de cualquier manera.
8. ¿Cuándo termina el muestreo?
El muestreo es una metodología utilizada para tomar muestras de datos a fin de mejorar la exactitud y cuantificar la incertidumbre de los parámetros de la población. Se hace para asegurar que el modelo es lo suficientemente bueno mediante la formación del modelo en diferentes patrones de un conjunto de datos para asegurar que las variaciones se manejan. También se hace en los casos en que los modelos necesitan ser validados utilizando subconjuntos aleatorios o cuando se sustituyen etiquetas en puntos de datos mientras se realizan las pruebas.
9. ¿Qué entiendes por Datos Desbalanceados?
Se dice que los datos están muy desequilibrados si se distribuyen de manera desigual entre diferentes categorías. Estos conjuntos de datos resultan en un error en el rendimiento del modelo y resultan en inexactitud.
10. ¿Hay alguna diferencia entre el valor esperado y el valor medio?
No hay muchas diferencias entre estos dos, pero cabe señalar que se utilizan en diferentes contextos. El valor medio generalmente se refiere a la distribución de probabilidad mientras que el valor esperado se refiere a los contextos que involucran variables aleatorias.
11. ¿Qué entiendes por Supervivencia Bias?
Este sesgo se refiere al error lógico mientras se centra en aspectos que sobrevivieron a algún proceso y pasando por alto aquellos que no funcionaron debido a la falta de prominencia. Este sesgo puede llevar a conclusiones erróneas.
12. Definir los términos KPI, elevación, ajuste del modelo, robustez y DOE.
- KPI: KPI es el indicador clave de rendimiento que mide lo bien que el negocio logra sus objetivos.
- Elevación: Se trata de una medida de rendimiento del modelo objetivo medida en relación con un modelo de elección aleatoria. Elevación indica lo bueno que es el modelo en la predicción versus si no había modelo.
- Ajuste del modelo: Esto indica lo bien que el modelo que se examina se ajusta a las observaciones dadas.
- Robustez: Esto representa la capacidad del sistema para manejar las diferencias y variaciones con eficacia.
- DOE: representa el diseño de experimentos, que representa el diseño de tareas con el objetivo de describir y explicar la variación de la información en condiciones hipotéticas para reflejar variables.
13. Definir variables de confusión.
Las variables de confusión también se conocen como confundadores. Estas variables son un tipo de variables ajenas que influyen tanto en variables independientes como dependientes, causando una asociación espuria y relaciones matemáticas entre aquellas variables que están asociadas pero que no están casualmente relacionadas entre sí.
14. ¿Definir y explicar el sesgo de selección?
El sesgo de selección ocurre en el caso en que el investigador tiene que tomar una decisión sobre qué participante estudiar. El sesgo de selección se asocia con esas investigaciones cuando la selección del participante no es aleatoria. El sesgo de selección también se llama efecto de selección. El sesgo de selección es causado por el método de recolección de muestras.
A continuación se explican cuatro tipos de sesgos de selección:
- Muestreo de Bias: Como resultado de una población que no es aleatoria en absoluto, algunos miembros de una población tienen menos posibilidades de ser incluidos que otros, resultando en una muestra sesgada. Esto causa un error sistemático conocido como sesgo de muestreo.
- Intervalo de tiempo: Los ensayos pueden detenerse temprano si alcanzamos cualquier valor extremo pero si todas las variables son invariantes similares, las variables con mayor varianza tienen una mayor probabilidad de alcanzar el valor extremo.
- Datos: Es cuando se seleccionan arbitrariamente datos específicos y no se siguen los criterios generalmente acordados.
- Atrición: El desgaste en este contexto significa la pérdida de los participantes. Es el descuento de los sujetos que no completaron el ensayo.
15. ¿Definir compensación entre sesgo y variación?
Entendamos primero el significado del sesgo y la varianza en detalle:
Bias: Es una especie de error en un modelo de aprendizaje automático cuando un algoritmo ML se simplifica demasiado. Cuando un modelo es entrenado, en ese momento hace suposiciones simplificadas para que pueda entender fácilmente la función de destino. Algunos algoritmos que tienen un sesgo bajo son Árboles de Decisión, SVM, etc. Por otro lado, los algoritmos de regresión logística y lineal son los que tienen un alto sesgo.
Diferencia: La variación también es una especie de error. Se introduce en un modelo ML cuando un algoritmo ML se hace altamente complejo. Este modelo también aprende el ruido del conjunto de datos que está destinado al entrenamiento. Además, funciona mal en el conjunto de datos de prueba. Esto puede llevar a una elevación excesiva, así como a una alta sensibilidad.
Cuando aumenta la complejidad de un modelo, se observa una reducción del error. Esto es causado por el sesgo inferior en el modelo. Pero, esto no sucede siempre hasta que llegamos a un punto en particular llamado el punto óptimo. Después de este punto, si seguimos aumentando la complejidad del modelo, se levantará y sufrirá el problema de la alta varianza. Podemos representar esta situación con la ayuda de un gráfico como se muestra a continuación:
Como se puede ver en la imagen de arriba, antes del punto óptimo, el aumento de la complejidad del modelo reduce el error (bias). Sin embargo, después del punto óptimo, vemos que el aumento en la complejidad del modelo de aprendizaje automático aumenta la varianza.
Comercio de Bias y Varianza: Por lo tanto, como sabemos que el sesgo y la varianza, ambos son errores en los modelos de aprendizaje automático, es muy esencial que cualquier modelo de aprendizaje automático tiene baja varianza, así como un sesgo bajo para que pueda lograr un buen rendimiento.
Veamos algunos ejemplos. Los Algoritmo del vecino K-Nearest es un buen ejemplo de un algoritmo con sesgo bajo y varianza alta. Esta compensación puede invertirse fácilmente aumentando el valor k, lo que a su vez da lugar a un aumento del número de vecinos. Esto, a su vez, da lugar a un aumento del sesgo y a una reducción de la variación.
Otro ejemplo puede ser el algoritmo de una máquina vectorial de soporte. Este algoritmo también tiene una varianza alta y, obviamente, un sesgo bajo y podemos revertir la compensación aumentando el valor del parámetro C. Así, aumentando el parámetro C aumenta el sesgo y disminuye la varianza.
Por lo tanto, la compensación es simple. Si aumentamos el sesgo, la varianza disminuirá y viceversa.
16. ¿Definir la matriz de confusión?
Es una matriz que tiene 2 filas y 2 columnas. Tiene 4 salidas que un clasificador binario le proporciona. Se utiliza para derivar diversas medidas como especificidad, tasa de error, precisión, precisión, sensibilidad y memoria.
El conjunto de datos de ensayo debe contener las etiquetas correctas y previstas. Las etiquetas dependen del rendimiento. Por ejemplo, las etiquetas predichas son las mismas si el clasificador binario funciona perfectamente. Además, coinciden con la parte de las etiquetas observadas en escenarios del mundo real. Los cuatro resultados mostrados anteriormente en la matriz de confusión significan lo siguiente:
- Verdadero Positivo: Esto significa que la predicción positiva es correcta.
- Falso Positivo: Esto significa que la predicción positiva es incorrecta.
- Verdadero Negativo: Esto significa que la predicción negativa es correcta.
- Falso Negativo: Esto significa que la predicción negativa es incorrecta.
Las fórmulas para calcular las medidas básicas que provienen de la matriz de confusión son:
La sensibilidad es la medida de la verdadera tasa positiva. También se llama recuerdo. La especificidad es la medida de la verdadera tasa negativa. La precisión es la medida de un valor predicho positivo. F-score es el medio armónico de precisión y memoria.
17. ¿Qué es la regresión logística? Indique un ejemplo en el que ha utilizado recientemente regresión logística.
La regresión logística también se conoce como el modelo logit. Es una técnica para predecir el resultado binario a partir de una combinación lineal de variables (llamadas variables predictoras).
Por ejemplo , digamos que queremos predecir el resultado de las elecciones para un líder político en particular. Por lo tanto, queremos averiguar si este líder va a ganar las elecciones o no. Por lo tanto, el resultado es binario es decir. ganar (1) o perder (0). Sin embargo, la entrada es una combinación de variables lineales como el dinero gastado en publicidad, el trabajo pasado realizado por el líder y el partido, etc.
18. ¿Qué es la regresión lineal? ¿Cuáles son algunos de los principales inconvenientes del modelo lineal?
La regresión lineal es una técnica en la que la puntuación de una variable Y se predice utilizando la puntuación de una variable predictora X. Y se llama variable de criterio. Algunos de los inconvenientes de la regresión lineal son los siguientes:
- La asunción de la linealidad de los errores es un inconveniente importante.
- No se puede utilizar para resultados binarios. Tenemos regresión logística para eso.
- Hay problemas demasiado adecuados que no se pueden resolver.
19. ¿Qué es un bosque al azar? Explique que está funcionando.
La clasificación es muy importante en el aprendizaje automático. Es muy importante saber a qué clase pertenece una observación. Por lo tanto, tenemos varios algoritmos de clasificación en aprendizaje automático como regresión logística, máquina vectorial de soporte, árboles de decisión, clasificador Naive Bayes, etc. Una de estas técnicas de clasificación que está cerca de la cima de la jerarquía de clasificación es la bosque aleatorio Clasificador.
Por lo tanto, primero tenemos que entender un árbol de decisión antes de que podamos entender el clasificador forestal aleatorio y sus obras. Por lo tanto, digamos que tenemos una cadena como se indica a continuación:
Por lo tanto, tenemos la cadena con 5 unos y 4 ceros y queremos clasificar los caracteres de esta cadena utilizando sus características. Estas características son el color (rojo o verde en este caso) y si la observación (es decir. carácter) está subrayado o no. Ahora, digamos que sólo nos interesan las observaciones rojas y subrayadas. Por lo tanto, el árbol de decisión se vería algo así:
Por lo tanto, empezamos con el color primero, ya que sólo estamos interesados en las observaciones rojas y separamos los caracteres rojo y verde-color. Después de eso, la rama "No", es decir. la rama que tenía todos los caracteres de color verde no se expandió más, ya que sólo queremos caracteres en rojo. Por lo tanto, expandimos la rama “Sí” y otra vez obtuvimos una rama “Sí” y una rama “No” basada en el hecho de si los caracteres estaban subrayados o no.
Así que, así es como dibujamos un árbol de decisiones típico. Sin embargo, los datos en la vida real no son tan limpios, pero esto fue sólo para dar una idea sobre el funcionamiento de los árboles de decisión. Pasemos ahora al bosque al azar.
Bosque aleatorio
Consiste en un gran número de árboles de decisión que funcionan como un conjunto. Básicamente, cada árbol en el bosque da una predicción de clase y el con el número máximo de votos se convierte en la predicción de nuestro modelo. Por ejemplo, en el ejemplo que se muestra a continuación, 4 árboles de decisión predicen 1 y 2 predicen 0. Por lo tanto, se considerará la predicción 1.
El principio subyacente de un bosque al azar es que varios estudiantes débiles se combinan para formar un estudiante agudo. Los pasos para construir un bosque al azar son los siguientes:
- Construir varios árboles de decisión en las muestras de datos y registrar sus predicciones.
- Cada vez que se considera una división para un árbol, elegir una muestra aleatoria de predictores mm como los candidatos divididos de todos los predictores pp. Esto le sucede a cada árbol en el bosque al azar.
- Aplicar la regla del pulgar i.e. a cada división m = p.m. = p.
- Aplicar las predicciones a la regla de la mayoría.
20. En un intervalo de tiempo de 15 minutos, la probabilidad de que usted puede ver una estrella fugaz o un montón de ellos es 0,2. ¿Cuál es el porcentaje de probabilidades de que veas al menos una estrella disparando desde el cielo si estás bajo él durante una hora?
Digamos que Prob es la probabilidad de que podamos ver un mínimo de una estrella fugaz en 15 minutos.
Por lo tanto, Prob = 0.2
Ahora, la probabilidad de que no veamos ninguna estrella fugaz en la duración de 15 minutos es = 1 - Prob
Por lo tanto, la probabilidad de que veamos una estrella fugaz en el intervalo de tiempo de una hora es = 1-0.4 = 0.6
Por lo tanto, hay aproximadamente un 60% de posibilidades de que podamos ver una estrella fugaz en el lapso de tiempo de una hora.
21. ¿Qué es el aprendizaje profundo? ¿Cuál es la diferencia entre el aprendizaje profundo y el aprendizaje automático?
El aprendizaje profundo es un paradigma del aprendizaje automático. En el aprendizaje profundo, múltiples capas de procesamiento están implicadas con el fin de extraer altas características de los datos. Las redes neuronales están diseñadas de tal manera que intentan simular el cerebro humano.
El aprendizaje profundo ha demostrado un rendimiento increíble en los últimos años debido al hecho de que muestra una gran analogía con el cerebro humano.
La diferencia entre el aprendizaje automático y el aprendizaje profundo es que el aprendizaje profundo es un paradigma o una parte del aprendizaje automático que se inspira en la estructura y funciones del cerebro humano llamadas redes neuronales artificiales. Más información .
22. ¿Qué es un Descenso Gradiente y Gradiente?
Gradiente: Gradient es la medida de una propiedad que cuánto ha cambiado la salida con respecto a un pequeño cambio en la entrada. En otras palabras, podemos decir que es una medida de cambio en los pesos con respecto al cambio en el error. El gradiente puede ser representado matemáticamente como la pendiente de una función.
Descenso gradiente: El descenso gradual es un algoritmo de minimización que minimiza la función de Activación. Bueno, puede minimizar cualquier función dada a ella, pero por lo general se proporciona con la función de activación sólo.
Descenso gradual, como el nombre sugiere significa descenso o una disminución en algo. La analogía del descenso de gradiente se toma a menudo como una persona que sube por una colina/montaña. La siguiente es la ecuación que describe lo que significa descenso de gradiente:
Por lo tanto, si una persona está bajando por la colina, la siguiente posición a la que el escalador tiene que llegar es denotada por “b” en esta ecuación. Entonces, hay un signo menos porque denota la minimización (como descenso de gradiente es un algoritmo de minimización). El Gamma se llama un factor de espera y el término restante que es el término Gradiente en sí muestra la dirección del descenso más empinado.
Esta situación puede ser representada en un gráfico de la siguiente manera:
Aquí, estamos en algún lugar en el “Peso Inicial” y queremos alcanzar el mínimo Global. Por lo tanto, este algoritmo de minimización nos ayudará a hacer eso.
Preguntas para una entrevista de ciencia de datos con experiencia
23. ¿Cómo son los problemas de las series temporales diferentes de otros problemas de regresión?
- Los datos de series temporales pueden ser considerados como una extensión a regresión lineal que utiliza términos como autocorrelación, movimiento de promedios para resumir datos históricos de variables del eje y para predecir un futuro mejor.
- La predicción y predicción es el objetivo principal de los problemas de las series temporales donde se pueden hacer predicciones exactas, pero a veces no se conocen las razones subyacentes.
- Tener Tiempo en el problema no significa necesariamente que se convierta en un problema de series temporales. Debe haber una relación entre el objetivo y el tiempo para que un problema se convierta en un problema de series temporales.
- Se espera que las observaciones cercanas unas a otras en el tiempo sean similares a las que están muy lejos y que proporcionan responsabilidades por la estacionalidad. Por ejemplo, el tiempo de hoy sería similar al de mañana, pero no similar al de cuatro meses a partir de hoy. Por lo tanto, la predicción meteorológica basada en datos pasados se convierte en un problema de series temporales.
24. ¿Qué son RMSE y MSE en un modelo de regresión lineal?
RMSE: RMSE significa Root Mean Square Error. En un modelo de regresión lineal, RMSE se utiliza para probar el rendimiento del modelo de aprendizaje automático. Se utiliza para evaluar la difusión de los datos alrededor de la línea de mejor En forma. Por lo tanto, en palabras simples, se utiliza para medir la desviación de los residuos.
RMSE se calcula utilizando la fórmula:
- Yi es el valor real de la variable de salida.
- Y(Cap) es el valor predicho y,
- N es el número de puntos de datos.
MSE: Mean Squared Error se utiliza para averiguar qué tan cerca está la línea de los datos reales. Por lo tanto, hacemos la diferencia en la distancia de los puntos de datos de la línea y la diferencia es al cuadrado. Esto se hace para todos los puntos de datos y la presentación de la diferencia cuadrada dividido por el número total de puntos de datos nos da el Error Mean Squared (MSE).
Por lo tanto, si estamos tomando la diferencia cuadrada de puntos de datos N y dividir la suma por N, ¿qué significa? Sí, representa el promedio de la diferencia cuadrada de un punto de datos de la línea es decir. el promedio de la diferencia cuadrada entre los valores reales y los predichos. A continuación se presenta la fórmula para encontrar la EMS:
- Yi es el valor real de la variable de salida (el punto de datos ith)
- Y(cap) es el valor predicho y,
- N es el número total de puntos de datos.
Así que, RMSE es la raíz cuadrada de MSE .
25. ¿Qué son Vectores de Soporte en SVM (Máquina Vectora de Soporte)?
En el diagrama anterior, podemos ver que las líneas delgadas marcan la distancia desde el clasificador hasta los puntos de datos más cercanos (puntos de datos oscuros). Estos se llaman vectores de soporte. Por lo tanto, podemos definir los vectores de soporte como los puntos de datos o vectores que son más cercanos (más cercanos) al hiperplano. Afectan la posición del hiperplano. Desde que apoyan el hiperplano, son conocidos como vectores de soporte.
26. Por lo tanto, usted ha hecho algunos proyectos en el aprendizaje automático y la ciencia de los datos y vemos que son un poco experimentados en el campo. Digamos que la memoria RAM de su portátil es sólo 4 GB y desea entrenar su modelo en el conjunto de datos de 10 GB.
¿Qué vas a hacer? ¿ Ha experimentado usted un problema así antes?
En este tipo de preguntas, primero tenemos que preguntarnos qué modelo de ML tenemos que entrenar. Después de eso, depende de si tenemos que entrenar un modelo basado en Redes Neural o SVM.
Los pasos para las redes neuronales se dan a continuación:
- La matriz Numpy se puede utilizar para cargar todos los datos. Nunca almacenará todos los datos, sino que simplemente creará un mapeo de los datos.
- Ahora, con el fin de obtener algunos datos deseados, pasar el índice en el NumPy Array.
- Estos datos se pueden utilizar para pasar como una entrada a la red neuronal manteniendo un pequeño tamaño de lote.
Los pasos para SVM se dan a continuación:
- Para SVM, se pueden obtener pequeños conjuntos de datos. Esto se puede hacer dividiendo el conjunto de big data.
- El subconjunto del conjunto de datos se puede obtener como una entrada si se utiliza la función de ajuste parcial.
- Repita el paso de usar el método de ajuste parcial para otros subconjuntos también.
Ahora, usted puede describir la situación si se ha enfrentado a un problema de este tipo en sus proyectos o trabajando en el aprendizaje automático / ciencia de datos.
27. Explicar los Fundamentos de la Red Neural.
En el cerebro humano, hay diferentes neuronas presentes. Estas neuronas combinan y realizan diversas tareas. La Red Neural en el aprendizaje profundo trata de imitar las neuronas cerebrales humanas. La red neuronal aprende los patrones de los datos y utiliza el conocimiento que obtiene de varios patrones para predecir la salida de nuevos datos, sin ninguna asistencia humana.
Un perceptrón es la red neuronal más simple que contiene una única neurona que realiza 2 funciones. La primera función es realizar la suma ponderada de todas las entradas y la segunda es una función de activación.
Hay otras redes neuronales que son más complicadas. Estas redes consisten en las tres capas siguientes:
- Capa de entrada: La red neuronal tiene la capa de entrada para recibir la entrada.
- Capa oculta: Puede haber múltiples capas ocultas entre la capa de entrada y la capa de salida. Las capas inicialmente ocultas se utilizan para detectar los patrones de bajo nivel, mientras que las capas posteriores son responsables de combinar la salida de capas anteriores para encontrar más patrones.
- Capa de salida: Esta capa produce la predicción.
A continuación se muestra un ejemplo de imagen de red neuronal:
28. ¿Qué es la Red Generativa Adversal?
Este enfoque se puede entender con el famoso ejemplo del vendedor de vino. Digamos que hay un vendedor de vino que tiene su propia tienda. Este vendedor de vino compra vino de los distribuidores que le venden el vino a un bajo costo para que pueda vender el vino a un alto costo para los clientes. Ahora, digamos que los traficantes de los que está comprando el vino, le están vendiendo vino falso. Hacen esto como el vino falso cuesta mucho menos que el vino original y el falso y el vino real son indistinguibles a un consumidor normal (cliente en este caso). El dueño de la tienda tiene algunos amigos que son expertos en vino y les envía su vino cada vez antes de mantener el stock a la venta en su tienda. Así que, sus amigos, los expertos en vino, le dan la opinión de que el vino es probablemente falso. Dado que el vendedor de vino ha estado comprando el vino durante mucho tiempo a los mismos distribuidores, quiere asegurarse de que sus comentarios son justo antes de que se queje a los distribuidores sobre él. Ahora, digamos que los distribuidores también tienen una pista de algún lugar que el vendedor de vino es sospechoso de ellos.
Por lo tanto, en esta situación, los distribuidores harán todo lo posible para vender el vino falso, mientras que el vendedor de vino hará todo lo posible para identificar el vino falso. Veamos esto con la ayuda de un diagrama que se muestra a continuación:
Desde la imagen de arriba, está claro que un vector de ruido está entrando en el generador (dealer) y genera el vino falso y el discriminador tiene que distinguir entre el vino falso y el vino real. Esto es un Red Generativa Adversal (GAN).
En un GAN, hay dos componentes principales, a saber. Generador y discriminador. Por lo tanto, el generador es una CNN que sigue produciendo imágenes y el discriminador trata de identificar las imágenes reales de las imágenes falsas.
29. ¿Qué es un gráfico computacional?
Un gráfico computacional también se conoce como “Gráfico de flujo de datos”. Todo en la famosa biblioteca de aprendizaje profundo TensorFlow se basa en el gráfico computacional. El gráfico computacional en Tensorflow tiene una red de nodos donde cada nodo opera. Los nodos de este gráfico representan operaciones y los bordes representan tensores.
30. ¿Qué son los autocodificadores?
Los codificadores automáticos son redes de aprendizaje. Transforman las entradas en salidas con errores mínimos posibles. Por lo tanto, básicamente, esto significa que la salida que queremos debe ser casi igual o tan cerca como a la entrada de la siguiente manera.
Se añaden varias capas entre la entrada y la capa de salida y las capas que están entre la entrada y la capa de salida son más pequeñas que la capa de entrada. Recibió información no etiquetada. Esta entrada se codifica para reconstruir la entrada más tarde.
31. ¿Qué son los Gradientes Explosivos y los Gradientes Desaparecientes?
- Gradientes que explotan: Digamos que usted está entrenando una RNN. Digamos, usted vio los gradientes de error exponencialmente crecientes que se acumulan, y como resultado de esto, se hacen actualizaciones muy grandes a los pesos del modelo de red neuronal. Estos gradientes de error exponencialmente crecientes que actualizan los pesos de la red neuronal en gran medida se llaman Explosión de los grados .
- Desvanecimiento de los grados: Vamos a decir de nuevo, que usted está entrenando una RNN. Digamos, la pendiente se volvió demasiado pequeña. Este problema de que la pendiente se vuelva demasiado pequeña se llama Desvanecimiento del grado . Causa un aumento importante en el tiempo de entrenamiento y causa un desempeño deficiente y una precisión extremadamente baja.
32. ¿Qué es el valor p y qué indica en la Hipótesis Nulo?
El valor P es un número que oscila entre 0 y 1. En una prueba de hipótesis en las estadísticas, el valor p ayuda a decirnos lo fuertes que son los resultados. La afirmación que se mantiene para el experimento o el ensayo se llama Hipótesis Nula.
- Un valor p bajo, es decir. Valor p menos o igual a 0,05 indica la fuerza de los resultados frente a la Hipótesis Nulo, lo que a su vez significa que la Hipótesis Nulo puede ser rechazada.
- Un valor p alto, es decir. Valor p superior a 0,05 indica la fuerza de los resultados a favor de la Hipótesis Nul, es decir. para la Hipótesis Nulo que a su vez significa que la Hipótesis Nulo puede ser aceptada.
33. Dado que usted tiene experiencia en el campo del aprendizaje profundo, ¿puede decirnos por qué TensorFlow es la biblioteca más preferida en el aprendizaje profundo?
Tensorflow es una biblioteca muy famosa en el aprendizaje profundo. La razón es bastante simple en realidad. Proporciona C++, así como APIs Python, lo que hace que sea muy fácil de trabajar. Además, TensorFlow tiene una velocidad de compilación rápida en comparación con Keras y Antorcha (otras famosas bibliotecas de aprendizaje profundo). Aparte de eso, Tenserflow soporta dispositivos de computación GPU y CPU. Por lo tanto, es un gran éxito y una biblioteca muy popular para el aprendizaje profundo.
34. Supongamos que hay un conjunto de datos con variables con valores faltantes de más del 30%, ¿cómo va a lidiar con un conjunto de datos de este tipo?
Dependiendo del tamaño del conjunto de datos, seguimos las siguientes maneras:
- En caso de que los conjuntos de datos sean pequeños, los valores que faltan se sustituyen por la media o media de los datos restantes. En pandas, esto se puede hacer usando media = df.mean() donde df representa el marco de datos pandas que representa el conjunto de datos y media() calcula la media de los datos. Para sustituir los valores que faltan por la media calculada, podemos utilizar df.fillna(media) .
- Para conjuntos de datos más grandes, las filas con valores faltantes se pueden eliminar y los datos restantes se pueden utilizar para la predicción de datos.
35. ¿Qué es la Validación Cruzada?
La validación cruzada es una técnica estadística utilizada para mejorar el rendimiento de un modelo. Aquí, el modelo será entrenado y probado con rotación utilizando diferentes muestras del conjunto de datos de entrenamiento para asegurar que el modelo funcione bien para datos desconocidos. Los datos de entrenamiento se dividirán en varios grupos y el modelo se ejecutará y validará contra estos grupos en rotación.
Las técnicas más utilizadas son:
- K- Fold method
- Dejar el método de salida p
- Método de dejar sin utilizar una sola vez
- Método de retención
36. ¿Cuáles son las diferencias entre correlación y covarianza?
Aunque estos dos términos se utilizan para establecer una relación y dependencia entre cualquiera de las dos variables aleatorias, las siguientes son las diferencias entre ellas:
- Correlación: Esta técnica se utiliza para medir y estimar la relación cuantitativa entre dos variables y se mide en términos de cuán fuertes son las variables relacionadas.
- Covarianza: Representa la medida en que las variables cambian juntas en un ciclo. Esto explica la relación sistemática entre pares de variables donde los cambios en una afectan a los cambios en otra variable.
38. ¿Con qué frecuencia debemos actualizar un algoritmo en el campo del aprendizaje automático?
No queremos actualizar y hacer cambios a un algoritmo sobre una base regular, ya que un algoritmo es un procedimiento de paso bien definido para resolver cualquier problema y si los pasos siguen en la actualización, ya no se puede decir que está bien definido. Además, esto trae muchos problemas a los sistemas que ya implementan el algoritmo, ya que resulta difícil introducir cambios continuos y regulares. Por lo tanto, debemos actualizar un algoritmo sólo en cualquiera de los siguientes casos:
- Si desea que el modelo evolucione como flujos de datos a través de infraestructura, es justo hacer cambios en un algoritmo y actualizarlo en consecuencia.
- Si la fuente de datos subyacente está cambiando, casi se hace necesario actualizar el algoritmo en consecuencia.
- Si hay un caso de no-estacionario, podemos actualizar el algoritmo.
- Una de las razones más importantes para actualizar cualquier algoritmo es su bajo rendimiento y falta de eficiencia. Por lo tanto, si un algoritmo carece de eficiencia o un rendimiento insuficiente debe ser reemplazado por algún algoritmo mejor o debe ser actualizado.
39. ¿Por qué necesitamos sesgo de selección?
Selection Bias ocurre en los casos en que no hay aleatorización específicamente logrado mientras se selecciona una parte del conjunto de datos para el análisis. Este sesgo indica que la muestra analizada no representa a toda la población que se pretende analizar.
- Por ejemplo, en la imagen de abajo, podemos ver que la muestra que hemos seleccionado no representa completamente a toda la población que tenemos. Esto nos ayuda a preguntarnos si hemos seleccionado los datos adecuados para el análisis o no.
40. ¿Por qué es crucial la limpieza de datos? ¿Cómo se limpian los datos?
Mientras se ejecuta un algoritmo en cualquier dato, para recopilar información adecuada, es muy necesario tener datos correctos y limpios que contengan sólo información relevante. Los datos sucios suelen dar lugar a percepciones y predicciones deficientes o incorrectas que pueden tener efectos perjudiciales.
Por ejemplo, al lanzar cualquier gran campaña para comercializar un producto, si nuestro análisis de datos nos dice que apuntemos a un producto que en realidad no tiene demanda y si la campaña se lanza, está destinada a fracasar. Esto resulta en una pérdida de los ingresos de la empresa. Aquí es donde entra en escena la importancia de tener datos adecuados y limpios.
- La limpieza de los datos procedentes de diferentes fuentes ayuda a la transformación de los datos y resulta en los datos en los que los científicos de datos pueden trabajar.
- Los datos debidamente limpiados aumentan la precisión del modelo y proporcionan muy buenas predicciones.
- Si el conjunto de datos es muy grande, entonces se vuelve engorroso ejecutar datos en él. El paso de limpieza de datos toma mucho tiempo (alrededor del 80% del tiempo) si los datos son enormes. No se puede incorporar con la ejecución del modelo. Por lo tanto, los datos de limpieza antes de ejecutar el modelo, resulta en una mayor velocidad y eficiencia del modelo.
- La limpieza de datos ayuda a identificar y solucionar cualquier problema estructural en los datos. También ayuda a eliminar cualquier duplicado y ayuda a mantener la consistencia de los datos.
El siguiente diagrama representa las ventajas de la limpieza de datos:
41. ¿Cuáles son los métodos de selección de características disponibles para seleccionar las variables adecuadas para construir modelos predictivos eficientes?
Mientras se utiliza un conjunto de datos en la ciencia de datos o algoritmos de aprendizaje automático, sucede que no todas las variables son necesarias y útiles para construir un modelo. Se requieren métodos de selección de características más inteligentes para evitar modelos redundantes que aumenten la eficiencia de nuestro modelo. Los siguientes son los tres métodos principales en la selección de características:
- Métodos de filtrado:
- Estos métodos recogen sólo las propiedades intrínsecas de las características que se miden mediante estadísticas univariadas y no el rendimiento validado cruzadamente. Son sencillos y generalmente más rápidos y requieren menos recursos computacionales en comparación con los métodos de envoltorio.
- Estos métodos necesitan algún tipo de método para buscar con avidez en todos los subconjuntos de características posibles, acceder a su calidad mediante el aprendizaje y la evaluación de un clasificador con la característica.
- La técnica de selección se basa en el algoritmo de aprendizaje automático en el que el conjunto de datos dado necesita encajar.
- Hay tres tipos de métodos de envoltura, que son:
- Selección hacia adelante: Aquí, una característica se prueba a la vez y se añaden nuevas características hasta que se obtiene un buen ajuste.
- Selección hacia atrás: Aquí, todas las características se prueban y las que no encajan se eliminan una por una para ver mientras se comprueba que funciona mejor.
- Eliminación de características recursivas: Las características se comprueban recursivamente y se evalúa su desempeño.
- Estos métodos son generalmente computacionalmente intensivos y requieren recursos de alta gama para el análisis. Pero estos métodos generalmente conducen a mejores modelos predictivos con mayor precisión que los métodos de filtro.
- Métodos incorporados:
- Los métodos integrados constituyen las ventajas tanto de los métodos de filtro como de envoltorio al incluir interacciones de características manteniendo al mismo tiempo costos computacionales razonables.
- Estos métodos son iterativos, ya que toman cada iteración modelo y cuidadosamente extraer características que contribuyen a la mayor parte del entrenamiento en esa iteración.
42. Durante el análisis, ¿cómo se tratan los valores que faltan?
Para identificar la extensión de los valores faltantes, primero tenemos que identificar las variables con los valores faltantes. Digamos que se identifica un patrón. El analista debería concentrarse ahora en ellos, ya que podría dar lugar a ideas interesantes y significativas. Sin embargo, si no hay patrones identificados, podemos sustituir los valores que faltan por los valores de mediana o media o simplemente podemos ignorar los valores que faltan.
Si la variable es categórica, se asigna el valor predeterminado a la media, mínimo y máximo. El valor que falta se asigna al valor predeterminado. Si tenemos una distribución de datos que vienen, para la distribución normal, damos el valor medio.
Si el 80% de los valores faltan para una variable en particular, entonces caeríamos la variable en lugar de tratar los valores que faltan.
43. ¿Tratar las variables categóricas como variables continuas resultará en un mejor modelo predictivo?
¡Sí! Una variable categórica es una variable que puede ser asignada a dos o más categorías sin un pedido definido de categoría. Las variables ordinales son similares a las variables categóricas con definición de orden adecuado y claro. Por lo tanto, si la variable es ordinal, entonces tratar el valor categórico como una variable continua dará lugar a mejores modelos predictivos.
44. ¿Cómo tratará los valores faltantes durante el análisis de datos?
El impacto de los valores faltantes se puede conocer después de identificar qué tipo de variables tienen los valores faltantes.
- Si el analista de datos encuentra algún patrón en estos valores que faltan, entonces hay posibilidades de encontrar información significativa.
- En caso de que no se encuentren patrones, entonces estos valores que faltan pueden ser ignorados o pueden ser reemplazados por valores por defecto tales como valores medios, mínimos, máximos o medianos.
- Si los valores que faltan pertenecen a variables categóricas, entonces se les asignan valores predeterminados. Si los datos tienen una distribución normal, los valores medios se asignan a los valores que faltan.
- Si faltan valores del 80%, entonces depende del analista reemplazarlos con valores predeterminados o soltar las variables.
45. ¿Qué representa la curva ROC y cómo crearla?
ROC (Característica operativa del receptor) curva es una representación gráfica del contraste entre las tasas de falsos positivos y las tasas reales positivas en diferentes umbrales. La curva se utiliza como un proxy para una compensación entre sensibilidad y especificidad.
La curva ROC se crea trazando valores de tasas reales positivas (TPR o sensibilidad) frente a tasas falsas positivas (FPR o (1 especificidad)) La TPR representa la proporción de observaciones correctamente predichas como positivas de las observaciones positivas generales. El RCP representa la proporción de observaciones erróneamente predichas a partir de las observaciones negativas generales. Considere el ejemplo de las pruebas médicas, la TPR representa la tasa a la que las personas son correctamente positivo para una enfermedad en particular.
46. ¿Cuáles son las diferencias entre análisis univariado, bivariado y multivariado?
Los análisis estadísticos se clasifican en función del número de variables procesadas en un momento dado.
47. ¿Cuál es la diferencia entre el conjunto de pruebas y el conjunto de validación?
El conjunto de pruebas se utiliza para probar o evaluar el rendimiento del modelo entrenado. Evalúa el poder predictivo del modelo. El conjunto de validación es parte del conjunto de entrenamiento que se utiliza para seleccionar parámetros para evitar el sobreajuste del modelo.
48. ¿Qué entiendes por un truco de kernel?
Las funciones de núcleo son funciones de producto punto generalizadas utilizadas para el producto punto de computación de vectores xx y yy en el espacio de características de alta dimensión. El método de truco Kernal se utiliza para resolver un problema no lineal utilizando un clasificador lineal transformando datos linealmente inseparables en datos separables en dimensiones superiores.
49. Diferenciar entre la trama de la caja y el histograma.
Los gráficos de cajas y los histogramas son visualizaciones utilizadas para mostrar distribuciones de datos para una comunicación eficiente de la información. Los histogramas son la representación del gráfico de barras de información que representa la frecuencia de valores de variables numéricas que son útiles para estimar la distribución de probabilidad, variaciones y valores atípicos. Los boxplots se utilizan para comunicar diferentes aspectos de la distribución de datos donde no se ve la forma de la distribución, pero aún así se pueden recopilar los conocimientos. Estos son útiles para comparar múltiples gráficos al mismo tiempo que ocupan menos espacio en comparación con los histogramas.
50. ¿Cómo equilibrar/corregir los datos desequilibrados?
Existen diferentes técnicas para corregir/equilibrar los datos desequilibrados. Se puede hacer aumentando los números de muestra para las clases minoritarias. El número de muestras puede reducirse para aquellas clases con puntos de datos extremadamente altos. A continuación se presentan algunos enfoques seguidos para equilibrar los datos:
- Utilice las métricas de evaluación correctas: En casos de datos desequilibrados, es muy importante utilizar las métricas de evaluación adecuadas que proporcionan información valiosa.
- Especificidad/Precisión: Indica el número de instancias seleccionadas que son relevantes.
- Sensibilidad: Indica el número de instancias relevantes que se seleccionan.
- Puntuación F1: Representa el medio armónico de precisión y sensibilidad.
- AUC (Área bajo la curva): Esto representa una relación entre las verdaderas tasas positivas y las tasas falsas positivas.
Por ejemplo, considere el siguiente gráfico que ilustra los datos de entrenamiento:
Aquí, si medimos la precisión del modelo en términos de obtener "0", entonces la precisión del modelo sería muy alta -> 99,9%, pero el modelo no garantiza ninguna información valiosa. En tales casos, podemos aplicar diferentes métricas de evaluación como se ha indicado anteriormente.
- Reampliación de conjuntos de entrenamiento: También es posible equilibrar los datos trabajando en la obtención de diferentes conjuntos de datos y esto se puede lograr mediante la remuestreo. Hay dos enfoques seguidos en el submuestreo que se utilizan sobre la base del caso de uso y los requisitos:
- Submuestreo Esto equilibra los datos reduciendo el tamaño de la clase abundante y se utiliza cuando la cantidad de datos es suficiente. Al realizar esto, un nuevo conjunto de datos que se equilibra se puede recuperar y esto se puede utilizar para seguir modelando.
- Sobremuestreo Esto se utiliza cuando la cantidad de datos no es suficiente. Este método equilibra el conjunto de datos tratando de aumentar el tamaño de las muestras. En lugar de deshacerse de muestras adicionales, nuevas muestras se generan e introducen mediante el empleo de los métodos de repetición, bootstrapping, etc.
- Realizar correctamente la validación cruzada K-fold: La validación cruzada debe aplicarse correctamente mientras se utiliza el sobremuestreo. La validación cruzada se debe hacer antes de sobremuestreo porque si se hace más tarde, entonces sería como sobreadaptar el modelo para obtener un resultado específico. Para evitar esto, el remuestreo de datos se hace repetidamente con diferentes ratios.
51. ¿Qué es mejor - bosque al azar o árboles de decisiones múltiples?
El bosque al azar es mejor que los árboles de decisión múltiples, ya que los bosques al azar son mucho más robustos, precisos y menos propensos a sobreajustarse, ya que es un método conjunto que asegura que los árboles de decisión débiles múltiples aprenden fuertemente.
52. Considere un caso en el que usted sabe que la probabilidad de encontrar al menos una estrella fugaz en un intervalo de 15 minutos es del 30%. ¿Evaluar la probabilidad de encontrar al menos una estrella fugaz en una hora de duración?
53. Tira la moneda seleccionada 10 veces de un frasco de 1000 monedas. De 1000 monedas, 999 monedas son justas y 1 moneda es de doble cabeza, asumir que usted ve 10 cabezas. Estimar la probabilidad de conseguir una cabeza en el próximo lanzamiento de moneda.
Sabemos que hay dos tipos de monedas: las justas y las de doble cabeza. Por lo tanto, hay dos maneras posibles de elegir una moneda. La primera es elegir una moneda justa y la segunda es elegir una moneda que tenga 2 cabezas.
54. ¿ Cuáles son algunos ejemplos cuando el falso positivo ha demostrado ser importante que el falso negativo?
Antes de citar casos, entendamos lo que son falsos positivos y falsos negativos.
- Los falsos positivos son aquellos casos que fueron erróneamente identificados como un evento aunque no lo fueran. Se llaman errores de tipo I.
- Los falsos negativos son aquellos casos que fueron erróneamente identificados como no eventos a pesar de ser un evento. Se llaman errores de tipo II.
Algunos ejemplos donde los falsos positivos eran importantes que los falsos negativos son:
- En el campo médico: Considere que un informe de laboratorio ha predicho cáncer a un paciente incluso si no tenía cáncer. Este es un ejemplo de error falso positivo. Es peligroso comenzar la quimioterapia para ese paciente, ya que no tiene cáncer, ya que iniciar la quimioterapia causaría daño a las células sanas y podría incluso conducir a cáncer.
- En el campo del comercio electrónico: Supongamos que una empresa decide iniciar una campaña donde dan $100 vales de regalo para la compra de $10000 por valor de artículos sin ninguna condición mínima de compra. Ellos asumen que se traduciría en al menos 20% de beneficio para los artículos vendidos por encima de $100.00. ¿Qué pasa si los vales se dan a los clientes que no han comprado nada pero se han marcado erróneamente como los que compraron $10000 valor de los productos. Este es el caso de error falso positivo.
55. ¿Damos un ejemplo en el que tanto los falsos positivos como los falsos negativos son igualmente importantes?
En los sectores bancarios: Los préstamos son las principales fuentes de ingresos para los bancos. Pero si la tasa de reembolso no es buena, entonces hay un riesgo de enormes pérdidas en lugar de cualquier beneficio. Así que dar préstamos a los clientes es una apuesta, ya que los bancos no pueden arriesgarse a perder buenos clientes, pero al mismo tiempo, no pueden permitirse el lujo de adquirir clientes malos. Este caso es un ejemplo clásico de igual importancia en escenarios falsos positivos y falsos negativos.
56. ¿Es bueno reducir la dimensionalidad antes de instalar un Modelo Vector de Soporte?
Si el número de características es mayor que las observaciones, entonces la reducción de dimensionalidad mejora la SVM (Modelo Vector de Soporte).
57. ¿Cuáles son las diversas suposiciones utilizadas en la regresión lineal? ¿Qué pasaría si se violan?
La regresión lineal se realiza con arreglo a los siguientes supuestos:
- Los datos de la muestra utilizados para modelar representan a toda la población.
- Existe una relación lineal entre la variable eje X y la media de la variable Y.
- La varianza residual es la misma para cualquier valor de X. Esto se llama homocedasticidad.
- Las observaciones son independientes unas de otras.
- Y se distribuye normalmente para cualquier valor de X.
Las violaciones extremas de las suposiciones anteriores dan lugar a resultados redundantes. Las violaciones menores de estas normas dan lugar a una mayor variación o sesgo de las estimaciones.
58. ¿Cómo se realiza la selección de funciones utilizando el método de regularización?
El método de regularización implica la adición de penalidades a diferentes parámetros en el modelo de aprendizaje automático para reducir la libertad del modelo para evitar el problema de la sobreadaptación. Hay varios métodos de regularización disponibles como la regularización del modelo lineal, regularización Lasso/L1, etc. La regularización del modelo lineal aplica penalidad sobre coeficientes que multiplican los predictores. La regularización Lasso/L1 tiene la característica de reducir algunos coeficientes a cero, por lo que es elegible para ser eliminado del modelo.
59. ¿Cómo se identifica si una moneda está sesgada?
Para identificar esto, realizamos una prueba de hipótesis como sigue: De acuerdo con la hipótesis nula, la moneda es imparcial si la probabilidad de volteo de cabeza es 50%. Según la hipótesis alternativa, la moneda está sesgada y la probabilidad no es igual a 500. Realice los siguientes pasos:
- Voltear moneda 500 veces
- Calcular valor p.
- Compare el valor p con el resultado alfa -> de la prueba de dos colas (0,05/2 = 0,025). Pueden producirse dos casos siguientes:
- Valor de p > alfa: Entonces la hipótesis nula es buena y la moneda es imparcial.
- Valor de p < alfa: Entonces la hipótesis nula es rechazada y la moneda es sesgada.
60. ¿Cuál es la importancia de la reducción de la dimensión?
El proceso de reducción de la dimensión constituye la reducción del número de características en un conjunto de datos para evitar un exceso de ajuste y reducir la varianza. La mayoría de las ventajas de este proceso son 4:
- Esto reduce el espacio de almacenamiento y el tiempo para la ejecución del modelo.
- Elimina la cuestión de la multicolinealidad mejorando así la interpretación de parámetros del modelo ML.
- Hace que sea más fácil visualizar los datos cuando se reducen las dimensiones.
- Evita la maldición del aumento de la dimensionalidad.
61. ¿Cómo es el parámetro de búsqueda de cuadrícula diferente de la estrategia de ajuste de búsqueda aleatoria?
Las estrategias de sintonización se utilizan para encontrar el conjunto correcto de hiperparametros. Los hiperparametros son aquellas propiedades que son fijas y específicas del modelo antes de que el modelo sea probado o entrenado en el conjunto de datos. Tanto la búsqueda en cuadrícula como las estrategias de ajuste de búsqueda aleatoria son técnicas de optimización para encontrar hiperparametros eficientes.
- Búsqueda de cuadrículas :
- Aquí, cada combinación de una lista preestablecida de hiperparametros es probada y evaluada.
- El patrón de búsqueda es similar a la búsqueda en una cuadrícula donde los valores están en una matriz y se realiza una búsqueda. Cada parámetro establecido es probado y su precisión es rastreada. después de cada combinación se prueba, el modelo con la mayor precisión se elige como el mejor.
- El principal inconveniente aquí es que, si se aumenta el número de hiperparametros, la técnica sufre. El número de evaluaciones puede aumentar exponencialmente con cada aumento en el hiperparametro. Esto se llama el problema de la dimensionalidad en una búsqueda de cuadrícula.
- Búsqueda aleatoria:
- En esta técnica, se prueban y evalúan combinaciones aleatorias de hiperparametros para encontrar la mejor solución. Para optimizar la búsqueda, la función se prueba en configuraciones aleatorias en el espacio de parámetros como se muestra en la imagen de abajo.
- En este método, hay mayores posibilidades de encontrar parámetros óptimos porque el patrón seguido es aleatorio. Hay posibilidades de que el modelo esté entrenado en parámetros optimizados sin necesidad de alias.
- Esta búsqueda funciona mejor cuando hay un menor número de dimensiones ya que toma menos tiempo encontrar el conjunto correcto.
Conclusión:
La ciencia de los datos es un campo muy vasto y abarca muchos temas como la minería de datos, análisis de datos, visualización de datos, aprendizaje automático, aprendizaje profundo, y lo más importante es que se sienta sobre la base de conceptos matemáticos como álgebra lineal y análisis estadístico. Dado que hay muchos requisitos previos para convertirse en un buen científico de datos profesional, las ventajas y beneficios son muy grandes. Data Scientist se ha convertido en el puesto de trabajo más buscado en estos días.
Preguntas frecuentes
62. ¿Cómo me preparo para una entrevista de ciencia de datos?
Algunos de los consejos de preparación para las entrevistas de ciencia de datos son las siguientes:
- Reanudar el edificio: En primer lugar, prepare bien su currículum. Es preferible si el curriculum vitae es sólo un curriculum vitae de 1 página, especialmente para un curriculum vitae más fresco. Usted debe pensar mucho en el formato del curriculum vitae, ya que importa mucho. Las entrevistas de ciencia de datos se pueden basar más en los temas como regresión lineal y logística, SVM, análisis de causa raíz, bosque aleatorio, etc. Por lo tanto, prepárese bien para las preguntas específicas de la ciencia de datos como las que se discuten en este artículo, asegúrese de que su curriculum vitae tiene una mención de temas tan importantes y usted tiene un buen conocimiento de ellos. También, por favor asegúrese de que su currículum contiene algunos Proyectos basados en la ciencia de los datos También. Siempre es mejor tener un proyecto de grupo o una experiencia de pasantía en el campo que usted está interesado en ir. Sin embargo, los proyectos personales también tendrán un buen impacto en el curriculum vitae. Por lo tanto, su currículum debe contener al menos 2-3 proyectos basados en la ciencia de datos que muestren su habilidad y nivel de conocimiento en la ciencia de datos. Por favor, no escribas tal habilidad en tu currículum que no posees. Si simplemente estás familiarizado con alguna tecnología y no la has estudiado a un nivel avanzado, puedes mencionar una etiqueta de principiante para esas habilidades.
- Preparar bien: Aparte de las preguntas específicas sobre ciencia de datos, las preguntas sobre temas básicos como sistemas de gestión de bases de datos (DBMS), sistemas operativos (OS), redes informáticas (CN) y programación orientada a objetos (OOPS) se pueden pedir a los estudiantes, especialmente. Así que prepárate bien para eso también.
- Estructuras de datos y algoritmos son los componentes básicos de la programación. Por lo tanto, usted debe estar bien versado con eso también.
- Investigar la Compañía: Este es el consejo que la mayoría de la gente echa de menos y es muy importante. Si vas a una entrevista con cualquier empresa, lee sobre la empresa antes y especialmente en el caso de la ciencia de datos, aprende qué bibliotecas utiliza la empresa, qué tipo de modelos están construyendo, y así sucesivamente. Esto te da una ventaja sobre la mayoría de las otras personas.
63. ¿Son duras las entrevistas de ciencia de datos?
Una respuesta honesta será “SÍ”. Esto se debe al hecho de que este campo está emergiendo y seguirá emergiendo para siempre. En casi todas las entrevistas, tienes que responder muchas preguntas difíciles y desafiantes con total confianza y tus conceptos deben ser fuertes para satisfacer al entrevistador. Sin embargo, con gran práctica, cualquier cosa se puede lograr. Por lo tanto, siga los consejos discutidos anteriormente y siga practicando y aprendiendo. Definitivamente tendrás éxito.
64. ¿Cuáles son las 3 mejores habilidades técnicas de un científico de datos?
Las 3 mejores habilidades de un científico de datos son:
- Matemáticas: La ciencia de los datos requiere una gran cantidad de matemáticas y un buen científico de los datos es fuerte en ella. No es posible convertirse en un buen científico de datos si usted es débil en matemáticas.
- Aprendizaje automático y aprendizaje profundo : Un científico de datos debe ser muy experto en tecnologías de Inteligencia Artificial como el aprendizaje profundo y el aprendizaje automático. Algunos buenos proyectos y una gran cantidad de práctica ayudarán a lograr la excelencia en ese campo.
- Programación: Esta es una habilidad obvia pero la más importante. Si una persona es buena en la programación significa que él / ella puede resolver problemas complejos, ya que eso es sólo una habilidad para resolver problemas. La programación es la capacidad de escribir código limpio y comprensible para la industria. Esta es la habilidad que la mayoría de los frescos aflojan debido a la falta de exposición al código a nivel de la industria. Esto también mejora con la práctica y la experiencia.
65. ¿Es la ciencia de los datos una buena carrera?
Sí, la ciencia de los datos es uno de los campos más futuristas y grandes de la carrera. Hoy y mañana o incluso años después, este campo se va a expandir y nunca terminar. La razón es simple. Los datos se pueden comparar con el oro hoy en día, ya que es la clave para vender todo en el mundo. Los científicos de datos saben cómo jugar con estos datos para generar algunas tremendas salidas que ni siquiera son imaginables hoy en día haciendo que sea una gran carrera.
66. ¿Se hacen preguntas de codificación en entrevistas de ciencia de datos?
Sí, las preguntas de codificación se hacen en entrevistas de ciencia de datos. Una cosa más importante a tener en cuenta aquí es que los científicos de datos son muy buenos solucionadores de problemas, ya que se complacen en un montón de estrictas actividades basadas en las matemáticas. Por lo tanto, el entrevistador espera que los candidatos a entrevista de ciencia de datos conozcan estructuras de datos y algoritmos y al menos encuentren las soluciones a la mayoría de los problemas.
67. ¿Python y SQL son suficientes para la ciencia de datos?
Sí. Python y SQL son suficientes para los roles de ciencia de datos. Sin embargo, conocer el lenguaje de programación R también puede tener un mejor impacto. Si usted sabe estos 3 idiomas, usted tiene el borde sobre la mayoría de los competidores. Sin embargo, Python y SQL son suficientes para entrevistas de ciencia de datos.
68. ¿Qué son las herramientas de Data Science?
Hay varias herramientas de ciencia de datos disponibles en el mercado en la actualidad. Varias herramientas pueden ser de gran importancia. Tensorflow es una de las herramientas de ciencia de datos más famosas. Algunas de las otras herramientas famosas son BigML, SAS (Sistema de Análisis Estadístico), Knime, Scikit, Pytorch, etc.
Ciencia de datos MCQ
¿Cuál de las siguientes no es una condición necesaria para datos de series temporales débilmente estacionarias?
La sobreadaptación más probable ocurre cuando hay una enorme cantidad de datos para entrenar. ¿Verdadero o falso?
Dada la información de que la demanda es de 100 en octubre de 2020, 150 en noviembre de 2020, 350 en diciembre de 2020 y 400 en enero de 2021. Calcule un promedio móvil simple de 3 meses para febrero de 2021.
¿Cuál de los siguientes métodos representa los datos jerárquicos en formato anidado?
¿Cuál de las siguientes definiciones define el análisis de los objetos de datos que no cumplen con el comportamiento general de los datos?
¿Qué representa una ecuación lineal que tiene 3 variables?
¿Cuál sería la fórmula de representación de este problema en términos de variables x e y: “El precio de 2 plumas y 1 lápiz como 10 unidades”?
¿Cuál de los siguientes es cierto con respecto a las pruebas de hipótesis?
¿Cuáles son los parámetros del modelo que se utilizan para construir modelos de ML utilizando métodos iterativos bajo métodos de aprendizaje basados en modelos?
Artículos Relacionados: