¿Cuáles son los principios básicos de la ciencia de los datos?

¿Necesita convertir sus habilidades de programación en habilidades efectivas de ciencia de datos? Principios de la ciencia de los datos se crea para ayudarle a unir los puntos entre matemáticas, programación y análisis de negocios. Con este libro, usted se sentirá seguro de hacer y responder preguntas complejas y sofisticadas de sus datos para pasar de las estadísticas abstractas y crudas a las ideas procesables.

Con un enfoque único que salva la brecha entre las matemáticas y las ciencias de la computación, estos libros te llevan a través de toda la tubería de la ciencia de los datos. Comenzando con la limpieza y preparación de datos, y estrategias y técnicas de extracción de datos eficaces, pasará a construir una imagen completa de cómo cada pieza del rompecabezas de la ciencia de datos encaja. Conozca los fundamentos de las matemáticas y estadísticas computacionales, así como algunos pseudocódigos que utilizan hoy en día los científicos y analistas de datos. Llegarás a entender el aprendizaje automático, descubrirás los modelos estadísticos que te ayudan a tomar el control y navegar incluso por los conjuntos de datos más densos, y descubrirás cómo crear visualizaciones potentes que comunican lo que significan tus datos.

Capítulo 1. Cómo sonar como un científico de datos

No importa en qué industria trabajes, TI, moda, comida o finanzas, no hay duda de que los datos afectan tu vida y tu trabajo. En algún momento de esta semana, tendrás o escucharás una conversación sobre datos. Los medios de comunicación están cubriendo más y más historias sobre fugas de datos, ciberdelincuencias y cómo los datos pueden darnos un vistazo a nuestras vidas. Pero, ¿por qué ahora? ¿Qué hace que esta era sea un caldo de cultivo para las industrias relacionadas con los datos?

En los 19 ió siglo, el mundo estaba en las garras de la edad industrial . La humanidad estaba explorando su lugar en la industria junto con invenciones mecánicas gigantes. Los capitanes de la industria, como Henry Ford, reconocieron las principales oportunidades de mercado en las manos de estas máquinas, y fueron capaces de lograr beneficios previamente inimaginables. Por supuesto, la era industrial tenía sus pros y sus contras. Mientras que la producción en masa puso los bienes en manos de más consumidores, nuestra batalla contra la contaminación también comenzó alrededor de este tiempo.

Para los 20 ió siglo, éramos bastante hábiles en la fabricación de máquinas enormes; el objetivo ahora era hacerlos más pequeños y más rápidos. La era industrial había terminado y fue sustituida por lo que llamamos la edad de la información . Empezamos a usar máquinas para reunir y almacenar información (datos) sobre nosotros mismos y nuestro entorno con el propósito de entender nuestro universo.

A partir de la década de 1940, las máquinas como ENIAC (considerado uno de, si no el primero, la computadora) eran ecuaciones matemáticas informáticas y modelos en ejecución y simulaciones como nunca antes.

¡Por fin tuvimos un asistente de laboratorio decente que podría ejecutar los números mejor que nosotros! Al igual que con la era industrial, la era de la información nos trajo tanto lo bueno como lo malo. Lo bueno eran las extraordinarias piezas de tecnología, incluyendo teléfonos móviles y televisores. Lo malo en este caso no era tan malo como la contaminación mundial, pero todavía nos dejó con un problema en el 21 st siglo, muchos datos.

Así es, la era de la información, en su búsqueda de obtener datos, ha explotado la producción de datos electrónicos. Las estimaciones muestran que creamos alrededor de 1,8 billones de gigabytes de datos en 2011 (tómese un momento para pensar en cuánto es). Sólo un año después, en 2012, creamos más de 2,8 billones de gigabytes de datos. Este número sólo va a explotar aún más para alcanzar unos 40 billones de gigabytes de creación de datos en sólo un año para 2020. La gente contribuye a esto cada vez que tuitea, publica en Facebook, guarda un nuevo currículum en Microsoft Word, o simplemente envía a su madre una foto a través de mensajes de texto.

No sólo estamos creando datos a un ritmo sin precedentes, sino que también los estamos consumiendo a un ritmo acelerado. Hace apenas tres años, en 2013, el usuario promedio de teléfono celular utilizaba menos de 1 GB de datos al mes. Hoy en día, se estima que ese número supera con creces los 2 GB al mes. No sólo estamos buscando el próximo examen de personalidad, lo que estamos buscando es perspicacia. ¡Todos estos datos ahí fuera, algunos de ellos tienen que ser útiles para mí! ¡Y puede ser!

Así que nosotros, en el 21 st siglo, se quedan con un problema. Tenemos muchos datos y seguimos haciendo más. Hemos construido máquinas increíblemente pequeñas que recopilan datos 24/7, y es nuestro trabajo darle sentido a todo. Introduzca el Edad de los datos . Esta es la edad en la que tomamos máquinas soñadas por nuestros 19 ió antepasados del siglo y los datos creados por nuestros 20 ió homólogas del siglo y crear ideas y fuentes de conocimiento de las que cada ser humano en la Tierra puede beneficiarse. Los Estados Unidos crearon un nuevo papel en el gobierno para el principal científico de datos. Las compañías tecnológicas, como Reddit, que hasta ahora no tenían un científico de datos en su equipo, ahora los contratan a izquierda y derecha. El beneficio es bastante obvio: usar datos para hacer predicciones y simulaciones precisas nos da una mirada a nuestro mundo como nunca antes.

Suena genial, pero ¿cuál es la trampa?

Este capítulo explorará la terminología y el vocabulario del científico de datos moderno. Veremos palabras y frases clave que son esenciales en nuestra discusión sobre ciencia de datos a lo largo de este libro. También veremos por qué utilizamos la ciencia de datos y los tres dominios clave de la ciencia de datos se deriva de antes de empezar a mirar el código en Python, el lenguaje principal utilizado en este libro:

Terminología básica de la ciencia de los datos

Los tres dominios de la ciencia de los datos

La sintaxis básica de Python

¿Qué es la ciencia de los datos?

Antes vamos más allá, vamos a ver algunas definiciones básicas que vamos a utilizar a lo largo de este libro. La cosa grande / horrible acerca de este campo es que es tan joven que estas definiciones pueden diferir de libro de texto a periódico a papel blanco.

Terminología básica

Las definiciones que siguen son lo suficientemente generales como para ser utilizadas en conversaciones diarias y trabajar para servir al propósito del libro, una introducción a los principios de la ciencia de los datos.

Comencemos definiendo qué son los datos. Esto puede parecer una primera definición tonta a tener, pero es muy importante. Cada vez que usamos la palabra "datos", nos referimos a una colección de información en organizados o no organizado formato:

Datos organizados : Esto se refiere a los datos ordenados en una estructura fila/columna, donde cada fila representa una sola observación y las columnas representan la características de esa observación.

Datos no organizados : Esto es el tipo de datos que está en el libre forma, normalmente texto o audio/señales en bruto que deben ser analizados más adelante para ser organizados.

Cada vez que abre Excel (o cualquier otro programa de hoja de cálculo), está buscando una estructura de fila/columna en blanco esperando datos organizados. Estos programas no funcionan bien con datos no organizados. En su mayor parte, nos ocuparemos de los datos organizados, ya que es la información más fácil de obtener, pero no evitaremos mirar el texto en bruto y los métodos de procesamiento de formas de datos no organizadas.

Ciencias de los datos es el arte y la ciencia de adquirir conocimiento a través de los datos.

¡ Qué pequeña definición para un tema tan grande, y con razón! La ciencia de los datos cubre tantas cosas que tomaría páginas para listar todo hacia fuera (debería saber, intenté y me editó abajo).

La ciencia de los datos se trata de cómo tomamos los datos, los usamos para adquirir conocimientos, y luego los usamos para hacer lo siguiente:

Tomar decisiones

Predecir el futuro

Comprender el pasado/presente

Crear nuevas industrias/productos

Este libro trata sobre los métodos de la ciencia de los datos, incluyendo cómo procesar los datos, recopilar ideas y utilizar esas ideas para tomar decisiones y predicciones informadas.

La ciencia de los datos es sobre el uso de datos con el fin de obtener nuevas ideas que de otro modo se hubieran perdido.

Como ejemplo, imagine que usted está sentado alrededor de una mesa con otras tres personas. Los cuatro de ustedes tienen que tomar una decisión basada en algunos datos. Hay cuatro opiniones que considerar. Usaría la ciencia de los datos para traer una quinta, sexta e incluso séptima opinión a la tabla.

Por eso la ciencia de los datos no reemplazará al cerebro humano, sino que lo complementará, trabajará junto a él. La ciencia de los datos no debe considerarse como una solución definitiva a nuestros problemas de datos; es simplemente una opinión, una opinión muy informada, pero, sin embargo, una opinión. Merece un asiento en la mesa.

¿Por qué la ciencia de los datos?

In esta edad de datos, está claro que tenemos un excedente de datos. Pero, ¿por qué debería eso requerir todo un nuevo conjunto de vocabulario? ¿Qué tenía de malo nuestro análisis anterior? Para uno, el gran volumen de datos hace literalmente imposible que un humano lo analice en un tiempo razonable. Los datos se recopilan de diversas formas y de diferentes fuentes, y a menudo vienen en muy desorganizados.

Los datos pueden faltar, estar incompletos o simplemente estar equivocados. A menudo, tenemos datos en escalas muy diferentes y eso hace que sea difícil compararlo. Consideremos que estamos examinando los datos en relación con la fijación de precios de los coches usados. Una característica de un coche es el año en que se hizo y otra podría ser el número de millas en ese coche. Una vez que limpiamos nuestros datos (que pasamos una gran cantidad de tiempo mirando en este libro), las relaciones entre los datos se vuelven más obvias, y el conocimiento que una vez fue enterrado profundamente en millones de filas de datos simplemente aparece. Uno de los principales objetivos de la ciencia de los datos es hacer prácticas y procedimientos explícitos para descubrir y aplicar estas relaciones en los datos.

Antes, nosotros miré la ciencia de los datos en una perspectiva más histórica, pero tomemos un minuto para discutir su papel en los negocios hoy, a través de un ejemplo muy simple.

Ejemplo – Sigma Technologies

Ben Runkle, CEO, Sigma Tecnologías, está tratando de resolver un gran problema. La compañía está perdiendo constantemente clientes de mucho tiempo. No sabe por qué se van, pero debe hacer algo rápido. Él está convencido de que para reducir su churn, debe crear nuevos productos y características, y consolidar las tecnologías existentes. Para estar seguro, llama a su científico jefe de datos, el Dr. Jessie Hughan. Sin embargo, no está convencida de que los nuevos productos y características por sí solos salvarán a la empresa. En lugar de eso, se refiere a las transcripciones de los recientes boletos de servicio al cliente. Le muestra a Runkle las transcripciones más recientes y encuentra algo sorprendente:

".... No estoy seguro de cómo exportar esto, ¿verdad?"

"¿Dónde está el botón que hace una nueva lista?"

"Espera, ¿sabes dónde está el deslizador?"

"Si no puedo resolver esto hoy, es un verdadero problema..."

Está claro que los clientes estaban teniendo problemas con la interfaz de usuario/UX existente, y no estaban molestos debido a la falta de características. Runkle y Hughan organizaron una revisión masiva de UI/UX y sus ventas nunca han sido mejores.

Por supuesto, el ciencias utilizado en el último ejemplo fue mínimo, pero hace un punto. Tiendemos a llamar a gente como Runkle, un conductor. El CEO común de hoy quiere tomar todas las decisiones rápidamente e iterar las soluciones hasta que algo funcione. El Dr. Haghun es mucho más analítico. Quiere resolver el problema tanto como Runkle, pero recurre a datos generados por el usuario en lugar de su instinto para obtener respuestas. La ciencia de los datos consiste en aplicar las habilidades de la mente analítica y usarlas como lo haría un conductor.

Ambas mentalidades tienen su lugar en las empresas de hoy; sin embargo, es la forma de pensar de Hagun la que domina las ideas de la ciencia de los datos, usando los datos generados por la empresa como su fuente de información en lugar de simplemente tomar una solución y seguirla.

El diagrama de la ciencia de los datos Venn

Es un común idea errónea de que sólo aquellos con un doctorado o genios pueden entender las matemáticas / programación detrás de la ciencia de datos. Esto es absolutamente falso. Entender la ciencia de los datos comienza con tres áreas básicas:

Matemáticas/estadística : Esto es el uso de ecuaciones y fórmulas para realizar análisis

Programación informática : Este es el capacidad de utilizar código para crear resultados en el ordenador

Conocimientos de dominio : Esto se refiere a la comprensión del ámbito del problema (medicina, finanzas, ciencias sociales, etc.)

El siguiente diagrama de Venn proporciona una representación visual de cómo se cruzan las tres áreas de la ciencia de los datos:

El diagrama de Venn de la ciencia de los datos

Aquellos con habilidades de hacking pueden conceptualizar y programar algoritmos complicados usando lenguajes de computadora. Teniendo un Conocimientos de matemáticas y estadísticas base le permite teorizar y evaluar algoritmos y ajustar los procedimientos existentes para adaptarse a situaciones específicas. Tener Experiencia sustantiva (experiencia de dominio) le permite aplicar conceptos y resultados de una manera significativa y eficaz.

Mientras que tener sólo dos de estas tres cualidades puede hacerte inteligente, también dejará un hueco. Considere que usted es muy hábil en la codificación y tiene formación formal en el comercio diario. Usted puede crear un sistema automatizado para negociar en su lugar, pero carece de las habilidades matemáticas para evaluar sus algoritmos y, por lo tanto, terminan perdiendo dinero a largo plazo. Es sólo cuando usted puede presumir de habilidades en codificación, matemáticas y conocimiento de dominio que usted puede realmente realizar ciencia de datos.

El que probablemente fue una sorpresa para ti fue Conocimiento de dominio . Es realmente sólo el conocimiento del área en la que estás trabajando. Si un analista financiero comenzó a analizar los datos sobre los ataques cardíacos, podrían necesitar la ayuda de un cardiólogo para dar sentido a muchos de los números.

Ciencia de los datos es la intersección de las tres áreas clave mencionadas anteriormente. Para obtener conocimiento de los datos, debemos ser capaces de utilizar la programación informática para acceder a los datos, entender las matemáticas detrás de los modelos que derivamos, y sobre todo, entender el lugar de nuestros análisis en el dominio en el que estamos. Esto incluye la presentación de datos. Si estamos creando un modelo para predecir los ataques cardíacos en los pacientes, ¿es mejor crear un PDF de información o una aplicación donde se pueden escribir los números y obtener una predicción rápida? Todas estas decisiones deben ser tomadas por el científico de datos.

Nota

También, tenga en cuenta que la intersección de matemáticas y codificación es aprendizaje automático. Este libro analizará el aprendizaje automático con gran detalle más adelante, pero es importante tener en cuenta que sin la capacidad explícita de generalizar cualquier modelo o resultados a un dominio, algoritmos de aprendizaje automático siguen siendo sólo eso, algoritmos sentados en su computadora. Usted podría tener el mejor algoritmo para predecir el cáncer. Usted podría ser capaz de predecir el cáncer con más de 99% de precisión basada en datos de pacientes de cáncer pasados, pero si usted no entiende cómo aplicar este modelo en un sentido práctico tal que los médicos y enfermeras pueden utilizarlo fácilmente, su modelo podría ser inútil.

Tanto la programación informática como las matemáticas están ampliamente cubiertas en este libro. El conocimiento de dominio viene con la práctica de la ciencia de datos y la lectura de ejemplos de análisis de otras personas.

Las matemáticas

La mayoría de la gente se detiene escuchar una vez que alguien dice la palabra matemáticas . Asienten con la cabeza en un intento de ocultar su total desdén por el tema. Este libro le guiará a través de las matemáticas necesarias para la ciencia de los datos, específicamente las estadísticas y la probabilidad. Usaremos estos subdominios de las matemáticas para crear lo que son llamada modelos .

A modelo de datos se refiere a una relación organizada y formal entre elementos de datos, generalmente destinada a simular un fenómeno del mundo real.

Esencialmente, usaremos matemáticas para formalizar las relaciones entre variables. Como antiguo matemático puro y profesor de matemáticas actual, sé lo difícil que puede ser esto. Haré todo lo posible para explicarlo todo con la mayor claridad posible. Entre las tres áreas de la ciencia de los datos, la matemática es lo que nos permite pasar del dominio al dominio. Entender la teoría nos permite aplicar un modelo que construimos para la industria de la moda a un modelo financiero.

Las matemáticas cubiertas en este libro van desde el álgebra básica hasta el modelado probabilístico y estadístico avanzado. No te saltes estos capítulos, incluso si ya lo sabes o te da miedo. Cada concepto matemático que presento, lo hago con cuidado, ejemplos y propósito. Las matemáticas de este libro son esenciales para los científicos de datos.

Ejemplo: modelos de reclutamiento de reproductores

En biología, utilizamos, entre muchos otros, un modelo conocida como la desove-recluta modelo para juzgar la salud biológica de una especie. Es una relación básica entre el número de unidades parentales sanas de una especie y el número de nuevas unidades en el grupo de animales. En un conjunto de datos públicos sobre el número de reproductores y reclutas de salmón, se formó el siguiente gráfico para visualizar la relación entre los dos. Podemos ver que definitivamente hay algún tipo de relación positiva (a medida que uno sube, también lo hace el otro). Pero, ¿cómo podemos formalizar esta relación? Por ejemplo, si supiéramos el número de desovedores en una población, ¿podríamos predecir el número de reclutas que el grupo obtendría, y viceversa?

Esencialmente, los modelos nos permiten conectar una variable para conseguir la otra. Considere el siguiente ejemplo:

En este ejemplo, digamos que sabíamos que un grupo de salmones tenía 1.15 (en miles) de desovedores. Entonces, tendríamos lo siguiente:

Este resultado puede ser muy beneficioso para Estimar cómo la salud de una población está cambiando. Si podemos crear estos modelos, podemos observar visualmente cómo la relación entre las dos variables puede cambiar.

Hay muchos tipos de modelos de datos, incluyendo modelos probabilísticos y estadísticos. Ambos son subconjuntos de un paradigma más grande, llamado aprendizaje automático . La idea esencial detrás de estos tres temas es que utilizamos los datos con el fin de llegar a la mejor modelo posible. Ya no dependemos de los instintos humanos, sino de los datos.

El modelo de desove-reclutamiento visualizado

El propósito de este ejemplo es mostrar cómo podemos definir las relaciones entre los elementos de datos usando ecuaciones matemáticas. ¡El hecho de que usara datos sobre la salud del salmón era irrelevante! A lo largo de este libro, vamos a ver las relaciones que implican dólares de marketing, datos de sentimientos, críticas de restaurantes, y mucho más. La razón principal de esto es que me gustaría que usted (el lector) se exponga a tantos dominios como sea posible.

Las matemáticas y la codificación son vehículos que permiten a los científicos de datos dar un paso atrás y aplicar sus habilidades prácticamente en cualquier lugar.

Programación informática

Seamos honestos. Tú Probablemente piense que la informática es mucho más genial que las matemáticas. Está bien, no te culpo. Las noticias no están llenas de noticias matemáticas como lo están de noticias en el frente tecnológico. Usted no enciende la televisión para ver una nueva teoría sobre los primos, más bien, usted verá informes de investigación sobre cómo el último teléfono inteligente puede tomar fotos de gatos mejor o algo así. Los lenguajes informáticos son la forma en que nos comunicamos con la máquina y le decimos que haga nuestra oferta. Una computadora habla muchos idiomas y, como un libro, se puede escribir en muchos idiomas; de manera similar, la ciencia de datos también se puede hacer en muchos idiomas. Python, Julia, y R son algunos de los muchos idiomas disponibles para nosotros. Este libro se centrará exclusivamente en el uso de Python.

¿Por qué Python?

Usaremos Python por una variedad de razones:

Python es un lenguaje extremadamente simple de leer y escribir, incluso si nunca has codificado antes, lo que hará que futuros ejemplos sean fáciles de ingerir y leer más adelante, incluso después de haber leído este libro

Es una de las lenguas más comunes, tanto en la producción como en el entorno académico (una de las de más rápido crecimiento, de hecho)

La comunidad en línea del idioma es vasta y amigable. Esto significa que una búsqueda rápida de Google debe producir múltiples resultados de personas que han enfrentado y resuelto situaciones similares (si no exactamente la misma)

Python tiene preconstruidos módulos de ciencia de datos que tanto el novato como el veterano científico de datos pueden utilizar

La última es probablemente la mayor razón por la que nos centraremos en Python. Estos módulos preconstruidos no sólo son potentes, sino también fáciles de recoger. Al final de los primeros capítulos, usted estará muy cómodo con estos módulos. Algunos de estos módulos son los siguientes:

pandas

aprender sci-kit

nacidos en el mar

Nuppy/scipy

solicitudes (para extraer datos de la Web)

Beautiful Soup (para el análisis Web-HTML)

Prácticas de Python

Antes de seguir adelante, es importante para formalizar muchas de las habilidades de codificación necesarias en Python.

En Python, tenemos variables que son marcadores de posición para los objetos. Nos centraremos en sólo unos pocos tipos de objetos básicos al principio:

int (un número entero)

Ejemplos: 3, 6, 99, -34, 34, 1111111

flotar (un decimal):

Ejemplos: 3.14159, 2.71, -0.34567

booleano (o bien Verdadero o Falso )

La declaración, el domingo es un fin de semana, es Verdadero

La declaración, el viernes es un fin de semana, es Falso

La declaración, pi es exactamente la relación de la circunferencia de un círculo a su diámetro, es Verdadero (loco, ¿verdad?)

cadena (texto o palabras compuestas de caracteres)

"Me encantan las hamburguesas" ( Por cierto, ¿quién no? )

"Matt es increíble"

Un Tweet es una cadena

lista (una colección de objetos)

Ejemplo: [1, 5.4, Verdadero, "manzana"]

También tendremos que entender a algunos operadores logísticos básicos. Para estos operadores, mantener el booleano tipo de datos en mente. Cada operador evaluará a cualquiera de los dos Verdadero o Falso . Echemos un vistazo a las siguientes ilustraciones:

== evalúa a Verdadero si ambos lados son iguales; de lo contrario se evalúa a Falso

3 + 4 == 7 (se evaluarán para Verdadero )

3 – 2 == 7 (se evaluarán a Falso )

(menos de)

3 < 5 ( Verdadero )

5 < 3 ( Falso )

<= (menos o igual a)

3 < = 3 ( Verdadero )

5 < = 3 ( Falso )

> (más grande que)

3 > 5 ( Falso )

5 > 3 ( Verdadero )

> = (mayor o igual a)

3 > 3 ( Verdadero )

5 > 3 ( Falso )

Cuando codifique en Python, usaré un signo de libra ( # ) para crear un "comentario", que no se procesará como código, sino que está simplemente allí para comunicarse con el lector. Cualquier cosa a la derecha de un # sign es un comentario sobre el código que se está ejecutando.

Ejemplo de Python básico

En Python, usamos espacios/tabs para denotar operaciones que pertenezcan a otras líneas de código.

Consejo

Nótese el uso de la si declaración. Significa exactamente lo que crees que significa. Cuando la declaración después de la si declaración es Verdadero , entonces se ejecutará la parte con pestañas debajo de ella, como se muestra en el siguiente código:

Los ¡Imprimir "Verdaderamente"! la declaración pertenece a la si x + y == 15.3: línea que lo precede porque está tabulado justo debajo de él. Esto significa que la imprimir se ejecutará si y sólo si x + y igual a 15.3 .

Tenga en cuenta que lo siguiente: lista variable, mi _lista , puede contener varios tipos de objetos. Este tiene un int , a flotar , booleano , y cadena entradas (en ese orden):

Usé el len para obtener la longitud de la lista (que era de cuatro).

Note la indexación cero de Python. La mayoría de los lenguajes de computadora comienzan a contar a cero en lugar de uno. Así que si quiero el primer elemento, llamo al índice cero, y si quiero el 95 ió elemento, llamo al índice 94.

Ejemplo – análisis de un solo tuit

Aquí hay un poco más. Código Python. En este ejemplo, voy a analizar algunos tuits sobre los precios de las acciones (uno de los estudios de caso importantes en este libro será tratar de predecir los movimientos del mercado basados en el sentimiento popular con respecto a las acciones en las redes sociales):

Voy a señalar algunas cosas sobre este fragmento de código, línea por línea, como sigue:

Los words_in_tweet variable tokenizes el tweet (lo separa por palabra). Si imprimiera esta variable, vería lo siguiente:

Iteramos a través de esta lista de palabras. Esto se llama un en lugar de Loop. Sólo significa que vamos a través de una lista uno por uno.

Aquí, tenemos otro si declaración. Para cada palabra en este tweet, si la palabra contiene la $ carácter (así es como la gente hace referencia a los valores en Twitter).

Si la declaración anterior es verdadero (es decir, si el tweet contiene una etiqueta de cashtag), imprimirlo y mostrarlo al usuario.

La salida de este código será la siguiente:

Obtenemos esta salida ya que estas son las únicas palabras en el tweet que usan la etiqueta de cashtag. Cada vez que uso Python en este libro, me aseguraré de que soy lo más explícito posible sobre lo que estoy haciendo en cada línea de código.

Conocimientos de dominio

Como he mencionado antes, este categoría se centra principalmente en tener conocimiento sobre el tema en particular que está trabajando. Por ejemplo, si usted son un analista financiero que trabaja en los datos del mercado de valores, usted tiene un montón de conocimiento de dominio. Si usted es un periodista mirando las tasas de adopción en todo el mundo, usted podría beneficiarse de consultar a un experto en el campo. ¡Este libro tratará de mostrar ejemplos de varios dominios problemáticos, incluyendo medicina, marketing, finanzas, e incluso avistamientos de OVNIS!

¿Eso significa que si no eres médico, no puedes trabajar con datos médicos? ¡Claro que no! Los grandes científicos de datos pueden aplicar sus habilidades a cualquier área, incluso si no son fluidos en ella. Los científicos de datos pueden adaptarse al campo y contribuir significativamente cuando su análisis está completo.

Una gran parte del conocimiento de dominio es la presentación. Dependiendo de su audiencia, puede importar mucho cómo presente sus hallazgos. Sus resultados son tan buenos como su vehículo de comunicación. Usted puede predecir el movimiento del mercado con 99,99% de precisión, pero si su programa es imposible de ejecutar, sus resultados no se utilizarán. Del mismo modo, si su vehículo es inapropiado para el campo, sus resultados no se utilizarán igualmente.

Más terminología

Este es un buen momento para definir un poco más de vocabulario. En este punto, probablemente estés buscando con entusiasmo un montón de material de ciencia de datos y viendo palabras y frases que aún no he usado. Estas son algunas terminologías comunes que es probable que te encuentres:

Aprendizaje automático : Esto se refiere a dar a los ordenadores la capacidad de aprender de los datos sin las "reglas" explícitas dadas por un programador.

Hemos visto el concepto de aprendizaje automático antes en este capítulo como la unión de alguien que tiene tanto habilidades de codificación y matemáticas. Aquí, estamos tratando de formalizar esta definición. El aprendizaje automático combina el poder de los ordenadores con algoritmos de aprendizaje inteligentes para automatizar el descubrimiento de relaciones en los datos y crear datos potentes modelos. Hablando de modelos de datos, nos ocuparemos de los siguientes dos tipos básicos de modelos de datos:

Modelo probabilístico : Esto se refiere al uso de probabilidad para encontrar una relación entre elementos que incluye un grado de aleatoriedad.

Modelo estadístico : Esto se refiere a aprovechar los teoremas estadísticos para formalizar las relaciones entre los elementos de datos en una fórmula matemática (generalmente) simple.

Si bien tanto los modelos estadísticos como probabilísticos se pueden ejecutar en computadoras y podrían considerarse aprendizaje automático en ese sentido, mantendremos estas definiciones separadas, ya que los algoritmos de aprendizaje automático generalmente intentan aprender relaciones de diferentes maneras.

Echaremos un vistazo a los modelos estadísticos y probabilísticos en los capítulos posteriores.

EDA se ocupa de la visualización y preparación de datos. Aquí es donde convertimos los datos no organizados en datos organizados y también limpiamos los puntos de datos faltantes/incorrectos. Durante EDA, vamos a crear muchos tipos de parcelas y utilizar estas parcelas para identificar características clave y relaciones para explotar en nuestros modelos de datos.

Minería de datos es el proceso de encontrar relaciones entre elementos de datos.

Minería de datos es la parte de la ciencia de los datos donde tratamos de encontrar relaciones entre variables (pensar modelo de desove-reclutamiento).

Traté bastante duro de no usar el término big data Hasta ahora. Esto es porque creo que este término está mal usado, mucho. Mientras que la definición de esta palabra varía de una persona a otra, el big data. Big Data es información que es demasiado grande para ser procesada por una sola máquina (si su computadora portátil se estrelló, podría estar sufriendo de un caso de big data).

El estado de la ciencia de los datos (hasta ahora). Este diagrama es incompleto y está destinado únicamente a propósitos de visualización.

Estudios monográficos de la ciencia de los datos

La combinación de matemáticas, programación informática y conocimiento de dominio es lo que hace que la ciencia de datos sea tan poderosa. A menudo, es difícil para una sola persona dominar las tres áreas. Es por eso que es muy común que las empresas contraten equipos de científicos de datos en lugar de una sola persona. Veamos algunos ejemplos poderosos de la ciencia de los datos en acción y su resultado.

Estudio de caso: automatización del papel del gobierno

Reclamaciones de seguridad social se sabe que es una molestia importante tanto para el agente que la lee como para la persona que escribió la reclamación. Algunas afirmaciones tardan más de 2 años en resolverse en su totalidad, ¡y eso es absurdo! Echemos un vistazo a lo que entra en una reclamación:

Muestra de formulario de seguridad social

No está mal. Es más que nada un mensaje de texto, sin embargo. Rellena esto, luego eso, luego esto, y así sucesivamente. Usted puede ver cómo sería difícil para un agente leer estos todo el día, forma tras forma. ¡Debe haber una manera mejor!

Bueno, la hay. Elder Research Inc. analizó estos datos no organizados y pudo automatizar el 20% de todas las formas de seguridad social para personas con discapacidad. Esto significa que una computadora podría examinar el 20 % de estos formularios escritos y dar su opinión sobre la aprobación.

No sólo eso, la empresa de terceros que se contrata para calificar las aprobaciones de los formularios en realidad dio a la máquina-calificado formas un grado más alto que las formas humanas. Por lo tanto, no sólo la computadora maneja el 20% de la carga, que, en promedio, hizo mejor que un humano.

Dispara a todos los humanos, ¿verdad?

Antes de que tenga un montón de e-mails enojados afirmando que la ciencia de los datos está trayendo el fin de los trabajadores humanos, tenga en cuenta que la computadora fue sólo capaz de manejar el 20% de la carga. ¡Eso significa que probablemente funcionó terriblemente para el 80% de los formularios! Esto es porque la computadora probablemente fue genial en formas simples . Las afirmaciones que habrían tomado un minuto humano tomaron el ordenador segundos para calcular. Pero estos minutos suman, y antes de que te des cuenta, ¡cada humano está siendo salvado más de una hora al día!

Las formas que podrían ser fáciles de leer para un ser humano también son probablemente fáciles para la computadora. Es cuando la forma se vuelve muy terse o cuando el escritor comienza a desviarse de la gramática habitual que la computadora comienza a fallar. Este modelo es genial porque permite a los humanos pasar más tiempo en esas afirmaciones difíciles y les da más atención sin distraerse por el gran volumen de papeles.

Nota

Tenga en cuenta que usé la palabra modelo . Recuerde que un modelo es una relación entre elementos. En este caso, la relación es entre las palabras escritas y el estado de aprobación de una reclamación.

Estudio de caso – dólares de comercialización

A dataset muestra la relación entre el dinero gastado en las categorías de televisión, radio y periódico. El objetivo es analizar la relación entre los tres diferentes medios de comercialización y cómo afecta a la venta de un producto. Nuestros datos están en forma de una estructura de fila y columna. Cada fila representa una región de ventas y las columnas nos dicen cuánto dinero se gastó en cada medio y el beneficio logrado en esa región.

Nota

Por lo general, el científico de datos debe pedir unidades y escala. En este caso, les diré que la televisión, la radio y el periódico se miden en "miles de dólares" y las ventas en "miles de widgets vendidos". Esto significa que en la primera región se gastaron 230.100 dólares en publicidad televisiva, 37.800 dólares en publicidad radiofónica y 69.200 dólares en publicidad periodística. En la misma región se vendieron 22.100 artículos.

Presupuestos publicitarios

Por ejemplo, en el tercero región, gastamos $17,200 en publicidad de TV y vendió 9.300 widgets.

Nótese cómo ninguna de estas variables forma una línea muy fuerte y, por lo tanto, podría no funcionar bien para predecir las ventas (por su cuenta). La televisión está más cerca de formar una relación obvia, pero aún así eso no es genial. En este caso, tendremos que formar un modelo más complejo que el que usamos en el modelo soover-recruiter y combinar las tres variables con el fin de modelar las ventas.

Este tipo de problema es muy común en la ciencia de los datos. En este ejemplo, estamos tratando de identificar las características clave que están asociadas con las ventas de un producto. Si podemos aislar estas características clave, entonces podemos explotar estas relaciones y cambiar cuánto gastamos en publicidad en diferentes lugares con la esperanza de aumentar nuestras ventas.

Estudio de caso – ¿Qué hay en una descripción de trabajo?

¿Buscas un trabajo en ciencias de datos? Genial, déjame ayudarte. En este estudio de caso, he "desguazado" (tomado de la Web) 1.000 descripciones de trabajo para empresas que contratan activamente a científicos de datos (a enero de 2016). El objetivo aquí es mirar algunas de las palabras clave más comunes que la gente usa en sus descripciones de trabajo.

Un ejemplo de listados de trabajo de científicos de datos.

(Tenga en cuenta que la segunda pregunta por el núcleo de las bibliotecas de Python; hablamos de esto más adelante en este libro)

solicitudes de importación
# utilizado para capturar datos de la web
de BeautifulSoup import BeautifulSoup
# usado para analizar HTML
de sklearn.feature_extraction.text import CountVectorizer
# utilizado para contar el número de palabras y frases (estaremos usando este módulo mucho)

Bien, antes de perderte, todo lo que este bucle está haciendo es pasar por 100 páginas de descripciones de trabajo, y para cada página, agarrar cada descripción de trabajo. La variable importante aquí es textos , que es una lista de más de 1.000 descripciones de funciones:

type(texts) # == list
vect = CondeVectorizador(ngram_range=(1,2), stop_words='english')
# Consigue conteos básicos de una y dos frases de palabras
matriz = vect.fit_transform(textos)
# encajar y aprender al vocabulario en el corpus
print len(vect.get_feature_names()) # cuántas características hay
# ¡Hay 11.293 frases de una y dos palabras en mi caso!¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡¡

He omitido algún código aquí, pero existe en el repositorio de GitHub para este libro. Los resultados son los siguientes (representados como la frase, y luego el número de veces que ocurrió):

Aprendizaje automático y la experiencia está en la parte superior de la lista. La experiencia viene con la práctica. Una idea básica del aprendizaje automático viene con este libro.

Estas palabras son seguidas de cerca por palabras estadísticas que implican conocimiento de matemáticas y teoría.

La palabra equipo es muy alto, lo que implica que necesitarás trabajar con un equipo de científicos de datos; no serás un lobo solitario.

Palabras de ciencias de la computación tales como algoritmos y Programación son prevalentes.

Las palabras técnicas , comprensión , y métodos implica un enfoque más teórico, ambivalente a cualquier dominio.

La palabra negocios implica un dominio de problema particular.

Hay muchas cosas interesantes que notar acerca de este estudio de caso, pero lo más importante es que hay muchas palabras y frases clave que conforman un papel de la ciencia de datos. No se trata sólo de matemáticas, codificación o conocimiento de dominio; realmente es la combinación de estas tres ideas (ya sea ejemplificado en un una sola persona o a través de un equipo multipersona) que hace la ciencia de los datos posible y potente.

Al principio de este capítulo, planteé una simple pregunta, ¿cuál es la captura de la ciencia de los datos? Bueno, hay uno. No todo es diversión, juegos y modelado. Debe haber un precio en nuestra búsqueda de máquinas y algoritmos cada vez más inteligentes. A medida que buscamos nuevas e innovadoras maneras de descubrir las tendencias de los datos, una bestia acecha en las sombras. No estoy hablando de la curva de aprendizaje de matemáticas o programación ni me refiero al excedente de datos. La era industrial nos dejó con una batalla continua contra la contaminación. La era de la información posterior dejó un rastro de big data. Entonces, ¿qué peligros podría traernos la edad de los datos?

La edad de los datos puede llevar a algo mucho más siniestro: la deshumanización del individuo a través de datos masivos.

Cada vez más personas están saltando de cabeza en el campo de la ciencia de datos, la mayoría sin experiencia previa en matemáticas o CS, que en la superficie es grande. Los científicos de datos promedio tienen acceso a millones de datos de perfiles de citas, tuits, reseñas en línea y mucho más con el fin de impulsar su educación.

Sin embargo, si saltas a la ciencia de los datos sin la exposición adecuada a la teoría o prácticas de codificación y sin respeto del dominio en el que estás trabajando, te enfrentas al riesgo de simplificar demasiado el fenómeno mismo que estás tratando de modelar.

Por ejemplo, digamos que desea automatizar su tubería de ventas mediante la construcción de un programa simplista que mira LinkedIn para palabras clave muy específicas en el perfil de LinkedIn de una persona.

palabras clave = ["Saas", "Ventas", "Enterprise"]

Genial, ahora puedes escanear LinkedIn rápidamente para encontrar personas que coincidan con tus criterios. Pero ¿qué hay de esa persona que deletrea "Software as a Service" en lugar de "Saas" o escribe mal "empresa" (es lo que pasa con el mejor de nosotros; apuesto a que alguien encontrará un error tipográfico en mi libro). ¿Cómo se dará cuenta tu modelo de que estas personas también son una buena pareja? No deben quedar atrás sólo porque el científico de datos de recortes ha generalizado demasiado a la gente de una manera tan fácil.

El programador optó por simplificar su búsqueda de otro humano buscando tres palabras clave básicas y terminó con una gran cantidad de oportunidades perdidas sobre la mesa.

En el siguiente capítulo, exploraremos los diferentes tipos de datos que existen en el mundo, que van desde texto libre a archivos de fila/columna altamente estructurados. También analizaremos las operaciones matemáticas que se permiten para diferentes tipos de datos, así como deducir información basada en la forma de los datos que vienen en.

Sinan Ozdemir es un científico de datos, fundador start-up y educador que vive en el Área de la Bahía de San Francisco. Estudió matemáticas puras en la Universidad Johns Hopkins. Luego pasó varios años dando conferencias sobre ciencia de datos allí, antes de fundar su propia start-up, Kylie ai, que utiliza la inteligencia artificial para clonar personalidades de marca y automatizar las comunicaciones de servicio al cliente. También es autor de Principios de Ciencia de Datos, disponible a través de Packt.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +