¿Qué paso en el proceso de ciencia de datos es el más importante qué paso toma el tiempo más largo para completar?

El proceso de ciencia de datos incluye un conjunto de pasos que los científicos de datos toman para recopilar, preparar y analizar datos y presentar los resultados de análisis a los usuarios de negocios.

Los datos son el alma de los negocios modernos. Cada vez más, sacar el máximo provecho de los datos de nuestra organización con una visión y comprensión precisas marca una verdadera diferencia para el éxito del negocio. Como resultado de ello, el científico de datos se ha convertido en un contrato crítico para empresas de todos los tamaños, ya sea que el trabajo sea un puesto especializado en TI o integrado en una unidad de negocio.

Sin embargo, no siempre está claro lo que queremos decir con el término científico de datos . A Analista de datos altamente cualificado ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ♪ ¿Alguien con antecedentes científicos que trabaja con datos?

Ciertamente, los científicos de datos suelen tener experiencia en estadística y scripting, y a menudo tienen una formación técnica, en lugar de una científica, artes liberales o negocios. Pero el elemento crítico de la ciencia de los datos -- que la convierte en una ciencia más que en una práctica comercial -- es la importancia de los procesos y experimentos.

Es probable que recuerde aprender sobre el método científico en la escuela secundaria. Los científicos vienen con teorías e hipótesis. Diseñan experimentos para probar esas hipótesis y luego confirmar, rechazar o, más a menudo, refinar la teoría.

Básico Información empresarial y presentación de informes Normalmente no sigue este proceso. En su lugar, BI y analistas de negocios tamizan, ordenan, tabulan y visualizan datos para apoyar un caso de negocio. Por ejemplo, pueden mostrar gráficamente que las ventas de los productos de nuestra empresa en la región occidental están disminuyendo y también que esta región incluye más clientes más jóvenes en comparación con otras áreas. A partir de ahí, podrían hacer el caso de que necesitamos cambiar nuestra estrategia de productos, marketing o ventas para esa región. En BI, el visualización de datos más persuasiva a menudo lleva la discusión.

El científico de datos adopta un enfoque diferente. Sigamos usando este ejemplo de ventas para mostrar cómo funciona el proceso de ciencia de datos, en los siguientes seis pasos.

1. Identificar una hipótesis de valor para el negocio

En nuestro caso, el científico de datos puede formular una hipótesis simple basada en preguntas planteadas por los equipos de ventas, marketing y productos: Creemos que los jóvenes tienen menos probabilidades de comprar nuestros productos, por lo que está reduciendo las ventas en la región occidental relativamente joven.

Además, podríamos encontrar algunas hipótesis relacionadas, tales como: No es simplemente que los clientes en la región occidental son más jóvenes, sino también que la gente más joven típicamente gana menos dinero y el ingreso promedio es menor allí que en otras regiones.

Ya se puede ver que el científico de datos debe ser capaz de pensar a través de diferentes implicaciones de hipótesis relacionadas con el fin de diseñar los experimentos de ciencia de datos correctos. Sólo hacer una pregunta directa cuando análisis de datos generalmente resulta menos útil que preguntar a varios. Y para obtener los mejores resultados, los científicos de datos deben trabajar con expertos empresariales para sacar a relucir casos extremos y contraejemplos que pueden ayudar a refinar sus hipótesis.

2. Reunir y preparar los datos requeridos

Con una hipótesis o un conjunto de ellas en la mano, es hora de que el científico de datos obtenga los datos correctos y los prepare para el análisis.

El equipo de BI trabaja comúnmente con datos de un almacén de datos que se ha limpiado, transformado y modelado para reflejar las reglas de negocio y cómo los analistas han mirado los datos en el pasado. El científico de datos, por otra parte, generalmente quiere mirar los datos en estado bruto, antes de que se le apliquen reglas. Además, las aplicaciones de ciencia de datos a menudo requieren más datos que lo que se almacena en un almacén.

En nuestro ejemplo, el almacén de datos de la empresa probablemente incluye varios detalles sobre los clientes, pero tal vez no cómo pagaron por los productos: con tarjeta de crédito, efectivo, pago en línea, etc. O podemos encontrar que, debido a que los modelos de almacén de datos pueden ser engorrosos de modificar, el sistema putativo de registro está un poco desactualizado y aún no incluye formas de pago más nuevas, exactamente las que son atractivas para los más jóvenes.

Por lo tanto, el científico de datos necesita trabajar con el equipo de TI para obtener acceso a las fuentes de datos más detalladas que están disponibles y reunir los datos requeridos. Estos pueden ser datos empresariales procedentes de ERP, CRM u otros sistemas operativos, pero cada vez más también incluyen registros web, datos de transmisión desde dispositivos IoT y muchos otros tipos de datos. Los datos brutos por lo general se extrae y se carga - o ingerido, como la jerga tiene - en un lago de datos . Por simplicidad y conveniencia, sin embargo, el científico de datos a menudo sólo trabaja contra un conjunto de datos de muestra en esta etapa temprana.

Y esto no quiere decir que los científicos de datos no Preparación de datos trabajo en absoluto. Por supuesto, por lo general no aplican modelos de negocio o reglas de negocio predefinidas a los datos brutos en la forma de un desarrollador de almacén de datos. Pero pasan mucho tiempo perfilando y limpiando datos -- por ejemplo, decidiendo cómo manejar los valores perdidos o atípicos -- y transformándolos en estructuras que son apropiadas para algoritmos de aprendizaje automático y modelos estadísticos.

3. Experimentar y sintonizar modelos analíticos

Diseñar el experimento es un paso crítico en el proceso de ciencia de datos. De hecho, algunos dirían que es más un arte que una ciencia. Ciertamente, ayuda si el científico de datos tiene una buena comprensión del negocio y alguna visión de lo que constituye variables interesantes a considerar, además de un sentido de qué algoritmos son probables dar resultados más útiles.

Hoy en día, hay numerosas herramientas de ciencia de datos y aprendizaje automático que pueden probar diferentes algoritmos y enfoques y seleccionar los mejores para aplicaciones analíticas, sin mucha intervención humana. Más o menos apunta la herramienta a los datos, especifica las variables que te interesan y deja que se ejecute. A menudo se describe como plataformas automatizadas de aprendizaje automático , estos sistemas se comercializan en gran medida a los usuarios de las empresas que funcionan como ciudadanos científicos de datos , pero son tan populares entre los científicos expertos en datos, que los utilizan para investigar más modelos de los que podrían hacer manualmente.

Incluso el mejor modelo se puede mejorar con algunos ajustes y ajustes de variables. A veces, el científico de datos puede incluso querer volver atrás y dar forma a los datos un poco diferente - tal vez la eliminación de valores atípicos que se dejaron durante la etapa inicial de preparación de datos. Por ejemplo, he visto muchos casos en los que los datos originales fueron recopilados con valores por defecto que eran convenientes pero incorrectos y potencialmente engañosos.

4. Seleccione un modelo y ejecute el análisis de datos

Una vez que el científico de datos ha encontrado el mejor algoritmo corriendo contra el conjunto de datos de prueba, es hora de ejecutar el experimento de análisis contra todos los datos.

¿Los resultados? Bueno, no puedo decirte lo que serán. Pero, con una hipótesis interesante, buenos datos y un Modelo cuidadosamente construido , un científico de datos debe ser capaz de encontrar algo útil para el negocio. Puedes sorprenderte a ti mismo, incluso en esta etapa, con un descubrimiento inesperado. Muy a menudo, o confirmas o rechazas tu hipótesis original -- que, por supuesto, es lo que te propusiste hacer en primer lugar.

Volviendo a nuestro ejemplo de ventas, supongamos que el modelo que decidimos ejecutar demuestra que, sí, los jóvenes tienen menos probabilidades de comprar nuestros productos, pero con algunos giros importantes, lo que nos lleva al siguiente paso.

5. Presentar y explicar los resultados a las partes interesadas de las empresas

Recuerde que el objetivo de nuestro experimento fue probar algunas ideas que luego podemos llevar al marketing, las ventas y el diseño de productos para darles nuevas ideas sobre nuestros clientes.

Lo que tenemos, sin embargo, es una masa de estadísticas de nuestro modelo que los usuarios de negocios pueden no entender. Tal vez en general, los más jóvenes son menos propensos a comprar nuestro producto; también, su compra promedio es menor que la de los clientes mayores. Pero algunos jóvenes compran mucho, resultando en un alto nivel medio de venta.

Para ayudar a las empresas interesadas a comprender tales complicaciones, los científicos de datos necesitan otra habilidad -- no una capacidad técnica adicional, sino una de un conjunto de habilidades suaves que deberían tener . Deben ser capaces de explicar el trabajo de análisis y contar la historia del experimento de ciencia de datos y sus resultados. Algunas empresas incluso tienen intérpretes de datos o traductores de análisis que se especializan en esta importante tarea, describiendo las implicaciones de los modelos analíticos y sus hallazgos en términos de negocio. Ellos y los científicos de datos por igual utilizan a menudo técnicas de narración de datos aclarar los resultados analíticos y las acciones propuestas.

6. Preparar e implementar el modelo para su uso en la producción

Ahora contamos con nuestros datos, nuestro modelo funciona y un buen entendimiento empresarial de lo que hemos descubierto. De hecho, los equipos de negocios incluso han pensado en cómo hacer algunas ofertas en nuestro sitio web para atraer a esos clientes jóvenes elusivos en el oeste. Ahora tenemos que tomar la Labor relacionada con la ciencia de los datos del laboratorio y ponerlo en producción con datos operativos mientras el negocio está funcionando.

Este paso final no siempre es sencillo. En primer lugar, la actualización continua del modelo analítico con datos nuevos puede requerir un enfoque diferente de la carga de datos. Lo que hicimos manualmente como experimento puede no ser eficiente en la práctica. En parte por esta razón, ha surgido otro papel en muchas empresas: el ingeniero de datos, cuyas responsabilidades incluyen trabajar en estrecha colaboración con los científicos de datos para preparar los modelos para la producción.

También debemos reconocer que, en nuestro ejemplo, los hábitos de compra cambian con el tiempo, tal vez con la economía o cambios en el gusto. Por lo tanto, tenemos que mantener el modelo al día y tal vez afinarlo de nuevo en el futuro. Ese también puede ser uno de un Tareas del ingeniero de datos , aunque el científico de datos debe reelaborar un modelo si se desvía demasiado de su precisión original.

Por último, el modelo que funciona mejor como experimento puede resultar costoso de ejecutar en la práctica. Con el análisis de datos cada vez más hecho en la nube, donde pagamos por el uso de computación y almacenamiento, podemos encontrar que algunos cambios hacen que el modelo sea ligeramente menos preciso pero más barato de ejecutar. Un ingeniero de datos también puede ayudar con eso, pero la compensación entre precisión y costo puede ser una opción difícil.

El lado empresarial de la ciencia de los datos

He descrito un esquema básico del proceso de ciencia de datos. Como pueden ver, hay algunos elementos que podemos llamar ingeniería, o incluso un arte. También tenemos que tener en cuenta que en el mundo comercial, la ciencia de los datos es un negocio. Es decir, el propósito de nuestros experimentos y el éxito del proceso siempre se centrarán de manera muy útil en realidades comerciales directas.

Como resultado, la ciencia de los datos es generalmente más colaborativa de lo que se podría pensar. No es una disciplina aislada, técnicamente oscura, con científicos de datos trabajando solos en el laboratorio. En el mejor de los casos, la ciencia de los datos está muy extendida. colaboración entre las empresas y los dominios de las tecnologías de la información y añade nuevo valor a muchas facetas diferentes del trabajo de una organización.

Artículos Relacionados:

Esta web usa cookies, puedes ver la política de cookies, aquí -
Política de cookies +