¿Qué es la ciencia de los datos cuáles son sus aplicaciones?
El término fue sugerido por primera vez en la década de 1970 como sinónimo de “ciencia informática” y luego en la década de 1980 como una frase alternativa para “estadística”. Finalmente, en la década de 1990, comenzó a formarse un consenso en cuanto a que la ciencia de datos es una práctica interdisciplinaria que combina la recopilación de datos, el procesamiento y el análisis de computadoras. Es visto como “científico” porque aplica el análisis sistemático a los datos observables del mundo real.
Desde entonces ha connotado ese lapso completo, desde la agregación de datos de origen hasta su aplicación en la toma de decisiones y procesos técnicos y empresariales.
Pero también se ha asociado más estrechamente con el papel y la función especializados de los “científicos de datos” en el florecimiento de los departamentos de datos que están gestionando cada vez más datos en la empresa moderna.
Acontecimiento
La ciencia de los datos en el sentido más amplio
En su sentido más amplio, ciencias de los datos puede ser visto como la aplicación de técnicas científicas y matemáticas a la toma de decisiones empresariales. Este trabajo puede dividirse en tres grandes áreas:
- Reunión: La simple recopilación de información de sistemas informáticos dispares puede ser un desafío en sí misma. Los datos a menudo están en diferentes formatos y pueden contener registros espurios o incompletos. Cuando los datos se limpian y estandarizan, deben ser almacenados para que los algoritmos de ciencia de datos puedan ser usados una y otra vez en el futuro.
- Analizando: La búsqueda de patrones, y la comprensión de cómo las demandas en cada etapa de la empresa están cambiando, requiere una mezcla de análisis estadístico e inteligencia artificial.
- Presentación de informes: Los informes pueden resumir la actividad, señalar el comportamiento anómalo y predecir tendencias y oportunidades. Tablas, gráficos, visualizaciones y resúmenes animados pueden contar una historia y guiar a los tomadores de decisiones.
Así como la ciencia de los datos se utiliza a veces en este sentido más amplio, la “inteligencia empresarial” (BI) y la “analítica de datos” también pueden aplicarse de manera más general. Dependiendo de la historia, la escala y el enfoque del departamento de datos de una empresa, el propio departamento, su función y/o sus empleados clave pueden tener una tarea más amplia y/o titularse así.
Sin embargo, estos términos tienen orígenes diferentes y también se aplican con mayor frecuencia a funciones más estrechas en la actualidad.
¿Cuál es la función de la ciencia de datos en un departamento de datos más grande?
Los equipos de desarrolladores, o ingenieros de software, se combinan con científicos y analistas de datos para crear herramientas y soluciones diseñadas para optimizar la recopilación de datos de una amplia variedad de fuentes, integrar estos datos, analizarlos y luego entregar informes o tableros de datos para que todos los usuarios puedan tomar decisiones.
Muchos de estos enfoques e instrumentos han recibido nombres. Algunos de los más comunes son los siguientes:
- Almacén de datos: En una almacén de datos la información se almacena en una colección de cuadros y estructuras bien ordenados, a menudo en bases de datos relacionales. Los datos suelen estar bien filtrados y, a veces, ya analizados. En las industrias con preguntas sobre el cumplimiento legal, los datos ya se comprueban para detectar anomalías y cuestiones para la investigación.
- Lago de datos: En una lago de datos la idea es recoger la información en un repositorio central, similar a un almacén de datos y, de hecho, las diferencias no siempre son claras. En general, los lagos de datos tienen más datos crudos que se filtran o procesan menos. Si aparecen preguntas, los datos están fácilmente disponibles para ser examinados, pero a menudo este trabajo no se hace a menos que haya una demanda de las respuestas.
- Almacenamiento de datos: Los almacenes de datos tienden a ser sistemas más simples que ofrecen colecciones más transitorias y temporales. Un ejemplo podría ser todos los datos recopilados por una fábrica en un día o semana. Los datos a menudo se procesan y se envían a un lago o almacén.
- Marca de datos: Los maarts de datos pueden ofrecer a usuarios internos o externos colecciones de datos altamente procesadas para su consumo inmediato. Dentro de las empresas, pueden tener informes oficiales que han sido verificados y certificados. Algunas empresas también ofrecen martines externos que venden colecciones de datos o las ofrecen de forma gratuita.
- Análisis predictivo : Algunos usan este término para enfatizar cómo la ciencia de los datos puede ayudar a planificar para el futuro con predicciones basadas en datos pasados.
- Plataforma de datos del cliente: Algunas herramientas se centran en el seguimiento de los clientes para ayudar en la comercialización. Estos a menudo se integran con fuentes de datos de terceros para construir mejores modelos de individuos de modo que los esfuerzos de marketing se pueden personalizar para ellos.
- Datos como servicio: Algunas empresas se están especializando en empaquetar colecciones de datos para que puedan integrarse en la ciencia de datos local.
- Entornos de desarrollo integrados (IDE): Estos paquetes de software también son utilizados por los desarrolladores. Recogen muchas de las herramientas comunes para el análisis, como un paquete Python o R, y se casan con un editor y administrador de archivos para que los científicos de datos puedan experimentar con la escritura y la ejecución de nuevos análisis en un solo lugar.
- Cuaderno de notas: Los cuadernos son a menudo considerados como documentos dinámicos o vivos. Agrupan texto, gráficos, tablas y datos con el software que los produjo. Esto permite a los científicos de datos compartir tanto sus resultados como el análisis que los creó. Los lectores no sólo pueden leer el texto, pueden hacer cambios y explorar inmediatamente.
- Notebook host: Muchos equipos de científicos de datos dedican servidores a alojar cuadernos. Estos sistemas almacenan los datos y el texto en los resultados para que puedan leerse y experimentarse fácilmente. Algunas empresas ofrecen alojamiento como servicio.
¿Cómo se acercan algunas de las principales empresas a la ciencia de los datos?
El mayor nube empresas dedican recursos sustanciales a ayudar a sus clientes a gestionar y analizar grandes conjuntos de datos que a menudo se miden en petabytes o exabytes .
En todos estos casos, estas principales plataformas en la nube ofrecen más servicios de los que se pueden resumir en un breve artículo. Ofrecen múltiples opciones para el almacenamiento y el análisis para que los científicos de datos puedan elegir las mejores herramientas para sus trabajos.
IBM
IBM integra su almacenamiento de datos con una colección de paquetes de análisis estadístico y algoritmos de inteligencia artificial. Estas herramientas, comercializadas en una serie de formas como la Nube Pak para los datos , gestiona el acceso y establece normas para proteger la privacidad desde el principio.
Las herramientas, que están disponibles tanto como servicios como para instalaciones locales, pueden integrar datos a través de múltiples nubes y servidores.
IBM también ofrece una colección de herramientas y servicios de IA bajo su marca Watson que proporcionan algoritmos para clasificar conjuntos de datos y buscar señales.
Oráculo
Oracle ofrece una amplia gama de bases de datos que pueden actuar como la base para los lagos de datos y almacenes, ya sea en las instalaciones, en los centros de datos de la nube de Oracle o en híbridos de ambos.
Nube de Oracle Infraestructura soporta algunas de las herramientas de ciencia de datos estándar, utilizando R, Python y Matlab, para que la información de estas bases de datos se pueda convertir en cuadernos, informes o tableros llenos de tablas, gráficos y gráficos.
La compañía también ha invertido mucho en proporcionar Vías para la formación de modelos de inteligencia artificial y su despliegue en entornos de producción.
Oracle está comprando empresas y dedicando a desarrolladores a producir soluciones más personalizadas para industrias particulares con necesidades intensivas en datos, como la atención médica.
Una opción, la Ciencia de los Datos Virtual Máquina , permite a los usuarios iniciar una instancia en la nube con todos los paquetes comunes que están optimizados para el análisis de big data y proyectos de aprendizaje automático.
Otra herramienta, la Máquina Azure Aprendizaje Estudio , maneja la mayoría de los detalles del almacenamiento y análisis de datos para que el usuario pueda construir portátiles que exploren las señales en un conjunto de datos sin preocuparse por la configuración del software.
Amazonia
Amazon ofrece una diversa colección de opciones de almacenamiento de datos, que van desde versiones gestionadas de código abierto bases de datos como PostgreSQL a almacenamiento en frío para mantener copias de archivos a un precio bajo. Los científicos de datos también pueden elegir entre los productos propios de Amazon Web Services (AWS) y algunos de otras empresas alojadas en la nube de AWS.
Herramientas como Vista rápida , por ejemplo, están diseñados para simplificar la creación de buenas visualizaciones de datos sensibles que también pueden adaptarse a medida que los usuarios hacen preguntas. Otros productos similares Kinesis céntrate en tipos de datos particulares, como vídeos en tiempo real o flujos de clics en el sitio web. SageMaker apoya a equipos que quieren crear e implementar inteligencia artificial y aprendizaje automático para crear modelos con potencia predictiva.
Google Cloud Platform (GCP) puede recopilar y procesar grandes cantidades de datos utilizando una variedad de bases de datos, como BigQuery, que está optimizada para conjuntos de datos extremadamente grandes. Las opciones de análisis de datos de Google incluyen herramientas en bruto para crear grandes tejidos de datos, así como estudios de análisis de datos para explorar. Colab , por ejemplo, alberga cuadernos Jupyter para el trabajo de ciencia de datos que tienen un acceso sin problemas a una gran colección de GPUs para el trabajo intensivo en computación.
La compañía ha invertido mucho en IA y ofrece una amplia gama de herramientas que desarrollan modelos para extraer información de los datos. Los VertexAI Banco de trabajo , por ejemplo, es un extremo frontal basado en Jupyter que se conecta a todos los servicios de IA motor disponibles en la nube de Google.
¿Cómo están las startups y los retadores manejando la ciencia de los datos?
Una variedad de empresas quieren ayudar a otros a entender la sabiduría que puede estar oculta dentro de sus datos. Algunos están construyendo plataformas para almacenar y analizar datos. Otros sólo están creando herramientas que se pueden instalar en las máquinas locales. Algunos ofrecen un servicio que puede ser medido por el byte.
En el centro de muchos de estos productos y servicios están los paquetes de software de código abierto como R o Python, los lenguajes comunes utilizados por los científicos de datos. También hay varios buenos paquetes de código abierto que ofrecen un análisis de datos medio ambiente. Software como RStudio , Eric y Eclipse son sólo algunos ejemplos de herramientas que ofrecen un entorno cómodo para explorar datos.
JetBrains vende PyCharm, un entorno de desarrollo integrado para crear aplicaciones Python. Muchos programadores trabajan en la ciencia de datos basada en Python. La compañía también distribuye una edición comunitaria gratuita que es popular entre muchas escuelas.
Copo de nieve hace una plataforma de almacenamiento de datos basada en la nube con una amplia gama de características, incluyendo ciberseguridad , colaboración y control de la gobernanza. Hay muchos usos para este lago de datos o servicio de almacén de datos; el apoyo al aprendizaje automático y la ciencia de datos es uno de los más populares. La nube de Snowflake admite muchas aplicaciones comunes y puede ejecutar muchas aplicaciones Python en los datos almacenados en su nube.
Kaggle es una plataforma de ciencia de datos que ofrece almacenamiento y análisis, tanto para conjuntos de datos privados como para muchos de los públicos de fuentes como gobiernos y universidades. La ciencia de los datos se hace a menudo con código basado en cuadernos que se ejecuta localmente en la nube de Kaggle utilizando ya sea hardware estándar o unidades de procesamiento gráfico especializada o unidades de procesamiento de tensor. La empresa también patrocina concursos de ciencia de datos que algunas empresas utilizan para aprovechar la creatividad y la sabiduría de la comunidad abierta.
Los Bricks de datos Lakehouse Platform es compatible con el almacenamiento y análisis de datos ya sea en su nube, en muchas de las grandes nubes, o en las instalaciones. La herramienta ayuda a orquestar flujos de trabajo complejos que recopilan datos de múltiples fuentes, integrándolos y luego generando gráficos, tablas y otros informes. Muchas de las rutinas de ciencia de datos más comunes se aplican fácilmente como pasos en estos flujos de trabajo. El objetivo es proporcionar una poderosa plataforma de recolección y almacenamiento de datos que también produce una buena ciencia de datos en el proceso.
¿Hay algo que la ciencia de los datos no pueda hacer?
Las preguntas sobre las limitaciones de la ciencia han sido una pregunta profunda y a menudo filosófica para los científicos a lo largo de los años. Las mismas preguntas sobre el poder y la precisión de las herramientas matemáticas son importantes para los usuarios que quieren entender cómo funcionan las empresas y otras organizaciones. Los límites del análisis estadístico y del aprendizaje automático se aplican igualmente fácilmente al trabajo de la ciencia de los datos.
En muchos casos, los problemas no son con las matemáticas o los algoritmos. La simple recopilación de datos de buena calidad es un reto. El análisis no puede realmente comenzar a ser confiable hasta que los científicos de datos se aseguren de que sus datos son confiables y consistentes.
Misión de VentureBeat va a ser una plaza urbana digital para que los responsables técnicos de la toma de decisiones adquieran conocimientos sobre la tecnología y la transacción de las empresas transformadoras. Descubra nuestras reuniones informativas.
Cumbre de Seguridad Inteligente en Demanda
¿Te perdiste una sesión en Intelligent Security Summit? Diríjase a la biblioteca bajo demanda para escuchar información de expertos y aprender la importancia de la ciberseguridad en su organización.
Artículos Relacionados: