¿Cuáles son los ejemplos de fuentes de datos?
Una fuente de datos es la ubicación de donde se originan los datos que se están utilizando.
Una fuente de datos puede ser la ubicación inicial donde nacen los datos o donde se digitaliza por primera vez la información física, sin embargo, incluso los datos más refinados pueden servir como fuente, siempre y cuando otro el proceso accede y utiliza Lo siento. Concretamente, una fuente de datos puede ser una base de datos, un archivo plano, mediciones en vivo de dispositivos físicos, datos web raspados, o cualquiera de la miríada de estática y Servicios de transmisión de datos que abundan a través de Internet.
Aquí hay un ejemplo de una fuente de datos en acción. Imagine una marca de moda que vende productos en línea. Para mostrar si un artículo está agotado, el sitio web recibe información de una base de datos de inventario. En este caso, las tablas de inventario son una fuente de datos, consultada por la aplicación web que sirve el sitio web a los clientes.
Centrarse en cómo se utiliza el término en el contexto familiar de la gestión de bases de datos ayudará a aclarar qué tipos de fuentes de datos existen, cómo funcionan y cuándo son útiles.
Nomenclatura de fuentes de datos
Las bases de datos siguen siendo las fuentes de datos más comunes, ya que son los principales almacenes de datos en sistemas de gestión de bases de datos relacionales ubicuos (RDBMS). En este contexto, un concepto importante es el nombre fuente de datos (DSN). El DSN se define dentro de las bases de datos o aplicaciones de destino como un puntero a los datos reales, si existe localmente o se encuentra en un servidor remoto (y si en una sola ubicación física o virtualizado.) El DSN no es necesariamente el mismo que el nombre de la base de datos o el nombre del archivo, sino que está en una dirección o etiqueta utilizada para llegar fácilmente a los datos en su origen.
En última instancia, los sistemas que hacen la Ingestión (de datos) determinar el contexto para cualquier discusión acerca de las fuentes de datos, por lo que las definiciones y nomenclaturas varían ampliamente y pueden ser confusas. Esto es especialmente cierto en la documentación más técnica. Por ejemplo, dentro de la plataforma de software Java, un «Datasource» se refiere específicamente a un objeto que representa una conexión a una base de datos (como un DSN extensible y empaquetado programáticamente). Mientras tanto, algunas plataformas más nuevas utilizan ‘DataSource’ más ampliamente para significar cualquier recopilación de datos que proporcione un medio estandarizado de acceso.
Tipos de fuentes de datos
Aunque la diversidad de contenido, formato y ubicación de los datos sólo está aumentando con las contribuciones de tecnologías como IoT y la adopción de medidas big data metodologías, sigue siendo posible clasificar la mayoría de las fuentes de datos en dos grandes categorías: fuentes de datos automáticas y fuentes de fecha de archivo.
Aunque ambos comparten el mismo propósito básico — apuntando a la ubicación de los datos y describiendo características de conexión similares — las fuentes de datos de máquinas y archivos se almacenan, acceden y utilizan de diferentes maneras.
Fuentes de datos de la máquina
Las fuentes de datos de la máquina tienen nombres definidos por los usuarios, deben residir en la máquina que ingiere datos y no pueden compartirse fácilmente. Al igual que otras fuentes de datos, las fuentes de datos de la máquina proporcionan toda la información necesaria para conectarse a los datos, como los controladores de software pertinentes y un gestor de controladores, pero los usuarios solo necesitan referirse al DSN como taquigrafía para invocar la conexión o consultar los datos.
La información de conexión se almacena en variables de entorno, opciones de configuración de la base de datos o una ubicación interna de la máquina o aplicación que se utiliza. Una fuente de datos Oracle, por ejemplo, contendrá una ubicación del servidor para acceder al DBMS remoto, información sobre qué controladores usar, el motor del controlador y cualquier otra parte relevante de una cadena de conexión típica, como el sistema y los identificadores de usuario y la autenticación.
Fuentes de datos de archivos
Las fuentes de datos de archivos contienen toda la información de conexión dentro de un único archivo de ordenador, compartido (normalmente con una extensión.dsn). Los usuarios no deciden qué nombre se asigna a las fuentes de datos de archivos, ya que estas fuentes no están registradas en aplicaciones, sistemas o usuarios individuales, y de hecho no tienen un DSN como el de las fuentes de datos de máquinas. Cada archivo almacena una cadena de conexión para una única fuente de datos.
Las fuentes de datos de archivos, a diferencia de las fuentes de la máquina, son editables y copiables como cualquier otro archivo de computadora. Esto permite a los usuarios y sistemas compartir una conexión común (moviendo la fuente de datos entre máquinas o servidores individuales), y para la racionalización de los procesos de conexión de datos (por ejemplo, manteniendo un archivo fuente en un recurso compartido para que pueda ser utilizado simultáneamente por múltiples aplicaciones y usuarios).
Es importante tener en cuenta que también existen archivos.dsn ‘incompartibles’. Estos son el mismo tipo de archivo descrito anteriormente, pero existen en una sola máquina y no pueden ser movidos o copiados. Estos archivos apuntan directamente a las fuentes de datos de la máquina. Esto significa que las fuentes de datos de archivos no compartidas son envolturas para fuentes de datos de máquinas, que sirven como un proxy para aplicaciones que esperan sólo archivos, pero también necesitan conectarse a datos de máquinas.
Cómo funcionan las fuentes de datos
Las fuentes de datos se utilizan de diversas maneras. Los datos pueden ser transportados gracias a diversos protocolos de red, como el conocido Protocolo de Transferencia de Archivos (FTP) y el Protocolo de Transferencia de HiperTexto (HTTP), o cualquiera de la miríada Interfaz de programación de aplicaciones (API) proporcionados por sitios web, aplicaciones en red y otros servicios.
Muchas plataformas utilizan fuentes de datos con direcciones FTP para especificar la ubicación de los datos necesarios para ser importados. Por ejemplo, en la plataforma Adobe Analytics, una fuente de datos de archivos se sube a un servidor utilizando un cliente FTP, luego un servicio utiliza esta fuente para mover y procesar los datos relevantes automáticamente.
SFTP (El S significa Secure o SSH) se utiliza cuando los nombres de usuario y contraseñas necesitan ser obfuscados y el contenido cifrado, o FTPS puede ser utilizado alternativamente añadiendo Transport Layer Security (TLS) a FTP, alcanzando el mismo objetivo.
Mientras tanto, ahora se proporcionan muchas y diversas API para administrar las fuentes de datos y cómo se utilizan en las aplicaciones. Las API se utilizan para vincular aplicaciones programáticamente a fuentes de datos, y normalmente proporcionan más personalización y una colección más versátil de métodos de acceso. Por ejemplo, Spark proporciona una API con implementaciones abstractas para representar y conectar a fuentes de datos, desde clases deshuesadas pero extensibles para fuentes relacionales genéricas, hasta implementaciones detalladas para conexiones JDBC de código duro.
Otros protocolos para mover datos de fuentes a destinos, especialmente en la web, incluyen NFS, SMB, SOAP, REST y WebDAV. Estos protocolos se utilizan a menudo dentro de las API (y algunas API hacen uso de otras API internamente), dentro de aplicaciones de datos completamente destacadas, o como procesos de transferencia independientes. Cada uno de ellos tiene características y preocupaciones de seguridad que deben tenerse en cuenta para cualquier transferencia de datos.
El propósito de una fuente de datos
En última instancia, las fuentes de datos están destinadas a ayudar a los usuarios y aplicaciones a conectarse y trasladar los datos a donde sea necesario. Recopilan información técnica relevante en un solo lugar y la ocultan para que los consumidores de datos puedan centrarse en el procesamiento e identificar la mejor manera de utilizar sus datos.
El propósito aquí es empaquetar la información de conexión en un formato más fácil de entender y fácil de usar. Esto hace que las fuentes de datos críticos para más fácilmente integración de sistemas dispares , ya que salvan a los accionistas de la necesidad de tratar y solucionar problemas de información de conexión compleja pero de bajo nivel.
Y aunque esta información de conexión está oculta, siempre es accesible cuando es necesario. Además, esta información se almacena en ubicaciones y formatos consistentes que pueden facilitar otros procesos como migraciones o cambios estructurales del sistema planificados.
Primeros pasos con las fuentes de datos y la integración
Una vez que los datos han llegado a su destino final, preferiblemente un repositorio centralizado como un almacén de datos en la nube, las diferencias en el formato o la estructura basada en la fuente deben ser suavizadas. El primer paso hacia este objetivo de integración de datos, sin embargo, implica la abstracción de las conexiones de datos iniciales, una tarea compleja cuando se tiene en cuenta el número de fuentes de datos accesibles a través de la nube.
Talend ayuda a los clientes a integrar datos de miles de fuentes internas y basadas en la nube, acelerando el viaje desde sistemas dispares e inmanejables a una visión unificada de Datos empresariales de confianza . Uso un único conjunto de aplicaciones centrado en la integridad e integración de datos, Talend Data Fabric mejora y asegura su cadena de valor de datos, desde la conexión inicial a una fuente de datos hasta una analítica e inteligencia empresarial eficaces.
Artículos Relacionados: