¿Qué es ETL?
ETL son las siglas de extract-transform-load (extraer, transformar y cargar), y se utiliza habitualmente para referirse al proceso de integración de datos. Extraer hace referencia a obtener datos de una fuente de datos determinada. Las transformaciones se emplean para convertir esos datos en un formato procesable. Cargar es el paso final, que consiste en depositar los datos en el destino designado.
¿Qué son las herramientas ETL?
Las herramientas ETL sirven para abstraer muchas de estas consideraciones. Su principal ventaja es que no requieren un recurso técnico que programe estos procesos desde cero, ya que ofrecen una interfaz para configurar fácilmente la integración de datos desde diversas fuentes. Las herramientas modernas basadas en la nube, como Fivetran, siguen mejorando la facilidad de uso y reduciendo la deuda técnica derivada de la gestión de herramientas gracias a funciones como:
Configuración sencilla
Las aplicaciones en la nube para crear integraciones suelen configurarse mediante una sencilla funcionalidad de OAuth
Actualizaciones automatizadas
Fivetran mantiene un cursor interno para cada fuente de datos configurada en tu cuenta, de modo que podemos consultar únicamente las marcas de tiempo o los registros de base de datos más recientes para determinar los cambios y reducir la carga en producción.
Gestión de la desviación de esquema
Ya se trate de columnas y tablas añadidas en la fuente de base de datos o de campos personalizados en una aplicación en la nube, el pipeline de Fivetran detectará estos cambios y los aplicará al esquema de destino correspondiente, de modo que no tengas que preocuparte por rehacer el pipeline ante cambios frecuentes en la fuente.
Gestión de la infraestructura
Gracias a nuestro alojamiento en la nube y a nuestra interfaz web fácil de usar, nunca tendrás que preocuparte por escalar la infraestructura para satisfacer tus necesidades de volumen de datos.
Seguridad
Los datos replicados por Fivetran siempre están cifrados, tanto en tránsito como en reposo. Para la conectividad con bases de datos, podemos conectarnos a bases de datos alojadas tanto de forma local (on-premise) como en la nube mediante una sencilla inclusión de IP en la lista de permitidos, túneles SSH, túneles SSH inversos o túneles VPN. Además, nos sometemos anualmente a una prueba de penetración realizada por un tercero y a la certificación de conformidad SOC 2 tipo 2. Para obtener más información sobre nuestra seguridad, descarga nuestro documento técnico.
Consideraciones sobre el proceso ETL para tu pipeline
Cuando programas el ETL internamente, normalmente tienes que plantearte algunas preguntas:
¿Cuentas con recursos de ingeniería dedicados no solo para la creación inicial, sino también para el mantenimiento continuo?
Los pipelines de datos suelen crearse para responder a una pregunta concreta, lo que significa que se consultan endpoints específicos de la API. Con el tiempo, tus analistas querrán responder a más preguntas, lo que podría requerir extraer datos de endpoints de API adicionales. Tus ingenieros también tendrán que actualizar los pipelines para adaptarse a los cambios estructurales en la fuente de datos. Mientras utilices una fuente de datos concreta, el mantenimiento será un compromiso continuo que consume tiempo de ingeniería.
¿Cómo gestionas el escalado de la infraestructura?
Esto solo se aplica si buscas pipelines que gestionen la actualización de datos para elaborar informes de forma continua. El volumen de datos no dejará de crecer, lo que requiere servidores dedicados para gestionar el volumen de datos actualizado.
¿Cómo te aseguras de que tus conectores solo extraigan los datos más recientes?
En lugar de realizar una extracción completa y comparar todos los datos disponibles en la fuente, lo que somete a un estrés innecesario al sistema de producción, tu script de ETL debería utilizar registros de seguimiento de cambios de base de datos o marcas de tiempo en el caso de las aplicaciones en la nube para extraer únicamente los datos actualizados.
¿El script de ETL tiene en cuenta la desviación de esquema desde la fuente hasta el destino?
Los cambios de esquema se producen con frecuencia en las bases de datos de producción, que incluyen sistemas para alojar datos de productos y backends de sistemas ERP. En las aplicaciones en la nube, los administradores de sistemas utilizan con frecuencia campos personalizados para ofrecer mayor flexibilidad, lo que da lugar a cambios de esquema, como tablas y columnas adicionales, que deben aplicarse en el destino.
Cuestiones de seguridad
Debes asegurarte de que los datos que circulan por internet hacia un almacén alojado en la nube o que se extraen de una fuente de datos alojada en la nube nunca se vean comprometidos. La privacidad y la seguridad siempre son importantes, y debes cifrar tu pipeline de datos y restringir el acceso a los usuarios que cuenten con las credenciales adecuadas.
¿Qué hace Fivetran?
La integración de datos automatizada de Fivetran ofrece conectores sin configuración que se adaptan dinámicamente a medida que cambian los esquemas y las API, garantizando un acceso fiable a los datos. Fivetran sincroniza continuamente los datos desde la fuente hasta el almacén y acelera el análisis de datos gestionando de forma programática esquemas listos para consultar y automatizando las transformaciones dentro del almacén. Fivetran ofrece una prueba gratuita de 14 días para garantizar que se cubran tus necesidades de integración de datos.







