¿Qué es Fivetran?

Fivetran es una plataforma moderna de movimiento de datos automatizado, basada en la nube, que permite a las organizaciones extraer, cargar y transformar datos sin esfuerzo entre una amplia variedad de fuentes y destinos.
Esto incluye tanto el caso de uso tradicional de integración de datos, en el que los datos se mueven desde aplicaciones, bases de datos y archivos hacia un repositorio central que consolide una “única fuente de la verdad” para la analítica, como la capacidad general de mover datos entre bases de datos, data warehouses y data lakes para apoyar las operaciones del negocio.
Mover datos de la fuente al destino requiere un sistema de alto desempeño que es más complejo de construir de lo que parece. Hay que considerar varias cosas: dimensionar y escalar correctamente el entorno, asegurar la disponibilidad, recuperarse de fallas y reconstruir el sistema en respuesta a fuentes de datos y necesidades de negocio cambiantes. Muchas herramientas comunes de integración de datos ofrecen frameworks para resolver estas tareas, pero aun así exigen un grado considerable de configuración y trabajo de ingeniería por parte del usuario final.
.png)
Además, no es raro que las organizaciones usen decenas o cientos de aplicaciones, herramientas y sistemas operacionales distintos que producen datos, cada uno de los cuales deja pistas digitales valiosas.
.png)
Estos retos imponen costos significativos en tiempo, trabajo y dinero a las organizaciones que intentan mover datos con cualquier tipo de solución a la medida y de alta configuración. Construir desde cero una infraestructura de operaciones de datos eficiente, confiable y escalable, incluso con la ayuda de un framework, es un ejercicio de frustración y de oportunidades perdidas.
En contraste, una solución automatizada de movimiento de datos lista para usar elimina la necesidad de que una organización construya esa solución internamente.
Automatización, confiabilidad y escalabilidad
Desde la perspectiva del usuario final, el flujo de trabajo ideal de movimiento de datos debería consistir en poco más que:
- Seleccionar conectores para fuentes de datos desde un menú.
- Proporcionar credenciales.
- Definir una programación.
- Presionar un botón para iniciar la ejecución.
La simplicidad de este flujo oculta una complejidad considerable bajo la superficie. La arquitectura de Fivetran está estrictamente dividida entre el entorno local del usuario, la nube de Fivetran y la nube del cliente. Esta división es esencial para asegurar tanto la seguridad como el desempeño. En cuanto a seguridad, las separaciones estrictas entre el front end, el back end y la nube del cliente garantizan que no haya forma de exponer datos sensibles a través del front end. En cuanto al desempeño, al tratarse de una herramienta cloud-native, Fivetran hace un uso extensivo de la paralelización bajo demanda.
El siguiente diagrama de arquitectura muestra el enfoque estándar de Fivetran, basado en la nube, para el movimiento de datos automatizado:
.png)
Ten en cuenta que para las organizaciones con requisitos de seguridad que limitan el uso de soluciones SaaS basadas en la nube, Fivetran también ofrece arquitecturas híbridas y on-premises.
Un flujo de trabajo típico sigue estos pasos:
- El usuario accede al front end de Fivetran a través del dashboard de Fivetran.com o la API.
- El usuario crea y configura los conectores.
- Las elecciones del usuario quedan registradas en la base de datos de producción de Fivetran.
- Con base en la configuración guardada en la base de datos de producción, el backend de Fivetran genera una serie de workers según la programación definida.
- Cada worker extrae y carga datos, con un procesamiento ligero. Los workers expiran cuando ya no se necesitan.
- Las transformaciones para producir modelos de datos listos para el analista se disparan por separado y se ejecutan en el destino. Los modelos de datos de Fivetran se generan a través de nuestra integración con dbt™ para potenciar las transformaciones.
Para asegurar que el flujo descrito funcione de manera fluida y confiable, Fivetran también está diseñado con una serie de consideraciones que un diagrama de arquitectura no captura fácilmente.
- Las actualizaciones incrementales garantizan datos oportunos y una mínima interrupción en los sistemas fuente. En lugar de extraer y cargar toda la fuente de datos en cada sincronización, Fivetran detecta los registros nuevos o modificados y reproduce los cambios en el destino. Las sincronizaciones completas solo se usan para la sincronización inicial o para corregir problemas serios de integridad de datos, como registros corruptos. El mecanismo principal con el que Fivetran logra las actualizaciones incrementales es change data capture (CDC).
- La idempotencia es la capacidad de un conector de datos para recuperarse fácilmente de sincronizaciones fallidas. En el contexto del movimiento de datos, la idempotencia garantiza que, si aplicas los mismos datos a un destino varias veces, obtienes el mismo resultado. Sin idempotencia, una sincronización fallida obliga a un ingeniero a rastrear qué registros se sincronizaron y cuáles no, y a diseñar un procedimiento de recuperación a la medida para eliminar registros duplicados. Con idempotencia, el conector de datos simplemente reproduce los datos que posiblemente no llegaron al destino. Si un registro ya está presente, la reproducción no tiene efecto; en caso contrario, el registro se agrega.
- El manejo del schema drift implica representar los datos con precisión incluso cuando las fuentes cambian. También implica detectar y forzar tipos de datos, y equilibrar la replicación y preservación precisas de los datos con el funcionamiento confiable de los conectores. Fivetran aborda este problema principalmente con actualizaciones en vivo, en las que los datos se reproducen de forma perfecta entre la fuente y el destino.
- Asegurar el desempeño del pipeline y de la red exige minimizar la latencia y los cuellos de botella. Fivetran lo logra con optimización algorítmica, paralelización, pipelining y buffering.
Por qué Fivetran es una plataforma, no solo un pipeline
Fivetran es más que una solución puntual que resuelve el problema único y específico de centralizar datos para la analítica. A más largo plazo, las organizaciones también necesitan democratizar el acceso a los datos y encontrar formas de monetizarlos. Con esas necesidades en mente, Fivetran ofrece capacidades de seguridad, gobernanza y extensibilidad.
Las capacidades de seguridad son indispensables para asegurar el cumplimiento normativo, gestionar el riesgo de marca, proteger las operaciones internas y la propiedad intelectual, y resguardar de forma ética la información del cliente u otros datos críticos del negocio mientras se mueven. Al evaluar la seguridad de una plataforma, las capacidades comunes incluyen opciones flexibles de despliegue y de red segura, certificaciones de cumplimiento de seguridad para plataformas SaaS, protección con encriptación end-to-end y aislamiento de procesos.
En la misma línea, la gobernanza de datos es esencial para que las organizaciones conozcan, accedan y protejan su información. Las capacidades de gobernanza de datos incluyen integración sencilla con catálogos de datos, visualización gráfica del lineage de los modelos de datos, captura de metadatos y otras herramientas de auditoría.
Por último, las capacidades de extensibilidad permiten que una organización controle de forma programática un ecosistema creciente de herramientas de gestión de datos e incruste sus activos de datos en sus productos. Conforme las necesidades de datos crecen en escala y complejidad con el tiempo, las organizaciones necesitarán gestionar usuarios a escala, integrarse con otras tecnologías de operaciones de datos y construir procesos y flujos de trabajo personalizados que dependen de los datos.
[CTA_MODULE]
Related blog posts
Empieza gratis
Únete a los miles de empresas que usan Fivetran para centralizar y transformar sus datos.






