Migración a un data lake: guía práctica paso a paso

Tu equipo puede considerar migrar a un data lake por una o ambas de las siguientes razones:
1. Centralización de grandes volúmenes de datos estructurados y no estructurados
2. Habilitar análisis más avanzados, como IA
Una migración exitosa a un data lake requiere considerar varios factores clave:
- Las decisiones arquitectónicas determinan cómo se almacenan, acceden y gestionan los datos. Una arquitectura sólida debe garantizar escalabilidad, rentabilidad y compatibilidad con los requerimientos de datos de tu organización.
- Herramientas como Fivetran simplifican la migración al automatizar el movimiento de datos desde múltiples fuentes hacia el data lake con mínimo esfuerzo.
- Los query engines funcionan mejor según los casos de uso y el data stack de cada equipo. Una vez que los datos llegan al data lake, el query engine adecuado permite obtener analytics e insights sin interrumpir los flujos de trabajo existentes.
[CTA_MODULE]
Decisiones arquitectónicas clave para tu data lake
Al construir o migrar a un data lake, cuatro decisiones fundamentales definen tu arquitectura:
1. Almacenamiento en la nube
Esta es, con frecuencia, la decisión más crítica, ya que suele ser la más difícil de cambiar más adelante. Deberás elegir entre AWS S3, Azure Data Lake Storage o Google Cloud Storage. En muchos casos, la decisión se simplifica según tu infraestructura cloud actual: si tu organización ya depende ampliamente de AWS, por ejemplo, S3 es la opción natural. En general, el almacenamiento cloud se ha vuelto una commodity y la mayoría de las opciones ofrecen precios y funciones similares. Aun así, vale la pena analizar las diferencias en rendimiento, precios y funciones entre proveedores.

2. Formato de tabla
La elección del formato de tabla abierto determina qué capacidades admite tu data, como consistencia transaccional, cumplimiento ACID y evolución de schema. El Fivetran Managed Data Lake Service permite cargar datos en formatos Iceberg y Delta Lake en todos los principales proveedores de almacenamiento. Esta estrategia de doble formato te da la flexibilidad de consultar tus datos con una amplia variedad de motores sin quedar atado a un formato específico.
3. Catálogo
Un catálogo mantiene los metadatos de tus datasets y es esencial para facilitar su búsqueda y garantizar la consistencia. Las opciones incluyen AWS Glue, Unity Catalog, BigQuery Metastore o el propio Iceberg REST Catalog de Fivetran.
Fivetran aprovisiona automáticamente un Iceberg REST Catalog dedicado. También puedes configurar catálogos de terceros según tu almacenamiento y formato de tabla. Consulta los diagramas arquitectónicos más abajo para ver ejemplos.
4. Motor de consulta (query engine)
La elección del motor de consulta depende de la experiencia de tu equipo y de las herramientas que ya utilizan. Algunos motores vienen integrados con data warehouses cloud y también pueden consultar formatos de tabla abiertos en un data lake de forma nativa. Algunos ejemplos: Snowflake, Databricks, BigQuery, Amazon Athena, Trino y Apache Spark.
La interoperabilidad como principio rector
Estas decisiones son interdependientes. Por ejemplo, si planeas consultar con Databricks, elegir Delta Lake y Unity Catalog tiene sentido por su profunda integración.
Comienza con las decisiones en las que tengas mayor claridad, como el proveedor de almacenamiento. La interoperabilidad inherente de los data lakes te brinda una flexibilidad considerable para adaptar el resto de tu arquitectura a las necesidades específicas de tu equipo y casos de uso.
El enfoque interoperable de Fivetran
La arquitectura de data lake de Fivetran está diseñada para la interoperabilidad. Es compatible con los formatos Iceberg y Delta, y permite la integración con catálogos de terceros como AWS Glue o el Iceberg REST Catalog de Fivetran (que internamente es Apache Polaris Catalog).
Uno de los principales beneficios de una arquitectura de data lake es la flexibilidad: no estás atado a un solo motor de consulta. Tus equipos pueden acceder a los mismos datos desde distintos motores, según el caso de uso.
Migración e implementación
Una vez que configures tu data lake, deberás cargarlo con tus datos. Comenzar con el Fivetran Managed Data Lake Service es sencillo. Contamos con una guía de configuración detallada que incluye instrucciones específicas para cada proveedor cloud compatible. Fivetran permite realizar sincronizaciones históricas en fuentes SaaS y bases de datos, así como sincronizar directamente desde data warehouses.
Si ya eres cliente de Fivetran y actualmente cargas datos en un destino diferente (por ejemplo, Snowflake o BigQuery), comunícate con tu Account Manager. Nuestro equipo puede ayudarte a migrar tus conectores existentes a tu nuevo destino de data lake con mínimas interrupciones.
Opciones de consulta para tu data stack actual
Una vez que tus datos llegan al data lake, el siguiente paso es hacerlos accesibles a través de las herramientas que tus equipos ya utilizan. La arquitectura de Fivetran está diseñada para soportar patrones de consulta flexibles y escalables, para que puedas analizar tus datos donde tenga más sentido.
Fivetran sigue un enfoque de Extracción, Carga y Transformación (ELT): los datos en bruto se cargan primero en tu data lake y luego se transforman aguas abajo según sea necesario. Esta separación brinda mayor flexibilidad para consultar y modelar los datos después de la ingesta.
Existen múltiples formas de consultar datos en un entorno de data lake. Las siguientes dos subsecciones abordan algunos de los enfoques más comunes.
Snowflake e Iceberg REST Catalog
En nuestra Fivetran Iceberg REST Catalog Integration Guide, detallamos cómo configurar Snowflake para consultar datos almacenados en tu data lake a través del Iceberg REST Catalog. Este patrón te permite cargar datos en una capa de almacenamiento (como S3 o ADLS) con formato de tabla Iceberg. Después de inicializar y registrar external tables en Snowflake, dichas tablas se actualizan automáticamente para reflejar los datos más recientes en la capa de almacenamiento, eliminando la necesidad de actualizaciones manuales o pipelines ETL duplicados.
Databricks y Unity Catalog

Otro patrón de consulta robusto y común para data lakes implica la integración con Unity Catalog y Databricks. En nuestro artículo "A modern data lake with Fivetran Managed Data Lake Service and Databricks Unity Catalog", detallamos cómo el Fivetran Managed Data Lake Service se integra de forma nativa con Unity Catalog para soportar esta arquitectura.
Al usar la integración nativa de Fivetran, los schemas y tablas de tu data lake se mantienen actualizados automáticamente, lo que optimiza el gobierno de datos y el control de acceso. Para soportar una arquitectura centralizada, tu metastore de Unity Catalog se conecta a tu ubicación de almacenamiento y actúa como una capa de metadatos unificada. Luego puedes vincular múltiples workspaces de Databricks al mismo metastore, lo que permite un acceso consistente entre entornos sin necesidad de configurar múltiples destinos en Fivetran ni gestionar entornos de desarrollo independientes.
Esta integración es una opción escalable para consultar los datos del data lake directamente desde Databricks, con un governance sólido y mínima carga operativa.
Modelos de datos de Fivetran en el data lake
Fivetran ofrece modelos de datos compatibles con dbt Core (anteriormente conocidos como "Fivetran dbt packages") para nuestros conectores más populares. Estos modelos preconfigurados producen tablas limpias y listas para analytics que alimentan directamente tus reportes, dashboards y herramientas de BI.
Puedes aprovechar nuestros modelos de datos compatibles con dbt Core en una arquitectura de data lake usando un motor de consulta compatible como BigQuery, Databricks, PostgreSQL, Redshift o Snowflake, siguiendo estos pasos:
- Carga tus datos de origen: Comienza configurando los conectores de Fivetran para las fuentes con las que deseas trabajar y asegúrate de que las external tables necesarias estén creadas en tu motor de consulta. Las tablas específicas requeridas para cada modelo de datos están listadas en la documentación correspondiente. Por ejemplo, si planeas usar el modelo facebook_ads__account_report, el grafo de linaje muestra que depende de las tablas basic_ad_action_items, basic_ad_actions, account_history y basic_ad. Estas tablas de origen deben estar presentes como external tables en tu motor de consulta para que el modelo se ejecute correctamente.

- Crea tu proyecto de dbt: Una vez que tus external tables estén disponibles, crea un proyecto de dbt Core configurado para tu motor de consulta. Sigue nuestra Transformations Setup Guide para obtener instrucciones paso a paso.
- Instala los modelos de datos de Fivetran: En el Paso 6 de la guía de configuración de dbt, instalarás el modelo de datos de Fivetran para tu fuente específica (por ejemplo, Facebook Ads Data Model) en tu proyecto de dbt. Al configurar el modelo de origen, es importante definir correctamente las variables de base de datos y schema que señalan la ubicación de las external tables en tu entorno de data lake. Aquí tienes un ejemplo para Facebook Ads.
Data lakes sin complicaciones
Con la automatización, flexibilidad e interoperabilidad que ofrecen las herramientas y tecnologías modernas, migrar a un data lake nunca ha sido tan sencillo. En lugar de dedicar tiempo de ingeniería a la implementación técnica, tu equipo puede enfocarse en tomar las mejores decisiones según tu caso de uso y tus necesidades específicas.
Fivetran hace gran parte del trabajo por ti. Como todas las soluciones de Fivetran, el Managed Data Lake Service está diseñado para ser simple y fácil de usar, y automatiza la integración y la gestión de datos en el data lake.
[CTA_MODULE]
Related blog posts
Empieza gratis
Únete a los miles de empresas que usan Fivetran para centralizar y transformar sus datos.






