Data lakehouse: arquitectura, ejemplos y beneficios

¿Intentas decidir dónde almacenar tus datos? La buena noticia es que hay muchas opciones disponibles. Los data warehouses son excelentes para datos estructurados, pero son bastante rígidos y costosos. Los data lakes, por su parte, destacan con datos no estructurados y semiestructurados, pero carecen de un governance estricto. Usar ambos — un data lake para staging y un data warehouse para modelos listos para analytics — es una opción, pero los costos aumentan rápidamente y los errores se multiplican al mover datos entre ambos.
Un data lakehouse te permite almacenar todo tipo de datos con facilidad, convertirlos en insights valiosos y alimentar los sistemas aguas abajo sin problemas de rendimiento. Aquí exploramos cómo funciona esta arquitectura compuesta y por qué los equipos están adoptando una arquitectura de datos centrada en el lakehouse.
¿Qué es un data lakehouse?
Un data lakehouse es una arquitectura compuesta que combina la escalabilidad y el almacenamiento de bajo costo de un data lake con las capacidades de gestión estructurada y orientada a analytics de un data warehouse.
Los lakehouses ingieren tanto datos no estructurados como estructurados en object storage, un medio que tradicionalmente funciona mejor con información no estructurada. Sin embargo, al usar open table formats para agregar cumplimiento estricto de schemas, transacciones ACID (Atomicidad, Consistencia, Aislamiento y Durabilidad), indexación y controles de governance adicionales, los lakehouses enriquecen la estructura del data lake con capacidades propias de un warehouse.
El resultado es una arquitectura única que te da lo mejor de ambos mundos. Los usuarios gestionan datos estructurados, semiestructurados y no estructurados sin sacrificar rendimiento ni cumplimiento normativo.
¿Cómo funciona un data lakehouse?
La arquitectura de un data lakehouse comprende cinco capas. Aquí tienes una visión general de cómo funcionan y qué aporta cada una a tu objetivo de datos.
Ingesta
Extrae datos de múltiples fuentes como bases de datos, flujos de eventos y aplicaciones SaaS. Las herramientas modernas de ingesta como Fivetran automatizan el manejo de schemas, la conversión y la deduplicación para garantizar que todo esté listo para analytics.
Almacenamiento
Gestiona los datos en object storage cloud de bajo costo, desacoplado de la capa de cómputo. Los lakehouses admiten formatos estructurados, semiestructurados y no estructurados, y habilitan funciones propias del warehouse como transacciones ACID a través de open table formats, que combinan datos en archivos con metadatos que especifican estados de tablas, información de particiones y estadísticas columnares.
Metadatos
Usa una capa de metadatos centralizada para rastrear versiones, linaje de datos y schemas. Esta capa aporta la estructura necesaria para mantener tu lakehouse organizado y en cumplimiento normativo.
Ejemplos de open table formats que combinan almacenamiento y metadatos incluyen Iceberg y Delta Lake.
Motor de consulta / API
La capa de consultas usa motores SQL y DataFrame APIs para transformar y consultar datos directamente en el lakehouse. Al estar el procesamiento de consultas desacoplado del almacenamiento, una sola capa de almacenamiento puede combinarse con múltiples motores, cada uno optimizado para BI u otros casos de uso.
Consumo
Las herramientas de analytics aguas abajo o los modelos de ML conectados consumen los datos del lakehouse, brindando a los usuarios finales reportes y análisis consistentes.
Con su flexibilidad, escalabilidad y agilidad, es fácil entender por qué las organizaciones están adoptando los data lakehouses como su opción de almacenamiento a escala empresarial.
Data lakehouse vs. data warehouse vs. data lake
Los data lakehouses combinan dos arquitecturas de datos previamente establecidas: los data warehouses y los data lakes. Aquí explicamos cómo se diferencian y por qué las empresas usan cada una.
Data warehouse
Un data warehouse es un sistema centralizado que almacena datos estructurados. Es ideal para BI y analytics, y te permite consultar datos rápidamente con SQL. Una desventaja es su poca flexibilidad: en un data warehouse, el almacenamiento y el cómputo están estrechamente acoplados, y escalar uno implica escalar el otro. Además, los data warehouses típicamente no manejan bien los datos en bruto o no estructurados. Los ingenieros deberán trabajar únicamente con datos estructurados y procesados.
Data lake
Un data lake ofrece almacenamiento de bajo costo para datos en bruto, no estructurados y de object storage, destacando en las áreas donde los warehouses tienen limitaciones. Además, los lakes son extremadamente escalables y perfectos para conectarse a sistemas que necesitan un flujo masivo de datos en bruto o no estructurados, como muchos sistemas de IA y ML. Sin embargo, si el governance y la consistencia no son prioridades, la calidad de los datos puede deteriorarse y dejarte atascado en un pantano de datos.
Data lakehouse
Un data lakehouse es una tecnología compuesta que aloja almacenamiento económico de tipo lake y warehouse para datos estructurados y analytics.
La razón principal por la que existen los lakehouses es que muchos casos de uso modernos no encajan perfectamente en un lake ni en un warehouse. Incluso el machine learning, que se adapta mejor a la estructura de un lake, puede necesitar datos estructurados de los warehouses. Extraer datos de sistemas analíticos separados y en silos puede volverse costoso, sin mencionar el riesgo de duplicar datos o introducir errores.
Características clave de un data lakehouse
Con las capacidades combinadas de otras arquitecturas, el data lakehouse ofrece las siguientes características clave:
- Transacciones ACID: Los lakehouses habilitan transacciones ACID, normalmente asociadas con los data warehouses, para garantizar la consistencia cuando múltiples usuarios leen y escriben datos de forma simultánea.
- Soporte para BI: Con soporte ACID y motores de consulta SQL, los analistas conectan directamente los data lakehouses con plataformas de business intelligence.
- Formatos de almacenamiento abiertos: Los equipos de datos combinan el motor de cómputo de su elección con el open storage format del lakehouse.
- Capacidades de schema y governance: Los lakehouses admiten schema-on-read, lo que permite al software que accede a los datos definir su estructura. Para datos estructurados, los schemas se implementan con validación estricta para garantizar que toda la información cargada sea consistente.
- Soporte para diversos tipos de datos y cargas de trabajo: Esta opción de almacenamiento contiene tanto datos estructurados como no estructurados, lo que significa que puedes usarla para almacenar, transformar y analizar imágenes, video, audio y texto, así como datos semiestructurados como archivos JSON.
- Almacenamiento y cómputo desacoplados: Los recursos de almacenamiento están desacoplados de los recursos de cómputo, lo que brinda modularidad para controlar costos y escalar tus cargas de trabajo.
Para muchas organizaciones, los lakehouses ofrecen lo mejor de ambos mundos al alimentar múltiples sistemas modernos centrados en datos con alta eficiencia y menores costos.
Ejemplos de data lakehouse
Con la capacidad de gestionar todos los formatos de datos, los lakehouses complementan directamente una amplia gama de casos de uso modernos. Estos son los principales ejemplos de cuándo usar un lakehouse.
Analytics de streaming en tiempo real
Los lakehouses son ideales para ingerir grandes volúmenes de datos y mantener las transacciones consistentes y confiables. Para los motores aguas abajo que necesitan datos de inmediato, los lakehouses cuentan con la cantidad y la calidad para entregar insights actualizados de forma continua.
Ciencia de datos y exploración escalables
Al concentrar una gran cantidad de datos en un solo lugar, puedes acceder fácilmente a los datasets y experimentar dentro de los lakehouses. Desde ahí, simplificas la interacción al eliminar la necesidad de navegar entre distintos sistemas para encontrar los datos que necesitas.
Analytics avanzados a nivel empresa
Los lakehouses alimentan los motores de analytics aguas abajo, como herramientas de BI y dashboards. Cuando toda tu organización toma decisiones a partir de la misma fuente de verdad, mantiene la alineación y la consistencia.
Beneficios del data lakehouse
Un lakehouse combina la escalabilidad de un data lake con la estructura orientada al cumplimiento y las capacidades analíticas de un data warehouse. Combinar estas arquitecturas ofrece una serie de beneficios:
- Escalabilidad: Gracias al uso de object storage, puedes escalar los repositorios del lakehouse para almacenar mayores volúmenes de datos.
- Mejor gestión de datos: Las funciones propias del warehouse, como las transacciones ACID y la aplicación de schemas, hacen la gestión de datos más efectiva.
- Arquitectura de datos simplificada: Los lakehouses integran lo mejor de los warehouses y los lakes, eliminando la necesidad de mantener dos componentes arquitectónicos separados.
- Menores costos: Al usar una sola arquitectura de datos, no necesitas pagar por mantener múltiples opciones de almacenamiento al mismo tiempo.
- Elimina la redundancia de datos: Mover datos entre lakes y warehouses puede generar redundancias. Con un lakehouse, eliminas la necesidad de migraciones y reduces la proliferación de copias de datos innecesarias.
Desafíos del data lakehouse
Aunque los lakehouses tienen varias ventajas, también presentan desafíos que vale la pena considerar:
- Complejidad tecnológica: Gestionar la arquitectura particular de un data lakehouse con open table formats puede representar un reto para equipos sin experiencia previa en lakehouses.
- Necesidad de nuevas habilidades: Los ingenieros pueden necesitar aprovisionar de forma independiente nuevas herramientas, sistemas y motores de consulta para integrarlos con el lakehouse.
- Elegir los componentes correctos: Existen cinco capas distintas en un data warehouse, y se debe seleccionar la herramienta adecuada para cada una. Cada decisión requiere planificación y comprensión del ecosistema.
Cómo Fivetran alimenta e impulsa el data lakehouse
La plataforma de movimiento de datos automatizado de Fivetran y su extensa biblioteca de conectores preconfigurados facilitan la ingesta continua de datos en el almacenamiento del lakehouse. Con más de 700 conectores, puedes centralizar datos de una enorme variedad de fuentes en una sola capa de almacenamiento.
Al ofrecer pipelines ELT end-to-end completamente gestionados, Fivetran elimina por completo la necesidad de mantenimiento administrativo de pipelines. Escala tu arquitectura de datos con herramientas de movimiento de datos robustas, fáciles de usar y líderes en la industria. Comienza gratis o agenda una demo en vivo para saber más.
Preguntas frecuentes
¿Qué es un data lakehouse de Databricks?
Databricks es el pionero de la estructura del lakehouse y lo define como una arquitectura unificada, abierta y escalable que combina lo mejor del data warehousing y los data lakes.
¿AWS es un data lake o un data warehouse?
AWS es un proveedor cloud que ofrece servicios específicos de data lake y warehouse. Puedes contar con AWS para obtener capacidades de lake o warehouse en la nube, con herramientas distintas para cada uno.
¿Un data lake es una herramienta ETL?
No, un data lake no es una herramienta ETL. Una herramienta ETL (Extract, Transform, Load) es un tipo de pipeline de datos que mueve los datos de origen al almacenamiento y los prepara para el análisis durante el proceso. Al cargar datos en tu lake, probablemente usarás una herramienta ETL.
[CTA_MODULE]
Related blog posts
Empieza gratis
Únete a los miles de empresas que usan Fivetran para centralizar y transformar sus datos.






