
Shutterstock construye una Open Data Infrastructure lista para IA con Fivetran
- Tiempo de integración de datos reducido de 1 sprint a minutos.
- Tiempo de resolución de incidentes en pipelines reducido de semanas a días.
- Habilitación de reportes casi en tiempo real.
- Construcción de una base preparada para el futuro que puede crecer con el negocio y soportar nuevos casos de uso sin tener que rediseñar la arquitectura.
“Una Open Data Infrastructure nos da la flexibilidad de usar la herramienta correcta para cada tarea. Ya sea Snowflake, servicios de AWS o algo nuevo en el futuro, nuestros datos ya están donde tienen que estar, sin tener que moverlos ni reconstruirlos.”
— Jitesh Kumar, Senior Software Development Manager en Shutterstock
Shutterstock es una plataforma creativa líder a nivel global, que ofrece imágenes, videos y música de alta calidad a millones de clientes alrededor del mundo. Tras bambalinas, el negocio corre sobre una arquitectura distribuida de microservicios que impulsa la entrega de contenido, las suscripciones, el licenciamiento y el comercio global a escala.
Dar soporte a este ecosistema requiere una infraestructura de datos altamente confiable. El equipo de data warehouse de Shutterstock se encarga de entregar datos de confianza para reportes internos, analítica de producto e informes financieros, incluido el reconocimiento de ingresos que se usa en las presentaciones ante la SEC.
Conforme el negocio creció, el equipo vio una oportunidad para evolucionar su arquitectura de datos y alinearla mejor con ese crecimiento. Los datos se generaban en docenas de microservicios y sistemas, junto con datos críticos del negocio que se almacenaban en herramientas como Google Sheets. Aunque esto le daba flexibilidad al negocio, integrar y gobernar esos datos requería un esfuerzo significativo de ingeniería. Al mismo tiempo, su enfoque de replicación basado en Debezium introducía vacíos de datos y tiempos de recuperación lentos, lo que hacía difícil cumplir consistentemente con los SLAs y los requerimientos de auditoría.
En lugar de seguir escalando un modelo estrechamente acoplado y centrado en el warehouse, el equipo se propuso adoptar un enfoque más flexible de lakehouse: uno que desacoplara el almacenamiento y el cómputo, mejorara el control sobre los datos y soportara una gama más amplia de casos de uso downstream.
Transición hacia una arquitectura de datos abierta y desacoplada sobre S3
Para apoyar esta transición, Shutterstock adoptó Fivetran Managed Data Lake Service como estándar para la ingesta de datos, construyendo una arquitectura de lakehouse en Amazon S3 con Snowflake como motor de cómputo y de consultas.
“Queríamos desacoplar el almacenamiento del cómputo y mantener el control de nuestros datos. Con Fivetran cargando datos en S3, hemos construido una Open Data Infrastructure que no está atada a ningún proveedor y que puede evolucionar con nosotros a lo largo del tiempo.”
— Jitesh Kumar, Senior Software Development Manager en Shutterstock
Al principio, Fivetran resolvió una necesidad puntual: ingerir de manera confiable los datos de Google Sheets en un entorno gobernado, creando una forma consistente de incorporar datos críticos del negocio como presupuestos y lógica de categorización. Conforme la adopción se expandió, Fivetran reemplazó los pipelines manuales y la replicación basada en Debezium, eliminando los vacíos de datos y mejorando la confiabilidad.
Hoy en día, Fivetran conecta más de 70 microservicios y fuentes de datos a un data lake basado en S3 que usa tablas Iceberg como base (capa bronze). Snowflake sirve como motor de cómputo para consultar esos datos, con dbt impulsando las transformaciones y los modelos curados en la capa final (gold).
Al centralizar los datos crudos en S3, Shutterstock creó una base a la que pueden acceder múltiples equipos y herramientas, sin duplicar ni encerrar los datos en un solo sistema. Los equipos de datos y de IA pueden trabajar directamente desde S3 usando servicios nativos de AWS, mientras que los equipos de negocio siguen confiando en Snowflake para los reportes gobernados.
De semanas a minutos: entrega más rápida, datos más confiables
Con Fivetran, Shutterstock mejoró significativamente tanto la velocidad como la confiabilidad de su plataforma de datos. El equipo redujo el tiempo de integración de datos de semanas de planeación y desarrollo a minutos de configuración. La confiabilidad de los pipelines también mejoró, reduciendo el tiempo de resolución de incidentes de semanas a días y eliminando los vacíos de datos que antes impactaban los SLAs.
Una disponibilidad de datos más predecible y oportuna permitió al equipo comenzar el procesamiento diario más temprano y entregar insights más rápido en todo el negocio. Este cambio ya está habilitando nuevos casos de uso, como visibilidad casi en tiempo real del desempeño del producto: los equipos pueden monitorear lanzamientos y actividad de clientes en minutos, en lugar de esperar los reportes del día siguiente.
Fivetran también fortaleció la capacidad de Shutterstock de cumplir con los requerimientos de auditoría y compliance. Al centralizar los logs de los conectores en Snowflake, el equipo puede consultar el desempeño de los pipelines, hacer seguimiento de las fallas y entregar un rastro de auditoría completo para los reportes financieros.
Posicionamiento para IA y la próxima generación de casos de uso
La arquitectura de Shutterstock está diseñada para ofrecer flexibilidad a largo plazo, no solo ganancias inmediatas. Al mantener los datos crudos en S3 en un formato abierto, el equipo creó una base que soporta múltiples herramientas y motores de procesamiento (desde Snowflake hasta servicios nativos de AWS y plataformas futuras), sin necesidad de duplicar datos ni rediseñar la arquitectura.
Con disponibilidad de datos casi en tiempo real y una arquitectura abierta y desacoplada, Shutterstock está bien posicionada para soportar casos de uso impulsados por IA, analítica avanzada y necesidades de negocio en evolución, todo mientras mantiene la gobernanza y la auditabilidad requeridas para los reportes financieros.
“Al construir una infraestructura de datos lista para IA con Fivetran, no solo estamos mejorando los reportes: estamos habilitando la próxima generación de casos de uso de analítica y de IA sobre datos confiables y en tiempo real.”
— Jitesh Kumar, Senior Software Development Manager en Shutterstock
[CTA_MODULE]




.png)

.png)




