Guides

Conception d'un entrepôt de données : types, architecture et étapes de mise en œuvre

May 16, 2023
Dans cet article, nous verrons comment vous pouvez concevoir un entrepôt de données pour votre entreprise et comment Fivetran peut vous aider à charger des données dans votre entrepôt de données et à les explorer jusqu'au niveau de détail souhaité.

Dans les entreprises, les données sont souvent dispersées entre les différents services et équipes. Des données disparates ne donnent pas aux dirigeants une vue complète et orientée données de la croissance de leur entreprise et des domaines à améliorer. 

Une source unique de vérité est essentielle pour obtenir des informations globales. Par exemple, en centralisant en un seul endroit toutes les données relatives à la gestion de la chaîne d'approvisionnement, au CRM et aux indicateurs de réussite client, une entreprise peut éviter le cloisonnement des réflexions.

Les data warehouses sont des référentiels de données qui consolident les données provenant de sources disparates à des fins de reporting et d'analyse. Les data warehouses unifient les processus d'organisation et de représentation des données, ce qui facilite leur capture, leur partage et leur analyse.

Dans cet article, nous verrons comment concevoir un data warehouse pour votre entreprise et comment Fivetran peut vous aider à charger des données dans votre data warehouse et à explorer le niveau de détail que vous souhaitez. 

Two approaches to designing a data warehouse  

Les deux méthodologies les plus discutées pour la conception d'un data warehouse sont les approches Inmon et Kimball. 

Bill Inmon (Top-down approach)

Dans l'approche descendante (top-down), le data warehouse est conçu en premier, puis ensuite les data marts (structures de données propres à une seule ligne d'activité ou à une équipe de l'entreprise) sont créés. 

Les data engineers extraient d'abord les données des sources de données et les transfèrent vers le data warehouse. Vous pouvez également disposer d'une zone de préparation (staging) pour stocker les données avant qu'elles ne soient déplacées dans un data warehouse. 

Ensuite, vous pouvez extraire les données du data warehouse, appliquer des techniques de synthèse aux données extraites et distribuer ces données aux data marts. L'avantage ici est que, puisque les data marts obtiennent toutes leurs données à partir d'un data warehouse central, les données restent cohérentes car elles proviennent d'un emplacement central. Cependant, cette méthode peut être longue et coûteuse.  

L'approche Inmon est utile si vous avez besoin d'une fonctionnalité d'intégration de données à l'échelle de l'entreprise, si vous disposez d'une grande équipe de spécialistes des données et si vous n'avez pas de contraintes de temps strictes pour l'analyse des données. Par exemple, une compagnie d'assurance pourrait adopter la méthode Inmon car elle offrirait une vue complète de ses clients, du taux de mortalité, de l'historique des sinistres, etc.

Kimball (Bottom-up approach)

Dans l'approche Kimball, les data marts sont créés en premier en fonction des besoins de l'entreprise, puis intégrés dans un data warehouse. Cette approche est également appelée data warehouse dimensionnel, où les systèmes analytiques peuvent accéder directement aux données pour les analyser. 

L'avantage de l'approche Kimball est que vous pouvez créer des data marts rapidement et générer des rapports plus vite. De plus, vous pouvez analyser les données sous tous les angles pour obtenir les informations souhaitées et faire évoluer l'architecture de conception de vos données à mesure que vos besoins métier évoluent.    

Par exemple, vous pouvez créer des data marts pour chaque service, comme les ventes, le marketing, la finance et les RH. Chaque service peut générer des rapports et évoluer facilement en ajoutant de nouveaux data marts. 

Comment les enregistrements sont organisés dans un data warehouse : les schémas

Les bases de données stockent les informations en lignes et en colonnes. Elles sont souvent utilisées pour organiser les données en tableaux ou en feuilles de calcul. Cependant, pour exploiter ces données, les analystes doivent les modéliser et les définir d'une manière spécifique. C'est là qu'interviennent les schémas.

Un schéma de base de données est un ensemble de règles qui définissent la façon dont les données sont organisées au sein d'une base de données. Ces règles déterminent la manière dont les données sont stockées et récupérées dans la base de données. Un schéma permet également aux analystes de comprendre comment différents éléments (tables de dimensions, tables de faits) sont liés au sein d'une base de données. De plus, comme la structure de la base de données est prédéfinie, il est facile pour les analystes d'extraire des données de n'importe quelle source et de les interpréter pour prendre des décisions métier. 

There are three types of schemas.

1. Star schema

Dans un schéma en étoile, le composant central est une table de faits unique. Autour de la table de faits se trouvent des tables de dimensions. 

La table de faits stocke toutes les principales informations métier, généralement sous forme numérique. Les tables de dimensions contiennent quant à elles tous les attributs liés aux données des tables de faits. Par exemple, une table de faits appelée « Sales » peut contenir des références à des attributs tels que l'ID du produit, l'ID de la commande, la quantité, le prix et la remise.

Un schéma en étoile permet d'interroger rapidement et facilement les données à des fins de reporting. Il est conçu pour prendre en charge des requêtes telles que la recherche des clients ayant commandé un article spécifique. 

2. Snowflake

Un schéma en flocon de neige est utile lorsque les entreprises souhaitent interroger des données très complexes pour des analyses avancées

Comme pour la conception d'un schéma en étoile, le schéma en flocon de neige comporte également une table de faits au centre, entourée de plusieurs tables de dimensions. Ici, les tables de dimensions sont en outre reliées à des tables normalisées. 

Ainsi, une table de dimension « date » peut comporter des tables pour le jour, la semaine, le trimestre et le mois. Ces nouvelles tables peuvent se connecter à la table de dimension parente. Cela permet de gérer des requêtes plus complexes. Par exemple, si un client s'intéresse au produit A puis souhaite en savoir plus sur le produit B via un chat en direct, la table de dimension des produits contiendra des informations spécifiques issues de la table de dimension enfant. 

3. Galaxy

Un schéma en galaxie comporte plusieurs tables de faits connectées et mises en correspondance avec plusieurs tables de dimensions, ce qui les rend idéales pour les organisations disposant de structures de données et de bases de données complexes. Dans un schéma en galaxie, la redondance des données est faible, ce qui permet une meilleure qualité des données. Cela facilite des analyses et des rapports performants. 

Data warehouse design architecture 

Jusqu'à récemment, seules les architectures à un et deux niveaux étaient répandues pour les data warehouses. Aujourd'hui, l'architecture à trois niveaux est la plus privilégiée. 

Comme le montre l'image ci-dessus, le niveau inférieur comprend un référentiel de données qui collecte les données de sources disparates. Le référentiel de données peut enregistrer des données provenant de bases de données multidimensionnelles ou relationnelles. Cependant, avant d'être stockées, les données sont transformées dans le cadre du processus Extract, Transform, Load (ETL). 

Data transformation can include:

  • Revising data
  • Data cleansing for formatting compatibility
  • Format conversions
  • Key restructuring
  • Deduplication (finding and removing duplicate data)
  • Data validation 
  • Removing repeat and empty columns 
  • Summarization
  • Sorting, ordering and indexing 
  • Standardization

Le niveau intermédiaire se compose d'un serveur de traitement analytique en ligne (OLAP). L'OLAP fonctionne avec deux types de modèles :

  • Multidimensional online analytical processing (MOLAP): Which involves multiple databases
  • Relational online analytical processing (ROLAP): Which involves relational databases

Le serveur OLAP est une étape cruciale pour les utilisateurs finaux tels que les analystes de données, car il offre une vue abstraite de la base de données et agit comme un intermédiaire entre les utilisateurs et la base de données. Le niveau supérieur est l'interface utilisateur composée d'outils front-end et d'API qui vous aident à extraire les données du data warehouse. Il peut s'agir de n'importe quel outil de data mining, de requête, de reporting et d'analyse.

Types of data warehouse designs 

En fonction des différents besoins métier, il existe plusieurs façons de concevoir vos data warehouses. 

On-prem vs. cloud

Historiquement, l'architecture des data warehouses était principalement réalisée en interne, mais cela s'accompagne de certaines limites :

  • C'est coûteux, car les organisations doivent acheter des serveurs ainsi qu'un espace pour les héberger. 
  • There are additional costs to hire staff to manage servers, locations, etc. 
  • Because it’s self-hosted, scalability can be an issue. 

À l'inverse, de nos jours, les data warehouses cloud sont largement adoptés. Cinquante-quatre pour cent des personnes interrogées lors d'une enquête ont indiqué que le data warehousing cloud est une tendance clé qu'elles souhaitent suivre. Cela s'explique par leurs nombreux avantages"+NB+":

  • There are no hardware or server costs. 
  • La conception est gérée par le fournisseur, qui dispose à son tour d'experts travaillant en coulisses. Cela permet d'économiser considérablement sur les coûts de recrutement. 
  • Ils sont flexibles et chaque entreprise peut les adapter à ses différents cas d'usage. 
  • Speeds up access to data and saves time.
  • Vous ne payez que ce que vous utilisez, ce qui les rend abordables.

Traditional/batch vs. real-time

La conception traditionnelle consiste à charger les données des sources par lots horaires, quotidiens ou hebdomadaires. La méthode par lots était la plus utilisée pour charger les données, mais comme les utilisateurs métier souhaitent voir les informations instantanément, la conception de data warehouses en temps réel devient de plus en plus répandue. 

Dans le modèle d'entreposage de données en temps réel, les données sont chargées en permanence dans l'entrepôt de données et sont mises à la disposition des analystes de données pour créer des rapports et des prévisions. Les utilisateurs finaux obtiennent les informations les plus récentes et prennent des décisions plus rapidement.

Par exemple, un client souhaite obtenir les informations les plus récentes concernant une commande en ligne qu'il a passée ou un directeur des ventes souhaite évaluer les tendances à partir de nouvelles données de vente, ce qui n'est possible que si les données proviennent en temps réel.

Parmi les autres avantages d'un modèle d'entreposage de données en temps réel, citons :

  • Améliore la démocratisation des données, en permettant à chaque membre de l'équipe d'accéder facilement aux données actuelles et historiques dont il a besoin pour accomplir ses tâches et optimiser ses efforts.
  • Crée une base pour des analyses avancées et un apprentissage automatique qui aident à concevoir des expériences client personnalisées.
  • Améliore le rythme auquel une entreprise évolue et peut réagir aux changements.

Étapes de conception d'un entrepôt de données

La conception de chaque entrepôt de données diffère en fonction de divers paramètres commerciaux, cas d'utilisation et exigences. Voici un plan commun que vous pouvez utiliser et modifier.

1. Reconnaître les objectifs commerciaux et les besoins des utilisateurs

La première étape consiste à vous assurer que votre entrepôt de données est compatible avec les processus commerciaux auxquels vous adhérez actuellement. Un autre élément essentiel est de vérifier auprès des parties prenantes de votre organisation quels sont leurs objectifs en matière d'utilisation de l'entrepôt de données. Ensuite, vous devez également connaître les exigences techniques et les normes de conformité que vous devez respecter avant le début de la mise en œuvre.

Enfin, répondre à ces questions peut simplifier la première étape :

  • Combien de sources de données devez-vous intégrer et quel est le volume de données ?
  • À quels besoins commerciaux actuels et futurs l'entrepôt de données répondra-t-il ?
  • À quelles questions l'entrepôt de données aidera-t-il à répondre ou comment l'architecture de l'entrepôt de données résoudra-t-elle les problèmes commerciaux ?

2. Choisissez un modèle de données

Les modèles de données permettent de créer de la documentation pour la mise en œuvre de l'entrepôt de données. Ils aident également les modélisateurs à décider de la manière de structurer les données, d'établir des relations entre les différents points de données et d'établir des mesures clés.

Bien que les ingénieurs de données puissent créer des modèles de données d'entreprise, ce processus prend beaucoup de temps. Par conséquent, une option plus sage consiste à utiliser une solution telle que Cinq trains qui propose des modèles de données prédéfinis. Fivetran normalise automatiquement les données afin de simplifier et d'accélérer la technique de modélisation.

3. Sélectionnez une solution ELT ou ETL

Vous pouvez choisir un processus d'extraction, de transformation, de chargement (ETL) ou un processus d'extraction, de chargement, de transformation (ELT) pour l'intégration des données. Toutefois, CEINTURE est une solution meilleure et plus flexible car elle génère toujours des données brutes et actualisées à des fins d'analyse. Voici plus d'informations sur le différences entre ELT et ETL processus. Notre solution, Fivetran, est dotée de connecteurs de données automatisés dont la configuration ne prend que quelques minutes et qui vous permettent de créer et de gérer efficacement les pipelines de données ELT. Une fois vos modèles et solutions définis, vous pouvez également définir la portée en termes de livrables, de personnes clés pour chaque tâche, de leurs indicateurs de performance clés, de budget et de délais.

4. Créez votre interface de reporting

Comment utiliser les résultats des requêtes de données pour créer intelligence d'affaires Des rapports (BI) ? Cela se fait grâce à des outils de visualisation des données et de création de rapports tels que Power BI et Tableau. Pour cette étape, décidez à quelle fréquence vous souhaitez créer des rapports et qui seront les parties prenantes pour les différents types de rapports afin de pouvoir choisir outil de business intelligence qui répond à vos besoins.

5. Déploiement et réalisation d'évaluations

Une fois toutes les étapes essentielles mises en œuvre, les entreprises peuvent intégrer des données dans leurs outils ELT/ETL, analyser les données et valider les résultats des systèmes de BI.

Comment Fivetran peut vous aider

Fivetran propose un pipeline de données entièrement géré et automatisé. Chaque connecteur SaaS est livré avec des schémas de données normalisés et prêts à l'emploi. Chaque fois que les sources de données changent, ces schémas s'adaptent automatiquement afin que vous obteniez les données les plus récentes.

Cinquante-deux pour cent des responsables informatiques souhaitent un traitement des analyses plus rapide. Une fois que les données atteignent l'entrepôt de données, Fivetran permet de les transformer rapidement et facilement en modèles prêts à être analysés.

Fivetran permet aux entreprises de créer des pipelines à partir de leurs sources de données sans écrire une seule ligne de code. Les data scientists et les ingénieurs n'ont donc pas à se soucier de la construction et de la maintenance de pipelines et à consacrer ce temps à ce qui est essentiel pour l'entreprise.

Cette page a été traduite automatiquement depuis l’anglais. La version originale est disponible ici.

Articles associés

Commencer gratuitement

Rejoignez les milliers d’entreprises qui utilisent Fivetran pour centraliser et transformer leur data.

Thank you! Your submission has been received!
Oops! Something went wrong while submitting the form.