Agence Modern Data Stack et Data Engineering

Nous construisons votre data platform, pour des données structurées, documentées et prêtes à être activées.

EdgeAngel est une agence data marketing et IA, et un cabinet de conseil indépendant. Nous intervenons sur la donnée marketing et analytics depuis 2018, en chantier cadré ou en régie auprès de vos équipes.

Ils nous font confiance

Eduservices
Louis Vuitton
Belambra
WeDressFair
LegalPlace
La marque en moins
IZI by EDF
Crédit Agricole
Beauty Success
Mercedes-Benz
Allocab
La Ferme du Mohair
M&A
Guerlain
Le Collectionist
HappyWool
Beemoov
Cerland
Cheval Energy
Citygo
Soulet
Nomadeshop
ETS
Hoff
Kiloutou
Legallais
Gamarde
Smartphone iD
Ponant
Bip&Go
Upcoop
Bostik
Randonades
Devensys
Intersport
Atelier Particulier
Forge Adour
Qonto
Cotesushi
Citeo
Aimigo
Golf One
PonyPower
Finary
Rexel
Orange Bank
Interencheres
Eduservices
Louis Vuitton
Belambra
WeDressFair
LegalPlace
La marque en moins
IZI by EDF
Crédit Agricole
Beauty Success
Mercedes-Benz
Allocab
La Ferme du Mohair
M&A
Guerlain
Le Collectionist
HappyWool
Beemoov
Cerland
Cheval Energy
Citygo
Soulet
Nomadeshop
ETS
Hoff
Kiloutou
Legallais
Gamarde
Smartphone iD
Ponant
Bip&Go
Upcoop
Bostik
Randonades
Devensys
Intersport
Atelier Particulier
Forge Adour
Qonto
Cotesushi
Citeo
Aimigo
Golf One
PonyPower
Finary
Rexel
Orange Bank
Interencheres
Rexel
M&A
WeDressFair
Nomadeshop
Interencheres
Bip&Go
Mercedes-Benz
LegalPlace
Belambra
Devensys
Golf One
Citeo
Legallais
Atelier Particulier
Aimigo
Smartphone iD
Cotesushi
Le Collectionist
Finary
Cerland
Soulet
Intersport
Allocab
Guerlain
Orange Bank
Randonades
Citygo
Louis Vuitton
La marque en moins
Upcoop
Beauty Success
La Ferme du Mohair
Ponant
Cheval Energy
ETS
Bostik
Hoff
HappyWool
PonyPower
Forge Adour
Kiloutou
Eduservices
Crédit Agricole
Gamarde
Qonto
Beemoov
IZI by EDF
Rexel
M&A
WeDressFair
Nomadeshop
Interencheres
Bip&Go
Mercedes-Benz
LegalPlace
Belambra
Devensys
Golf One
Citeo
Legallais
Atelier Particulier
Aimigo
Smartphone iD
Cotesushi
Le Collectionist
Finary
Cerland
Soulet
Intersport
Allocab
Guerlain
Orange Bank
Randonades
Citygo
Louis Vuitton
La marque en moins
Upcoop
Beauty Success
La Ferme du Mohair
Ponant
Cheval Energy
ETS
Bostik
Hoff
HappyWool
PonyPower
Forge Adour
Kiloutou
Eduservices
Crédit Agricole
Gamarde
Qonto
Beemoov
IZI by EDF
ETS
Golf One
Kiloutou
Intersport
Guerlain
Cotesushi
Louis Vuitton
Le Collectionist
Smartphone iD
M&A
Mercedes-Benz
Belambra
Beemoov
Soulet
Forge Adour
Crédit Agricole
Gamarde
Upcoop
Aimigo
Finary
La Ferme du Mohair
Allocab
HappyWool
Bostik
La marque en moins
Citygo
PonyPower
Ponant
Qonto
LegalPlace
Cerland
Eduservices
Devensys
Nomadeshop
Randonades
Atelier Particulier
Cheval Energy
Hoff
Rexel
WeDressFair
IZI by EDF
Legallais
Bip&Go
Orange Bank
Interencheres
Citeo
Beauty Success
ETS
Golf One
Kiloutou
Intersport
Guerlain
Cotesushi
Louis Vuitton
Le Collectionist
Smartphone iD
M&A
Mercedes-Benz
Belambra
Beemoov
Soulet
Forge Adour
Crédit Agricole
Gamarde
Upcoop
Aimigo
Finary
La Ferme du Mohair
Allocab
HappyWool
Bostik
La marque en moins
Citygo
PonyPower
Ponant
Qonto
LegalPlace
Cerland
Eduservices
Devensys
Nomadeshop
Randonades
Atelier Particulier
Cheval Energy
Hoff
Rexel
WeDressFair
IZI by EDF
Legallais
Bip&Go
Orange Bank
Interencheres
Citeo
Beauty Success

Expertises

Data platform, collecte et pipelines : ce que nous prenons en charge

Certains clients nous appellent pour construire de zéro, d'autres ont un entrepôt qui tourne et des chiffres qu'ils ne croient plus, d'autres veulent activer ce qu'ils ont déjà. Nous entrons par le maillon qui manque.

01

Data platform : sélection, migration et setup

Le choix de la plateforme vous engage sur plusieurs années. Il se décide sur vos cas d'usage, vos équipes et votre cloud, et tout se construit dans votre projet.

  • Audit de l'existant : sources, usages réels, coûts, ce qui doit migrer
  • Sélection : BigQuery, Snowflake, Databricks ou Microsoft Fabric, selon votre cloud et vos équipes
  • Setup dans votre projet cloud : environnements, IAM et gouvernance des accès, infrastructure as code
  • Migration depuis un entrepôt on-premise ou un autre cloud, données et modèles, les usages servis pendant la bascule
  • FinOps : coûts de stockage et de requête cadrés dès la conception, puis suivis
  • Conformité RGPD et hébergement en Europe, data lakehouse quand vos volumes le demandent
02

Tracking et compliance

La chaîne commence sur votre site et votre app. Nous concevons la collecte, nous la vérifions et nous l'alignons sur le consentement, et elle arrive dans l'entrepôt avec sa documentation.

  • Plan de marquage : chaque événement, ses paramètres, sa valeur attendue, web et app
  • GTM web et server-side (sGTM) : tags, déclencheurs, hits enrichis
  • CMP et Consent Mode v2 : une collecte alignée sur le consentement, et la preuve
  • Export brut vers l'entrepôt : Google Analytics, Piano, Segment, back-office
  • Recette et monitoring : chaque événement vérifié, des alertes sur les volumes
  • Conformité RGPD et ePrivacy : registre des vendors, hébergement en Europe
03

Ingestion, modélisation et reverse ETL

Synchroniser vos sources, préparer vos données et les renvoyer vers vos outils, avec des flux solides, versionnés et surveillés.

Nous opérons une plateforme d'ingestion pour nos clients, pilotée par API et scriptée : un nouveau périmètre se déploie et se documente en quelques jours. Nous sommes Airbyte Partner, et nous intervenons aussi sur les ETL déjà en place chez vous.

  • ETL et ELT : Airbyte, Fivetran, connecteurs natifs, ou un connecteur écrit pour votre source
  • Synchronisations validées : fréquence, reprises sur incident, historisation, un seul endroit pour savoir si un flux a tourné
  • Modèles dbt ou Dataform : couches brute, préparée et métier, tests, data lineage, historique des versions
  • Couche sémantique et catalogue : chaque définition écrite une fois, lisible par un humain et par un agent
  • Reverse ETL : audiences, conversions et scores renvoyés vers vos régies, votre CRM et vos outils métier
  • Contrôles de fraîcheur, de complétude et d'exactitude, avec des alertes

Le code de transformation vit dans un dépôt versionné, avec son historique. Vous pouvez le lire, le reprendre, ou le confier à quelqu'un d'autre.

04

Expertises outils & technologies

Nos consultants interviennent sur votre stack, quelle qu'elle soit. Les outils les plus fréquents dans nos missions :

Offre de services

Notre accompagnement data engineering, du besoin métier au run

Chaque brique est remplaçable indépendamment des autres. Le choix se fait sur votre cloud, vos équipes et vos cas d'usage, et il se réexamine.

01

Exprimer le besoin métier et cartographier les données

Nous partons de vos questions métier et des décisions qu'elles servent : quels indicateurs, à quelle maille, à quelle fréquence, pour qui. Nous cartographions ensuite les données nécessaires, leurs sources, leurs propriétaires et leurs règles, et nous écrivons les définitions avec les équipes qui les portent. Ce document cadre l'architecture, les flux et l'ordre des chantiers.

Une question métier, un indicateur, une définition, une source. C'est ce tableau qui décide de ce qu'on branche, et dans quel ordre.

02

Centraliser dans un data warehouse

Vos sources remontent dans un entrepôt qui vit dans votre projet cloud : régies, analytics, CRM, back-office, produit. Nous choisissons la méthode source par source, connecteur du marché, export natif ou connecteur écrit pour vous, et nous validons chaque synchronisation : fréquence, reprises sur incident, historisation, contrôles de fraîcheur et de complétude. Un seul endroit dit si un flux a tourné.

Les sources arrivent telles quelles. La normalisation se fait dans l'entrepôt, où elle est relisible.

03

Modéliser les données

La donnée brute devient un chiffre que quelqu'un peut citer en réunion. Nous écrivons vos règles métier en SQL, avec dbt ou Dataform : une couche brute, une couche préparée, des tables métier par usage, des tests de cohérence, le data lineage et l'historique des versions. Le code vit dans un dépôt versionné que vos équipes peuvent lire, reprendre ou confier à quelqu'un d'autre.

La jointure qui relie l'argent encaissé au clic payé, et la règle de calcul telle qu'elle est écrite.

04

Documenter : couche sémantique et catalogue

Chaque table et chaque champ portent leur définition, écrite une fois : ce qu'une conversion compte, comment se calcule un ratio, d'où vient une dimension. Ces définitions vivent dans un catalogue ou une couche sémantique, Knowledge Catalog sur Google Cloud, dbt Semantic Layer ou l'équivalent de votre stack, et jamais dans les tables. Vos analystes, vos dashboards et vos agents IA lisent la même définition, et une règle qui change se corrige à un seul endroit.

La définition est écrite une fois, dans le catalogue. Les tables ne portent aucune règle métier, donc une seule vérité circule.

05

Activer les cas d'usage

La donnée modélisée et documentée repart vers ce qui produit un résultat. La BI et le reporting : des dashboards de pilotage sur une source unique. L'IA et l'agentique : des agents qui interrogent des tables documentées et remontent chaque réponse à sa définition. L'activation data : le reverse ETL vers vos régies, votre CRM et vos outils métier, avec des audiences first-party et des conversions enrichies. Le même chiffre sert l'arbitrage humain et l'enchère automatique.

Le même chiffre sert l'arbitrage humain et l'enchère automatique. C'est ce qui rend les deux cohérents.

06

Faire vivre la chaîne : run, support et formation

Une chaîne de données continue de bouger avec votre activité. Après la mise en production, un consultant reste à vos côtés en run mensuel : il surveille les flux et les coûts, fait évoluer les modèles et le catalogue quand vos sources et vos schémas changent, répond aux questions de vos équipes et les forme sur l'entrepôt, le catalogue et les outils. Les sujets se décident ensemble, et la compétence passe dans votre équipe quand vous voulez reprendre la main.

Le run garde la chaîne fiable et la fait évoluer : un rythme mensuel, des sujets décidés ensemble, et la compétence qui passe dans vos équipes.

Équipe

Un accompagnement data engineering sur mesure

Nous travaillons en autonomie sur le périmètre que vous nous confiez, ou en appui de votre DSI, de vos équipes data et de vos intégrateurs. Le partage se décide au cadrage, et il se réajuste en cours de mission.

Nos profils lead sur nos services data engineering et modern data stack

  • Portrait illustré de Mathieu Lima

    Mathieu Lima

    Directeur Data Foundations et CTO

    Cofondateur

    Ingénieur Télécom SudParis

    Institut Mines-Télécom

  • Portrait illustré d'Olivier Chubilleau

    Olivier Chubilleau

    CEO, co-lead Data Engineering

    Cofondateur

    Institut Mines-Télécom Business School

Nos formats d'intervention

Régie

Un consultant intégré à votre équipe et à vos rituels, pour une durée cadrée.

  • Data engineer, analytics engineer ou data architect, selon le besoin
  • À la journée ou au forfait, au rythme de vos sprints
  • La compétence passe dans votre équipe

Projet

Un chantier avec un périmètre, un calendrier et des livrables nommés.

  • Cadrage, ingestion, modélisation, catalogue et activation
  • Premières données en production en quelques semaines, puis extension
  • Le code, les modèles et la documentation sont chez vous

Nos profils experts

  • Data Engineer Construit et opère les pipelines d'ingestion et l'entrepôt.
  • Analytics Engineer Modélise et documente les données que vos outils et vos agents lisent.
  • Data Architect Dessine l'architecture cible et arbitre les choix techniques.
  • DataOps Engineer Industrialise le déploiement, l'orchestration et la surveillance.
  • Data Analyst Construit les tableaux de bord et les analyses sur le modèle livré.
  • Consultant data marketing Fait le lien entre le besoin métier et la donnée disponible.

L'agence

Un cabinet indépendant de consultants seniors, fondé en 2018.

Des hubs à Paris, Bordeaux et Barcelone. Vous savez qui travaille sur votre compte, et vous parlez directement aux consultants qui le suivent.

Découvrir l'agence
2018
année de création
3
hubs : Paris, Bordeaux, Barcelone
8
partenariats officiels

Témoignages

Ce que nos clients en disent.

  • Avec la solution Capture pour nos reportings et la qualité des consultants, nos bilans de performance sont devenus ultra clairs et pertinents. Cela nous permet de piloter l'activité au quotidien et de nous donner les moyens d'atteindre nos objectifs.
    Blue Horse Group Mathias Pestre-Mazieres

    Mathias Pestre-Mazieres CEO Blue Horse Group

  • Une stratégie d'acquisition qui a parfaitement sécurisé notre haute saison. Grâce à un pilotage fin de la complémentarité Google / Meta, nous avons pu scaler nos volumes avec une rentabilité maîtrisée.
    Forge Adour Lydie Castagnet

    Lydie Castagnet Directrice Marketing & Communication Forge Adour

  • EdgeAngel ne se limite pas à l'achat média, ils donnent du sens aux chiffres. Ils ont su détecter les signaux faibles dans nos données pour transformer notre acquisition et débloquer de nouveaux leviers de performance.
    Golf One 64 Valentine Soulès

    Valentine Soulès Responsable e-commerce Golf One 64

  • Depuis le déploiement de Capture par EdgeAngel, notre équipe SEO a considérablement amélioré la qualité du reporting et l'analyse des opportunités : les rapports sont très performants, avec une granularité très poussée (+30 millions de lignes dans le dataset) et l'adoption par l'équipe est totale.
    Qonto Karim Elmlih

    Karim Elmlih Head of Organic Acquisition – Growth Qonto

  • Partenaires depuis 2018 sur nos enjeux tracking et privacy (Piano, sGTM, RGPD), EdgeAngel allie expertise technique pointue et rigueur. Une extension de notre équipe indispensable pour sécuriser et accélérer nos projets data complexes.
    Kiloutou Cédric Tamboise

    Cédric Tamboise Group Digital & e-Commerce Director Kiloutou

  • Depuis 2021, EdgeAngel sécurise notre tracking Web & App. Leur expertise technique avancée nous a permis de reprendre le contrôle total de nos données pour piloter efficacement l'évolution de nos écosystèmes digitaux.
    Citeo François Charlet

    François Charlet Communication et Marketing Digital Citeo

Solution

Capture : la Data Platform modulaire pour activer vos données Marketing & IA.

Connectez vos outils entre eux et alimentez vos workflows IA et agentiques avec vos données et votre contexte métier. Capture augmente votre infrastructure existante et la rend plus efficiente : vous restez propriétaire des outils et des données.

Découvrir Capture

Questions fréquentes sur la Modern Data Stack

Qu'est-ce qu'une Modern Data Stack ?

Une Modern Data Stack est un ensemble de briques spécialisées qui collectent, centralisent, transforment et activent les données d'une entreprise, reliées par des pipelines automatisés. Chaque brique est remplaçable indépendamment des autres.

Concrètement : l'ingestion amène la donnée, l'entrepôt la stocke, la transformation la met en forme selon vos règles métier, l'activation la renvoie vers vos outils. La gouvernance et la documentation traversent les quatre.

Quels outils composent une Modern Data Stack ?

Une Modern Data Stack s'organise en six catégories :

  • Ingestion et synchronisation : Airbyte, Fivetran, Stitch
  • Stockage et entrepôt : Google BigQuery, Snowflake, Databricks
  • Transformation : dbt, Dataform
  • Activation et reverse ETL : Hightouch, Census, Segment
  • Visualisation et BI : Data Studio, Power BI, Metabase
  • Gouvernance et sémantique : catalogue de données, couche sémantique, data lineage, contrôle des accès, conformité RGPD

Le choix dépend de votre maturité, de vos équipes, de votre cloud et des cas d'usage visés.

Sur les sujets de souveraineté, un socle européen est un critère de décision réel : OVHcloud et Scaleway côté cloud, Didomi côté gestion du consentement. Il se traite au cadrage, avec vos contraintes réglementaires.

Quelle différence entre Modern Data Stack et data platform ?

La Modern Data Stack désigne les briques modulaires qui collectent, transforment et activent la donnée. La data platform désigne le socle technique sur lequel elles reposent : infrastructure cloud, stockage, orchestration, sécurité, gestion des accès.

Les deux se conçoivent ensemble. Une stack posée sur un socle mal cadré coûte cher en exploitation et devient difficile à faire évoluer, et un socle sans usages reste une facture cloud.

BigQuery, Snowflake ou Databricks : comment choisir ?

Le choix se fait sur votre cloud, vos compétences internes et votre profil de coûts. Si vous êtes déjà sur Google Cloud, BigQuery est le chemin court : facturation à la requête, pas de cluster à dimensionner, intégration native avec l'écosystème publicitaire et analytics. Sur AWS ou Azure, ou avec des équipes déjà formées, Snowflake et Databricks ont leurs arguments, notamment sur les charges de calcul lourdes et le machine learning.

Notre expertise la plus profonde est sur BigQuery, et nous le disons. Si votre socle est ailleurs, nous intervenons dessus : la conception du modèle pèse plus lourd que le moteur qui l'exécute.

dbt ou Dataform pour la transformation ?

Les deux font le même travail : écrire des transformations SQL versionnées, testées et documentées. dbt est le standard du marché, avec le plus gros écosystème et la plus grande communauté, souvent le bon choix si vos équipes le connaissent déjà ou si votre entrepôt est ailleurs que sur Google Cloud. Dataform est natif BigQuery, sans licence supplémentaire ni orchestrateur séparé, et il vit dans votre projet Google Cloud.

Nous travaillons avec l'un comme avec l'autre. Ce qui compte davantage : que les modèles soient versionnés, que les règles métier soient écrites et que les tests existent.

À quoi sert une couche sémantique ou un catalogue de données ?

À écrire chaque définition métier une seule fois, hors des tables, et à la rendre lisible par tout ce qui consomme la donnée. Une couche sémantique (semantic layer) porte les métriques et les dimensions : la formule d'un coût par lead, ce qu'une conversion compte, comment un canal se déduit d'une source. Un catalogue de données porte la documentation des tables et des champs, le glossaire métier et le data lineage.

Concrètement, chez nos clients sur Google Cloud, les définitions vivent dans Knowledge Catalog (Dataplex Universal Catalog) et s'appliquent par code, versionnées dans un dépôt. Vos dashboards, vos analystes et vos agents IA lisent la même définition, et une règle qui change se corrige à un seul endroit. Sur une autre stack, dbt Semantic Layer ou le catalogue de votre entrepôt jouent le même rôle.

Une CDP remplace-t-elle une Modern Data Stack ?

Non, elles répondent à deux besoins différents. Une CDP unifie les profils clients et les active vers des outils marketing, avec une interface faite pour des équipes métier. Un entrepôt stocke l'ensemble de vos données, y compris celles qui ne concernent pas le client, et sert autant l'analyse que l'activation.

Trois situations se présentent en pratique. Vous avez une CDP : nous l'intégrons à la chaîne et nous l'alimentons depuis l'entrepôt, ce qui évite qu'elle devienne une deuxième source de vérité. Vous en évaluez une : nous cadrons ce qu'elle apporte face à un entrepôt plus un reverse ETL. Vous préférez vous en passer : la fonction se couvre avec l'entrepôt, la modélisation et l'activation.

Comment savoir si les chiffres qui sortent de la stack sont justes ?

Par un contrôle écrit. Nous publions une réconciliation entre la table exposée aux outils et la vue de production qui fait référence : les mêmes agrégats, sur la même période, ligne par ligne, avec l'écart affiché. Le contrôle rejoue à chaque évolution du modèle.

À côté de ça, les tests de cohérence tournent sur les modèles, les contrôles de fraîcheur et de complétude tournent sur l'ingestion, et le data lineage dit d'où vient chaque champ. Une donnée manquante reste vide et se signale.

Qui possède le code et les données de la stack ?

Vous. Et c'est une question qu'il faut poser à tout prestataire, parce que la réponse varie.

Chez nous : l'entrepôt et les tables modélisées vivent dans votre projet cloud, le code de transformation est versionné dans un dépôt avec son historique, la documentation des modèles est livrée. Si vous reprenez la main ou changez de partenaire, vous partez avec l'ensemble.

Une nuance honnête : selon l'architecture retenue, une partie du flux d'ingestion peut transiter par une plateforme que nous opérons. C'est un choix qui se discute au cadrage, et il se documente.

Combien de temps pour une première chaîne en production ?

Quelques semaines pour un premier périmètre livré et documenté : deux ou trois sources, un entrepôt, un modèle et un usage servi. Quelques mois pour une chaîne complète sur l'ensemble des sources.

Le facteur qui pèse le plus, ce sont les accès. Obtenir les droits sur une régie, un CRM ou un back-office prend souvent plus de temps que de brancher le flux, et ça se prépare dès le cadrage.

Pouvez-vous reprendre une stack existante ?

Oui, et c'est le point de départ de beaucoup de nos projets. Une stack reprise vient avec ses raisons : un prestataire parti, une équipe qui a changé, un chantier arrêté au milieu.

Nous commençons par un état des lieux : ce qui tourne, ce qui a cessé de tourner sans que personne le voie, ce qui est documenté, ce qui coûte. Puis nous décidons avec vous ce qui se garde, ce qui se refait et ce qui s'arrête. Nous savons aussi transférer une stack que nous avons construite vers vos équipes ou vers un autre partenaire.

Contact

Vous laissez vos coordonnées, nous revenons vers vous sous 24h.

Un premier échange pour comprendre votre contexte, et vous dire ce qui est faisable et à quelles conditions.

  1. Infos contact
  2. Définition du besoin
  3. Puis nous programmons un rendez-vous

Vos coordonnées servent à vous répondre sur ce sujet. Politique de protection des données

Ou appelez-nous directement : 01 84 16 42 20

Paul Schmitt

Paul Schmitt

Directeur Conseil

"Notre objectif est de rendre vos données actionnables pour générer de la valeur concrète, rapidement."

L'équipe