EdgeAngel est une agence data marketing et IA, et un cabinet de conseil indépendant. Nous intervenons sur la donnée marketing et analytics depuis 2018, en chantier cadré ou en régie auprès de vos équipes.
Data platform, collecte et pipelines : ce que nous prenons en charge
Certains clients nous appellent pour construire de zéro, d'autres ont un entrepôt qui tourne et des chiffres qu'ils ne croient plus, d'autres veulent activer ce qu'ils ont déjà. Nous entrons par le maillon qui manque.
01
Data platform : sélection, migration et setup
Le choix de la plateforme vous engage sur plusieurs années. Il se décide sur vos cas d'usage, vos équipes et votre cloud, et tout se construit dans votre projet.
Audit de l'existant : sources, usages réels, coûts, ce qui doit migrer
Sélection : BigQuery, Snowflake, Databricks ou Microsoft Fabric, selon votre cloud et vos équipes
Setup dans votre projet cloud : environnements, IAM et gouvernance des accès, infrastructure as code
Migration depuis un entrepôt on-premise ou un autre cloud, données et modèles, les usages servis pendant la bascule
FinOps : coûts de stockage et de requête cadrés dès la conception, puis suivis
Conformité RGPD et hébergement en Europe, data lakehouse quand vos volumes le demandent
02
Tracking et compliance
La chaîne commence sur votre site et votre app. Nous concevons la collecte, nous la vérifions et nous l'alignons sur le consentement, et elle arrive dans l'entrepôt avec sa documentation.
Plan de marquage : chaque événement, ses paramètres, sa valeur attendue, web et app
GTM web et server-side (sGTM) : tags, déclencheurs, hits enrichis
CMP et Consent Mode v2 : une collecte alignée sur le consentement, et la preuve
Export brut vers l'entrepôt : Google Analytics, Piano, Segment, back-office
Recette et monitoring : chaque événement vérifié, des alertes sur les volumes
Conformité RGPD et ePrivacy : registre des vendors, hébergement en Europe
Synchroniser vos sources, préparer vos données et les renvoyer vers vos outils, avec des flux solides, versionnés et surveillés.
Nous opérons une plateforme d'ingestion pour nos clients, pilotée par API et scriptée : un nouveau périmètre se déploie et se documente en quelques jours. Nous sommes Airbyte Partner, et nous intervenons aussi sur les ETL déjà en place chez vous.
ETL et ELT : Airbyte, Fivetran, connecteurs natifs, ou un connecteur écrit pour votre source
Synchronisations validées : fréquence, reprises sur incident, historisation, un seul endroit pour savoir si un flux a tourné
Modèles dbt ou Dataform : couches brute, préparée et métier, tests, data lineage, historique des versions
Couche sémantique et catalogue : chaque définition écrite une fois, lisible par un humain et par un agent
Reverse ETL : audiences, conversions et scores renvoyés vers vos régies, votre CRM et vos outils métier
Contrôles de fraîcheur, de complétude et d'exactitude, avec des alertes
Le code de transformation vit dans un dépôt versionné, avec son historique. Vous pouvez le lire, le reprendre, ou le confier à quelqu'un d'autre.
Nos consultants interviennent sur votre stack, quelle qu'elle soit. Les outils les plus fréquents dans nos missions :
BigQuery Data warehouse de Google Cloud : datasets, partitionnement, coûts de requête, exports natifs de Google Analytics et Google Ads.
Snowflake et Databricks Entrepôt et lakehouse sur AWS ou Azure : modélisation, gouvernance des accès, maîtrise des coûts de calcul.
Airbyte Ingestion ELT open source : connecteurs, synchronisations planifiées, plateforme pilotée par API. Nous sommes Airbyte Partner.
dbt Transformation SQL versionnée : modèles, tests, documentation et data lineage, sur tout entrepôt.
Dataform Transformation native BigQuery : SQLX, releases et workflows planifiés, dans votre projet Google Cloud.
Knowledge Catalog Le catalogue de Google Cloud (Dataplex Universal Catalog) : définitions métier, glossaire, aspects et lineage, lisibles par vos équipes et vos agents.
Notre accompagnement data engineering, du besoin métier au run
Chaque brique est remplaçable indépendamment des autres. Le choix se fait sur votre cloud, vos équipes et vos cas d'usage, et il se réexamine.
01
Exprimer le besoin métier et cartographier les données
Nous partons de vos questions métier et des décisions qu'elles servent : quels indicateurs, à quelle maille, à quelle fréquence, pour qui. Nous cartographions ensuite les données nécessaires, leurs sources, leurs propriétaires et leurs règles, et nous écrivons les définitions avec les équipes qui les portent. Ce document cadre l'architecture, les flux et l'ordre des chantiers.
Une question métier, un indicateur, une définition, une source. C'est ce tableau qui décide de ce qu'on branche, et dans quel ordre.
02
Centraliser dans un data warehouse
Vos sources remontent dans un entrepôt qui vit dans votre projet cloud : régies, analytics, CRM, back-office, produit. Nous choisissons la méthode source par source, connecteur du marché, export natif ou connecteur écrit pour vous, et nous validons chaque synchronisation : fréquence, reprises sur incident, historisation, contrôles de fraîcheur et de complétude. Un seul endroit dit si un flux a tourné.
Les sources arrivent telles quelles. La normalisation se fait dans l'entrepôt, où elle est relisible.
03
Modéliser les données
La donnée brute devient un chiffre que quelqu'un peut citer en réunion. Nous écrivons vos règles métier en SQL, avec dbt ou Dataform : une couche brute, une couche préparée, des tables métier par usage, des tests de cohérence, le data lineage et l'historique des versions. Le code vit dans un dépôt versionné que vos équipes peuvent lire, reprendre ou confier à quelqu'un d'autre.
La jointure qui relie l'argent encaissé au clic payé, et la règle de calcul telle qu'elle est écrite.
04
Documenter : couche sémantique et catalogue
Chaque table et chaque champ portent leur définition, écrite une fois : ce qu'une conversion compte, comment se calcule un ratio, d'où vient une dimension. Ces définitions vivent dans un catalogue ou une couche sémantique, Knowledge Catalog sur Google Cloud, dbt Semantic Layer ou l'équivalent de votre stack, et jamais dans les tables. Vos analystes, vos dashboards et vos agents IA lisent la même définition, et une règle qui change se corrige à un seul endroit.
La définition est écrite une fois, dans le catalogue. Les tables ne portent aucune règle métier, donc une seule vérité circule.
05
Activer les cas d'usage
La donnée modélisée et documentée repart vers ce qui produit un résultat. La BI et le reporting : des dashboards de pilotage sur une source unique. L'IA et l'agentique : des agents qui interrogent des tables documentées et remontent chaque réponse à sa définition. L'activation data : le reverse ETL vers vos régies, votre CRM et vos outils métier, avec des audiences first-party et des conversions enrichies. Le même chiffre sert l'arbitrage humain et l'enchère automatique.
Le même chiffre sert l'arbitrage humain et l'enchère automatique. C'est ce qui rend les deux cohérents.
06
Faire vivre la chaîne : run, support et formation
Une chaîne de données continue de bouger avec votre activité. Après la mise en production, un consultant reste à vos côtés en run mensuel : il surveille les flux et les coûts, fait évoluer les modèles et le catalogue quand vos sources et vos schémas changent, répond aux questions de vos équipes et les forme sur l'entrepôt, le catalogue et les outils. Les sujets se décident ensemble, et la compétence passe dans votre équipe quand vous voulez reprendre la main.
Le run garde la chaîne fiable et la fait évoluer : un rythme mensuel, des sujets décidés ensemble, et la compétence qui passe dans vos équipes.
Nous travaillons en autonomie sur le périmètre que vous nous confiez, ou en appui de votre DSI, de vos équipes data et de vos intégrateurs. Le partage se décide au cadrage, et il se réajuste en cours de mission.
Nos profils lead sur nos services data engineering et modern data stack
Mathieu Lima
Directeur Data Foundations et CTO
Cofondateur
Ingénieur Télécom SudParis
Institut Mines-Télécom
Olivier Chubilleau
CEO, co-lead Data Engineering
Cofondateur
Institut Mines-Télécom Business School
Nos formats d'intervention
Régie
Un consultant intégré à votre équipe et à vos rituels, pour une durée cadrée.
Data engineer, analytics engineer ou data architect, selon le besoin
À la journée ou au forfait, au rythme de vos sprints
La compétence passe dans votre équipe
Projet
Un chantier avec un périmètre, un calendrier et des livrables nommés.
Cadrage, ingestion, modélisation, catalogue et activation
Premières données en production en quelques semaines, puis extension
Le code, les modèles et la documentation sont chez vous
Nos profils experts
Data EngineerConstruit et opère les pipelines d'ingestion et l'entrepôt.
Analytics EngineerModélise et documente les données que vos outils et vos agents lisent.
Data ArchitectDessine l'architecture cible et arbitre les choix techniques.
DataOps EngineerIndustrialise le déploiement, l'orchestration et la surveillance.
Data AnalystConstruit les tableaux de bord et les analyses sur le modèle livré.
Consultant data marketingFait le lien entre le besoin métier et la donnée disponible.
L'agence
Un cabinet indépendant de consultants seniors, fondé en 2018.
Des hubs à Paris, Bordeaux et Barcelone. Vous savez qui travaille sur votre compte, et vous parlez directement aux consultants qui le suivent.
Avec la solution Capture pour nos reportings et la qualité des consultants, nos bilans de performance sont devenus ultra clairs et pertinents. Cela nous permet de piloter l'activité au quotidien et de nous donner les moyens d'atteindre nos objectifs.
Mathias Pestre-Mazieres CEO Blue Horse Group
Une stratégie d'acquisition qui a parfaitement sécurisé notre haute saison. Grâce à un pilotage fin de la complémentarité Google / Meta, nous avons pu scaler nos volumes avec une rentabilité maîtrisée.
Lydie Castagnet Directrice Marketing & Communication Forge Adour
EdgeAngel ne se limite pas à l'achat média, ils donnent du sens aux chiffres. Ils ont su détecter les signaux faibles dans nos données pour transformer notre acquisition et débloquer de nouveaux leviers de performance.
Valentine Soulès Responsable e-commerce Golf One 64
Depuis le déploiement de Capture par EdgeAngel, notre équipe SEO a considérablement amélioré la qualité du reporting et l'analyse des opportunités : les rapports sont très performants, avec une granularité très poussée (+30 millions de lignes dans le dataset) et l'adoption par l'équipe est totale.
Karim Elmlih Head of Organic Acquisition – Growth Qonto
Partenaires depuis 2018 sur nos enjeux tracking et privacy (Piano, sGTM, RGPD), EdgeAngel allie expertise technique pointue et rigueur. Une extension de notre équipe indispensable pour sécuriser et accélérer nos projets data complexes.
Cédric Tamboise Group Digital & e-Commerce Director Kiloutou
Depuis 2021, EdgeAngel sécurise notre tracking Web & App. Leur expertise technique avancée nous a permis de reprendre le contrôle total de nos données pour piloter efficacement l'évolution de nos écosystèmes digitaux.
François Charlet Communication et Marketing Digital Citeo
Solution
Capture : la Data Platform modulaire pour activer vos données Marketing & IA.
Connectez vos outils entre eux et alimentez vos workflows IA et agentiques avec vos données et votre contexte métier. Capture augmente votre infrastructure existante et la rend plus efficiente : vous restez propriétaire des outils et des données.
Une Modern Data Stack est un ensemble de briques spécialisées qui collectent, centralisent, transforment et activent les données d'une entreprise, reliées par des pipelines automatisés. Chaque brique est remplaçable indépendamment des autres.
Concrètement : l'ingestion amène la donnée, l'entrepôt la stocke, la transformation la met en forme selon vos règles métier, l'activation la renvoie vers vos outils. La gouvernance et la documentation traversent les quatre.
Quels outils composent une Modern Data Stack ?
Une Modern Data Stack s'organise en six catégories :
Ingestion et synchronisation : Airbyte, Fivetran, Stitch
Stockage et entrepôt : Google BigQuery, Snowflake, Databricks
Transformation : dbt, Dataform
Activation et reverse ETL : Hightouch, Census, Segment
Visualisation et BI : Data Studio, Power BI, Metabase
Gouvernance et sémantique : catalogue de données, couche sémantique, data lineage, contrôle des accès, conformité RGPD
Le choix dépend de votre maturité, de vos équipes, de votre cloud et des cas d'usage visés.
Sur les sujets de souveraineté, un socle européen est un critère de décision réel : OVHcloud et Scaleway côté cloud, Didomi côté gestion du consentement. Il se traite au cadrage, avec vos contraintes réglementaires.
Quelle différence entre Modern Data Stack et data platform ?
La Modern Data Stack désigne les briques modulaires qui collectent, transforment et activent la donnée. La data platform désigne le socle technique sur lequel elles reposent : infrastructure cloud, stockage, orchestration, sécurité, gestion des accès.
Les deux se conçoivent ensemble. Une stack posée sur un socle mal cadré coûte cher en exploitation et devient difficile à faire évoluer, et un socle sans usages reste une facture cloud.
BigQuery, Snowflake ou Databricks : comment choisir ?
Le choix se fait sur votre cloud, vos compétences internes et votre profil de coûts. Si vous êtes déjà sur Google Cloud, BigQuery est le chemin court : facturation à la requête, pas de cluster à dimensionner, intégration native avec l'écosystème publicitaire et analytics. Sur AWS ou Azure, ou avec des équipes déjà formées, Snowflake et Databricks ont leurs arguments, notamment sur les charges de calcul lourdes et le machine learning.
Notre expertise la plus profonde est sur BigQuery, et nous le disons. Si votre socle est ailleurs, nous intervenons dessus : la conception du modèle pèse plus lourd que le moteur qui l'exécute.
dbt ou Dataform pour la transformation ?
Les deux font le même travail : écrire des transformations SQL versionnées, testées et documentées. dbt est le standard du marché, avec le plus gros écosystème et la plus grande communauté, souvent le bon choix si vos équipes le connaissent déjà ou si votre entrepôt est ailleurs que sur Google Cloud. Dataform est natif BigQuery, sans licence supplémentaire ni orchestrateur séparé, et il vit dans votre projet Google Cloud.
Nous travaillons avec l'un comme avec l'autre. Ce qui compte davantage : que les modèles soient versionnés, que les règles métier soient écrites et que les tests existent.
À quoi sert une couche sémantique ou un catalogue de données ?
À écrire chaque définition métier une seule fois, hors des tables, et à la rendre lisible par tout ce qui consomme la donnée. Une couche sémantique (semantic layer) porte les métriques et les dimensions : la formule d'un coût par lead, ce qu'une conversion compte, comment un canal se déduit d'une source. Un catalogue de données porte la documentation des tables et des champs, le glossaire métier et le data lineage.
Concrètement, chez nos clients sur Google Cloud, les définitions vivent dans Knowledge Catalog (Dataplex Universal Catalog) et s'appliquent par code, versionnées dans un dépôt. Vos dashboards, vos analystes et vos agents IA lisent la même définition, et une règle qui change se corrige à un seul endroit. Sur une autre stack, dbt Semantic Layer ou le catalogue de votre entrepôt jouent le même rôle.
Une CDP remplace-t-elle une Modern Data Stack ?
Non, elles répondent à deux besoins différents. Une CDP unifie les profils clients et les active vers des outils marketing, avec une interface faite pour des équipes métier. Un entrepôt stocke l'ensemble de vos données, y compris celles qui ne concernent pas le client, et sert autant l'analyse que l'activation.
Trois situations se présentent en pratique. Vous avez une CDP : nous l'intégrons à la chaîne et nous l'alimentons depuis l'entrepôt, ce qui évite qu'elle devienne une deuxième source de vérité. Vous en évaluez une : nous cadrons ce qu'elle apporte face à un entrepôt plus un reverse ETL. Vous préférez vous en passer : la fonction se couvre avec l'entrepôt, la modélisation et l'activation.
Comment savoir si les chiffres qui sortent de la stack sont justes ?
Par un contrôle écrit. Nous publions une réconciliation entre la table exposée aux outils et la vue de production qui fait référence : les mêmes agrégats, sur la même période, ligne par ligne, avec l'écart affiché. Le contrôle rejoue à chaque évolution du modèle.
À côté de ça, les tests de cohérence tournent sur les modèles, les contrôles de fraîcheur et de complétude tournent sur l'ingestion, et le data lineage dit d'où vient chaque champ. Une donnée manquante reste vide et se signale.
Qui possède le code et les données de la stack ?
Vous. Et c'est une question qu'il faut poser à tout prestataire, parce que la réponse varie.
Chez nous : l'entrepôt et les tables modélisées vivent dans votre projet cloud, le code de transformation est versionné dans un dépôt avec son historique, la documentation des modèles est livrée. Si vous reprenez la main ou changez de partenaire, vous partez avec l'ensemble.
Une nuance honnête : selon l'architecture retenue, une partie du flux d'ingestion peut transiter par une plateforme que nous opérons. C'est un choix qui se discute au cadrage, et il se documente.
Combien de temps pour une première chaîne en production ?
Quelques semaines pour un premier périmètre livré et documenté : deux ou trois sources, un entrepôt, un modèle et un usage servi. Quelques mois pour une chaîne complète sur l'ensemble des sources.
Le facteur qui pèse le plus, ce sont les accès. Obtenir les droits sur une régie, un CRM ou un back-office prend souvent plus de temps que de brancher le flux, et ça se prépare dès le cadrage.
Pouvez-vous reprendre une stack existante ?
Oui, et c'est le point de départ de beaucoup de nos projets. Une stack reprise vient avec ses raisons : un prestataire parti, une équipe qui a changé, un chantier arrêté au milieu.
Nous commençons par un état des lieux : ce qui tourne, ce qui a cessé de tourner sans que personne le voie, ce qui est documenté, ce qui coûte. Puis nous décidons avec vous ce qui se garde, ce qui se refait et ce qui s'arrête. Nous savons aussi transférer une stack que nous avons construite vers vos équipes ou vers un autre partenaire.