Retour aux questions fréquentes

Qu'est-ce que l'ETL blockchain ?

Mis à jour en août 2026

L'ETL blockchain est la pratique consistant à extraire des données d'une blockchain, à les transformer en une forme exploitable, et à les charger dans un entrepôt de données ou une base de données. C'est le même schéma extract-transform-load utilisé partout ailleurs en ingénierie des données, appliqué à une source aux propriétés inhabituelles.

Si vous avez déjà construit des pipelines de données, les concepts se transposent directement. Il vaut la peine de comprendre les différences avant de supposer que l'outillage se transpose aussi.

En quoi diffère-t-il de l'ETL classique ?

ETL classiqueETL blockchain
SourceBase de données, API, fichiers de logsUne chaîne, via un nœud
HistoriqueGénéralement borné, souvent incrémentalHistorique complet, fréquemment requis dans son intégralité
ImmutabilitéLes enregistrements peuvent être mis à jourLes anciens enregistrements sont définitifs, les récents peuvent être inversés
SchémaDéfini par la sourceDoit être dérivé des ABI de contrats ou des IDL de programmes
VolumeVariableImportant et en croissance permanente

Le problème des réorganisations de chaîne n'a pas de véritable équivalent dans l'ETL classique. Des données déjà chargées peuvent devenir invalides, non pas parce qu'elles ont changé en amont, mais parce que la chaîne a remplacé le bloc dont elles provenaient. Les pipelines qui supposent une justesse en append-only conserveront silencieusement des enregistrements erronés.

Que comporte chaque étape ?

Extract. Récupérer les données brutes de la chaîne. L'approche habituelle consiste à interroger un nœud via JSON-RPC, ce qui est lent et coûteux à l'échelle. L'alternative consiste à instrumenter le nœud pour qu'il émette des données au fur et à mesure de son exécution — c'est ce que fait Firehose, en écrivant tout dans des fichiers plats lisibles en parallèle.

Transform. Décoder les données binaires en enregistrements exploitables. C'est là que l'ABI ou l'IDL est appliqué, que vous filtrez ce qui vous intéresse, et que l'agrégation a lieu. Substreams est un moteur de transformation conçu pour cela, exécutant des modules Rust en parallèle sur des segments historiques.

Load. Écrire vers la destination — Postgres, ClickHouse, BigQuery, Kafka, ou des fichiers dans du stockage objet. En termes Substreams, ce sont des sinks.

Pourquoi l'étape d'extraction est-elle habituellement le goulot d'étranglement ?

Parce que l'approche naïve ne passe pas à l'échelle. Lire l'historique complet d'une chaîne via RPC implique un nombre énorme d'allers-retours séquentiels contre un nœud qui n'a pas été conçu pour cela. Les équipes le découvrent souvent seulement après qu'un backfill tourne depuis une semaine.

Extraire une seule fois vers des fichiers plats inverse l'économie du problème. Le travail coûteux a lieu une seule fois, et chaque consommateur suivant lit des fichiers en parallèle plutôt que de re-requêter. Cela signifie aussi que réexécuter une transformation après un changement de schéma ne nécessite pas de tout ré-extraire.

Qu'en est-il des données que la chaîne n'émet pas ?

C'est ce qui piège les gens. Tout ce qui se passe onchain ne produit pas nécessairement un événement. Une valeur déplacée par un appel interne, des changements dans le stockage d'un contrat, des ajustements de solde — rien de tout cela n'apparaît nécessairement dans les logs.

Si votre pipeline repose uniquement sur les logs, ces données ne sont pas simplement difficiles à obtenir, elles sont absentes. Les méthodes d'extraction qui capturent le détail d'exécution complet — arbres d'appels, changements d'état, changements de solde — sont le seul moyen d'y accéder.


Questions fréquentes

Puis-je utiliser dbt ou Airflow avec des données blockchain ? Oui, une fois les données chargées dans un entrepôt. Le travail spécifique à la chaîne se situe dans l'extraction et la transformation ; l'outillage en aval est classique.

L'ETL blockchain est-il la même chose que l'indexation blockchain ? Globalement, oui. « Indexation » est le terme utilisé dans l'écosystème crypto ; « ETL » décrit la même activité en termes d'ingénierie des données.

Quelle est la partie la plus difficile ? Gérer correctement les réorganisations de chaîne, et obtenir l'historique complet sans un backfill de plusieurs semaines.


Faites l'impasse sur l'étape d'extraction — obtenez une clé API sur thegraph.market, aucune information personnelle requise.

Voir aussi : Qu'est-ce que l'indexation blockchain ? · Comment diffuser des données onchain vers une base de données ? · Qu'est-ce qu'un jeu de données blockchain en fichiers plats ?