hulk10/data_gouv_datasets_catalog-full-documents
🇫🇷 Catalogue des jeux de données de data.gouv.fr – Version structurée Ce dataset constitue une version structurée et exhaustive du catalogue des jeux de données publiés sur data.gouv.fr, la plateforme nationale française de l’open data. Il recense l’ensemble des jeux de données référencés sur la plateforme et fournit leurs métadonnées complètes : titre et description, organisation productrice, licence, couverture spatiale et temporelle, fréquence de mise à jour, formats… See the full description on the dataset page: https://huggingface.co/datasets/hulk10/data_gouv_datasets_catalog-full-documents.
🇫🇷 Catalogue des jeux de données de data.gouv.fr – Version structurée
Ce dataset constitue une version structurée et exhaustive du catalogue des jeux de données publiés sur [data.gouv.fr](https://www.data.gouv.fr), la plateforme nationale française de l’open data.
Il recense l’ensemble des jeux de données référencés sur la plateforme et fournit leurs métadonnées complètes :
- titre et description,
- organisation productrice,
- licence,
- couverture spatiale et temporelle,
- fréquence de mise à jour,
- formats disponibles,
- métriques d’usage (vues, téléchargements, réutilisations),
- informations de moissonnage (harvest).
Les données proviennent du jeu de données officiel publié par data.gouv.fr sur data.gouv.fr.
Ce dataset est conceptuellement lié à une version chunkée et vectorisée du catalogue, conçue pour la recherche sémantique et les usages RAG. La présente version privilégie la fidélité aux métadonnées sources, sans embeddings, afin de faciliter les analyses globales, statistiques et institutionnelles.
🗂️ Contenu du dataset
Le dataset est fourni au format Parquet et contient un unique split train.
Chaque ligne correspond à un jeu de données référencé sur data.gouv.fr, décrit à travers l’ensemble de ses métadonnées publiques.
📊 Schéma des données
🛠️ Méthodologie de constitution
1. 📥 Source des données
Les données sont issues du jeu de données officiel :
- Catalogue des données de data.gouv.fr https://www.data.gouv.fr/datasets/catalogue-des-donnees-de-data-gouv-fr/
Le dataset inclut l’ensemble des jeux de données disposant d’une description suffisamment renseignée, afin de garantir une qualité descriptive minimale.
2. 🧾 Conservation des métadonnées complètes
Contrairement à la version vectorisée :
- aucune troncature sémantique n’est appliquée,
- les descriptions complètes sont conservées,
- l’intégralité des métriques et champs techniques est disponible.
Cette approche est particulièrement adaptée à :
- l’analyse de l’écosystème open data français,
- l’étude des producteurs et thématiques de données,
- la mesure de l’usage et de l’impact des jeux de données,
- la gouvernance et la qualité des métadonnées publiques.
3. 🧠Absence volontaire d’embeddings
Aucun champ d’embedding n’est généré dans cette version.
Cela permet :
- une exploitation neutre et durable des métadonnées,
- des traitements statistiques et analytiques à grande échelle,
- une vectorisation ultérieure adaptée à des cas d’usage spécifiques.
🔗 Lien avec la version vectorisée
Ce dataset est conceptuellement lié au dataset suivant :
Data.gouv.fr Datasets Catalog – version chunkée et vectorisée https://huggingface.co/datasets/AgentPublic/data-gouv-datasets-catalog
Les deux versions peuvent être combinées dans des pipelines avancés (exploration + recherche sémantique).
📚 Source & Licence
đź”— Source
đź“„ Licence
Licence Ouverte Etalab 2.0 Les données sont librement réutilisables sous réserve de mention de la source et de la licence.
📌 Cas d’usage
Ce dataset est particulièrement adapté pour :
- la cartographie de l’offre open data française,
- l’analyse des politiques publiques de données,
- l’étude des producteurs et thématiques de données,
- la mesure de la réutilisation et de l’impact,
- les projets de recherche et d’IA appliqués à l’open data.
