CoolFace
Datasetpublic

hulk10/data_gouv_datasets_catalog-full-documents

🇫🇷 Catalogue des jeux de données de data.gouv.fr – Version structurée Ce dataset constitue une version structurée et exhaustive du catalogue des jeux de données publiés sur data.gouv.fr, la plateforme nationale française de l’open data. Il recense l’ensemble des jeux de données référencés sur la plateforme et fournit leurs métadonnées complètes : titre et description, organisation productrice, licence, couverture spatiale et temporelle, fréquence de mise à jour, formats… See the full description on the dataset page: https://huggingface.co/datasets/hulk10/data_gouv_datasets_catalog-full-documents.

sourceHugging Faceetalab-2.0updated 17h agoView on Hugging Face
0likes527downloads
Dataset Card

🇫🇷 Catalogue des jeux de données de data.gouv.fr – Version structurée

Ce dataset constitue une version structurée et exhaustive du catalogue des jeux de données publiés sur [data.gouv.fr](https://www.data.gouv.fr), la plateforme nationale française de l’open data.

Il recense l’ensemble des jeux de données référencés sur la plateforme et fournit leurs métadonnées complètes :

  • —titre et description,
  • —organisation productrice,
  • —licence,
  • —couverture spatiale et temporelle,
  • —frĂ©quence de mise Ă  jour,
  • —formats disponibles,
  • —mĂ©triques d’usage (vues, tĂ©lĂ©chargements, rĂ©utilisations),
  • —informations de moissonnage (harvest).

Les données proviennent du jeu de données officiel publié par data.gouv.fr sur data.gouv.fr.

Ce dataset est conceptuellement lié à une version chunkée et vectorisée du catalogue, conçue pour la recherche sémantique et les usages RAG. La présente version privilégie la fidélité aux métadonnées sources, sans embeddings, afin de faciliter les analyses globales, statistiques et institutionnelles.


🗂️ Contenu du dataset

Le dataset est fourni au format Parquet et contient un unique split train.

Chaque ligne correspond à un jeu de données référencé sur data.gouv.fr, décrit à travers l’ensemble de ses métadonnées publiques.


📊 Schéma des données

ChampTypeDescription
idstringIdentifiant unique du jeu de données
slugstringIdentifiant textuel (slug)
titlestringTitre du jeu de données
acronymstringAcronyme (le cas échéant)
urlstringURL du jeu de données sur data.gouv.fr
organizationstringOrganisation productrice
organization_idstringIdentifiant de l’organisation
ownerstringPropriétaire du jeu de données
owner_idstringIdentifiant du propriétaire
descriptionstringDescription complète
description_shortstringDescription courte
frequencystringFréquence de mise à jour
licensestringLicence (ex. Etalab-2.0)
temporal_coverage.startstringDébut de la couverture temporelle
temporal_coverage.endstringFin de la couverture temporelle
spatial.granularitystringGranularité spatiale
spatial.zonesstringZones géographiques couvertes
featuredboolJeu de données mis en avant
created_atstringDate de création
last_modifiedstringDernière modification
tagsstringMots-clés
archivedstringIndique si le dataset est archivé
resources_countintNombre total de ressources
main_resources_countintNombre de ressources principales
resources_formatsstringFormats disponibles
harvest.backendstringBackend de moissonnage
harvest.domainstringDomaine source
harvest.created_atstringDate de création du harvest
harvest.modified_atstringDate de mise Ă  jour du harvest
harvest.remote_urlstringURL distante moissonnée
quality_scorefloatScore de qualité data.gouv.fr
metric.discussionsintNombre de discussions
metric.discussions_openintDiscussions ouvertes
metric.reusesintNombre de réutilisations
metric.reuses_by_monthsstringHistorique mensuel des réutilisations
metric.dataservicesintNombre de data services
metric.followersintNombre d’abonnés
metric.followers_by_monthsstringHistorique mensuel des abonnés
metric.viewsintNombre de vues
metric.resources_downloadsfloatNombre de téléchargements
source_filestringFichier source d’origine

🛠️ Méthodologie de constitution

1. 📥 Source des données

Les données sont issues du jeu de données officiel :

  • —Catalogue des donnĂ©es de data.gouv.fr https://www.data.gouv.fr/datasets/catalogue-des-donnees-de-data-gouv-fr/

Le dataset inclut l’ensemble des jeux de données disposant d’une description suffisamment renseignée, afin de garantir une qualité descriptive minimale.


2. 🧾 Conservation des métadonnées complètes

Contrairement à la version vectorisée :

  • —aucune troncature sĂ©mantique n’est appliquĂ©e,
  • —les descriptions complètes sont conservĂ©es,
  • —l’intĂ©gralitĂ© des mĂ©triques et champs techniques est disponible.

Cette approche est particulièrement adaptée à :

  • —l’analyse de l’écosystème open data français,
  • —l’étude des producteurs et thĂ©matiques de donnĂ©es,
  • —la mesure de l’usage et de l’impact des jeux de donnĂ©es,
  • —la gouvernance et la qualitĂ© des mĂ©tadonnĂ©es publiques.

3. 🧠 Absence volontaire d’embeddings

Aucun champ d’embedding n’est généré dans cette version.

Cela permet :

  • —une exploitation neutre et durable des mĂ©tadonnĂ©es,
  • —des traitements statistiques et analytiques Ă  grande Ă©chelle,
  • —une vectorisation ultĂ©rieure adaptĂ©e Ă  des cas d’usage spĂ©cifiques.

🔗 Lien avec la version vectorisée

Ce dataset est conceptuellement lié au dataset suivant :

Data.gouv.fr Datasets Catalog – version chunkée et vectorisée https://huggingface.co/datasets/AgentPublic/data-gouv-datasets-catalog
Version vectoriséePrésente version
Texte synthétiqueMétadonnées complètes
Embeddings BGE-M3Aucun embedding
Recherche sémantique / RAGAnalyse open data
Indexation IAGouvernance & statistiques

Les deux versions peuvent être combinées dans des pipelines avancés (exploration + recherche sémantique).


📚 Source & Licence

đź”— Source

đź“„ Licence

Licence Ouverte Etalab 2.0 Les données sont librement réutilisables sous réserve de mention de la source et de la licence.


📌 Cas d’usage

Ce dataset est particulièrement adapté pour :

  • —la cartographie de l’offre open data française,
  • —l’analyse des politiques publiques de donnĂ©es,
  • —l’étude des producteurs et thĂ©matiques de donnĂ©es,
  • —la mesure de la rĂ©utilisation et de l’impact,
  • —les projets de recherche et d’IA appliquĂ©s Ă  l’open data.