CoolFace
Datasetpublic

hulk10/state_administrations_directory-full-documents

🇫🇷 Référentiel des administrations de l’État – Version structurée Ce dataset regroupe le Référentiel de l’organisation administrative de l’État, publié par la Direction de l’information légale et administrative (DILA).Il recense l’ensemble des administrations, services et organismes de l’État français, avec leurs missions, coordonnées, responsables et relations hiérarchiques. Les données sont issues des sources open data officielles : du portail data.gouv.fr, et du site… See the full description on the dataset page: https://huggingface.co/datasets/hulk10/state_administrations_directory-full-documents.

sourceHugging Faceetalab-2.0updated 7h agoView on Hugging Face
1likes293downloads
Dataset Card

🇫🇷 Référentiel des administrations de l’État – Version structurée

Ce dataset regroupe le Référentiel de l’organisation administrative de l’État, publié par la Direction de l’information légale et administrative (DILA). Il recense l’ensemble des administrations, services et organismes de l’État français, avec leurs missions, coordonnées, responsables et relations hiérarchiques.

Les données sont issues des sources open data officielles :

  • —du portail data.gouv.fr,
  • —et du site institutionnel lannuaire.service-public.fr.

La structure de ce dataset est inspirée du French State Administrations Directory Dataset, qui propose une version enrichie par des embeddings pour la recherche sémantique. Le présent dataset conserve une structuration exhaustive et fidèle aux données sources, sans génération d’embeddings, afin de permettre des usages analytiques, documentaires et institutionnels.


🗂️ Contenu du dataset

Le dataset est fourni au format Parquet et contient un unique split train.

Chaque ligne correspond à une entité administrative de l’État, telle que :

  • —un ministère,
  • —une direction centrale,
  • —un service dĂ©concentrĂ©,
  • —une autoritĂ© administrative,
  • —ou un organisme rattachĂ©.

📊 Schéma des données

ChampTypeDescription
doc_idstringIdentifiant unique de l’entité administrative
typesstringType(s) d’organisme ou de service
namestringNom officiel de l’administration
mission_descriptionstringDescription des missions
addressesstringAdresses postales (structure sérialisée)
phone_numbersstringNuméros de téléphone
mailsstringAdresses électroniques
urlsstringLiens web associés
social_mediasstringComptes sur les réseaux sociaux
mobile_applicationsstringApplications mobiles associées
opening_hoursstringHoraires d’ouverture
contact_formsstringLiens vers formulaires de contact
additional_informationstringInformations complémentaires
modification_datestringDate de dernière mise à jour
siretstringNuméro SIRET
sirenstringNuméro SIREN
people_in_chargestringResponsables et personnes en charge
organizational_chartstringInformations d’organigramme
hierarchystringLiens hiérarchiques avec d’autres entités
directory_urlstringURL de la fiche officielle Service-Public
source_filestringFichier source d’origine
⚠️ Certains champs complexes (adresses, hiérarchie, responsables) sont stockés sous forme sérialisée afin de préserver la structure d’origine.

🛠️ Méthodologie de constitution

1. 📥 Extraction des données

Les données proviennent du Référentiel de l’organisation administrative de l’État maintenu par la DILA. Les fichiers sources (JSON/XML) ont été :

  • —extraits,
  • —normalisĂ©s,
  • —et consolidĂ©s dans un schĂ©ma tabulaire unique.

Les champs d’identification, de contact, de mission et de structure organisationnelle sont conservés sans altération sémantique.


2. 🏛️ Structuration administrative

Chaque entité administrative est décrite selon plusieurs dimensions :

  • —fonctionnelle (missions, compĂ©tences),
  • —organisationnelle (organigramme, hiĂ©rarchie),
  • —opĂ©rationnelle (coordonnĂ©es, horaires, contacts),
  • —institutionnelle (identifiants SIREN/SIRET, rattachements).

Cette structuration permet une exploitation directe pour :

  • —la cartographie administrative,
  • —l’analyse des pĂ©rimètres d’action de l’État,
  • —la qualitĂ© et la cohĂ©rence des services publics.

3. 🧾 Absence volontaire d’embeddings

Contrairement à la version enrichie pour la recherche sémantique :

  • —aucun champ chunk_text n’est gĂ©nĂ©rĂ©,
  • —aucun embedding n’est calculĂ©.

Ce choix vise Ă  :

  • —prĂ©server l’intĂ©gritĂ© documentaire,
  • —faciliter les traitements statistiques, juridiques ou institutionnels,
  • —permettre une vectorisation ultĂ©rieure adaptĂ©e Ă  des besoins spĂ©cifiques.

🔗 Lien avec le dataset de référence vectorisé

Ce dataset est conceptuellement lié au dataset suivant :

French State Administrations Directory Dataset – version chunkée et vectorisée https://huggingface.co/datasets/AgentPublic/state-administrations-directory

Comparaison synthétique :

Version vectoriséePrésente version
Texte synthétiqueDonnées exhaustives
Embeddings BGE-M3Aucun embedding
Recherche sémantiqueAnalyse administrative
Usage RAG / IAUsage institutionnel & analytique

Les deux versions sont complémentaires et peuvent être combinées dans des chaînes de traitement avancées.


📚 Sources & Licence

đź”— Sources

đź“„ Licence

Licence Ouverte Etalab 2.0 Les données sont librement réutilisables, sous réserve de mention de la source et de la licence.


📌 Cas d’usage

Ce dataset est particulièrement adapté pour :

  • —les projets d’IA sur les services publics,
  • —les annuaires administratifs enrichis,
  • —l’analyse de l’organisation de l’État,
  • —la recherche en sciences administratives et politiques,
  • —les outils d’orientation et d’accès aux services publics.