CoolFace
Datasetpublic

MisterAI/WM-ENT-API-DUMP_FR_2026.07

Jeux De Données : Dump WikiMedia Français Juillet 2026 : Extraction et Nettoyage Complet Description Ce JDD contient des articles extraits du dump complet de Wikimedia d'août 2026, nettoyés et structurés pour l'entraînement de modèles d'apprentissage automatique. Source originale : Wikimedia Enterprise Licence : CC BY 4.0 Volume initial : 46 Go en tar.gz : ~120-150 Go décompressés Volume final nettoyé : 14.6 Go : 144 fichiers .jsonl Fichiers traités : 144… See the full description on the dataset page: https://huggingface.co/datasets/MisterAI/WM-ENT-API-DUMP_FR_2026.07.

sourceHugging Facecc-by-sa-4.0updated 1d agoView on Hugging Face
0likes70downloads
Dataset Card

Jeux De Données : Dump WikiMedia Français Juillet 2026 : Extraction et Nettoyage Complet

Description

Ce JDD contient des articles extraits du dump complet de Wikimedia d'août 2026, nettoyés et structurés pour l'entraînement de modèles d'apprentissage automatique.

Source originale : Wikimedia Enterprise

Licence : CC BY 4.0

Volume initial : 46 Go en tar.gz : ~120-150 Go décompressés

Volume final nettoyé : 14.6 Go : 144 fichiers .jsonl

Fichiers traités : 144 'Chunk' Compressés en .tar.gz

bash
-rwxr-xr-x 1 MisterAI MisterAI 266M 19 sept. 14:21 frwiki_26.07_chunk_0.tar.gz
-rwxr-xr-x 1 MisterAI MisterAI 315M 19 sept. 15:33 frwiki_26.07_chunk_100.tar.gz
-rwxr-xr-x 1 MisterAI MisterAI 324M 19 sept. 15:34 frwiki_26.07_chunk_101.tar.gz
-rwxr-xr-x 1 MisterAI MisterAI 324M 19 sept. 15:35 frwiki_26.07_chunk_102.tar.gz
-[...]

Contenu et Structure

Chaque entrée du JDD contient les champs suivants (JSONL, une ligne = un article) :

ChampDescription
idIdentifiant numérique de la page MediaWiki
Nom_ArticleTitre exact de l'article
URL_ArticleLien permanent canonique (https://fr.wikipedia.org/wiki/...)
Sujet_ArticleLead (chapeau introductif avant la première section ==)
Texte_ArticleTexte intégral de l'article (toutes sections hors références/Annexes/liens externes)
categoriesListe des catégories [[Catégorie:...]] (noms propres, dédoublonnées)
portailsListe des portails `{{Portail...}}` (noms propres, dédoublonnées)
revision_idID de la révision source
timestampHorodatage de la révision (ISO 8601)

Exemple :

  • —1 ligne unique jsonl Affichée en pretty-print ici pour lisibilité
json
{
  "id": "5958729",
  "Nom_Article": "Engoulevent de Temminck",
  "URL_Article": "https://fr.wikipedia.org/wiki/Engoulevent_de_Temminck",
  "Sujet_Article": "animal\nembranchement\nsous-embranchement\nclasse\nordre\nfamille\ngenre\nanimal\nEurostopodus temminckii (Gould, 1838) (protonyme)\nLyncornis temminckii area.svg\n\nPrésent à l'année.\n\nLC\n\nLEngoulevent de Temminck (Lyncornis temminckii) est une espèce d'oiseaux de la famille des Caprimulgidae.",
  "Texte_Article": "animal\nembranchement\nsous-embranchement\nclasse\nordre\nfamille\ngenre\nanimal\nEurostopodus temminckii (Gould, 1838) (protonyme)\nLyncornis temminckii area.svg\n\nPrésent à l'année.\n\nLC\n\nLEngoulevent de Temminck (Lyncornis temminckii) est une espèce d'oiseaux de la famille des Caprimulgidae.\n\n== Répartition ==\nCet oiseau vit au Brunei, en Indonésie, en Malaisie, à Singapour et en Thaïlande.\n\n== Taxinomie ==\nLa dénomination spécifique, temminckii, commémore le zoologiste néerlandais Coenraad Jacob Temminck.",
  "categories": [
    "Portail:Sciences/Articles liés",
    "Projet:Biologie/Pages liées",
    "Caprimulgidae",
    "Oiseau de Malésie",
    "Oiseau décrit en 1838",
    "Statut UICN Préoccupation mineure",
    "Portail:Biologie/Articles liés",
    "Taxobox utilisant la classification du Congrès ornithologique international",
    "Article utilisant une Infobox",
    "Portail:Ornithologie/Articles liés",
    "Portail:Zoologie/Articles liés",
    "Article avec taxobox-animal",
    "Article à illustrer Taxobox animal"
  ],
  "portails": [
    "ornithologie"
  ],
  "revision_id": "232862472",
  "timestamp": "2026-01-30T02:13:00Z"
}
  • —1 Ligne unique jsonl
json
{"id": "5958729", "Nom_Article": "Engoulevent de Temminck", "URL_Article": "https://fr.wikipedia.org/wiki/Engoulevent_de_Temminck", "Sujet_Article": "animal\nembranchement\nsous-embranchement\nclasse\nordre\nfamille\ngenre\nanimal\nEurostopodus temminckii (Gould, 1838) (protonyme)\nLyncornis temminckii area.svg\n\nPrésent à l'année.\n\nLC\n\nLEngoulevent de Temminck (Lyncornis temminckii) est une espèce d'oiseaux de la famille des Caprimulgidae.", "Texte_Article": "animal\nembranchement\nsous-embranchement\nclasse\nordre\nfamille\ngenre\nanimal\nEurostopodus temminckii (Gould, 1838) (protonyme)\nLyncornis temminckii area.svg\n\nPrésent à l'année.\n\nLC\n\nLEngoulevent de Temminck (Lyncornis temminckii) est une espèce d'oiseaux de la famille des Caprimulgidae.\n\n== Répartition ==\nCet oiseau vit au Brunei, en Indonésie, en Malaisie, à Singapour et en Thaïlande.\n\n== Taxinomie ==\nLa dénomination spécifique, temminckii, commémore le zoologiste néerlandais Coenraad Jacob Temminck.", "categories": ["Portail:Sciences/Articles liés", "Projet:Biologie/Pages liées", "Caprimulgidae", "Oiseau de Malésie", "Oiseau décrit en 1838", "Statut UICN Préoccupation mineure", "Portail:Biologie/Articles liés", "Taxobox utilisant la classification du Congrès ornithologique international", "Article utilisant une Infobox", "Portail:Ornithologie/Articles liés", "Portail:Zoologie/Articles liés", "Article avec taxobox-animal", "Article à illustrer Taxobox animal"], "portails": ["ornithologie"], "revision_id": "232862472", "timestamp": "2026-01-30T02:13:00Z"}

Processus de Nettoyage (Pipeline unique)

L'extraction est réalisée en un seul passage par un Script Python (mwparserfromhell) :

  1. 1.Parsing streaming des chunk tar.gz → dernière révision de chaque page.
  2. 2.Conversion des tableaux Wiki en Markdown (avec titre) avant parsing AST.
  3. 3.Parsing AST complet (mwparserfromhell) → suppression sections parasites (Références, Annexes…), balises <ref>/<gallery>, liens externes.
  4. 4.Dispatch intelligent des templates (≈ 40 patterns) : suppression totale (infobox, navbox, imdb…), conservation du contenu pour le formatage pur (gras, lang, citation…), extraction sémantique pour les cas utiles (date, lien web, ouvrage, démographie, colonne, multiple image…).
  5. 5.Vignettes & WikiTables simples : [[Fichier:…|vignette|desc]] → [IMAGE: desc] ; {{Wikitable|…|…}} → [TABLEAU:\n|…|…|] (premier niveau seulement).
  6. 6.Nettoyage final : liens [[…]], entités HTML, apostrophes wiki, espaces.
  7. 7.Extraction métadonnées (catégories, portails, lead/full_text) + écriture JSONL parallèle.

mwparserfromhell : The MediaWiki Parser From Hell

Remerciements : earwig/mwparserfromhell
Sans mwparserfromhell, deux approches classiques échouent :
Approche naïveRésultat
Regex globales sur le wikitexte brutCasse l'imbrication {{template {{autre}} }}, mange du texte, laisse des artefacts, ne gère pas les tableaux `{}`.
Troncature au lead (première section seulement)Perte de 70–85 % du texte utile (historique, description, tableaux, listes, données chiffrées). Mon premier JDD de juillet faisait cela → 6,2 Go au lieu de ~25 Go exploitables.

[Voir Premier Essai limité à la section introductive : Wiki_FR_2026.07](https://huggingface.co/datasets/MisterAI/Wiki_FR_2026.07)

Avec mwparserfromhell :

mwparserfromhell fournit un puissant parseur AST (Abstract Syntax Tree) qui :

  • —Respecte l'imbrication des {{ }} et [[ ]].
  • —Permet filter_templates(recursive=True) + traitement enfants avant parents (ordre inverse) → les paramètres des templates parents contiennent déjà du texte propre.
  • —Permet filter_tags(), filter_wikilinks(), filter_external_links(), filter_comments() sur l'arbre, pas sur du texte plat.
  • —Rend possible la conversion sémantique de 40+ families de templates au lieu de les jeter.

Résultat concret : chaque article garde la majorité du texte exploitable (sections, tableaux Markdown, légendes d'images, bibliographies structurées, données démographiques, citations) au lieu d'un chapeau de 3 lignes.

  • —NB : Ce n'est pas un outil magique non plus, pour chaque balise a recuperer il faut forger un gestionnaire de balise...

Versions Disponibles

Nom RépertoireTailleNombre de FichiersNombre de lignesPublication
WM-ENT-API-DUMPFR2026.07JDDR_EAv1~100 Mo10 fichiers .jsonl + 1 validation20,356 Lignes✅ Disponible
WM-ENT-API-DUMPFR2026.07JDDR_EAv2~200 Mo10 fichiers .jsonl + 1 validation40,843 Lignes✅ Disponible
WM-ENT-API-DUMPFR2026.07JDDR_EAv3~500 Mo10 fichiers .jsonl + 1 validation101,472 Lignes✅ Disponible
WM-ENT-API-DUMPFR2026.07JDDR_EAv4~1 Go10 fichiers .jsonl + 1 validation202,718 Lignes🕐 À Venir
WM-ENT-API-DUMP_FR_2026.07_JDD_COMPLET~11.5Go144 fichiers .jsonl2,831,463 Lignes🕐 À Venir

Utilisation Recommandée

Ce JDD est adapté à :

  • —L'entraînement de modèles de traitement du langage naturel (LLM, BERT-like, etc.)
  • —L'extraction d'informations et la classification de textes (catégories/portails comme labels faibles)
  • —Les tâches de génération de contenu basées sur des connaissances factuelles (RAG, fine-tuning)
  • —L'analyse structurelle (tables Markdown, listes, citations, données chiffrées)

Note : Le champ Sujet_Article (lead) permet un aperçu rapide ; Texte_Article contient le corps complet nettoyé. Les URLs permettent de remonter à la source pour vérification.


Licence et Attribution

Les données originales de Wikimedia-Enterprise sont distribuées sous la licence :

Sources :

Téléchargements :

Bash
curl -H "Authorization: Bearer ACCESS_TOKEN" -L https://api.enterprise.wikimedia.com/v2/snapshots/frwiki_namespace_0/download --output frwiki.tar.gz

Extraction, nettoyage et structuration réalisés par **MisterAI** avec :

  • —L'assistance de :
  • —PHASE I : Ancien JDD
  • —Devstral/Codestral/Nemotron/NorthCohere/Command A+/DDGAIClaude4.5
  • —PHASE II : Le JDD Actuel
  • —Nemotron
  • —Claude5-Sonnet
  • —L'utilisation de
  • —`mwparserfromhell`