wikimedia/wikidata-title-desc
Wikidata Title and Description Wikidata entity titles and short descriptions for all 324 Wikipedia language editions, extracted from the Wikimedia Analytics wmf.wikidata_entity table. Each row links a Wikidata QID to the title and description as they appear in a specific language edition of Wikipedia. Dataset Details Field Value Source wmf.wikidata_entity (Wikidata + Wikipedia sitelinks) Snapshot 2026-03-30 Languages 324 Total titles 88,292,409… See the full description on the dataset page: https://huggingface.co/datasets/wikimedia/wikidata-title-desc.
Wikidata Title and Description
Wikidata entity titles and short descriptions for all 324 Wikipedia language editions, extracted from the Wikimedia Analytics wmf.wikidata_entity table. Each row links a Wikidata QID to the title and description as they appear in a specific language edition of Wikipedia.
Dataset Details
Schema
Usage
Load all languages:
from datasets import load_dataset
ds = load_dataset("wikimedia/wikidata-title-desc")Load a specific language:
ds = load_dataset("wikimedia/wikidata-title-desc", "ml") # Malayalam
ds = load_dataset("wikimedia/wikidata-title-desc", "en") # English
ds = load_dataset("wikimedia/wikidata-title-desc", "simple") # Simple EnglishFilter to rows that have a description:
ds = load_dataset("wikimedia/wikidata-title-desc", "en")
ds_with_desc = ds.filter(lambda x: x["description"])Language Coverage
Notes
- Descriptions come from Wikidata and may be absent (
nullor empty string) for many articles, especially in smaller language editions. - The
simpleconfig corresponds to Simple English Wikipedia (simplewiki), not a standard BCP-47 code. - Rows with the same
qidacross differentlangconfigs refer to the same Wikidata entity.
Versioning
Each snapshot is tagged in the repository (e.g. snapshot-2026-03-30). To load data from a specific snapshot:
ds = load_dataset("wikimedia/wikidata-title-desc", revision="snapshot-2026-03-30")Source & Attribution
Data is derived from Wikidata and Wikipedia, both licensed under CC BY-SA 4.0.
Extracted using the Wikimedia Analytics Data Lake.
