CoolFace
Datasetpublic

google/wiki40b

Dataset Card for "wiki40b" Dataset Summary Clean-up text for 40+ Wikipedia languages editions of pages correspond to entities. The datasets have train/dev/test splits per language. The dataset is cleaned up by page filtering to remove disambiguation pages, redirect pages, deleted pages, and non-entity pages. Each example contains the wikidata id of the entity, and the full Wikipedia article after page processing that removes non-content sections and structured… See the full description on the dataset page: https://huggingface.co/datasets/google/wiki40b.

sourceHugging Faceupdated 3y agoView on Hugging Face
37likes11kdownloads
.gitattributes28 linesDownload Raw Back to root
1*.7z filter=lfs diff=lfs merge=lfs -text2*.arrow filter=lfs diff=lfs merge=lfs -text3*.bin filter=lfs diff=lfs merge=lfs -text4*.bin.* filter=lfs diff=lfs merge=lfs -text5*.bz2 filter=lfs diff=lfs merge=lfs -text6*.ftz filter=lfs diff=lfs merge=lfs -text7*.gz filter=lfs diff=lfs merge=lfs -text8*.h5 filter=lfs diff=lfs merge=lfs -text9*.joblib filter=lfs diff=lfs merge=lfs -text10*.lfs.* filter=lfs diff=lfs merge=lfs -text11*.model filter=lfs diff=lfs merge=lfs -text12*.msgpack filter=lfs diff=lfs merge=lfs -text13*.onnx filter=lfs diff=lfs merge=lfs -text14*.ot filter=lfs diff=lfs merge=lfs -text15*.parquet filter=lfs diff=lfs merge=lfs -text16*.pb filter=lfs diff=lfs merge=lfs -text17*.pt filter=lfs diff=lfs merge=lfs -text18*.pth filter=lfs diff=lfs merge=lfs -text19*.rar filter=lfs diff=lfs merge=lfs -text20saved_model/**/* filter=lfs diff=lfs merge=lfs -text21*.tar.* filter=lfs diff=lfs merge=lfs -text22*.tflite filter=lfs diff=lfs merge=lfs -text23*.tgz filter=lfs diff=lfs merge=lfs -text24*.xz filter=lfs diff=lfs merge=lfs -text25*.zip filter=lfs diff=lfs merge=lfs -text26*.zstandard filter=lfs diff=lfs merge=lfs -text27*tfevents* filter=lfs diff=lfs merge=lfs -text28