CoolFace
Datasetpublic

BabyLM-community/babylm-ko-subtitles

babylm-ko Dataset Description This dataset is part of the BabyLM multilingual collection. Dataset Summary Language: ko Script: Korean (Hangul + Han) Category: subtitles Source: Unknown Age Estimate: n/a Number of Documents: 7909 Total Tokens: 34475400 Tokens Per Category subtitles: 34475400 tokens Data Fields text: The document text category: Type of content (e.g., child-directed-speech, educational, etc.)… See the full description on the dataset page: https://huggingface.co/datasets/BabyLM-community/babylm-ko-subtitles.

sourceHugging Faceunknownupdated 1y agoView on Hugging Face
0likes16downloads
7 commits on main
dbbbec51y ago

Upload dataset_metadata.json with huggingface_hub

haznitrama
0dd27111y ago

Upload README.md with huggingface_hub

haznitrama
0880ba51y ago

Upload dataset

haznitrama
78098bc1y ago

Upload dataset_metadata.json with huggingface_hub

haznitrama
f953d4b1y ago

Upload README.md with huggingface_hub

haznitrama
20e1a781y ago

Upload dataset

haznitrama
c373be31y ago

initial commit

haznitrama