NathanRoll/global-news-radio-30s
Global News Radio Dataset Multilingual news radio recordings from 51 languages across 42 countries. Recordings 51 Total audio 1500 min (25.0 h) Format MP3 16kHz mono 64kbps Parquet shards 11 Languages 51 Countries 42 Size 687 MB Languages Amharic, Arabic, Bashkir, Basque, Belarusian, Bengali, Brazilian Portuguese,Portugues Do Brasil,Português Brasil, Catalan, Croatian, Czech, Danish, Dutch, English, Estonian, Faroese, Finnish… See the full description on the dataset page: https://huggingface.co/datasets/NathanRoll/global-news-radio-30s.
Global News Radio Dataset
Multilingual news radio recordings from 51 languages across 42 countries.
Languages
Amharic, Arabic, Bashkir, Basque, Belarusian, Bengali, Brazilian Portuguese,Portugues Do Brasil,Português Brasil, Catalan, Croatian, Czech, Danish, Dutch, English, Estonian, Faroese, Finnish, Flemish, French, Georgian, German, Greek, Haitian Creole, Hebrew, Hindi, Hokkien, Hungarian, Icelandic, Indonesian, Japanese, Kazakh, Korean, Kurdish, Latvian, Luganda, Mongolian, Nepali, Norwegian, Ossetian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tamil, Telugu
Usage
from datasets import load_dataset
ds = load_dataset("NathanRoll/global-news-radio-30s")
sample = ds["train"][0]
print(sample["station_name"], sample["language"])Source
Radio Browser API via pyradios. Built with streaming append-only shard uploads — each parquet shard is uploaded once and never re-uploaded.
License
Metadata: CC-BY-4.0. Audio from public radio broadcasts.
