CoolFace
Datasetpublic

NathanRoll/global-news-radio-30s

Global News Radio Dataset Multilingual news radio recordings from 51 languages across 42 countries. Recordings 51 Total audio 1500 min (25.0 h) Format MP3 16kHz mono 64kbps Parquet shards 11 Languages 51 Countries 42 Size 687 MB Languages Amharic, Arabic, Bashkir, Basque, Belarusian, Bengali, Brazilian Portuguese,Portugues Do Brasil,Português Brasil, Catalan, Croatian, Czech, Danish, Dutch, English, Estonian, Faroese, Finnish… See the full description on the dataset page: https://huggingface.co/datasets/NathanRoll/global-news-radio-30s.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
0likes638downloads
Dataset Card

Global News Radio Dataset

Multilingual news radio recordings from 51 languages across 42 countries.

Recordings51
Total audio1500 min (25.0 h)
FormatMP3 16kHz mono 64kbps
Parquet shards11
Languages51
Countries42
Size687 MB

Languages

Amharic, Arabic, Bashkir, Basque, Belarusian, Bengali, Brazilian Portuguese,Portugues Do Brasil,Português Brasil, Catalan, Croatian, Czech, Danish, Dutch, English, Estonian, Faroese, Finnish, Flemish, French, Georgian, German, Greek, Haitian Creole, Hebrew, Hindi, Hokkien, Hungarian, Icelandic, Indonesian, Japanese, Kazakh, Korean, Kurdish, Latvian, Luganda, Mongolian, Nepali, Norwegian, Ossetian, Persian, Polish, Portuguese, Romanian, Russian, Serbian, Slovak, Slovenian, Spanish, Swahili, Swedish, Tamil, Telugu

Usage

python
from datasets import load_dataset
ds = load_dataset("NathanRoll/global-news-radio-30s")
sample = ds["train"][0]
print(sample["station_name"], sample["language"])

Source

Radio Browser API via pyradios. Built with streaming append-only shard uploads — each parquet shard is uploaded once and never re-uploaded.

License

Metadata: CC-BY-4.0. Audio from public radio broadcasts.