CoolFace
Datasetpublic

Funk888/gigaspeech2-th-joined

gigaspeech2-th-joined Thai speech-transcript pairs derived from GigaSpeech 2, re-segmented into clips of a length that is convenient for training speech-language models. Built to train a Thai speech adapter for the Ultravox architecture, where very short fragments make poor training examples but long clips do not fit the context budget. Statistics Examples 40,000 Total audio ~42 hours Sample rate 16 kHz, mono Clip duration 2.0–12.0 s (mean 3.8… See the full description on the dataset page: https://huggingface.co/datasets/Funk888/gigaspeech2-th-joined.

sourceHugging Faceupdated 17d agoView on Hugging Face
1likes119downloads
10 commits on main
354973117d ago

Create README.md

Funk888
3ad096c4mo ago

Upload data/train-0007.parquet with huggingface_hub

Funk888
ae468cf4mo ago

Upload data/train-0006.parquet with huggingface_hub

Funk888
30f221a4mo ago

Upload data/train-0005.parquet with huggingface_hub

Funk888
7293c544mo ago

Upload data/train-0004.parquet with huggingface_hub

Funk888
d0f5d264mo ago

Upload data/train-0003.parquet with huggingface_hub

Funk888
ac64cd74mo ago

Upload data/train-0002.parquet with huggingface_hub

Funk888
6d6ecc64mo ago

Upload data/train-0001.parquet with huggingface_hub

Funk888
570c2eb4mo ago

Upload data/train-0000.parquet with huggingface_hub

Funk888
8e668ed4mo ago

initial commit

Funk888