Funk888/gigaspeech2-th-joined
gigaspeech2-th-joined Thai speech-transcript pairs derived from GigaSpeech 2, re-segmented into clips of a length that is convenient for training speech-language models. Built to train a Thai speech adapter for the Ultravox architecture, where very short fragments make poor training examples but long clips do not fit the context budget. Statistics Examples 40,000 Total audio ~42 hours Sample rate 16 kHz, mono Clip duration 2.0–12.0 s (mean 3.8… See the full description on the dataset page: https://huggingface.co/datasets/Funk888/gigaspeech2-th-joined.
Create README.md
Upload data/train-0007.parquet with huggingface_hub
Upload data/train-0006.parquet with huggingface_hub
Upload data/train-0005.parquet with huggingface_hub
Upload data/train-0004.parquet with huggingface_hub
Upload data/train-0003.parquet with huggingface_hub
Upload data/train-0002.parquet with huggingface_hub
Upload data/train-0001.parquet with huggingface_hub
Upload data/train-0000.parquet with huggingface_hub
initial commit
