z050209/va-spoken-qa-agentvoice-stage2
Stage-2 spoken-QA training corpus (gemma4_talker) 97,697 train / 935 val spoken QA pairs. Questions: REAL user audio from VoiceAssistant-400K (audio_q.*.tar, filenames match input_audio basenames in the manifests). Answers: synthesized in ONE fixed agent voice (LibriSpeech train-clean-100 narrator ref via ResembleAI/Chatterbox; audio_a.*.tar matching assistant_audio). Manifests carry transcripts, answer text, and GLM-4-Voice speech tokens for both sides (glm_in_tokens question /… See the full description on the dataset page: https://huggingface.co/datasets/z050209/va-spoken-qa-agentvoice-stage2.
08
audio_a.000.tardownload
audio_a.001.tardownload
audio_a.002.tardownload
audio_a.003.tardownload
audio_a.004.tardownload
audio_a.005.tardownload
audio_a.006.tardownload
audio_a.007.tardownload
audio_a.008.tardownload
audio_a.009.tardownload
audio_a.010.tardownload
audio_a.011.tardownload
audio_a.012.tardownload
audio_a.013.tardownload
audio_a.014.tardownload
audio_a.015.tardownload
audio_a.016.tardownload
audio_a.017.tardownload
audio_a.018.tardownload
audio_a.019.tardownload
audio_a.020.tardownload
audio_a.021.tardownload
audio_a.022.tardownload
audio_a.023.tardownload
audio_a.024.tardownload
audio_a.025.tardownload
audio_a.026.tardownload
audio_a.027.tardownload
audio_a.028.tardownload
audio_a.029.tardownload
audio_a.030.tardownload
audio_a.031.tardownload
audio_a.032.tardownload
audio_a.033.tardownload
audio_q.000.tardownload
audio_q.001.tardownload
audio_q.002.tardownload
audio_q.003.tardownload
audio_q.004.tardownload
audio_q.005.tardownload
audio_q.006.tardownload
audio_q.007.tardownload
audio_q.008.tardownload
audio_q.009.tardownload
audio_q.010.tardownload
