datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
cantonese-life-scenarios-corpus
多用途粤语生活场景语料库
1 项目简介
「多用途粤语生活场景语料库」是一个面向粤语学习、语音识别、语音合成、智能客服、对话系统和大模型训练的生活场景类有声语料库。
本语料库以真实日常生活中的高频表达为基础,围绕问候、感谢、做客、出行、住宿、就餐、购物、逛街、通讯、邮寄、银行、看病、天气、时间、旅游、运动、兴趣爱好、休闲娱乐、求职、工作、校园、租房、美容美发、问路、聚会应酬、约定约会、情绪表达、常用语、聊天、寻求帮助等常见场景,构建约 10,000 句粤语生活表达数据。
每条语料包含普通话文本、粤语文本、粤拼注音及粤语音频,适用于多种粤语人工智能应用场景。
2 目录结构
.
├── README.md # 项目说明文档(数据介绍、字段设计与使用方式)
├── index.csv # 语料索引表(句子级字段与场景信息的汇总)
├── template_pre.jsonl #… See the full description on the dataset page: https://huggingface.co/datasets/leeduckgo/cantonese-life-scenarios-corpus.LifeAudioSingleTurnStreamingCoT
LifeAudioSingleTurnStreamingCoT
Version: vFinal
A single-turn audio dataset with streaming chain-of-thought reasoning for SFT. 822 active training rows with audio references.
Schema
Top-level fields: id, split, modality, turn_type, audio, input, timestamps, streaming, target, taxonomy, quality, source, metadata
audio (path, reference, duration_sec, loadability)
input (text, instruction, length_bucket)
target (reasoning, answer, response)
streaming (checkpoints… See the full description on the dataset page: https://huggingface.co/datasets/skyzhou06/LifeAudioSingleTurnStreamingCoT.LifeAudioMultiTurnStreamingCoT
LifeAudioMultiTurnStreamingCoT
Version: vFinal
A multi-turn audio dataset with streaming chain-of-thought reasoning for SFT. 13349 active training rows with audio references.
Schema
Top-level fields: id, split, modality, turn_type, dialogue, audio, input, streaming, target, taxonomy, quality, source, metadata
dialogue (list of turns with role/text)
audio (path, reference, duration_sec, loadability)
input (instruction, length_bucket)
target (reasoning, answer… See the full description on the dataset page: https://huggingface.co/datasets/skyzhou06/LifeAudioMultiTurnStreamingCoT.mydatasetsaudios_salmonn_0.01percent_sampled
