mustafakali/UyZh-FolkSpeech
UyZh-FolkSpeech:维吾尔语-汉语平行短句与常用词条数据集(四说话人录音全覆盖) UyZh-FolkSpeech is a Uyghur-Chinese parallel dataset with four-speaker audio coverage for each entry. 相关链接 代码与项目主页(GitHub):https://github.com/kalimustafa/UyZh-FolkSpeech 论文与材料(GitHub 仓库内 paper/):https://github.com/kalimustafa/UyZh-FolkSpeech/tree/main/paper 数据集概述 UyZh-FolkSpeech 面向低资源场景的维吾尔语-汉语语言技术研究与工程落地,覆盖新疆地区常见的民间谚语与日常口语表达,并补充常用词与短语条目。数据可用于: 机器翻译(Uyghur ↔ Chinese) 跨语言检索与对话系统 语音增强 NLP、自动语音识别(ASR)… See the full description on the dataset page: https://huggingface.co/datasets/mustafakali/UyZh-FolkSpeech.
UyZh-FolkSpeech:维吾尔语-汉语平行短句与常用词条数据集(四说话人录音全覆盖)
UyZh-FolkSpeech is a Uyghur-Chinese parallel dataset with four-speaker audio coverage for each entry.
相关链接
- 代码与项目主页(GitHub):https://github.com/kalimustafa/UyZh-FolkSpeech
- 论文与材料(GitHub 仓库内 paper/):https://github.com/kalimustafa/UyZh-FolkSpeech/tree/main/paper
数据集概述
UyZh-FolkSpeech 面向低资源场景的维吾尔语-汉语语言技术研究与工程落地,覆盖新疆地区常见的民间谚语与日常口语表达,并补充常用词与短语条目。数据可用于:
- 机器翻译(Uyghur ↔ Chinese)
- 跨语言检索与对话系统
- 语音增强 NLP、自动语音识别(ASR)
- 语音到文本翻译(Speech-to-Text Translation)等下游任务
数据规模
不可变编号(Immutable IDs)
所有条目均分配不可变 ID,便于版本迭代与可复现引用:
- 短句对:
UYZH-S-* - 词与短语:
UYZH-W-*
建议在任何派生数据、评测切分与模型训练记录中保留 id 字段,以实现稳定追踪。
数据文件与字段设计
推荐使用 TSV(UTF-8 编码)存储文本条目,并用 manifest 映射音频。
文本文件(示例)
data/uyzh_bilingual_pairs.tsv:953 条短句对data/common_words_1031.tsv:1031 条词/短语
建议字段如下: | 字段 | 类型 | 说明 | | --- | --- | --- | | id | string | 不可变记录 ID(UYZH-S-* / UYZH-W-*) | | subset | string | sentence / word_phrase(或更细标签) | | uy | string | 维吾尔文文本(UTF-8) | | zh | string | 中文文本(UTF-8) | | source_type | string | online / field(如已提供) | | tags | string 或 list | 最小主题标签(如已提供) |
音频清单(manifest)
audio/audio_manifest.tsv:文本 ID 与音频文件一一映射(建议)
建议至少包含: | 字段 | 类型 | 说明 | | --- | --- | --- | | id | string | 对应文本条目 ID | | speaker | string | 说话人标识(S01-S04) | | path | string | 音频相对路径(指向仓库内文件) | | duration | float | 时长(秒) | | sample_rate | int | 固定 48000 | | channels | int | 固定 1 | | codec | string | aac-lc | | bitrate | int 或 string | 比特率(如有记录) |
音频规范
- 格式:M4A(AAC-LC)
- 采样率:48 kHz
- 声道:单声道
- 覆盖:每个文本条目提供 4 位母语说话人录音(S01-S04,两男两女)
- 对齐:通过 manifest 实现文本与音频的一一映射,便于复现与下游处理
数据生成与处理流程(Methods 概要)
数据由公开材料与线下采集整理而成,采用统一处理流水线:
- OCR/转写
- 人工校对
- 句级对齐
- 规范化清洗
- 质量检查
并对录音建立清单映射,以支持语音相关任务的可复现使用。
质量控制(Quality Control)
- 全量一致性检查:ID 唯一性、字段完整性、编码与字符集一致性
- 文本规范化:空白与标点统一、异常字符处理、明显错配修订
- 音频检查:格式统一、路径可解析、时长与采样率一致
- 下游友好:保留不可变 ID,便于切分与对比实验
使用方式(Datasets 示例)
说明:如果你希望 Hugging Face Dataset Viewer 可直接预览,请确保仓库中存在可识别的结构化数据文件(如 .tsv/.csv/.json/.parquet),并且音频可通过 manifest 的相对路径访问。
读取 TSV(本地或下载后)
from datasets import load_dataset
ds = load_dataset(
"csv",
data_files={"train": "data/uyzh_bilingual_pairs.tsv"},
delimiter="\t",
split="train"
)
print(ds[0])
