conversion
japanese-conversion
Awesome Japanese IME Training Data
Awesome Japanese Corpus の本文を直接 KyTea で解析し、文脈付きかな漢字変換の
ランキング学習例を作成したデータセットです。中間の読み付きデータセットは
作りません。任意の検証モードでは、抽出範囲についてMeCabの読みとも一致した
例だけを採用できます。
context: 変換対象より前の本文
input: 変換対象のひらがな読み
correct: 元コーパスにある正解表記
incorrect: predict.py で全体または一部分を再変換した誤候補の配列
n_words: 抽出した連続形態素数
source_text と target_start / target_end により、元文章中の抽出位置を
復元できます。元データの利用条件は from と from_license を参照して
ください。
pi0_conversion_no_padThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v2.0",
"robot_type": "panda",
"total_episodes": 1417,
"total_frames": 166855,
"total_tasks": 33,
"total_videos": 0,
"total_chunks": 2,
"chunks_size": 1000,
"fps": 15,
"splits": {
"train": "0:1417"
},
"data_path": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/mlfu7/pi0_conversion_no_pad.pi0_conversionThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v2.0",
"robot_type": "panda",
"total_episodes": 1417,
"total_frames": 166855,
"total_tasks": 33,
"total_videos": 0,
"total_chunks": 2,
"chunks_size": 1000,
"fps": 15,
"splits": {
"train": "0:1417"
},
"data_path": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/mlfu7/pi0_conversion.Emilia-YODAS-Voice-Conversion
Emilia-YODAS-Voice-Conversion
We sample https://huggingface.co/datasets/amphion/Emilia-Dataset YODAS set for voice conversion.
Filter transcriptions based on character repetitiveness and word ngrams.
Filter speaker similarity using https://huggingface.co/nvidia/speakerverification_en_titanet_large during speaker permutation.
Convert audio to speech tokens using https://huggingface.co/neuphonic/neucodec
We also upload the full permutation as zip files.
Speech Tokenizer… See the full description on the dataset page: https://huggingface.co/datasets/Scicom-intl/Emilia-YODAS-Voice-Conversion.Multilingual-TTS-Voice-Conversion
Multilingual-TTS-Voice-Conversion
Convert TTS dataset to become Voice Conversion dataset by doing similarity combination. Multilingual TTS comes from malaysia-ai/Multilingual-TTS
Source code
Source code at https://github.com/Scicom-AI-Enterprise-Organization/Multilingual-TTS/tree/main/vc-tts
Acknowledgement
Special thanks to https://www.scitix.ai/ for H100 Node!
test_mcap_conversionThis dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v2.0",
"robot_type": "rainbow",
"total_episodes": 35,
"total_frames": 5180,
"total_tasks": 1,
"total_videos": 0,
"total_chunks": 1,
"chunks_size": 1000,
"fps": 30,
"splits": {
"train": "0:35"
},
"data_path": "data/chunk-{episode_chunk:03d}/episode_{episode_index:06d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/ccop/test_mcap_conversion.
