kizuna-intelligence/AItuber-Persona-Voices-JA
AItuber Persona Voices JA 195体のAITuberペルソナに対し、キャラクター設定に基づいた声質設計・セリフ生成・音声合成を行ったデータセットです。 概要 項目 値 ペルソナ数 195 総音声ファイル数 20,800 (参照音声195 + 発話20,600) 音声フォーマット WAV, PCM 16-bit, 44.1kHz, mono セリフカテゴリ original, descriptive, emotional 言語 日本語 データ構造 各行は1つの音声ファイルに対応し、以下のカラムを持ちます: カラム 型 説明 persona_id string ペルソナ識別子 (persona_000 ~ persona_194) persona_index int ペルソナインデックス(元データセットの行位置に対応) persona_name string キャラクター名… See the full description on the dataset page: https://huggingface.co/datasets/kizuna-intelligence/AItuber-Persona-Voices-JA.
AItuber Persona Voices JA
195体のAITuberペルソナに対し、キャラクター設定に基づいた声質設計・セリフ生成・音声合成を行ったデータセットです。
概要
データ構造
各行は1つの音声ファイルに対応し、以下のカラムを持ちます:
セリフカテゴリ
- reference: VoiceDesignモデルが生成した参照音声(ペルソナあたり1件)
- original: キャラクターの口調・個性が強く出るセリフ(~10件)
- descriptive: キャラクターの趣味・知識に関する説明的なセリフ(~47件)
- emotional: 喜怒哀楽など感情表現を含むセリフ(~45件)
サンプル音声
紹介動画: persona_showcase.mp4
使い方
from datasets import load_dataset
ds = load_dataset("kizuna-intelligence/AItuber-Persona-Voices-JA", split="train")
# 特定のペルソナの発話を取得
persona_042 = ds.filter(lambda x: x["persona_id"] == "persona_042")
# 参照音声のみ取得
references = ds.filter(lambda x: x["utterance_category"] == "reference")
# 感情的な発話のみ取得
emotional = ds.filter(lambda x: x["utterance_category"] == "emotional")元データセットとの紐付け
persona_index は DataPilot/AItuber-Personas-Japan の行位置(0-based)に対応しています。
from datasets import load_dataset
voices = load_dataset("kizuna-intelligence/AItuber-Persona-Voices-JA", split="train")
personas = load_dataset("DataPilot/AItuber-Personas-Japan", split="train")
# persona_042 の元データを取得
voice_row = voices.filter(lambda x: x["persona_index"] == 42)[0]
original = personas[42] # concept, system_prompt, thema etc.紐付けユーティリティスクリプト: link_personas.py
生成パイプライン
本データセットは以下のパイプラインで生成されました:
- ペルソナ定義 — DataPilot/AItuber-Personas-Japan から195体のAITuberペルソナ設定を使用
- 声質設計 & セリフ生成 — Qwen/Qwen3.5-27B でペルソナ設定から声質テキスト記述(日本語・中国語)とキャラクター固有のセリフを生成
- 参照音声生成 — Qwen/Qwen3-TTS の VoiceDesign 機能で中国語の声質記述から参照音声を生成
- 発話音声合成 — Aratako/MioTTS-1.7B で参照音声を元に全セリフの音声を合成
ライセンス・クレジット
本データセットは CC-BY-4.0 ライセンスで公開します。
使用したデータセット・モデル
注意事項
- 本データセットの音声はすべてAIにより合成されたものです。実在の人物の音声は含まれていません。
- 声質設計テキストはLLMにより生成されたものであり、実際の音声特徴と完全に一致するとは限りません。
- 商用利用については各上流モデル・データセットのライセンス条件も併せてご確認ください。
Citation
@dataset{aituber_persona_voices_ja_2026,
title={AItuber Persona Voices JA},
author={Kizuna Intelligence},
year={2026},
publisher={Hugging Face},
url={https://huggingface.co/datasets/kizuna-intelligence/AItuber-Persona-Voices-JA}
}