CoolFace
Datasetpublic

kizuna-intelligence/AItuber-Persona-Voices-JA

AItuber Persona Voices JA 195体のAITuberペルソナに対し、キャラクター設定に基づいた声質設計・セリフ生成・音声合成を行ったデータセットです。 概要 項目 値 ペルソナ数 195 総音声ファイル数 20,800 (参照音声195 + 発話20,600) 音声フォーマット WAV, PCM 16-bit, 44.1kHz, mono セリフカテゴリ original, descriptive, emotional 言語 日本語 データ構造 各行は1つの音声ファイルに対応し、以下のカラムを持ちます: カラム 型 説明 persona_id string ペルソナ識別子 (persona_000 ~ persona_194) persona_index int ペルソナインデックス(元データセットの行位置に対応) persona_name string キャラクター名… See the full description on the dataset page: https://huggingface.co/datasets/kizuna-intelligence/AItuber-Persona-Voices-JA.

sourceHugging Facecc-by-4.0updated 6mo agoView on Hugging Face
6likes155downloads
Dataset Card

AItuber Persona Voices JA

195体のAITuberペルソナに対し、キャラクター設定に基づいた声質設計・セリフ生成・音声合成を行ったデータセットです。

概要

項目値
ペルソナ数195
総音声ファイル数~20,800 (参照音声195 + 発話~20,600)
音声フォーマットWAV, PCM 16-bit, 44.1kHz, mono
セリフカテゴリoriginal, descriptive, emotional
言語日本語

データ構造

各行は1つの音声ファイルに対応し、以下のカラムを持ちます:

カラム型説明
persona_idstringペルソナ識別子 (persona_000 ~ persona_194)
persona_indexintペルソナインデックス(元データセットの行位置に対応)
persona_namestringキャラクター名
voice_description_jastring声質の日本語説明
voice_description_zhstring声質の中国語説明(VoiceDesign用)
utterance_indexint発話インデックス(-1 = 参照音声)
utterance_textstring発話テキスト(参照音声の場合は空文字列)
utterance_categorystringカテゴリ: reference, original, descriptive, emotional
audioAudio音声データ (44.1kHz)

セリフカテゴリ

  • —reference: VoiceDesignモデルが生成した参照音声(ペルソナあたり1件)
  • —original: キャラクターの口調・個性が強く出るセリフ(~10件)
  • —descriptive: キャラクターの趣味・知識に関する説明的なセリフ(~47件)
  • —emotional: 喜怒哀楽など感情表現を含むセリフ(~45件)

サンプル音声

ペルソナタグセリフ音声
夜凪 鈴蘭ツンデレ小悪魔 x 高校生べ、別に泣いてるわけじゃないのよ!ただ、涙が溢れただけ!再生
風真 律東北弁 x ギター少年弦の交換は50時間ルールだべ。新品の金属臭が俺の魂を刺激するのさ。再生
蔦宮 縁お嬢様 x 推し活あら、素敵ですわね。その推しグッズ、光の当たる場所に飾るべきですわよ。再生
神宮寺 レンボーイッシュ x ゲーマーおお、それマジかよ!まさかその展開が来るなんて、シナリオにないぞ!再生
久留米 吏理系女子大生 x 味噌汁結論から言うと、今日の味噌汁、具の投入順序が変数だったね。再生

紹介動画: persona_showcase.mp4

使い方

python
from datasets import load_dataset

ds = load_dataset("kizuna-intelligence/AItuber-Persona-Voices-JA", split="train")

# 特定のペルソナの発話を取得
persona_042 = ds.filter(lambda x: x["persona_id"] == "persona_042")

# 参照音声のみ取得
references = ds.filter(lambda x: x["utterance_category"] == "reference")

# 感情的な発話のみ取得
emotional = ds.filter(lambda x: x["utterance_category"] == "emotional")

元データセットとの紐付け

persona_index は DataPilot/AItuber-Personas-Japan の行位置(0-based)に対応しています。

python
from datasets import load_dataset

voices = load_dataset("kizuna-intelligence/AItuber-Persona-Voices-JA", split="train")
personas = load_dataset("DataPilot/AItuber-Personas-Japan", split="train")

# persona_042 の元データを取得
voice_row = voices.filter(lambda x: x["persona_index"] == 42)[0]
original = personas[42]  # concept, system_prompt, thema etc.

紐付けユーティリティスクリプト: link_personas.py

生成パイプライン

本データセットは以下のパイプラインで生成されました:

  1. 1.ペルソナ定義 — DataPilot/AItuber-Personas-Japan から195体のAITuberペルソナ設定を使用
  2. 2.声質設計 & セリフ生成 — Qwen/Qwen3.5-27B でペルソナ設定から声質テキスト記述(日本語・中国語)とキャラクター固有のセリフを生成
  3. 3.参照音声生成 — Qwen/Qwen3-TTS の VoiceDesign 機能で中国語の声質記述から参照音声を生成
  4. 4.発話音声合成 — Aratako/MioTTS-1.7B で参照音声を元に全セリフの音声を合成

ライセンス・クレジット

本データセットは CC-BY-4.0 ライセンスで公開します。

使用したデータセット・モデル

リソース用途ライセンス
DataPilot/AItuber-Personas-Japanペルソナ定義ODC-BY
Qwen/Qwen3.5-27B声質設計・セリフ生成Apache-2.0
Qwen/Qwen3-TTS参照音声生成(VoiceDesign)Apache-2.0
Aratako/MioTTS-1.7B発話音声合成Apache-2.0

注意事項

  • —本データセットの音声はすべてAIにより合成されたものです。実在の人物の音声は含まれていません。
  • —声質設計テキストはLLMにより生成されたものであり、実際の音声特徴と完全に一致するとは限りません。
  • —商用利用については各上流モデル・データセットのライセンス条件も併せてご確認ください。

Citation

bibtex
@dataset{aituber_persona_voices_ja_2026,
  title={AItuber Persona Voices JA},
  author={Kizuna Intelligence},
  year={2026},
  publisher={Hugging Face},
  url={https://huggingface.co/datasets/kizuna-intelligence/AItuber-Persona-Voices-JA}
}