summerMC/coding-excellence-ja
Coding Excellence 日本語版 Fable-5-traces のコーディング性能分布を分析し、そのパターンを日本語で強化注入したコード生成データセット。 📊 概要 項目 値 レコード数 100,000 形式 {"instruction": "...", "input": "...", "output": "..."} ファイルサイズ 714 MB (JSONL, LFS管理) 出力平均長 6,697文字 (日本語CoT + コード) 言語 日本語(指示・思考過程・コメントすべて日本語) ライセンス AGPL-3.0 🎯 特長 指示・思考過程(CoT)・コードコメント:すべて日本語で記述 コードは標準的な英語記法のまま(変数名・API・キーワード) 日本語で「考えながらコードを書く」プロセスを学習可能 Fable-5 の5因子を日本語話者向けに最適化 🧠 5つのコーディング性能因子… See the full description on the dataset page: https://huggingface.co/datasets/summerMC/coding-excellence-ja.
035
Coding Excellence 日本語版
Fable-5-traces のコーディング性能分布を分析し、そのパターンを日本語で強化注入したコード生成データセット。
📊 概要
🎯 特長
- 指示・思考過程(CoT)・コードコメント:すべて日本語で記述
- コードは標準的な英語記法のまま(変数名・API・キーワード)
- 日本語で「考えながらコードを書く」プロセスを学習可能
- Fable-5 の5因子を日本語話者向けに最適化
🧠 5つのコーディング性能因子
📈 コード品質指標
🌐 言語分布
🚀 使い方
import json
# データ読み込み
with open("coding_excellence_ja.jsonl") as f:
data = [json.loads(line) for line in f]
# Hugging Face datasets で読む
from datasets import load_dataset
ds = load_dataset("summerMC/coding-excellence-ja", split="train")
# ChatML形式でファインチューニング(日本語対応モデル用)
train_data = []
for r in ds:
messages = [
{"role": "user", "content": r["instruction"] + ("\n" + r["input"] if r["input"] else "")},
{"role": "assistant", "content": r["output"]},
]
train_data.append({"messages": messages})📋 レコード例
{
"instruction": "堅牢なREST APIサーバを、包括的なエラーハンドリング、入力バリデーション、設定可能な動作とともに作成してください。",
"input": "言語: python\n要件: 設定可能な動作、堅牢なエラーハンドリング、構造化ロギング、入力バリデーション",
"output": "この実装について慎重に考えていきます。REST APIサーバを構築するにあたり...\n\n```python\nimport os\nimport sys\nimport json\nimport logging\n...\n```"
}🧬 Claudeレベル版(新規)
config_name: "claude" で読み込める高性能版。
通常版との違い
読み込み
# Claudeレベルのデータセット
ds = load_dataset("summerMC/coding-excellence-ja", "claude", split="train")
print(len(ds)) # 30000
print(ds[0]["output"][:100]) # CoT開始ファインチューニング
from datasets import load_dataset
ds = load_dataset("summerMC/coding-excellence-ja", "claude", split="train")
train_data = []
for r in ds:
messages = [
{"role": "user", "content": r["instruction"] + "\n" + r["input"]},
{"role": "assistant", "content": r["output"]},
]
train_data.append({"messages": messages})カスタム生成
pip install numpy
python3 coding_excellence_ja_claude_generator.py --records 30000 --output my_claude.jsonl --seed 42📝 ライセンス
AGPL-3.0
🙏 クレジット
- Glint-Research/Fable-5-traces - 元データセット
- summerMC - 分布解析・日本語化・合成生成
