CoolFace
Datasetpublic

k0ndra/imatrix-ja-en

Japanese-English imatrix Calibration Data imatrix計算用のキャリブレーションデータです。日本語LLMのGGUF量子化品質向上を目的として作成しました。 本データセットは下記「ライセンス」欄に記載したデータセット群から派生した二次的著作物です。 構成 カテゴリ 割合 内容 ja_general 35% 日本語一般文章 ja_qa 20% 日本語Q&A・対話 ja_technical 10% 日本語技術・学術文 code 15% プログラムコード en_reasoning 15% 英語推論・知識文 structured 5% SQL・構造化データ 目標トークン数/チャンク: 512 ファイル ファイル チャンク数 用途 imatrix-ja-en-500-shuffled.txt 500 チャンクをシャッフル済み(推奨)… See the full description on the dataset page: https://huggingface.co/datasets/k0ndra/imatrix-ja-en.

sourceHugging Facecc-by-sa-4.0updated 6mo agoView on Hugging Face
0likes44downloads
Dataset Card

Japanese-English imatrix Calibration Data

imatrix計算用のキャリブレーションデータです。 日本語LLMのGGUF量子化品質向上を目的として作成しました。

本データセットは下記「ライセンス」欄に記載したデータセット群から派生した二次的著作物です。

構成

カテゴリ割合内容
ja_general35%日本語一般文章
ja_qa20%日本語Q&A・対話
ja_technical10%日本語技術・学術文
code15%プログラムコード
en_reasoning15%英語推論・知識文
structured5%SQL・構造化データ
  • 目標トークン数/チャンク: 512

ファイル

ファイルチャンク数用途
imatrix-ja-en-500-shuffled.txt500チャンクをシャッフル済み(推奨)
imatrix-ja-en-500-raw.txt500カテゴリ順
imatrix-ja-en-1000-shuffled.txt1,000チャンクをシャッフル済み(推奨)
imatrix-ja-en-1000-raw.txt1,000カテゴリ順
imatrix-ja-en-2000-shuffled.txt2,000チャンクをシャッフル済み(推奨)
imatrix-ja-en-2000-raw.txt2,000カテゴリ順

※ 余談ですが、本当にシャッフルした方が良いのかは定かではありません。一種のおまじないです。ちなみに _raw 版はカテゴリ順(日本語→英語)に並んでいますが、「英語→日本語の順で読ませた方が良い」という説もあります。

トークン統計

取得済みチャンク総数推定総トークン数チャンク平均トークン
500283,336 (0.28M)566
1,000571,187 (0.57M)571
2,0001,140,364 (1.14M)570

ライセンス

本データセット全体は CC BY-SA 4.0 のもとで公開されています。 CC BY-SA 4.0 のライセンス全文: https://creativecommons.org/licenses/by-sa/4.0/

本データセットは複数のソースから派生した二次的著作物であり、各ソース素材には元のライセンスが引き続き適用されます。本データセットの利用者は、CC BY-SA 4.0 の条件に加え、各ソースの元ライセンスの条件(著作権表示の保持等)も遵守する必要があります。

使用したデータセットと帰属

以下は本データセットの生成に実際に使用したソースの一覧です。

ライセンス構造の説明

本データセットは以下の構造で公開されています。

  • CC BY-SA 系素材(Wikipedia, databricks-dolly-15k-ja)および CC BY 素材(code_contests, mbpp, sql-create-context)から派生した部分: CC BY-SA 4.0 が適用されます。CC BY 4.0 は CC BY-SA 4.0 と互換であり、CC BY-SA 4.0 の派生物として公開できます。
  • Apache 2.0 素材(oasst2-33k-ja)から取り込んだ部分: Apache 2.0 は派生物への CC BY-SA 4.0 適用を禁止しませんが、元のライセンスの条件(著作権表示の保持等)は引き続き有効です。
  • データセット作成者自身の貢献部分(選択・配置・加工等): CC BY-SA 4.0 で提供されます。

利用者は CC BY-SA 4.0 の条件を遵守することで本データセット全体を利用できますが、Apache 2.0 由来の部分については元ライセンスの著作権表示を保持してください。

CC BY-SA 3.0 → 4.0 について

databricks-dolly-15k-ja のライセンスである CC BY-SA 3.0 は、CC BY-SA 4.0 との互換性が Creative Commons によって認められており、CC BY-SA 4.0 の派生物として公開することが可能です。 参照: https://creativecommons.org/share-your-work/licensing-considerations/compatible-licenses/

著作権表示 (Copyright Notices)

以下のライセンスは著作権表示の保持を条件としています。

Wikipedia (CC BY-SA 4.0)

CC BY-SA 4.0 の条件に基づき、原著作者のクレジットを表示します。各記事の著作権は各執筆者に帰属します。

kunishou/databricks-dolly-15k-ja (CC BY-SA 3.0)
deepmind/code_contests (CC BY 4.0)
google-research-datasets/mbpp (CC BY 4.0)
b-mc2/sql-create-context (CC BY 4.0)
Apache License 2.0
  • llm-jp/oasst2-33k-ja: Copyright LLM-jp Contributors — Apache License 2.0 上流データセット:
  • kunishou/oasst2-135k-ja — OpenAssistant/oasst2 の DeepL 日本語翻訳
  • OpenAssistant/oasst2 — Apache License 2.0, Copyright LAION-AI / OpenAssistant Contributors

Apache License 2.0 の全文は https://www.apache.org/licenses/LICENSE-2.0 を参照してください。