kojikojiprg/ai-theories-corpus-en-pretraining
ai-theories en コーパス ai-theories(https://github.com/kojikojiprg/ai-theories)プロジェクトの成果物。 006(小型 GPT の事前学習)・008 の英語条件用のコーパス。 ライセンスについての注記 このデータセット自体のライセンスは クリエイティブ・コモンズ 表示-継承 4.0 国際 (CC BY-SA 4.0) である。ai-theoriesの他の成果物(トークナイザなど)は cc-by-nc-4.0を採用しているが、本データセットの内容はフリー百科事典 『ウィキペディア(Wikipedia)』の本文そのもの(wikitext を平文に変換したのみで、 内容は改変していない)であり、Wikipedia 本文自体のライセンス(CC BY-SA 4.0、 表示・継承の条件)を継承する必要があるため、別のライセンスとしている。 由来… See the full description on the dataset page: https://huggingface.co/datasets/kojikojiprg/ai-theories-corpus-en-pretraining.
ai-theories en コーパス
ai-theories(https://github.com/kojikojiprg/ai-theories)プロジェクトの成果物。 006(小型 GPT の事前学習)・008 の英語条件用のコーパス。
ライセンスについての注記
このデータセット自体のライセンスは クリエイティブ・コモンズ 表示-継承 4.0 国際 (CC BY-SA 4.0) である。ai-theoriesの他の成果物(トークナイザなど)は cc-by-nc-4.0を採用しているが、本データセットの内容はフリー百科事典 『ウィキペディア(Wikipedia)』の本文そのもの(wikitext を平文に変換したのみで、 内容は改変していない)であり、Wikipedia 本文自体のライセンス(CC BY-SA 4.0、 表示・継承の条件)を継承する必要があるため、別のライセンスとしている。
由来
src/data/wikipedia_manifests/en_006_pretraining.json (記事タイトル・リビジョン ID を固定したマニフェスト、 356 記事)から、Wikimedia API (action=parse、oldidでリビジョンを指定)で取得した。タイトルとリビジョン ID を 両方固定しているため、取得時点によらず同一の入力が得られる。
- マニフェスト記事数: 356
- 取得できた記事数: 356
取得できなかった記事:
なし(すべての記事を取得できた)
バージョン管理についての注記
このリポジトリ名(kojikojiprg/ai-theories-corpus-en-pretraining)には、マニフェストの版数や記事数を含めない。 将来、同じ言語で異なるマニフェスト(記事数や選定基準が異なるコーパス)が必要に なった場合は、新しいリポジトリを作らずブランチで管理する。 現在このリポジトリが 対象としているマニフェストはen_006_pretraining.json(356 記事)であり、これは上記「由来」節と本カードの記載からのみ判別できる(リポジトリ名 からは判別できない)。
このコーパスは、上記の方針の例外である。ブランチで管理する場合、呼び出し側が revision の指定を省略・失念すると、既定ブランチ(kojikojiprg/ai-theories-corpus-enのmain、en_009_scaling.json、9826 記事)が静かに解決されてしまい、意図した本コーパス(en_006_pretraining.json、356 記事)とは異なる記事集合のまま取得自体はエラーにならず、実験がそのまま進んでしまう。リポジトリを分けておけば、この種の取り違え(誤ったリポジトリ ID の指定)は取得失敗として顕在化する。静かに誤ったコーパスを返すより、失敗として顕在化する構成を優先し、独立したリポジトリとした。
研究・教育目的で構築したものであり、品質保証は行っていない。商用・実運用での利用は 想定しない。
構成
このリポジトリはcorpus.txtとmetadata.jsonの 2 ファイルからなる(以前は単一の corpus.jsonだったが、コーパス全文を JSON 文字列として保持すると二重にメモリを 消費するため、Google Colab の RAM 制約(12 GB)に対応してプレーンテキストと メタデータに分離した)。コーパス全文が必要な場合は`corpus.txt`を、由来や バイト数などのメタデータのみが必要な場合は`metadata.json`を読めばよい。
corpus.txtは、取得できた記事本文を連結した全文をそのまま UTF-8 のプレーンテキスト として格納したファイルである。
metadata.jsonは以下のフィールドを含む。
language: 言語コード(en)manifest: 記事タイトル・リビジョン ID の対応を記したマニフェストファイル名 (en_006_pretraining.json)manifest_article_count: マニフェストに列挙された記事数fetched_article_count: 実際に取得できた記事数skipped_articles: 取得に失敗した記事(タイトル・理由)のリストvalidation_ratio: 0.05(src/data/text.pyのsplit_train_val_text()で使う訓練・検証分割の比率)raw_bytes:corpus.txtの UTF-8 バイト数(24,331,593)source_commit: 取得時点のai-theoriesリポジトリのコミットハッシュ (aabac46a2708574ed67e522105684aa867a2b276)
