pre-modern
premodern-japanese-books-ocr-pairs
Premodern Japanese Books OCR Pairs
日本語
概要
日本古典籍統一データセット v0.1.0 の公開用Viewです。固定済み内部Releaseから、再配布と機械学習利用が許可された行だけを収録しています。収録行数は 641,400 行、収録SourceDataset数は 1 件です。
用途
日本語歴史資料の研究、検索、OCRまたは言語モデル用データ処理に利用できます。個々の行には採用したCanonical ID、権利判定、必要な帰属を保持しています。
権利
単一のライセンス値は全行の条件を表しません。必ず NOTICE.md と行単位の権利列を確認してください。
限界
v0.1.0 は監査対象52候補のうち、固定入力が成立した21 SourceDatasetを対象とする段階公開です。内容の正確性、外部参照の永続性、特定用途への適合性を保証しません。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-ocr-pairs.premodern-japanese-books-lm-corpus
Premodern Japanese Books LM Corpus
日本語
概要
日本古典籍統一データセットの言語モデル学習用本文ビュー v0.2.0 です。lm-curated v0.2.0から、本文採用対象とした1,598文書を収録しています。文書の本文はcontent列に入り、文書単位の論理分割はsplit列に記録しています。
収録範囲
kouigenji
ndl-minhon-ocrdataset
yatanavi
利用上の注意
Hugging Face上の物理splitはtrain一つです。split列にtrain、validation、testの論理分割を保持しています。
NDL Minhonでは角括弧の記号だけを削除し、角括弧内部の文字は保持しています。
やたナビでは読み仮名、異読、校訂注、その他の補助表記を除去しています。
利用条件と帰属表示はNOTICE.mdを確認してください。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-lm-corpus.premodern-japanese-books-source-crosswalk
Premodern Japanese Books Source Crosswalk
日本語
概要
日本古典籍統一データセット v0.1.0 の公開用Viewです。固定済み内部Releaseから、再配布と機械学習利用が許可された行だけを収録しています。収録行数は 17,570,138 行、収録SourceDataset数は 7 件です。
用途
日本語歴史資料の研究、検索、OCRまたは言語モデル用データ処理に利用できます。個々の行には採用したCanonical ID、権利判定、必要な帰属を保持しています。
権利
単一のライセンス値は全行の条件を表しません。必ず NOTICE.md と行単位の権利列を確認してください。
限界
v0.1.0 は監査対象52候補のうち、固定入力が成立した21 SourceDatasetを対象とする段階公開です。内容の正確性、外部参照の永続性、特定用途への適合性を保証しません。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-source-crosswalk.pre-modern-serbian-cyrillic
