CoolFace
2 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01Kotomiya07 /premodern-japanese-books-lm-corpus Premodern Japanese Books LM Corpus 日本語 概要 日本古典籍統一データセットの言語モデル学習用本文ビュー v0.2.0 です。lm-curated v0.2.0から、本文採用対象とした1,598文書を収録しています。文書の本文はcontent列に入り、文書単位の論理分割はsplit列に記録しています。 収録範囲 kouigenji ndl-minhon-ocrdataset yatanavi 利用上の注意 Hugging Face上の物理splitはtrain一つです。split列にtrain、validation、testの論理分割を保持しています。 NDL Minhonでは角括弧の記号だけを削除し、角括弧内部の文字は保持しています。 やたナビでは読み仮名、異読、校訂注、その他の補助表記を除去しています。 利用条件と帰属表示はNOTICE.mdを確認してください。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-lm-corpus.tabular1K<n<10K0 likes98 downloads19d agoHugging Face02Kotomiya07 /premodern-japanese-books-source-crosswalk Premodern Japanese Books Source Crosswalk 日本語 概要 日本古典籍統一データセット v0.1.0 の公開用Viewです。固定済み内部Releaseから、再配布と機械学習利用が許可された行だけを収録しています。収録行数は 17,570,138 行、収録SourceDataset数は 7 件です。 用途 日本語歴史資料の研究、検索、OCRまたは言語モデル用データ処理に利用できます。個々の行には採用したCanonical ID、権利判定、必要な帰属を保持しています。 権利 単一のライセンス値は全行の条件を表しません。必ず NOTICE.md と行単位の権利列を確認してください。 限界 v0.1.0 は監査対象52候補のうち、固定入力が成立した21 SourceDatasetを対象とする段階公開です。内容の正確性、外部参照の永続性、特定用途への適合性を保証しません。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-source-crosswalk.tabular10M<n<100M0 likes60 downloads20d agoHugging Face

Listings come live from the Hugging Face Hub API. CoolFace does not host these files.