CoolFace
12 results

pre-modern

Kotomiya07 /premodern-japanese-books-ocr-pairs Premodern Japanese Books OCR Pairs 日本語 概要 日本古典籍統一データセット v0.1.0 の公開用Viewです。固定済み内部Releaseから、再配布と機械学習利用が許可された行だけを収録しています。収録行数は 641,400 行、収録SourceDataset数は 1 件です。 用途 日本語歴史資料の研究、検索、OCRまたは言語モデル用データ処理に利用できます。個々の行には採用したCanonical ID、権利判定、必要な帰属を保持しています。 権利 単一のライセンス値は全行の条件を表しません。必ず NOTICE.md と行単位の権利列を確認してください。 限界 v0.1.0 は監査対象52候補のうち、固定入力が成立した21 SourceDatasetを対象とする段階公開です。内容の正確性、外部参照の永続性、特定用途への適合性を保証しません。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-ocr-pairs.0 likes107 downloads20d agoHugging FaceKotomiya07 /premodern-japanese-books-lm-corpus Premodern Japanese Books LM Corpus 日本語 概要 日本古典籍統一データセットの言語モデル学習用本文ビュー v0.2.0 です。lm-curated v0.2.0から、本文採用対象とした1,598文書を収録しています。文書の本文はcontent列に入り、文書単位の論理分割はsplit列に記録しています。 収録範囲 kouigenji ndl-minhon-ocrdataset yatanavi 利用上の注意 Hugging Face上の物理splitはtrain一つです。split列にtrain、validation、testの論理分割を保持しています。 NDL Minhonでは角括弧の記号だけを削除し、角括弧内部の文字は保持しています。 やたナビでは読み仮名、異読、校訂注、その他の補助表記を除去しています。 利用条件と帰属表示はNOTICE.mdを確認してください。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-lm-corpus.tabular1K<n<10K0 likes98 downloads19d agoHugging FaceKotomiya07 /premodern-japanese-books-source-crosswalk Premodern Japanese Books Source Crosswalk 日本語 概要 日本古典籍統一データセット v0.1.0 の公開用Viewです。固定済み内部Releaseから、再配布と機械学習利用が許可された行だけを収録しています。収録行数は 17,570,138 行、収録SourceDataset数は 7 件です。 用途 日本語歴史資料の研究、検索、OCRまたは言語モデル用データ処理に利用できます。個々の行には採用したCanonical ID、権利判定、必要な帰属を保持しています。 権利 単一のライセンス値は全行の条件を表しません。必ず NOTICE.md と行単位の権利列を確認してください。 限界 v0.1.0 は監査対象52候補のうち、固定入力が成立した21 SourceDatasetを対象とする段階公開です。内容の正確性、外部参照の永続性、特定用途への適合性を保証しません。… See the full description on the dataset page: https://huggingface.co/datasets/Kotomiya07/premodern-japanese-books-source-crosswalk.tabular10M<n<100M0 likes60 downloads20d agoHugging Facemarijadjokic /pre-modern-serbian-cyrillictext10K<n<100K0 likes5 downloads3mo agoHugging Face