oshizo/donut-base-japanese-visual-novel
Donut (base-sized model, fine-tuned on visual novel like synthetic dataset )
ビジュアルノベル風画像の合成データセットでnaver-clova-ix/donut-baseを訓練したモデルです。
使い方
サンプルノートブックsample_predictions_colab.ipynbを参照してください。
oshizo/donut-base-japanese-visual-novel
認識結果のサンプル
<img src="https://raw.githubusercontent.com/oshizo/donut-base-japanese-visual-novel/main/sample_images/sample_01.png" width="600">
---
<img src="https://raw.githubusercontent.com/oshizo/donut-base-japanese-visual-novel/main/sampleimages/sample02.png" width="600">
<img src="https://raw.githubusercontent.com/oshizo/donut-base-japanese-visual-novel/main/sample_images/sample_03.png" width="600">
---
<img src="https://raw.githubusercontent.com/oshizo/donut-base-japanese-visual-novel/main/sampleimages/sample04.png" width="600">
仕様
- ルビを読み取りません。ルビが表示されていても影響されずに本文を読み取ることを目標にしています。
- SAVE, LOADなどのUI要素と、2日目、4/3などの日付表示をなるべく読み取らないことを目標にしています
- options, names, messsages の3つのキーを持つjsonを出力します
学習に含むレイアウト
以下のレイアウトと、それぞれのパターンが存在しないパターンが学習データに含まれます。
<img src="https://raw.githubusercontent.com/oshizo/donut-base-japanese-visual-novel/main/modelcardimages/trained_patterns.png" width="600">
学習に含まないレイアウト
以下のようなパターンなど、学習データに含まれないパターンはうまく読み取れません。
<img src="https://raw.githubusercontent.com/oshizo/donut-base-japanese-visual-novel/main/modelcardimages/nottrainedpatterns.png" width="600">
その他の制約
- 幅1,920px, 高さ1,080pxの画像でのみ訓練、評価しているため、縦横比が大きく異なる場合認識精度が落ちる可能性があります
- decoderのtokenizerには
XLMRobertaTokenizerをベースに日本語の漢字を1500種類程度追加したものを使用しています。tokenizerに存在せず出力されない漢字が存在します
学習方法
もう少し詳しい情報を以下のnote記事に記載しました。
