Yesianrohn/openocr-web-images
OpenOCR Web Images 从网络爬取的多语言图片数据集,配套多个 OCR 模型的打标结果,用于 OCR 模型 训练/评估数据构建。 数据集结构 data_download/ en/ # 英文候选图片 data/train-part*.parquet # 图片数据,字段见下方"图片数据字段" labels/ ppocrv6/part*/label-*.parquet # PP-OCRv6 打标结果 hunyuanocr/part*/label-*.parquet # HunyuanOCR (VLM) 打标结果 ch/ # 中文候选图片,目前只有图片,还没跑打标 data/train-part*.parquet mlt/ # 多语言候选图片,目前只有图片,还没跑打标… See the full description on the dataset page: https://huggingface.co/datasets/Yesianrohn/openocr-web-images.
OpenOCR Web Images
从网络爬取的多语言图片数据集,配套多个 OCR 模型的打标结果,用于 OCR 模型 训练/评估数据构建。
数据集结构
data_download/
en/ # 英文候选图片
data/train-part*.parquet # 图片数据,字段见下方"图片数据字段"
labels/
ppocrv6/part*/label-*.parquet # PP-OCRv6 打标结果
hunyuanocr/part*/label-*.parquet # HunyuanOCR (VLM) 打标结果
ch/ # 中文候选图片,目前只有图片,还没跑打标
data/train-part*.parquet
mlt/ # 多语言候选图片,目前只有图片,还没跑打标
data/train-part*.parquet
label_common.py # 打标框架公共基础设施(断点恢复/批处理/写盘调度)
label_ppocrv6.py # PP-OCRv6 打标脚本
run_label_ppocrv6.sh # PP-OCRv6 多卡/多机启动脚本
label_hunyuanocr.py # HunyuanOCR 打标脚本
run_label_hunyuanocr.sh # HunyuanOCR 多卡/多机启动脚本ch/mlt目前只有下载好的图片、还没有跑任何模型打标;en三个模型的 打标都还在跑,labels/<model>/part*/下已经写出的 shard 是当前进度, 后续会持续更新(追加新的 shard,不会覆盖/删除已有数据)。
图片数据字段(en|ch|mlt/data/*.parquet)
标注数据字段(en/labels/<model>/part*/*.parquet)
三个模型的标注字段完全对齐(除 model 外一致),可直接按 id 与图片数据、 或不同模型的标注结果互相 join 对比:
用法示例
from datasets import load_dataset
# 加载英文图片
images = load_dataset("Yesianrohn/openocr-web-images", name="en_images")["train"]
# 加载 PP-OCRv6 的打标结果
labels = load_dataset("Yesianrohn/openocr-web-images", name="en_ppocrv6")["train"]
# 按 id 关联查看某一张图 + 它的标注
row = images.filter(lambda r: r["id"] == 12345)[0]
lbl = labels.filter(lambda r: r["id"] == 12345)[0]复现/继续打标
pip install paddleocr paddlepaddle-gpu pyarrow pillow numpy # ppocrv6
pip install transformers torch pyarrow pillow numpy accelerate # hunyuanocr
DATASET_DIR=data_download/en bash run_label_ppocrv6.sh
DATASET_DIR=data_download/en bash run_label_hunyuanocr.sh两个脚本均支持单机多卡(NUM_GPUS)、多机扩展(NODE_RANK/SHARDS_PER_BLOCK) 以及断点续跑(重复执行同一条命令即可,已完成的 shard 会被自动跳过,不会 重复处理),细节见脚本内注释。
