nanxidajun/NuosuBburma-OCR-Evaluation-Set
NuosuBburma OCR Evaluation Set 规范彝文 OCR 评估集 用于规范彝文(NuosuBburma)的模型性能评估与错误分析。 内容涵盖纯彝文、彝汉混排及少量含拉丁字母的混排文本;场景覆盖书籍、手写、屏幕和实拍。 真实性声明:全部评估样本来自真实扫描或实际拍摄,不含合成评估数据。 评估任务 输入为单张包含规范彝文、彝汉混排及少量拉丁字母、数字或标点的图像。模型按照图像中的视觉阅读顺序转写可见文字,保留必要的行结构和原有字符,不进行翻译、改写或文本补全。评估重点是复杂版式、混排文字和真实拍摄干扰条件下的文字识别能力。 在线可视化 查看评估集分布与图像—标准答案对照 内容统计 项目 数量 样本 / 图片 1030 / 1030 文档页 / OCR 实例 519 / 511 图像类别 类别 数据形态 主要干扰 评估重点… See the full description on the dataset page: https://huggingface.co/datasets/nanxidajun/NuosuBburma-OCR-Evaluation-Set.
NuosuBburma OCR Evaluation Set
规范彝文 OCR 评估集
用于规范彝文(NuosuBburma)的模型性能评估与错误分析。 内容涵盖纯彝文、彝汉混排及少量含拉丁字母的混排文本;场景覆盖书籍、手写、屏幕和实拍。 真实性声明:全部评估样本来自真实扫描或实际拍摄,不含合成评估数据。
评估任务
输入为单张包含规范彝文、彝汉混排及少量拉丁字母、数字或标点的图像。模型按照图像中的视觉阅读顺序转写可见文字,保留必要的行结构和原有字符,不进行翻译、改写或文本补全。评估重点是复杂版式、混排文字和真实拍摄干扰条件下的文字识别能力。
在线可视化
内容统计
图像类别
难度分类依据
低难度
结构较简单的文档区域样本。裁切范围集中,背景和版式干扰较少。
中难度
普通文档整页及结构较复杂的文档区域样本。包含多行文本或常规复杂版式,需要处理阅读顺序、段落结构及页面噪声。
高难度
标题封面及全部拍照样本,包括手写页拍照、屏幕拍照和真实场景拍照。图像中可能包含复杂背景、透视畸变、摩尔纹、反光、阴影、褶皱、污渍及图文混排等干扰。
数据文件
标注格式
每行一个 JSON 对象,包含 id、images、messages 和 meta;GT 位于唯一一条 assistant 消息中。
统计口径中,“文档页”对应 sample_type=page,“OCR 实例”对应 sample_type=region;图像获取方式由 scene 独立记录。
标注与质检
正式 GT 采用分级人工质检体系,模型输出只作为预标注和差异提示,不能自动覆盖人工结论:
- 预标注——先用模型生成预标注,但不直接作为最终标准答案。
- 多版本交叉检查——用多轮训练得到的不同模型版本产生识别结果,辅助发现潜在标注错误。
- 字符级对齐高亮——通过字符级对齐工具高亮替换、漏字和多字位置,集中检查模型输出与当前标注的差异。
- 首轮人工核查——项目负责人对照原始图片检查高亮出的差异并修正错误。
- 母语者复核——将疑难、不确定或容易混淆的规范彝文样本交由熟悉规范彝文的母语者核查。
- 人工裁决为准——最终标准答案由人工确认,以原图和人工判断为准。
在线可视化 提供图片与标准答案的逐条对照。
在人工质检之外,发布前对全部 1,030 条样本执行自动一致性审计:
评分与使用边界
本集所有评估输入均来自真实扫描或实际拍摄,用于 OCR 独立评估和错误分析,不作为训练数据。拍摄类图像由数据集制作者实际采集;书籍页面所涉及的原作品权利归相应权利人所有。图片和标注的公开使用须遵守相关权利要求及适用法律。
