CoolFace
Datasetpublic

nanxidajun/NuosuBburma-OCR-Evaluation-Set

NuosuBburma OCR Evaluation Set 规范彝文 OCR 评估集 用于规范彝文(NuosuBburma)的模型性能评估与错误分析。 内容涵盖纯彝文、彝汉混排及少量含拉丁字母的混排文本;场景覆盖书籍、手写、屏幕和实拍。 真实性声明:全部评估样本来自真实扫描或实际拍摄,不含合成评估数据。 评估任务 输入为单张包含规范彝文、彝汉混排及少量拉丁字母、数字或标点的图像。模型按照图像中的视觉阅读顺序转写可见文字,保留必要的行结构和原有字符,不进行翻译、改写或文本补全。评估重点是复杂版式、混排文字和真实拍摄干扰条件下的文字识别能力。 在线可视化 查看评估集分布与图像—标准答案对照 内容统计 项目 数量 样本 / 图片 1030 / 1030 文档页 / OCR 实例 519 / 511 图像类别 类别 数据形态 主要干扰 评估重点… See the full description on the dataset page: https://huggingface.co/datasets/nanxidajun/NuosuBburma-OCR-Evaluation-Set.

sourceHugging Faceotherupdated 2mo agoView on Hugging Face
1likes444downloads
Dataset Card

NuosuBburma OCR Evaluation Set

规范彝文 OCR 评估集

用于规范彝文(NuosuBburma)的模型性能评估与错误分析。 内容涵盖纯彝文、彝汉混排及少量含拉丁字母的混排文本;场景覆盖书籍、手写、屏幕和实拍。 真实性声明:全部评估样本来自真实扫描或实际拍摄,不含合成评估数据。

评估任务

输入为单张包含规范彝文、彝汉混排及少量拉丁字母、数字或标点的图像。模型按照图像中的视觉阅读顺序转写可见文字,保留必要的行结构和原有字符,不进行翻译、改写或文本补全。评估重点是复杂版式、混排文字和真实拍摄干扰条件下的文字识别能力。

在线可视化

查看评估集分布与图像—标准答案对照

内容统计

项目数量
样本 / 图片1030 / 1030
文档页 / OCR 实例519 / 511

[image]

图像类别

类别数据形态主要干扰评估重点
书籍扫描完整文档页及诗歌、正文、脚注等 OCR 实例扫描噪声、复杂版式整页阅读顺序、版式识别和抗噪能力
手写拍照软笔与硬笔书写,覆盖不同纸张、笔迹和笔色透视变化、纸张褶皱、阴影复杂拍摄条件下的手写识别泛化能力
屏幕拍照普通文档页及彩色背景文字摩尔纹、屏幕反光、透视畸变、污渍屏幕拍摄图像的适应性与抗干扰能力
实景拍照街头招牌等自然环境文字复杂背景、光照变化、拍摄视角自然场景中的文字识别泛化能力

难度分类依据

低难度

结构较简单的文档区域样本。裁切范围集中,背景和版式干扰较少。

中难度

普通文档整页及结构较复杂的文档区域样本。包含多行文本或常规复杂版式,需要处理阅读顺序、段落结构及页面噪声。

高难度

标题封面及全部拍照样本,包括手写页拍照、屏幕拍照和真实场景拍照。图像中可能包含复杂背景、透视畸变、摩尔纹、反光、阴影、褶皱、污渍及图文混排等干扰。

数据文件

文件用途
README.md数据集说明、覆盖统计和使用边界。
annotations.jsonl正式样本标注,每行包含一个图像与对应 GT。
images/与标注一一对应的评估图片。
dataset_summary.json数据分布、文件完整性与哈希审计摘要。

标注格式

每行一个 JSON 对象,包含 id、images、messages 和 meta;GT 位于唯一一条 assistant 消息中。

统计口径中,“文档页”对应 sample_type=page,“OCR 实例”对应 sample_type=region;图像获取方式由 scene 独立记录。

标注与质检

正式 GT 采用分级人工质检体系,模型输出只作为预标注和差异提示,不能自动覆盖人工结论:

  1. 1.预标注——先用模型生成预标注,但不直接作为最终标准答案。
  2. 2.多版本交叉检查——用多轮训练得到的不同模型版本产生识别结果,辅助发现潜在标注错误。
  3. 3.字符级对齐高亮——通过字符级对齐工具高亮替换、漏字和多字位置,集中检查模型输出与当前标注的差异。
  4. 4.首轮人工核查——项目负责人对照原始图片检查高亮出的差异并修正错误。
  5. 5.母语者复核——将疑难、不确定或容易混淆的规范彝文样本交由熟悉规范彝文的母语者核查。
  6. 6.人工裁决为准——最终标准答案由人工确认,以原图和人工判断为准。

在线可视化 提供图片与标准答案的逐条对照。

在人工质检之外,发布前对全部 1,030 条样本执行自动一致性审计:

检查项结果
正式样本 / 正式图片1,030 / 1,030
唯一 ID / 唯一图片引用1,030 / 1,030
缺失图片 / 孤立图片0 / 0
空 GT / 占位符 GT / 待定样本0 / 0 / 0
重复 ID / 重复图片哈希0 / 0
图片与标注映射异常0
图片尺寸与元数据不一致0
审计状态AUDIT_PASSED

评分与使用边界

本集所有评估输入均来自真实扫描或实际拍摄,用于 OCR 独立评估和错误分析,不作为训练数据。拍摄类图像由数据集制作者实际采集;书籍页面所涉及的原作品权利归相应权利人所有。图片和标注的公开使用须遵守相关权利要求及适用法律。