CoolFace
Modelpublic

L2658183739/PaddleOCR-VL-1.5-OCSR

sourceHugging Faceapache-2.0updated 2mo agoView on Hugging Face
0likes41downloads
Model Card

PaddleOCR-VL OCSR V3

这是冻结的 V3 final 模型。完整训练、评测、许可与复现代码见 GitHub 项目。

该模型接收一张单分子结构图,生成一行 canonical SMILES。它不适用于谱图解析、反应预测、药效预测或医疗决策。

模型来源

  • —架构:PaddleOCR-VL-1.5 系列 remote-code 模型。
  • —任务基座:已经完成 OCSR 任务适配的 V2-1 export。
  • —主训练:22,762 条 strict control 数据上的低学习率 LoRA continuation,1400 steps。
  • —Checkpoint:完整评测 200-1400 七个 checkpoint 后选择 checkpoint-1400。
  • —最终解码:beam4/return4;300-step hard replay 与 chem-light rerank 因 development 回退被拒绝。

结果

面板Nexactvalid/nonempty角色
legacy development + greedy150735.97% macro74.63% min valid选 checkpoint
legacy development + beam4/return4150742.07% macro88.71% min valid选 decoder
wild strict30122.92%84.72%62 篇整论文 locked
scaffold novel13413.43%75.37%locked 子集
symbolic4600.00%100.00% nonempty独立文字转写 track

development 已被历史版本用于调参,不能称为 unseen test。wild/scaffold 在模型、prompt 和生成策略冻结后只运行一次。symbolic 不使用 RDKit canonicalization,也不混入 canonical 主分数。

推理

使用配套 GitHub 项目的推理脚本:

bash
python V3/scripts/infer_ocsr_transformers.py \
  --model-dir /path/to/this/model \
  --image molecule.png \
  --prompt-file V3/configs/prompt.txt \
  --device cuda \
  --torch-dtype bfloat16 \
  --max-new-tokens 256 \
  --min-pixels 50176 \
  --max-pixels 200704 \
  --num-beams 4 \
  --num-return-sequences 4 \
  --save-candidates

模型与 processor 使用 trust_remote_code=True 加载。H800 PCIe 80GB 的最终 beam 策略使用单 worker;四个 beam worker 会 OOM。Greedy 可以使用四 worker 做功能验证,但不等同于最终冻结策略。

训练数据与评测边界

训练数据由 USPTO、UOB、real-world、MolGrapher synthetic 和三个 USPTO-30K 子集组成。最终 control 的七部分数量、过滤和泄漏控制见配套项目的 TRAINING_DATA_AND_FINETUNING_REPORT_zh.md 与 DATASET_CARD_zh.md。

当前限制:

  • —只有两个训练 seed,且运行顺序未完全平衡;配比结论是探索性选择。
  • —项目所有者确认 frozen legacy/wild/symbolic labels 已完成离线人工审核;公开证据是 owner attestation 与 labels SHA256,不公开或虚构审核人身份和逐样本内部记录。
  • —private-photo 自采评测为 0,算法增强不能替代真实拍照。
  • —部分训练样本缺样本级 license/source URL/structure ID,不随公共模型仓发布原始数据。
  • —模型可能输出语法合法但结构错误的 SMILES,下游必须使用化学工具和人工流程复核。

文件完整性

  • —model-00001-of-00001.safetensors:2a7ac278677ff56379e67933d6d81481991b755b93355fca5902cc36a7b1cc13
  • —config.json:7757d2584da82c862eee7f44c808a2f98697800ebff9070c94dc7f99edfa79ba

完整训练、消融、locked 结果和复现脚本位于 配套 GitHub 项目。项目代码与本项目产生的派生权重采用 Apache-2.0;训练原图和训练 JSONL 不随模型仓发布,第三方来源、上游许可状态和隔离策略见 GitHub 的 V3/DATA_LICENSES_AND_ATTRIBUTION_zh.md 与 V3/NOTICE。