L2658183739/PaddleOCR-VL-1.5-OCSR
041
PaddleOCR-VL OCSR V3
这是冻结的 V3 final 模型。完整训练、评测、许可与复现代码见 GitHub 项目。
该模型接收一张单分子结构图,生成一行 canonical SMILES。它不适用于谱图解析、反应预测、药效预测或医疗决策。
模型来源
- 架构:PaddleOCR-VL-1.5 系列 remote-code 模型。
- 任务基座:已经完成 OCSR 任务适配的 V2-1 export。
- 主训练:22,762 条 strict control 数据上的低学习率 LoRA continuation,1400 steps。
- Checkpoint:完整评测 200-1400 七个 checkpoint 后选择
checkpoint-1400。 - 最终解码:beam4/return4;300-step hard replay 与 chem-light rerank 因 development 回退被拒绝。
结果
development 已被历史版本用于调参,不能称为 unseen test。wild/scaffold 在模型、prompt 和生成策略冻结后只运行一次。symbolic 不使用 RDKit canonicalization,也不混入 canonical 主分数。
推理
使用配套 GitHub 项目的推理脚本:
python V3/scripts/infer_ocsr_transformers.py \
--model-dir /path/to/this/model \
--image molecule.png \
--prompt-file V3/configs/prompt.txt \
--device cuda \
--torch-dtype bfloat16 \
--max-new-tokens 256 \
--min-pixels 50176 \
--max-pixels 200704 \
--num-beams 4 \
--num-return-sequences 4 \
--save-candidates模型与 processor 使用 trust_remote_code=True 加载。H800 PCIe 80GB 的最终 beam 策略使用单 worker;四个 beam worker 会 OOM。Greedy 可以使用四 worker 做功能验证,但不等同于最终冻结策略。
训练数据与评测边界
训练数据由 USPTO、UOB、real-world、MolGrapher synthetic 和三个 USPTO-30K 子集组成。最终 control 的七部分数量、过滤和泄漏控制见配套项目的 TRAINING_DATA_AND_FINETUNING_REPORT_zh.md 与 DATASET_CARD_zh.md。
当前限制:
- 只有两个训练 seed,且运行顺序未完全平衡;配比结论是探索性选择。
- 项目所有者确认 frozen legacy/wild/symbolic labels 已完成离线人工审核;公开证据是 owner attestation 与 labels SHA256,不公开或虚构审核人身份和逐样本内部记录。
- private-photo 自采评测为 0,算法增强不能替代真实拍照。
- 部分训练样本缺样本级 license/source URL/structure ID,不随公共模型仓发布原始数据。
- 模型可能输出语法合法但结构错误的 SMILES,下游必须使用化学工具和人工流程复核。
文件完整性
model-00001-of-00001.safetensors:2a7ac278677ff56379e67933d6d81481991b755b93355fca5902cc36a7b1cc13config.json:7757d2584da82c862eee7f44c808a2f98697800ebff9070c94dc7f99edfa79ba
完整训练、消融、locked 结果和复现脚本位于 配套 GitHub 项目。项目代码与本项目产生的派生权重采用 Apache-2.0;训练原图和训练 JSONL 不随模型仓发布,第三方来源、上游许可状态和隔离策略见 GitHub 的 V3/DATA_LICENSES_AND_ATTRIBUTION_zh.md 与 V3/NOTICE。
