CoolFace
Modelpublic

RinnRinnmini/qwen3-4b-agent-trajectory-merged11-sftdpo_v15

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes11downloads
Model Card

qwen3-4b-agent-trajectory-merged11-sftdpo_v15

This repository provides a merged model based on Qwen/Qwen3-4B-Instruct-2507. The LoRA adapter (after DPO) has been merged into the base model.

Load directly with transformers (no PEFT adapter loading required).