CoolFace
Modelpublic

RinnRinnmini/qwen3-4b-agent-trajectory-merged11-sftdpo_v10

sourceHugging Faceapache-2.0updated 7mo agoView on Hugging Face
0likes12downloads
Model Card

qwen3-4b-agent-trajectory-merged11-sftdpo_v10

This repository provides a merged model based on Qwen/Qwen3-4B-Instruct-2507. The LoRA adapter (after DPO) has been merged into the base model.

Load directly with transformers (no PEFT adapter loading required).