continker/Qwen3.5-27B-metro-v23
040
[!WARNING] Superseded by [Qwen3.5-27B-metro-v24](https://huggingface.co/continker/Qwen3.5-27B-metro-v24) — the leakage-free retraining used in the MetroLLM-Bench paper. This v23 model was trained on the full case set (held-out cases included) and is retained for provenance only.
Qwen3.5-27B + metro-v23 LoRA
Domain-specialised tool-using agent for transit-kiosk tasks: routing, fare calculation, disruption advisories, accessibility, multilingual cultural notes, multi-turn context tracking, and policy adaptation across 6 metro systems (MARTA, BART, CTA, Doha, Taipei MRT, Beijing Subway).
QLoRA r=16 fine-tune of Qwen/Qwen3.5-27B on 790 distilled traces from Qwen3.5-27B and Qwen3.5-35B-A3B teachers (filtered to tier1 ≥ 90% per case, deduplicated by case_id, evaluated on the MetroLLM-Bench v23 harness).
Files
Eval (v23, 6 systems, Haiku judge for Tier 2)
Cross-system average: Tier-1 91.0, Composite 89.4 (-1.6 T1 / -1.2 Comp vs base Qwen3.5-27B)
Quickstart (llama.cpp)
huggingface-cli download continker/Qwen3.5-27B-metro-v23 \
Qwen3.5-27B-metro-v23-Q4_K_M.gguf --local-dir ./models
llama-server -m ./models/Qwen3.5-27B-metro-v23-Q4_K_M.gguf \
--port 8080 --ctx-size 32768 --n-gpu-layers 999Quickstart (PEFT adapter, Python)
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer
base = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-27B", torch_dtype="bfloat16")
model = PeftModel.from_pretrained(base, "continker/Qwen3.5-27B-metro-v23", subfolder="adapter")
tokenizer = AutoTokenizer.from_pretrained("continker/Qwen3.5-27B-metro-v23", subfolder="adapter")Training
- Base:
Qwen/Qwen3.5-27B - Method: QLoRA, rank=16, alpha=32, dropout=0.05
- Targets: q/k/v/o + gate/up/down projections
- Optimizer: AdamW, lr=2e-4, cosine, warmup 5%
- Epochs: 3, effective batch 8 (perdevicetrainbatchsize=2 × grad_accum=4)
- Max sequence length: 2048
- Seed: 42 (default; multi-seed CI in progress for 27B)
- Dataset: 790 distilled examples, see continker/metrollm-bench-train-data-v23
Limitations
- Trained on 6 metro systems; generalisation to other systems untested.
- Tool-use schema is specific to the MetroLLM-Bench mock server (routeplanner, farecalculator, stationinfo, disruptionfeed, knowledgebase, submitassistant_state).
- Quantised to 4-bit (Q4KM); for full-precision behaviour use the adapter on bf16 base weights.
Citation
@misc{metrollm-bench-2026,
title={MetroLLM-Bench: Evaluating LLMs as Prompt-Driven Transit Kiosk Agents},
author={Hendriks, Remco and contributors},
year={2026},
publisher={HuggingFace},
howpublished={\url{https://huggingface.co/continker}}
}