CoolFace
Modelpublic

sttjr/paganini-qwen35-27b-grpo-lora

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes8downloads
Model Card

Paganini GRPO LoRA β€” Qwen3.5-27B

<p align="center"> <img src="https://img.shields.io/badge/Base%20Model-Qwen3.5--27B-blue" /> <img src="https://img.shields.io/badge/Method-GRPO%20%2B%20LoRA-purple" /> <img src="https://img.shields.io/badge/Language-PT--BR%20%7C%20EN-green" /> <img src="https://img.shields.io/badge/Domain-FIDC%20%7C%20Code-orange" /> <img src="https://img.shields.io/badge/License-Apache%202.0-lightgrey" /> </p>

Paganini is a dual-domain LoRA adapter trained via GRPO (Group Relative Policy Optimization) on top of Qwen3.5-27B. It serves as the intelligence backbone for 9 specialized FIDC agents in the Paganini AIOS platform, with deep expertise in Brazilian investment fund regulation (CVM 175) and software architecture.

🧠 Model Overview

PropertyValue
Base ModelQwen/Qwen3.5-27B
Parameters27B
Adapter TypeLoRA (PEFT)
Training MethodGRPO (Group Relative Policy Optimization)
LoRA Rank32
LoRA Alpha32
LoRA Targetsall-linear
TaskCAUSAL_LM
Adapter Size966 MB (safetensors)
LanguagesPortuguese (Brazil) + English
Training PlatformTinker API β€” Thinking Machines Lab cloud GPUs
Training Duration~3 hours (23 runs)
Run ID7e18a5a1-8a6b-530d-b443-4f855a3aa8c4:train:0

πŸ—οΈ Training Pipeline

Paganini follows a two-stage alignment pipeline:

Qwen3.5-27B (base)
       β”‚
       β–Ό
  β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
  β”‚  Stage 1: Supervised Fine-Tuning (SFT)  β”‚
  β”‚  Platform: RunPod A100 80GB             β”‚
  β”‚  Accuracy: 87.75% | Loss: 0.454         β”‚
  β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜
       β”‚
       β–Ό  sttjr/paganini-qwen35-27b-sft-lora
       β”‚
  β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
  β”‚  Stage 2: GRPO RL Alignment (this)      β”‚
  β”‚  Platform: Tinker API (TML Cloud GPUs)  β”‚
  β”‚  23 training runs | ~3 hours            β”‚
  β”‚  Dual-domain reward optimization        β”‚
  β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜
       β”‚
       β–Ό  sttjr/paganini-qwen35-27b-grpo-lora  ← you are here

SFT Predecessor

The GRPO run was initialized from the SFT checkpoint:


πŸ“¦ Dataset

Name: dual-dataset-v2.jsonl

SplitCount
Total samples13,697
Code domain6,848
Finance domain6,849

Difficulty distribution:

LevelCount
L1 (Basic)4,566
L2 (Intermediate)4,566
L3 (Advanced)4,565

Sources:

  • β€”Finance: FIDC (Fundo de Investimento em Direitos CreditΓ³rios) regulatory corpus under CVM Resolution 175 β€” covering eligibility, concentration limits, covenants, PLD/AML procedures, compliance gates, and risk management
  • β€”Code: Software architecture patterns, pipeline compliance, TDD practices, and spec adherence for AIOS agent development

🎯 Reward Function (Dual-Domain)

The GRPO training uses a composite reward function:

R(x) = Ξ» Β· R_code + (1 - Ξ») Β· R_fin + R_shared

Where Ξ» = 1.0 for code samples and Ξ» = 0.0 for finance samples.

R_code β€” Code Domain Rewards

ComponentReward
Spec adherence+0.30
Architecture patterns+0.25
Pipeline compliance+0.15
Code blocks present+0.10
TDD terms present+0.10
Maximum+0.90

R_finance β€” Finance Domain Rewards

ComponentReward
Guardrail compliance+0.35
Source attribution+0.20
CVM citation+0.15
Article reference+0.15
Maximum+0.85

R_shared β€” Shared Penalty/Bonus

ComponentReward
Hallucination penaltyβˆ’0.15
Corporate speak penaltyβˆ’0.05 per occurrence
PT-BR language bonus+0.05
Length < 50 tokens penaltyβˆ’0.20

πŸ€– Use Case: Paganini AIOS

This model is the intelligence backbone for 9 specialized FIDC domain agents in the Paganini AIOS platform:

AgentRole
πŸ›οΈ AdminAdministrative governance and fund operations
🏦 CustodianAsset custody, settlement, and safekeeping
πŸ“Š ManagerPortfolio management and investment decisions
βš–οΈ ComplianceRegulatory adherence and audit trails
πŸ“‹ ReportingInvestor reporting and fund disclosures
πŸ” Due DiligenceCedente/debtor analysis and credit assessment
πŸ‘οΈ RegWatchRegulatory change monitoring (CVM, BACEN)
πŸ“§ IRInvestor Relations communication
πŸ’Ή PricingAsset pricing and NAV calculation

6-Gate Guardrail Pipeline

Each query passes through a sequential compliance chain:

Input β†’ [Eligibility] β†’ [Concentration] β†’ [Covenant] β†’ [PLD/AML] β†’ [Compliance] β†’ [Risk] β†’ Output

All 6 gates must pass before a response is delivered to end users. This ensures CVM 175-compliant, hallucination-free outputs across all agent types.


πŸš€ Usage

Installation

bash
pip install transformers peft accelerate

Load and Run

python
from peft import PeftModel
from transformers import AutoModelForCausalLM, AutoTokenizer

# Load base model
base = AutoModelForCausalLM.from_pretrained(
    "Qwen/Qwen3.5-27B",
    device_map="auto",
    torch_dtype="auto"
)

# Load GRPO LoRA adapter
model = PeftModel.from_pretrained(base, "sttjr/paganini-qwen35-27b-grpo-lora")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen3.5-27B")

# Finance domain example (PT-BR)
prompt = "Explique os requisitos de PDD mΓ­nima para FIDC conforme CVM 175."
inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512, temperature=0.7, do_sample=True)
print(tokenizer.decode(out[0], skip_special_tokens=True))

Merge Adapter (Optional)

python
# Merge LoRA weights into base model for faster inference
merged_model = model.merge_and_unload()
merged_model.save_pretrained("paganini-27b-merged")
tokenizer.save_pretrained("paganini-27b-merged")

πŸ“Š Checkpoints

CheckpointSizeDescription
paganini-test2.7 GBIntermediate checkpoint
paganini-rl-final2.7 GBFinal GRPO-aligned checkpoint

⚠️ Intended Use & Limitations

Intended Use

  • β€”FIDC regulatory Q&A in Portuguese (Brazil)
  • β€”Software architecture guidance for AIOS agents
  • β€”Compliance-first financial analysis aligned with CVM 175
  • β€”Internal enterprise use within the Paganini AIOS platform

Out-of-Scope Use

  • β€”General-purpose chatbot (use base Qwen3.5-27B instead)
  • β€”Non-Brazilian regulatory domains (model is specialized for CVM/BACEN frameworks)
  • β€”Real-time trading decisions or autonomous financial transactions

Limitations

  • β€”Finance knowledge is bounded by CVM 175 regulatory corpus at training cutoff
  • β€”PT-BR outputs are prioritized; EN responses may be less fluent
  • β€”Requires at least 2Γ— A100 80GB GPUs or equivalent for full-precision inference
  • β€”LoRA adapter requires the base Qwen3.5-27B model (~54 GB in fp16)

πŸ”— Project Links

ResourceLink
πŸ™ GitHub (Paganini AIOS)juboyy/paganini-aios
πŸ“Š Dashboarddashboard-v2-pearl-rho.vercel.app
πŸ€— SFT Predecessorsttjr/paganini-qwen35-27b-sft-lora

πŸ“„ Citation

bibtex
@misc{paganini-grpo-lora-2026,
  title        = {Paganini GRPO LoRA -- Qwen3.5-27B: Dual-Domain RL Alignment for FIDC Regulatory Intelligence},
  author       = {sttjr},
  year         = {2026},
  publisher    = {HuggingFace},
  howpublished = {\url{https://huggingface.co/sttjr/paganini-qwen35-27b-grpo-lora}},
  note         = {GRPO-aligned LoRA adapter for Brazilian investment fund regulation and software architecture}
}

πŸ“œ License

Apache 2.0 β€” See LICENSE for details.


Paganini AIOS β€” Built for the Brazilian FIDC ecosystem.