arthu1/north-air-api
0
v5.1: revert INT8 — too lossy for 0.6B, keep LoRA merge + float32
v5: merge LoRA at startup + INT8 quantization + faster params
Skip quantization for PEFT models — fixes generate crash
Fix: quantization fallback if generate breaks
Revert to Docker/FastAPI + add dynamic INT8 quantization for faster CPU inference
Switch to Gradio SDK + ZeroGPU for free GPU inference
Deploy North Air CPU API + model
Deploy North Air CPU API + model
Deploy North Air CPU API + model
Deploy North Air CPU API + model
initial commit
