neureps/warmly-qwen35-2b-enko-gguf
01.7k
warmly-qwen35-2b-enko-gguf — Warmly 프로덕션 모델 (프루닝 2B GGUF)
오프라인 SNS 앱 Warmly(온기)의 프로덕션 배포 리포입니다. EN/KO 어휘 프루닝 마스터 neureps/Qwen3.5-2B-enko를 llama.cpp로 양자화했습니다. Android 앱(내장 llama-server)이 루트의 배포 파일을 직접 다운로드합니다.
버전 이력
파일 (루트 — 프로덕션 파일명 변경 금지, 앱이 URL로 고정 참조)
현행 배포 구성 합계(base+q5_0) 1201MB — 공식 하니스 20/20, heldout PPL 10.91, v0.2.15부터. distill-v1의 제작 과정·잔존 특성(복잡 캡션 영어 누출 → 후처리+재생성이 흡수, 폴백 0)은 어댑터 리포 카드와 학습 데이터 warmly-distill-data 참조.
양자화 변형 (variants/ — A안 실측 스윕 전체, 2026-07-13)
파일명 규칙: Qwen3.5-2B-enko-{양자화}-{imatrix 종류}.gguf
imatrix-domain= 도메인 캘리브레이션(위imatrix-domain.gguf) /imatrix-general= 위키+댓글(imatrix-general.gguf) /plain= imatrix 없음
핵심 교훈: 후처리 통과율은 저비트 열화를 못 잡는다 — 진짜 판별자는 자연성(주관 평가)이며 PPL과 강하게 상관. 2B는 품질을 유지하며 1GB 언더가 불가능(유일한 1GB 언더 IQ3_XXS는 붕괴).
사용법 (llama.cpp)
# 텍스트 (댓글 생성) — enable_thinking:false 필수, 안 끄면 출력이 빔
llama-server -m Qwen3.5-2B-enko-dIQ4_XS.gguf -c 4096
# 비전 (캡션)
llama-mtmd-cli -m Qwen3.5-2B-enko-dIQ4_XS.gguf --mmproj Qwen3.5-2B-enko-mmproj-q5_0.gguf --image photo.jpg -p "Describe..."관련 리포
- 프루닝 마스터(safetensors): neureps/Qwen3.5-2B-enko
- 구 배포 v1(프루닝 전, 롤백용): neureps/warmly-qwen35-2b-gguf
- 0.8B GGUF: neureps/warmly-qwen35-08b-enko-gguf
