AD-Styles/mini-llava-demo
0
Mini-LLaVA — v2 Demo
CLIP-ViT-B/32 + MLP Projector + Qwen2.5-0.5B (+ LoRA r=16) 로 직접 구현한 Vision-Language Model 의 데모 배포. HuggingFace 의 LlavaForConditionalGeneration 같은 고수준 추상화 미사용 — <image> 토큰 splice 와 융합 로직 직접 구현.
⚠️ 데모 버전의 한계 (정직한 명시)
v3 production 버전 개발 중: 한국어 instruction 데이터 + CLIP-ViT-L/14 + OOD detection.
🔗 링크
💡 사용 팁
- CPU 환경 이라 응답에 5-15초 소요됩니다 (첫 응답은 모델 로드 추가).
- 영문 질문 권장 (한국어는 의도적으로 약함).
- 예시 질문 클릭 → 이미지 업로드 → "응답 생성".
🤖 김도윤 (AD-Styles) · 2026 · MIT License
