AuroraSystem/Clary-0.6-0.6B
145
Aurora Clary 0.6 Safetensors
Файлы

Быстрый старт (text only)
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"AuroraSystem/Aurora-Clary-0.6",
subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
prompt = tok.apply_chat_template(
[{"role": "user", "content": "Напиши факториал на Python"}],
tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))Быстрый старт (Vision)
Для картинок нужен CLIP + проектор. Архитектура:
Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> ответВозможности
- Текст: инструкции, знания, русский + английский
- Код: генерация Python
- Математика
- Суммаризация (EN + RU)
- Vision: описание изображений, цвета
- Режим
/think(Qwen3 thinking)
Ограничения
- Вижн OCR слабый (мелкий текст не читает)
- Системные промпты не обучались
- База — Qwen3-0.6B, потолок соответствует 0.6B-классу
Альтернативные форматы
- GGUF (для llama.cpp / LM Studio / Ollama): AuroraSystem/Clary-0.6-0.6B-GGUF
Лицензия
Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).
English
Files

Quick start (text only)
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"AuroraSystem/Aurora-Clary-0.6",
subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")
prompt = tok.apply_chat_template(
[{"role": "user", "content": "Write a Python factorial function"}],
tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))Quick start (Vision)
For images you need CLIP + projector. Architecture:
Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text -> Qwen3 embeddings -> [tokens]
[vision_tokens + text_tokens] -> Qwen3-0.6B -> answerCapabilities
- Text: instructions, knowledge, Russian + English
- Code: Python generation
- Math
- Summarization (EN + RU)
- Vision: image description, colors
/thinkmode (Qwen3 thinking)
Limitations
- OCR is weak (small text not recognized)
- System prompts were not trained
- Base is Qwen3-0.6B, ceiling matches 0.6B class
Alternative formats
- GGUF (for llama.cpp / LM Studio / Ollama): AuroraSystem/Clary-0.6-0.6B-GGUF
License
Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).
