CoolFace
Modelpublic

AuroraSystem/Clary-0.6-0.6B

sourceHugging Faceapache-2.0updated 1mo agoView on Hugging Face
1likes45downloads
Model Card

Aurora Clary 0.6 Safetensors

Файлы

ФайлОписание
config.jsonконфиг LLM
model.safetensorsQwen3-0.6B + LoRA (merged)
tokenizer.json / tokenizer_config.jsonтокенизатор
projector.safetensorsvision-проектор (768→2048→2048→1024)
clip_vision/CLIP ViT-B/32 vision encoder

benchmark_gsm8k_boolq

Быстрый старт (text only)

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "AuroraSystem/Aurora-Clary-0.6",
    subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")

prompt = tok.apply_chat_template(
    [{"role": "user", "content": "Напиши факториал на Python"}],
    tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))

Быстрый старт (Vision)

Для картинок нужен CLIP + проектор. Архитектура:

Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text  -> Qwen3 embeddings                                        -> [tokens]
       [vision_tokens + text_tokens] -> Qwen3-0.6B -> ответ

Возможности

  • —Текст: инструкции, знания, русский + английский
  • —Код: генерация Python
  • —Математика
  • —Суммаризация (EN + RU)
  • —Vision: описание изображений, цвета
  • —Режим /think (Qwen3 thinking)

Ограничения

  • —Вижн OCR слабый (мелкий текст не читает)
  • —Системные промпты не обучались
  • —База — Qwen3-0.6B, потолок соответствует 0.6B-классу

Альтернативные форматы

  • —GGUF (для llama.cpp / LM Studio / Ollama): AuroraSystem/Clary-0.6-0.6B-GGUF

Лицензия

Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).


English

Files

FileDescription
config.jsonLLM config
model.safetensorsQwen3-0.6B + LoRA (merged)
tokenizer.json / tokenizer_config.jsontokenizer
projector.safetensorsvision projector (768→2048→2048→1024)
clip_vision/CLIP ViT-B/32 vision encoder

benchmark_gsm8k_boolq

Quick start (text only)

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "AuroraSystem/Aurora-Clary-0.6",
    subfolder="merged", torch_dtype="auto", device_map="auto"
)
tok = AutoTokenizer.from_pretrained("AuroraSystem/Aurora-Clary-0.6", subfolder="merged")

prompt = tok.apply_chat_template(
    [{"role": "user", "content": "Write a Python factorial function"}],
    tokenize=False, add_generation_prompt=True
)
out = model.generate(tok(prompt, return_tensors="pt").to(model.device), max_new_tokens=200)
print(tok.decode(out[0], skip_special_tokens=True))

Quick start (Vision)

For images you need CLIP + projector. Architecture:

Image -> CLIP ViT-B/32 (frozen) -> Projector (768→2048→2048→1024) -> [49 tokens]
Text  -> Qwen3 embeddings                                       -> [tokens]
       [vision_tokens + text_tokens] -> Qwen3-0.6B -> answer

Capabilities

  • —Text: instructions, knowledge, Russian + English
  • —Code: Python generation
  • —Math
  • —Summarization (EN + RU)
  • —Vision: image description, colors
  • —/think mode (Qwen3 thinking)

Limitations

  • —OCR is weak (small text not recognized)
  • —System prompts were not trained
  • —Base is Qwen3-0.6B, ceiling matches 0.6B class

Alternative formats

  • —GGUF (for llama.cpp / LM Studio / Ollama): AuroraSystem/Clary-0.6-0.6B-GGUF

License

Apache-2.0. Base — Qwen3-0.6B (Apache-2.0).