VoidWalkercero/Qwen3-0.6B-Particle-SousVide-R128-Perfect
18.2k
Qwen3-0.6B-Particle-SousVide-R128-Perfect
⚡ 40.1 tok/s on your CPU (i5-6200U 2C/4T) + 37 MB RAM — gguf2bin interface
Runtime: `AnonymoDGH/gguf2bin` on GitHub — C99 G2BX mmap + AVX2 + Vulkan
Qwen3-0.6B + 6 custom technologies — gguf2bin runtime (C99, AVX2, Vulkan)
Perfect r128 20k · 1.00 loss (3.52→1.00) · 62.7% SecEval · 520k lines 465MB (110 shardsrdru200m6.9GB +code_search_net20k)
⚡ Speed on YOUR CPU + RAM (gguf2bin)
Your CPU (i5-6200U 2C/4T DDR3L 9.4 GB/s) — measured `bench -n32 min3` with `--fast`:
What counts on 2GB? Weights = mmap evictable (❌), KV cache = F32→Q8_0 (--q8-kv), buffers + tokenizer ~60 MB (✅). model.g2bx never loads to RAM, only KV + 37 MB.
gguf2bin2_new.exe chat model.g2bx --cyber adapter.lora --mv 0 --fast # 24.7 t/s, 511 MB
gguf2bin2_new.exe chat model.g2bx --cyber adapter.lora --mv 0.5 --fast # 40.1 t/s, same RAM
gguf2bin2_new.exe run model.g2bx "Hello" --max-ram 2048 # auto Q8 + ctx halved → 37 MBTechnologies
Files
How to run with your runtime gguf2bin (recommended, fastest)
# 1. Build (MinGW / Linux)
gcc -O3 -mavx2 -mfma -mf16c -ffast-math -fopenmp -std=c99 -Iinclude -o gguf2bin2_new.exe src/*.c -lm -fopenmp
# 2. Fast chat (cyber+general)
gguf2bin2_new.exe chat model.g2bx --cyber adapter.lora --mv 0 --fast --threads 4
# 3. Run with prompt
gguf2bin2_new.exe run model.g2bx "What is XSS? Explain 3 types" -n 200 -t 0.7 --mv 0 --fast --cyber adapter.lora
gguf2bin2_new.exe run model.g2bx "Write a Python function to find max chain" -n 150 -t 0.7 --cyber adapter.lora --mv 0 --fast
# 4. Bench
gguf2bin2_new.exe bench model.g2bx -n 32 --mv 0.5 # 40.1 tok/s
gguf2bin2_new.exe bench model.g2bx -n 32 --bvh # 2.5× on ctx32k
# 5. Retrain
gguf2bin2_new.exe cyber-train Qwen3-0.6B-q4.g2bx D:\datasets\huge_520k.jsonl -o my.lora --steps 5000 --particle --temp 60How to run with llama.cpp / ollama (GGUF)
# GGUF Q4_0 merged is included
llama-cli -m Qwen3-0.6B-Particle-SousVide-R128-Perfect.gguf -p "What is XSS?" -n 200
ollama create qwen3-0.6b-particle -f Modelfile # Modelfile: FROM ./Qwen3-0.6B-Particle-SousVide-R128-Perfect.gguf
ollama run qwen3-0.6b-particle "Write a Python function to find max chain"Benchmarks (Qwen3-0.6B Q4)
Speed (`bench -n32 min3`, i5-6200U / your CPU):
Intelligence:
Train: 520k lines (500k rdru200m +20k code) 465MB, 20k steps, r128, DoRA+GaLore+MoE, PT 4x 60→45°C, Levy α1.5, curriculum easy→hard.
Training
Dataset D:\datasets\rdru200m\parts 110 shards 6.9GB + code_search_net 20k. See src/l8_cyber.c cyber_train_particle().
License
Apache 2.0 (Qwen3) + gguf2bin MIT
