rendeia/Arandu-Nano-1.1-GGUF
Arandu Mirim 1.1 (GGUF, Q4KM + imatrix pt-BR)
Primeiro modelo da família Arandu (G1 — Eficiência) da plataforma [Rendeia](https://github.com/rendeia/Arandu) — uma IA que roda 100% local e offline, na CPU, portátil em pendrive. Otimizado para português do Brasil, com suporte nativo a outros idiomas (en/es/fr/de) herdado da base Qwen3.
Rendeia une renda (tradição artesã brasileira de tecer) e ideia. A marca abriga famílias de modelos com nomes em tupi-guarani — Arandu (sabedoria), Katu (bom/justo), Vera (verdadeiro), Taba (aldeia) — e tiers consistentes por tamanho: Mirim (pequeno), Eté (médio), Guaçu (grande).
✨ Novidades da plataforma v1.3 (junho/2026)
Os pesos deste modelo são os mesmos da versão anterior; o que evoluiu foi a plataforma em volta e a nomenclatura:
- 🕸️ Nova marca: Rendeia (era "Arandu IA"). Repo migrado para rendeia/Arandu.
- 🏷️ Nova nomenclatura: este modelo agora é Arandu Mirim 1.1 (era "Arandu Nano 1.1"). Tiers em tupi-guarani consistentes entre famílias (Mirim / Eté / Guaçu).
- 🧠 Família Katu (G2 — Raciocínio) disponível em repo próprio rendeia/Katu — modelos que pensam antes de responder (DeepSeek R1 Distill). Roda no navegador via WebGPU (paradigma browser-native, sem servidor).
- ⚡ Prompt caching (
--cache-reuse 256 --slot-save-path cache/) — o time-to-first-token cai 1–3s a partir da 2ª pergunta, sobrevive ao--sleep-idle-seconds. - 🚀 Variante Q4_0 com repack AVX-512/AVX2 — em CPUs modernos (Intel 11ª gen+, Zen4+), 15–25% mais tok/s que Q4KM. Trade-off: qualidade ~3-5% pior.
- 🧠 Memória em camadas no USB — perfil + índice de itens + detalhes sob demanda. Cabe nos 2048 tokens sem depender do RAG por embedding.
- 📎 Upload de documentos — PDF (pdf.js offline), imagens/PDF escaneado via OCR (Tesseract portátil),
.txt/.md/.csv/.json/.log. - 🌐 Multilíngue — seletor
auto/pt/en/es/fr/de; o Qwen3 já é multilíngue. - 🏢 Windows corporativo — fallback automático para
llama-server.exequando o AppLocker bloqueia ollamafile.exe.
O que é
Este é o Qwen3-1.7B quantizado em Q4_K_M, porém re-quantizado com uma matriz de importância (imatrix) calibrada em português do Brasil. A imatrix preserva com mais precisão os pesos mais ativados ao processar texto em pt-BR, melhorando um pouco a qualidade sem custo adicional de RAM ou velocidade.
Não é um fine-tune: é o Qwen3-1.7B com uma receita de quantização orientada ao português. O ganho vem da calibração + da camada de produto da Rendeia (prompt de identidade, memória em camadas, RAG opcional estrito anti-alucinação).
Especificações
Como usar
Com [llamafile](https://github.com/Mozilla-Ocho/llamafile) (recomendado) ou llama.cpp:
# llamafile — flags recomendadas (v1.3+)
llamafile.exe -m Qwen_Qwen3-1.7B-Q4_K_M.gguf --server \
-c 2048 -t 3 -fa on -ctk q8_0 -ctv q8_0 \
--sleep-idle-seconds 180 \
--cache-reuse 256 --slot-save-path cache
# llama.cpp
llama-server -m Qwen_Qwen3-1.7B-Q4_K_M.gguf -c 2048 -fa on \
--cache-reuse 256 --slot-save-path cachePara a experiência completa (interface pt-BR, memória no USB, upload com OCR, multilíngue, RAG offline, voz, lançadores clica-e-roda), use o pacote da Rendeia: 👉 <https://github.com/rendeia/Arandu/releases>
📖 Manual completo (pt-BR + EN): docs/MANUAL.md — instalação, configuração, todas as funções (memória, upload, RAG, voz, multilíngue, modo pensador, OCR) e solução de problemas.
Como foi gerado (reprodutível)
A imatrix foi calculada com llama-imatrix sobre um corpus de calibração em português (IA, fatos do Brasil, ciência, história, linguagem cotidiana) e aplicada com llama-quantize --imatrix. Passo a passo e o corpus estão em `treino/imatrix/` no repositório.
Outras famílias da Rendeia
- [Katu](https://github.com/rendeia/Katu) (G2 — Raciocínio) — modelos que pensam antes de responder, rodando no navegador via WebGPU (não usa GGUF; usa MLC pré-compilado).
- Vera (G3 — Multimodal) — planejado.
- Taba (G4 — Agentes) — planejado.
Limitações
- Modelo pequeno (1,7B): pode errar fatos e raciocínios complexos.
- Conhecimento factual é reforçado pela camada de memória/RAG no produto, não no peso do modelo.
- Otimizado para pt-BR e uso geral (conversa/redação/resumo) — não para tarefas especializadas (código avançado, matemática pesada). Para raciocínio, use a família Katu.
- Multilíngue: qualidade é forte nos idiomas principais (pt, en, es, fr, de) e decai em idiomas de poucos recursos.
Licença e créditos
- Licença: Apache-2.0
- Modelo base: Qwen3-1.7B (Alibaba Cloud), Apache-2.0
- Motor: llamafile / llama.cpp (Mozilla / ggml-org), Apache-2.0
- Plataforma Rendeia: <https://github.com/rendeia/Arandu>
