CoolFace
Modelpublic

rendeia/Arandu-Nano-1.1-GGUF

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
1likes36downloads
Model Card

Arandu Mirim 1.1 (GGUF, Q4KM + imatrix pt-BR)

Primeiro modelo da família Arandu (G1 — Eficiência) da plataforma [Rendeia](https://github.com/rendeia/Arandu) — uma IA que roda 100% local e offline, na CPU, portátil em pendrive. Otimizado para português do Brasil, com suporte nativo a outros idiomas (en/es/fr/de) herdado da base Qwen3.

Rendeia une renda (tradição artesã brasileira de tecer) e ideia. A marca abriga famílias de modelos com nomes em tupi-guarani — Arandu (sabedoria), Katu (bom/justo), Vera (verdadeiro), Taba (aldeia) — e tiers consistentes por tamanho: Mirim (pequeno), Eté (médio), Guaçu (grande).

✨ Novidades da plataforma v1.3 (junho/2026)

Os pesos deste modelo são os mesmos da versão anterior; o que evoluiu foi a plataforma em volta e a nomenclatura:

  • —🕸️ Nova marca: Rendeia (era "Arandu IA"). Repo migrado para rendeia/Arandu.
  • —🏷️ Nova nomenclatura: este modelo agora é Arandu Mirim 1.1 (era "Arandu Nano 1.1"). Tiers em tupi-guarani consistentes entre famílias (Mirim / Eté / Guaçu).
  • —🧠 Família Katu (G2 — Raciocínio) disponível em repo próprio rendeia/Katu — modelos que pensam antes de responder (DeepSeek R1 Distill). Roda no navegador via WebGPU (paradigma browser-native, sem servidor).
  • —⚡ Prompt caching (--cache-reuse 256 --slot-save-path cache/) — o time-to-first-token cai 1–3s a partir da 2ª pergunta, sobrevive ao --sleep-idle-seconds.
  • —🚀 Variante Q4_0 com repack AVX-512/AVX2 — em CPUs modernos (Intel 11ª gen+, Zen4+), 15–25% mais tok/s que Q4KM. Trade-off: qualidade ~3-5% pior.
  • —🧠 Memória em camadas no USB — perfil + índice de itens + detalhes sob demanda. Cabe nos 2048 tokens sem depender do RAG por embedding.
  • —📎 Upload de documentos — PDF (pdf.js offline), imagens/PDF escaneado via OCR (Tesseract portátil), .txt/.md/.csv/.json/.log.
  • —🌐 Multilíngue — seletor auto/pt/en/es/fr/de; o Qwen3 já é multilíngue.
  • —🏢 Windows corporativo — fallback automático para llama-server.exe quando o AppLocker bloqueia o llamafile.exe.

O que é

Este é o Qwen3-1.7B quantizado em Q4_K_M, porém re-quantizado com uma matriz de importância (imatrix) calibrada em português do Brasil. A imatrix preserva com mais precisão os pesos mais ativados ao processar texto em pt-BR, melhorando um pouco a qualidade sem custo adicional de RAM ou velocidade.

Não é um fine-tune: é o Qwen3-1.7B com uma receita de quantização orientada ao português. O ganho vem da calibração + da camada de produto da Rendeia (prompt de identidade, memória em camadas, RAG opcional estrito anti-alucinação).

Especificações

BaseQwen/Qwen3-1.7B
QuantizaçãoQ4KM com imatrix pt-BR
Tamanho~1,05 GB
RAM em uso~1,2 GB (contexto 2048, KV q8_0)
Velocidade~14 tok/s em CPU modesta (i5 11ª gen)
Modonon-thinking (/no_think) por padrão, para CPU
Idiomaspt-BR (otimizado) · en/es/fr/de (suportados pela base)
FamíliaArandu (G1 — Eficiência)
TierMirim (pequeno / rápido)
Plataforma[Rendeia](https://github.com/rendeia/Arandu)

Como usar

Com [llamafile](https://github.com/Mozilla-Ocho/llamafile) (recomendado) ou llama.cpp:

sh
# llamafile — flags recomendadas (v1.3+)
llamafile.exe -m Qwen_Qwen3-1.7B-Q4_K_M.gguf --server \
  -c 2048 -t 3 -fa on -ctk q8_0 -ctv q8_0 \
  --sleep-idle-seconds 180 \
  --cache-reuse 256 --slot-save-path cache

# llama.cpp
llama-server -m Qwen_Qwen3-1.7B-Q4_K_M.gguf -c 2048 -fa on \
  --cache-reuse 256 --slot-save-path cache

Para a experiência completa (interface pt-BR, memória no USB, upload com OCR, multilíngue, RAG offline, voz, lançadores clica-e-roda), use o pacote da Rendeia: 👉 <https://github.com/rendeia/Arandu/releases>

📖 Manual completo (pt-BR + EN): docs/MANUAL.md — instalação, configuração, todas as funções (memória, upload, RAG, voz, multilíngue, modo pensador, OCR) e solução de problemas.

Como foi gerado (reprodutível)

A imatrix foi calculada com llama-imatrix sobre um corpus de calibração em português (IA, fatos do Brasil, ciência, história, linguagem cotidiana) e aplicada com llama-quantize --imatrix. Passo a passo e o corpus estão em `treino/imatrix/` no repositório.

Outras famílias da Rendeia

  • —[Katu](https://github.com/rendeia/Katu) (G2 — Raciocínio) — modelos que pensam antes de responder, rodando no navegador via WebGPU (não usa GGUF; usa MLC pré-compilado).
  • —Vera (G3 — Multimodal) — planejado.
  • —Taba (G4 — Agentes) — planejado.

Limitações

  • —Modelo pequeno (1,7B): pode errar fatos e raciocínios complexos.
  • —Conhecimento factual é reforçado pela camada de memória/RAG no produto, não no peso do modelo.
  • —Otimizado para pt-BR e uso geral (conversa/redação/resumo) — não para tarefas especializadas (código avançado, matemática pesada). Para raciocínio, use a família Katu.
  • —Multilíngue: qualidade é forte nos idiomas principais (pt, en, es, fr, de) e decai em idiomas de poucos recursos.

Licença e créditos

  • —Licença: Apache-2.0
  • —Modelo base: Qwen3-1.7B (Alibaba Cloud), Apache-2.0
  • —Motor: llamafile / llama.cpp (Mozilla / ggml-org), Apache-2.0
  • —Plataforma Rendeia: <https://github.com/rendeia/Arandu>