NeveAI/Neve-Echo-6-12B-QAT-GGUF
<div align="center"> <img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/uEgq1cKh6eWYsyWKbcqch.png" width="50%"> </div>
<h1 align="center">Neve-Echo-6-12B-QAT-GGUF</h1>
<div align="center"> <a href="https://github.com/NeveIA"> <img src="https://cdn-uploads.huggingface.co/production/uploads/68a3ba234a7dfca33d72eee2/KQa7-ajynUAhTS-kxNtYT.png" width="20%" alt="NeveAI GitHub"> </a> </div>
[!Note] Esse model card é para as novas versões da família Neve Echo otimizadas com Treinamento Consciente de Quantização (QAT), que permite preservar uma qualidade semelhante à bfloat16 enquanto reduz drasticamente os requisitos de memória para carregar o modelo. Quatro versões dos checkpoints QAT estão disponíveis: Checkpoints QAT não quantizados (Q4_0): Pesos de meia precisão extraídos do pipeline QAT, ideais para compilação downstream personalizada e pesquisa. GGUF (Q4_0): Formatos prontos para implantação, com ampla compatibilidade no ecossistema. Otimizado para dispositivos móveis (wNa8o8): Um esquema personalizado projetado explicitamente para eficiência em hardware móvel. Ele apresenta camadas de decodificação direcionadas de 2 bits, caches KV otimizados e ativações estáticas para maximizar a economia de VRAM. Tensores Comprimidos (w4a16): Checkpoints QAT serializados no formato compressed-tensors para inferência nativa e otimizada com vLLM.
Introdução
O Neve Echo 6 é um modelo de linguagem de última geração focado em uso geral e raciocínio para tarefas variadas. Esta versão em formato GGUF foi otimizada pela NeveAI para oferecer o equilíbrio ideal entre precisão lógica e eficiência computacional.
Destaques do Modelo
Este modelo foi desenvolvido para uso geral e execução de tarefas diversas, focando em:
- Raciocínio Avançado (Thinking): Projetado como um modelo altamente capaz de raciocínio, com suporte a modos de pensamento estruturado para tarefas complexas.
- Uso Geral e Produtividade: Otimizado para uma ampla variedade de tarefas como geração de texto, assistência, explicações, planejamento e automação.
- Multimodalidade (Texto + Imagem): Capaz de processar entradas multimodais com suporte a diferentes resoluções e proporções.
- Tool Calling e System Prompt: Suporte nativo a chamadas de função e ao papel
system, permitindo maior controle e integração com ferramentas externas.
Benchmark de Performance
O Neve Echo 6 demonstra desempenho alinhado a modelos de ponta em múltiplas categorias:
Detalhes da Arquitetura
- Arquitetura: Transformer otimizado para raciocínio e tarefas gerais.
- Parâmetros: ~12B totais (com subset ativo por token para eficiência).
- Janela de Contexto: Até 256K tokens.
- Camadas: Arquitetura profunda com atenção global na camada final.
- MoE: Roteamento dinâmico de experts (subset ativo por inferência), otimizando performance e uso de memória.
Como utilizar (GGUF)
Este modelo é compatível com llama.cpp, Ollama, LM Studio e outras ferramentas que suportam o formato GGUF. Foco direcionado ao uso do modelo na plataforma autoral da organização NeveAI
Licença
Este repositório e os pesos do modelo estão licenciados sob a Licença Apache 2.0.
Contato
Se tiver qualquer dúvida, por favor, levante um issue ou entre em contato conosco em NeveIA.
