pabloreyespo/Llama-3.1-70B-LatamGPT-SFT-1.0-IQ2_S
LatamGPT 3.1 70B SFT - GGUF (Cuantizaciones Extremas)
Este repositorio contiene pesos en formato GGUF altamente optimizados para Llama-3.1-70B-LatamGPT-SFT-1.0, un modelo Llama 3.1 afinado (fine-tuned) específicamente para el español y portugués de Latinoamérica.
Estos pesos fueron cuantizados usando llama.cpp con una Matriz de Importancia (imatrix) personalizada, calibrada en el set de datos conversacional CohereForAI/aya_dataset para preservar la mayor fluidez lingüística posible en tasas de compresión extremas.
Archivos Disponibles
(Más cuantizaciones como IQ3_M y Q4_K_M próximamente).
Limitaciones Conocidas (IQ2_S)
La versión IQ2_S comprime un modelo de 140GB a ~23GB. Debido a esta cuantización extrema de 2 bits, el modelo sufre de una degradación factual y lógica significativa.
- Mantiene una excelente gramática y sintaxis en español.
- Puede alucinar hechos, fallar en acertijos lógicos o, en ocasiones, emitir tokens internos del sistema (
<pad>,assistant) cuando se confunde. - Recomendamos encarecidamente el uso de parámetros de muestreo estrictos (como
Min-P) para controlar las alucinaciones.
Cómo Ejecutar con llama.cpp
Debido a que este es un modelo basado en Llama-3.1 con una tasa de compresión muy agresiva, el muestreo estándar Top-P / Top-K puede provocar que genere texto repetitivo o sin sentido.
Recomendamos encarecidamente usar el muestreo Min-P y desactivar Top-K/Top-P.
Aquí tienes el comando óptimo para ejecutar este modelo en la terminal usando llama-cli:
./llama-cli \
-m latamgpt-IQ2_S.gguf \
-c 2048 \
-ngl 65 \
-i \
--chat-template llama3 \
-sys "Eres LatamGPT, un asistente de inteligencia artificial útil y amigable. Respondes siempre en español de forma coherente." \
--temp 0.5 \
--min-p 0.05 \
--top-p 1.0 \
--top-k 0 \
--repeat-penalty 1.15 \
-r "<|eot_id|>" \
-r "assistant" \
-r "user" \
-r "<|start_header_id|>"Formato del Prompt (Llama 3.1)
Si estás usando una interfaz gráfica como LM Studio, text-generation-webui u Ollama, asegúrate de que tu plantilla de chat esté configurada estrictamente como Llama 3:
<|begin_of_text|><|start_header_id|>system<|end_header_id|>
{system_prompt}<|eot_id|><|start_header_id|>user<|end_header_id|>
{prompt}<|eot_id|><|start_header_id|>assistant<|end_header_id|>
{response}<|eot_id|>