CoolFace
Modelpublic

pabloreyespo/Llama-3.1-70B-LatamGPT-SFT-1.0-IQ2_S

sourceHugging Facellama3.1updated 4mo agoView on Hugging Face
0likes16downloads
Model Card

LatamGPT 3.1 70B SFT - GGUF (Cuantizaciones Extremas)

Este repositorio contiene pesos en formato GGUF altamente optimizados para Llama-3.1-70B-LatamGPT-SFT-1.0, un modelo Llama 3.1 afinado (fine-tuned) específicamente para el español y portugués de Latinoamérica.

Estos pesos fueron cuantizados usando llama.cpp con una Matriz de Importancia (imatrix) personalizada, calibrada en el set de datos conversacional CohereForAI/aya_dataset para preservar la mayor fluidez lingüística posible en tasas de compresión extremas.

Archivos Disponibles

Nombre del ArchivoTipo de CuantizaciónTamañoVRAM Requerida (aprox)Descripción
latamgpt-IQ2_S.ggufIQ2_S (2-bit)~23 GB~24 GBCompresión extrema. Cabe en una sola GPU de 24GB (ej. RTX 3090 / 4090 / L4). Nota: Sufre de una alta degradación de perplejidad.

(Más cuantizaciones como IQ3_M y Q4_K_M próximamente).

Limitaciones Conocidas (IQ2_S)

La versión IQ2_S comprime un modelo de 140GB a ~23GB. Debido a esta cuantización extrema de 2 bits, el modelo sufre de una degradación factual y lógica significativa.

  • —Mantiene una excelente gramática y sintaxis en español.
  • —Puede alucinar hechos, fallar en acertijos lógicos o, en ocasiones, emitir tokens internos del sistema (<pad>, assistant) cuando se confunde.
  • —Recomendamos encarecidamente el uso de parámetros de muestreo estrictos (como Min-P) para controlar las alucinaciones.

Cómo Ejecutar con llama.cpp

Debido a que este es un modelo basado en Llama-3.1 con una tasa de compresión muy agresiva, el muestreo estándar Top-P / Top-K puede provocar que genere texto repetitivo o sin sentido.

Recomendamos encarecidamente usar el muestreo Min-P y desactivar Top-K/Top-P.

Aquí tienes el comando óptimo para ejecutar este modelo en la terminal usando llama-cli:

bash
./llama-cli \
    -m latamgpt-IQ2_S.gguf \
    -c 2048 \
    -ngl 65 \
    -i \
    --chat-template llama3 \
    -sys "Eres LatamGPT, un asistente de inteligencia artificial útil y amigable. Respondes siempre en español de forma coherente." \
    --temp 0.5 \
    --min-p 0.05 \
    --top-p 1.0 \
    --top-k 0 \
    --repeat-penalty 1.15 \
    -r "<|eot_id|>" \
    -r "assistant" \
    -r "user" \
    -r "<|start_header_id|>"

Formato del Prompt (Llama 3.1)

Si estás usando una interfaz gráfica como LM Studio, text-generation-webui u Ollama, asegúrate de que tu plantilla de chat esté configurada estrictamente como Llama 3:

Plaintext
<|begin_of_text|><|start_header_id|>system<|end_header_id|>

{system_prompt}<|eot_id|><|start_header_id|>user<|end_header_id|>

{prompt}<|eot_id|><|start_header_id|>assistant<|end_header_id|>

{response}<|eot_id|>