CoolFace
Modelpublic

AnishRacherla/aya-expanse-8b-compressed-final-int8

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes4downloads
Model Card

Aya Expanse 8B — Compressed (int8)

Self-contained. No other repo needed.

Pipeline: Pruning → LoRA fine-tune → Merge → int8 quantize

Load

python
from transformers import AutoTokenizer, AutoModelForCausalLM, BitsAndBytesConfig
import torch
bnb = BitsAndBytesConfig(load_in_8bit=True)
tok = AutoTokenizer.from_pretrained('AnishRacherla/aya-expanse-8b-compressed-final-int8', trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained('AnishRacherla/aya-expanse-8b-compressed-final-int8', quantization_config=bnb, device_map='auto', trust_remote_code=True)

Benchmark vs Baseline (FLORES-200, 100 En→Zh)

MetricBaseline int4**This model**Δ
VRAM5.31 GB7.65 GB+2.34
Tokens/sec9.26.1-3.1
COMET0.50950.8620+0.3525