CoolFace
Modelpublic

EchoLabs33/granite-4.0-h-micro-hxq

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
0likes8downloads
Model Card

granite-4.0-h-micro-hxq

HelixCode (HXQ) compressed version of ibm-granite/granite-4.0-h-micro.

Compression Stats

MetricValue
Base modelibm-granite/granite-4.0-h-micro
Architecturegranitemoehybrid
Compression ratio1.88x
Baseline PPL (WikiText-2)Pending GPU verification
HXQ PPL (WikiText-2)10.8476
PPL deltaPending (dense baseline needed for comparison)

Verification Status

  • —Conversion receipt: PASS (tensor count validated, SHA256 9992bf6834069ee0...)
  • —Compression receipt: see stats above
  • —GPU eval receipt: Awaiting GPU verification — compression receipt only

Fine-tuning

Fine-tunable via LoRA using HelixLinearSTE (straight-through estimator). STE bypass activates automatically when HelixLinear layers are frozen during adapter training.

Architecture Notes

Mamba2 blocks + shared transformer + LoRA adapters all compressed. conv1d exact (high kurtosis). Alog/D/dtbias exact.

Codec: VQ-256 + sidecar outlier correction. Compressed form is the executable — no decompression step. Forward pass: W = codebook[indices] + sidecar, then X@W via Triton fused kernel.

Usage

python
import helix_substrate  # registers HXQ quantizer
from transformers import AutoModelForCausalLM, AutoTokenizer

model = AutoModelForCausalLM.from_pretrained(
    "EchoLabs33/granite-4.0-h-micro-hxq",
    device_map="auto",
    trust_remote_code=True,
)
tokenizer = AutoTokenizer.from_pretrained("EchoLabs33/granite-4.0-h-micro-hxq", trust_remote_code=True)

inputs = tokenizer("Hello, world!", return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

Produced by

HXQ/HelixCode — HelixCode (HXQ) universal compression codec.

Compressed with tools/ssm_compress_pipeline.py.