EchoLabs33/granite-4.0-h-micro-hxq
08
granite-4.0-h-micro-hxq
HelixCode (HXQ) compressed version of ibm-granite/granite-4.0-h-micro.
Compression Stats
Verification Status
- Conversion receipt: PASS (tensor count validated, SHA256
9992bf6834069ee0...) - Compression receipt: see stats above
- GPU eval receipt: Awaiting GPU verification — compression receipt only
Fine-tuning
Fine-tunable via LoRA using HelixLinearSTE (straight-through estimator). STE bypass activates automatically when HelixLinear layers are frozen during adapter training.
Architecture Notes
Mamba2 blocks + shared transformer + LoRA adapters all compressed. conv1d exact (high kurtosis). Alog/D/dtbias exact.
Codec: VQ-256 + sidecar outlier correction. Compressed form is the executable — no decompression step. Forward pass: W = codebook[indices] + sidecar, then X@W via Triton fused kernel.
Usage
import helix_substrate # registers HXQ quantizer
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained(
"EchoLabs33/granite-4.0-h-micro-hxq",
device_map="auto",
trust_remote_code=True,
)
tokenizer = AutoTokenizer.from_pretrained("EchoLabs33/granite-4.0-h-micro-hxq", trust_remote_code=True)
inputs = tokenizer("Hello, world!", return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=64)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))Produced by
HXQ/HelixCode — HelixCode (HXQ) universal compression codec.
Compressed with tools/ssm_compress_pipeline.py.
