darthcrawl/mistral-7b-instruct-v0.3-artisan-mlx-4bit-dwq
034
mistral-7b-instruct-v0.3-artisan — MLX 4-bit DWQ
4-bit MLX quantization of darthcrawl/mistral-7b-instruct-v0.3-artisan.
from mlx_lm import load, generate
model, tok = load("darthcrawl/mistral-7b-instruct-v0.3-artisan-mlx-4bit-dwq")
print(generate(model, tok, "hello", max_tokens=64))