CoolFace
Modelpublic

Rapid42/Qwen3.5-4B-MXFP4

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes26downloads
Model Card

Rapid42/Qwen3.5-4B-MXFP4

Qwen3.5 4B — quantized to MXFP4 for Apple Silicon

Converted and optimized by Rapid42 — engineering tools for fast pipelines.


What This Is

This is Qwen3.5-4B quantized to MXFP4 format using mlx-lm. Blazing fast on any M-series Mac — even the base M1/M2 with 8GB RAM.

The smallest model in our Qwen3.5 lineup. Best for:

  • —Rapid iteration — fast drafts, autocomplete, short-form generation
  • —Always-on assistants — runs alongside other apps without memory pressure
  • —Edge/embedded — lowest resource footprint in the family
  • —Parameters: ~4B (dense)
  • —Quantization: MXFP4 (via mlx-lm 0.31.1)
  • —Base model: Qwen/Qwen3.5-4B
  • —Framework: Apple MLX

Hardware Requirements

DeviceRAMExperience
Any M-series Mac (8GB+)~3GB✅ Runs everywhere
M1 MacBook Air (8GB)~3GB✅ Comfortable
M3 Max / Pro~3GB✅ Near-instant responses
iPhone 15 Pro (via MLX)~3GB✅ Runs on-device

This is the "works on everything" model. Load time under 5 seconds on any M-series chip.


Quick Start

bash
pip install mlx-lm
python
from mlx_lm import load, generate

model, tokenizer = load("Rapid42/Qwen3.5-4B-MXFP4")

messages = [{"role": "user", "content": "Write a bash script to batch rename EXR files."}]
prompt = tokenizer.apply_chat_template(
    messages, add_generation_prompt=True, return_dict=False
)

response = generate(model, tokenizer, prompt=prompt, max_tokens=256, verbose=True)
print(response)

CLI (instant interactive chat):

bash
mlx_lm.chat --model Rapid42/Qwen3.5-4B-MXFP4

When to Use 4B vs Larger Models

Use CaseRecommended
Quick code snippets✅ 4B (fast)
Complex reasoning / long-form❌ Use 27B or 35B-A3B
Always-on background assistant✅ 4B (low overhead)
Multilingual tasks⚠️ 4B is decent, larger is better
RAG / retrieval + answer✅ 4B works well with good context

Why MXFP4?

MXFP4 (Microscaling FP4) uses per-block scaling factors that preserve more precision than standard int4, while remaining natively fast on Apple Silicon via MLX. For a 4B model this means near-fp16 quality at int4 memory cost.


About Rapid42

Rapid42 builds fast, precise engineering tools — from VFX pipeline utilities to optimized ML model distributions.

→ rapid42.com · ExrToPsd · Level Careers