CoolFace
Modelpublic

aufklarer/Qwen3-ForcedAligner-0.6B-bf16

sourceHugging Faceapache-2.0updated 6mo agoView on Hugging Face
0likes31downloads
Model Card

Qwen3-ForcedAligner-0.6B — MLX bf16

Full-precision (bf16→float16) conversion of Qwen/Qwen3-ForcedAligner-0.6B for Apple Silicon inference via MLX.

No quantization applied — maximum accuracy for word-level timestamp prediction.

Model Details

DetailValue
Audio encoder24 layers, 1024 dim, 16 heads, float16
Text decoder28 layers, 1024 hidden, 16Q/8KV heads, float16
Classify headLinear(1024, 5000), float16
Timestamp resolution80ms per class
Total size~1.8 GB

Usage

swift
let aligner = try await Qwen3ForcedAligner.fromPretrained(
    modelId: "aufklarer/Qwen3-ForcedAligner-0.6B-bf16"
)
let aligned = aligner.align(
    audio: samples, text: "Hello world", sampleRate: 24000
)

Variants

VariantSizeModel ID
4-bit~979 MBaufklarer/Qwen3-ForcedAligner-0.6B-4bit
8-bit~1.4 GBaufklarer/Qwen3-ForcedAligner-0.6B-8bit
bf16~1.8 GBaufklarer/Qwen3-ForcedAligner-0.6B-bf16

Links