CoolFace
Modelpublic

cstr/omniASR-CTC-1B-GGUF

sourceHugging Faceapache-2.0updated 5mo agoView on Hugging Face
1likes63downloads
Model Card

OmniASR-CTC-1B (GGUF)

GGUF conversion of Facebook's omniASR-CTC-1B for use with CrispASR.

Model Details

  • —Architecture: wav2vec2 encoder (48L, d=1280) + CTC head
  • —Parameters: ~1B
  • —Encoder: 7-layer CNN frontend (320x downsampling) + 48L transformer with grouped positional convolution
  • —Output: CTC greedy decoding (character-level SentencePiece, 9812 tokens)
  • —Languages: 1100+ (multilingual, trained on 3.6M hours)
  • —License: Apache 2.0
  • —Input: Raw 16 kHz mono PCM (no mel features)

Usage with CrispASR

bash
# Auto-detected from GGUF metadata (omniasr-ctc arch)
crispasr --backend omniasr -m omniasr-ctc-1b-q4_k.gguf -f audio.wav

# With language specification
crispasr --backend omniasr -m omniasr-ctc-1b-q4_k.gguf -l de -f audio.wav

Available Files

FileQuantSizeDescription
omniasr-ctc-1b.ggufF161.9 GBFull precision
omniasr-ctc-1b-q4_k.ggufQ4_K551 MBRecommended — good balance of quality and size

Conversion

Converted using:

bash
python models/convert-omniasr-ctc-to-gguf.py \
  --input facebook/omniASR-CTC-1B \
  --output omniasr-ctc-1b.gguf

Quantized with:

bash
crispasr-quantize omniasr-ctc-1b.gguf omniasr-ctc-1b-q4_k.gguf Q4_K

Comparison with OmniASR-CTC-300M

ModelParamsSize (Q4_K)Accuracy
OmniASR-CTC-300M300M157 MBGood
OmniASR-CTC-1B1B551 MBBetter (deeper encoder)

Both use the same CTC architecture — the 1B variant has 48 encoder layers (vs 24) and wider hidden dimension (1280 vs 1024).

Original Model