cstr/omniASR-CTC-1B-GGUF
163
OmniASR-CTC-1B (GGUF)
GGUF conversion of Facebook's omniASR-CTC-1B for use with CrispASR.
Model Details
- Architecture: wav2vec2 encoder (48L, d=1280) + CTC head
- Parameters: ~1B
- Encoder: 7-layer CNN frontend (320x downsampling) + 48L transformer with grouped positional convolution
- Output: CTC greedy decoding (character-level SentencePiece, 9812 tokens)
- Languages: 1100+ (multilingual, trained on 3.6M hours)
- License: Apache 2.0
- Input: Raw 16 kHz mono PCM (no mel features)
Usage with CrispASR
# Auto-detected from GGUF metadata (omniasr-ctc arch)
crispasr --backend omniasr -m omniasr-ctc-1b-q4_k.gguf -f audio.wav
# With language specification
crispasr --backend omniasr -m omniasr-ctc-1b-q4_k.gguf -l de -f audio.wavAvailable Files
Conversion
Converted using:
python models/convert-omniasr-ctc-to-gguf.py \
--input facebook/omniASR-CTC-1B \
--output omniasr-ctc-1b.ggufQuantized with:
crispasr-quantize omniasr-ctc-1b.gguf omniasr-ctc-1b-q4_k.gguf Q4_KComparison with OmniASR-CTC-300M
Both use the same CTC architecture — the 1B variant has 48 encoder layers (vs 24) and wider hidden dimension (1280 vs 1024).
Original Model
- Paper: OmniASR: Transcribing Every Language Everywhere All at Once
- Code: facebookresearch/omnilingual-asr
- Training Data: 3.6M hours across 1100+ languages
