audio-cpp/audio.cpp-gguf
1644.6m
1---2license: other3library_name: audio.cpp4pipeline_tag: text-to-speech5tags:6- gguf7- audio.cpp8- quantized9- text-to-speech10- automatic-speech-recognition11- voice-conversion12- text-to-audio13- audio-to-audio14- source-separation15- speaker-diarization16- speech17base_model_relation: quantized18base_model:19- MiniMaxAI/MiniMax-H320- ACE-Step/Ace-Step1.521- ACE-Step/acestep-v15-base22- Aratako/Irodori-TTS-500M-v323- Aratako/Irodori-TTS-600M-v3-VoiceDesign24- Aratako/Irodori-TTS-v4.1-Small25- Aratako/MioCodec-25Hz-44.1kHz-v226- Aratako/MioTTS-1.7B27- Aratako/Semantic-DACVAE-Japanese-32dim28- Banafo/Kroko-ASR29- dots-studio/dots.tts-mf30- dots-studio/dots.tts-soar31- fishaudio/s2-pro32- FunAudioLLM/Fun-ASR-Nano-2512-hf33- HeartMuLa/HeartCodec-oss-2026012334- HeartMuLa/HeartMuLa-oss-3B35- HeartMuLa/HeartMuLaGen36- IndexTeam/IndexTTS-237- IndexTeam/IndexTTS-2.538- ASLP-lab/MeanVC239- OpenBMB/VoxCPM240- OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano41- OpenMOSS-Team/MOSS-Audio-Tokenizer-v242- OpenMOSS-Team/MOSS-TTS-Local-Transformer-v1.543- OpenMOSS-Team/MOSS-TTS-Nano-100M44- Qwen/Qwen3-ASR-0.6B45- Qwen/Qwen3-ASR-1.7B-hf46- Qwen/Qwen3-ForcedAligner-0.6B47- Qwen/Qwen3-TTS-12Hz-0.6B-Base48- Qwen/Qwen3-TTS-12Hz-1.7B-Base49- Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice50- Qwen/Qwen3-TTS-12Hz-1.7B-VoiceDesign51- Qwen/Qwen3-TTS-Tokenizer-12Hz52- ResembleAI/chatterbox53- RMSnow/Vevo254- bosonai/higgs-audio-v3-stt55- bosonai/higgs-audio-v3-tts-4b56- k2-fsa/OmniVoice57- kyutai/pocket-tts58- llm-jp/llm-jp-3-150m59- microsoft/VibeVoice-1.5B60- microsoft/VibeVoice-ASR61- mistralai/Voxtral-Mini-4B-Realtime-260262- mlx-community/SeedVC-MLX63- mlx-community/mel-roformer-mlx64- mlx-community/supertonic-3-mlx65- mlx-community/wavlm-base-plus-mlx66- MuScriptor/muscriptor-small67- neuphonic/neutts-2e68- syvai/hviske-v5.369- nvidia/diar_sortformer_4spk-v170- nvidia/magpie_tts_multilingual_357m71- nvidia/nemotron-3.5-asr-streaming-0.6b72- nvidia/parakeet-tdt-0.6b-v373- nvidia/personaplex-7b-v174- owensong/Inflect-Micro-v275- stabilityai/stable-audio-3-medium76- stabilityai/stable-audio-3-small-music77- stabilityai/stable-audio-3-small-sfx78---79 80# audio.cpp GGUF Model Packages81 82This directory contains audio.cpp-native GGUF conversions of multiple speech models. These files are intended for use with [audio.cpp](https://github.com/0xShug0/audio.cpp).83 84If you enjoy the project, please star [audio.cpp on GitHub](https://github.com/0xShug0/audio.cpp) and this Hugging Face repository.85 86For conversion details, supported layouts, direct-file loading, sidecar embedding, and the latest compatibility notes, see the audio.cpp GGUF guide:87 88- https://github.com/0xShug0/audio.cpp/blob/main/docs/gguf.md89 90!!! Converted and quantized packages are checked with automated metrics, but perceived quality can still differ for human listeners. Please validate the exact package, backend, and route to confirm the output is acceptable for your use case.91 92 93## Files94 95The table lists the GGUF packages currently provided by this repository.96 97| Directory | audio.cpp family | GGUF provided | Original model license |98|---|---|---|---|99| `ACE-Step1.5-GGUF` | `ace_step` | BF16 + Q8 | MIT |100| `AudioSR-GGUF` | `audiosr` | F32 | MIT |101| `BS-RoFormer-ep368-GGUF` | `bs_roformer` | Q8 | Apache-2.0 |102| `Breeze-TTS-2-GGUF` | `breeze_tts` | BF16 + Q8 + Q4 | BreezeBlue Research and Non-Commercial License |103| `Chatterbox-GGUF` | `chatterbox` | F16 + Q8 | MIT |104| `Chatterbox-Turbo-GGUF` | `chatterbox_turbo` | Q8 | MIT |105| `Citrinet-ASR-GGUF` | `citrinet_asr` | Q8 | CC-BY-4.0 |106| `Confucius4-TTS-GGUF` | `confucius4_tts` | original | Apache-2.0 |107| `ControlFoley-GGUF` | `controlfoley` | F32 | Apache-2.0 |108| `CosyVoice3-GGUF` | `cosyvoice3` | F32 + Q8 | Apache-2.0 |109| `DotTTS-Edit-GGUF` | `dots_tts` | BF16 + Q8 | Apache-2.0 |110| `DotTTS-MF-GGUF` | `dots_tts` | BF16 | Apache-2.0 |111| `DotTTS-SOAR-GGUF` | `dots_tts` | original + BF16 | Apache-2.0 |112| `DramaBox-GGUF` | `dramabox` | Q8 | LTX-2 Community License |113| `FireRedAudio-GGUF` | `firered_audio` | original + Q8 | Apache-2.0 |114| `FireRedTTS3-Base-GGUF` | `fireredtts3` | original + Q8 | Apache-2.0 |115| `FireRedTTS3-Instruct-GGUF` | `fireredtts3` | original + Q8 | Apache-2.0 |116| `Fish-Audio-S2-Pro-GGUF` | `fish_audio` | BF16 + Q8 | Fish Audio Research License |117| `Fun-ASR-Nano-2512-GGUF` | `fun_asr_nano` | F16 + Q8 | FunASR Model Open Source License Agreement v1.1 |118| `Granite-Speech-5.0-470M-TurboCTC-GGUF` | `granite5asr` | Q8 | Apache-2.0 |119| `HeartMuLa-GGUF` | `heartmula` | F16 + Q8 | Apache-2.0 |120| `HTDemucs-GGUF` | `htdemucs` | F16 + Q8 | MIT |121| `Higgs-Audio-v3-STT-GGUF` | `higgs_audio_stt` | F16 + Q8 | Apache-2.0 |122| `Higgs-Audio-v3-TTS-4B-GGUF` | `higgs_audio_tts` | BF16 + Q8 | Boson Higgs TTS 3 Research and Non-Commercial License |123| `Hviske-v5.3-GGUF` | `hviske_asr` | Q8 | CC-BY-NC-4.0 |124| `IndexTTS2-GGUF` | `index_tts2` | original + F16 + Q8 | bilibili Model Use License Agreement |125| `IndexTTS2.5-GGUF` | `index_tts2` | original + F16 + Q8 | bilibili Model Use License Agreement |126| `Inflect-Micro-v2-GGUF` | `inflect_v2` | original | Apache-2.0 |127| `Irodori-TTS-500M-v3-GGUF` | `irodori_tts` | F16 + Q8 | MIT |128| `Irodori-TTS-600M-v3-VoiceDesign-GGUF` | `irodori_tts` | F16 + Q8 | MIT |129| `Irodori-TTS-v4-Small-GGUF` | `irodori_tts` | F16 + Q8 | MIT |130| `Kokoro-82M-GGUF` | `kokoro_tts` | BF16 + Q8 | Apache-2.0 |131| `Kroko-ASR-GGUF` | `kroko_asr` | Q8 | CC-BY-SA community model license |132| `MMS-Forced-Aligner-GGUF` | `mms_forced_aligner` | F16 | CC-BY-NC-4.0 |133| `MOSS-TTS-Local-v1.5-GGUF` | `moss_tts_local` | BF16 + Q8 | Apache-2.0 |134| `MOSS-TTS-Nano-100M-GGUF` | `moss_tts_nano` | BF16 + Q8 | Apache-2.0 |135| `MOSS-VoiceGenerator-GGUF` | `moss_voicegen` | BF16 + F16 codec decode | Apache-2.0 |136| `MagpieTTS-Multilingual-357M-GGUF` | `magpie_tts` | original | NVIDIA Open Model License |137| `MeanVC2-GGUF` | `meanvc2` | F32 + Q4_K | Apache-2.0 |138| `Mel-Band-RoFormer-GGUF` | `mel_band_roformer` | F16 + Q8 | MIT |139| `MiDashengLM-Gen-GGUF` | `midashenglm_gen` | F32 + Q8 | Apache-2.0 |140| `MiniMax-H3-Q4-GGUF` | `minimax_h3` | Q4_K + INT8 DiT option | MiniMax-H3 Community License |141| `MioCodec-25Hz-44.1kHz-v2-GGUF` | `miocodec` | original + F16 + Q8 | MIT |142| `MioTTS-1.7B-GGUF` | `miotts` | original + BF16 + Q8 | Apache-2.0 |143| `Moonshine-Streaming-GGUF` | `moonshine_asr` | Q8 | MIT |144| `MuScriptor-Small-GGUF` | `muscriptor` | F32 | CC-BY-NC-4.0 |145| `Nemotron-3.5-ASR-Streaming-0.6B-GGUF` | `nemotron_asr` | F16 + Q8 | OpenMDW-1.1 |146| `NeuTTS-2E-GGUF` | `neutts` | original | Apache-2.0 |147| `OmniVoice-GGUF` | `omnivoice` | BF16 + F16 + Q8 | Apache-2.0 |148| `Parakeet-TDT-0.6B-v3-GGUF` | `parakeet_tdt` | F16 + Q8 | CC-BY-4.0 |149| `PersonaPlex-GGUF` | `personaplex` | Q4_K + Q8 | Apache-2.0 |150| `PocketTTS-GGUF` | `pocket_tts` | BF16 + Q8 | CC-BY-4.0 |151| `Qwen3-ASR-0.6B-GGUF` | `qwen3_asr` | F16 + Q8 | Apache-2.0 |152| `Qwen3-ASR-1.7B-GGUF` | `qwen3_asr` | F16 + Q8 | Apache-2.0 |153| `Qwen3-ForcedAligner-0.6B-GGUF` | `qwen3_forced_aligner` | F16 + Q8 | Apache-2.0 |154| `Qwen3-TTS-12Hz-0.6B-Base-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |155| `Qwen3-TTS-12Hz-1.7B-Base-GGUF` | `qwen3_tts` | original + BF16 + Q8 | Apache-2.0 |156| `Qwen3-TTS-12Hz-1.7B-CustomVoice-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |157| `Qwen3-TTS-12Hz-1.7B-VoiceDesign-GGUF` | `qwen3_tts` | BF16 + Q8 | Apache-2.0 |158| `RVC-GGUF` | `rvc` | F16 | MIT |159| `SeedVC-MLX-GGUF` | `seed_vc` | original + F16 + Q8 | GPL-3.0 |160| `Sortformer-Diar-4spk-v1-GGUF` | `sortformer_diar` | F16 + Q8 | CC-BY-NC-4.0 |161| `Stable-Audio-3-Medium-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |162| `Stable-Audio-3-Small-Music-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |163| `Stable-Audio-3-Small-SFX-GGUF` | `stable_audio` | F16 + Q8 | Stability AI Community License |164| `Supertonic-3-GGUF` | `supertonic` | original + F16 + Q8 | BigScience Open RAIL-M |165| `Vevo2-GGUF` | `vevo2` | original + F16 + Q8 | CC-BY-NC-ND-4.0 |166| `VibeVoice-1.5B-GGUF` | `vibevoice` | BF16 + Q8 + Q4 | MIT |167| `VibeVoice-ASR-GGUF` | `vibevoice_asr` | F16 + Q8 | MIT |168| `VoxCPM1-GGUF` | `voxcpm1` | Q8 + F16 AudioVAE | Apache-2.0 |169| `VoxCPM2-GGUF` | `voxcpm2` | original + BF16 + Q8 | Apache-2.0 |170| `Voxtral-Mini-4B-Realtime-2602-GGUF` | `voxtral_realtime` | BF16 + Q8 + Q4_K | Apache-2.0 |171 172## Usage173 174Pass a GGUF file directly as `--model`:175 176```bash177audiocpp_cli --task tts --family supertonic --model Supertonic-3-GGUF/supertonic-3-orig.gguf --backend cuda --language en --text "Hello." --voice-id M1 --out out.wav178```179 180For ASR:181 182```bash183audiocpp_cli --task asr --family qwen3_asr --model Qwen3-ASR-0.6B-GGUF/qwen3-asr-0.6b-f16.gguf --backend cuda --audio speech.wav --text "" --text-out transcript.txt184```185 186## License187 188Each GGUF file is a converted form of its original model. Use and redistribution are governed by the corresponding original model license listed above. Please review the original model card and license terms before using or redistributing any converted weights.189 