CoolFace
Modelpublic

voconly-org/parakeet-tdt-0.6b-v3-gguf

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes31downloads
Model Card

Parakeet TDT 0.6B v3 GGUF

NVIDIA 推出的高效时间依赖转录 (TDT) 多语言语音识别模型,第三代版本,专注于欧洲语言。

模型简介

NVIDIA Parakeet TDT (Time-Delay Transformer) 是采用时间依赖架构的多语言语音识别模型:

  • —参数量:0.6B (600M)
  • —版本:v3 (第三代)
  • —语言支持:25种欧洲语言
  • —量化格式:GGUF (llama.cpp 兼容)
  • —特点:TDT架构、高准确率、快速推理、欧洲语言专项优化
  • —适用场景:欧洲语言语音转写、语音命令识别、字幕生成

支持语言 (25种欧洲语言)

语言代码语言代码语言代码
英语en德语de法语fr
西班牙语es意大利语it葡萄牙语pt
荷兰语nl俄语ru乌克兰语uk
波兰语pl捷克语cs斯洛伐克语sk
匈牙利语hu罗马尼亚语ro保加利亚语bg
克罗地亚语hr斯洛文尼亚语sl塞尔维亚语sr
希腊语el丹麦语da瑞典语sv
芬兰语fi爱沙尼亚语et拉脱维亚语lv
立陶宛语lt马耳他语mt--

可用量化版本

文件名量化类型文件大小说明
parakeet-tdt-0.6b-v3-Q4KM.ggufQ4KM~最小推荐日常使用
parakeet-tdt-0.6b-v3-Q5KM.ggufQ5KM~小平衡精度
parakeet-tdt-0.6b-v3-Q6_K.ggufQ6_K~中更高精度
parakeet-tdt-0.6b-v3-Q8_0.ggufQ8_0~中高最高量化精度
注意:F16/F32 版本已排除,推荐使用量化版本。

使用方法

llama.cpp 命令行

bash
./main -m parakeet-tdt-0.6b-v3-Q4_K_M.gguf -f audio.wav --output-txt

Python (llama-cpp-python)

python
from llama_cpp import Llama

llm = Llama(
    model_path="parakeet-tdt-0.6b-v3-Q4_K_M.gguf",
    n_gpu_layers=-1,
)

result = llm.transcribe("audio.wav")
print(result["text"])

TDT 架构特点

Parakeet TDT 采用时间延迟Transformer架构,具有以下优势:

  1. 1.时间建模能力强:更好地捕捉语音的时序特征
  2. 2.长音频处理:对长音频有更好的处理能力
  3. 3.快速推理:优化的架构设计,推理速度更快
  4. 4.准确率高:在多个基准测试中表现优异

性能基准

测试集WER (词错误率)
LibriSpeech test-clean~3-4%
LibriSpeech test-other~7-8%

技术规格

  • —架构:Time-Delay Transformer
  • —采样率:16kHz
  • —输入格式:WAV/PCM 音频
  • —推理速度:快速 (具体取决于硬件)

许可证

CC BY 4.0 License

致谢