voconly-org/parakeet-tdt-0.6b-v3-gguf
031
Parakeet TDT 0.6B v3 GGUF
NVIDIA 推出的高效时间依赖转录 (TDT) 多语言语音识别模型,第三代版本,专注于欧洲语言。
模型简介
NVIDIA Parakeet TDT (Time-Delay Transformer) 是采用时间依赖架构的多语言语音识别模型:
- 参数量:0.6B (600M)
- 版本:v3 (第三代)
- 语言支持:25种欧洲语言
- 量化格式:GGUF (llama.cpp 兼容)
- 特点:TDT架构、高准确率、快速推理、欧洲语言专项优化
- 适用场景:欧洲语言语音转写、语音命令识别、字幕生成
支持语言 (25种欧洲语言)
可用量化版本
注意:F16/F32 版本已排除,推荐使用量化版本。
使用方法
llama.cpp 命令行
./main -m parakeet-tdt-0.6b-v3-Q4_K_M.gguf -f audio.wav --output-txtPython (llama-cpp-python)
from llama_cpp import Llama
llm = Llama(
model_path="parakeet-tdt-0.6b-v3-Q4_K_M.gguf",
n_gpu_layers=-1,
)
result = llm.transcribe("audio.wav")
print(result["text"])TDT 架构特点
Parakeet TDT 采用时间延迟Transformer架构,具有以下优势:
- 时间建模能力强:更好地捕捉语音的时序特征
- 长音频处理:对长音频有更好的处理能力
- 快速推理:优化的架构设计,推理速度更快
- 准确率高:在多个基准测试中表现优异
性能基准
技术规格
- 架构:Time-Delay Transformer
- 采样率:16kHz
- 输入格式:WAV/PCM 音频
- 推理速度:快速 (具体取决于硬件)
许可证
CC BY 4.0 License
致谢
- 原始模型:nvidia/parakeet-tdt-0.6b-v3
- GGUF转换:由 voconly 团队完成
