voconly-org/nemotron-3.5-asr-streaming-0.6b-gguf
089
Nemotron 3.5 ASR Streaming 0.6B GGUF
NVIDIA 推出的轻量级流式多语言语音识别模型,支持32种语言,专为实时转录场景优化。
模型简介
NVIDIA Nemotron 3.5 ASR Streaming 是专为实时流式处理设计的多语言语音识别模型:
- 参数量:0.6B (600M)
- 语言支持:32种语言(含中英日韩及欧洲主要语言)
- 量化格式:GGUF (llama.cpp 兼容)
- 特点:流式处理、低延迟、轻量级、多语言
- 适用场景:实时字幕、直播转写、语音助手、会议实时记录
支持语言 (32种)
可用量化版本
注意:F16/F32 版本已排除,推荐使用量化版本以获得最佳流式性能。
使用方法
实时流式转录
from llama_cpp import Llama
import sounddevice as sd
import numpy as np
llm = Llama(
model_path="nemotron-3.5-asr-streaming-0.6b-Q4_K_M.gguf",
n_gpu_layers=-1,
)
# 实时录音转写
def callback(indata, frames, time, status):
# 流式处理音频
result = llm.transcribe_buffer(indata)
if result["text"]:
print(result["text"], end="", flush=True)
with sd.InputStream(callback=callback):
input("按 Enter 停止...")离线批处理
./main -m nemotron-3.5-asr-streaming-0.6b-Q4_K_M.gguf -f audio.wav --output-txt性能特点
- 低延迟:专为实时处理优化,延迟极低
- 轻量级:模型小巧,资源占用少
- 多语言:支持32种语言,覆盖全球主要语种
- 流式友好:支持音频流逐步输入
- 边缘部署:适合在边缘设备上运行
技术规格
- 架构:基于 Transformer 的流式编码器
- 采样率:16kHz
- 延迟:<100ms (取决于硬件)
- 内存占用:最低约 500MB (Q4KM)
应用场景
- 实时字幕:直播、视频会议实时字幕
- 语音助手:智能家居、车载系统
- 客服系统:实时通话转写
- 无障碍辅助:听力障碍辅助工具
许可证
CC BY 4.0 License
致谢
- 原始模型:nvidia/nemotron-3.5-asr-streaming-0.6b
- GGUF转换:由 voconly 团队完成
