CoolFace
Modelpublic

voconly-org/nemotron-3.5-asr-streaming-0.6b-gguf

sourceHugging Faceopenmdw-1.1updated 1mo agoView on Hugging Face
0likes89downloads
Model Card

Nemotron 3.5 ASR Streaming 0.6B GGUF

NVIDIA 推出的轻量级流式多语言语音识别模型,支持32种语言,专为实时转录场景优化。

模型简介

NVIDIA Nemotron 3.5 ASR Streaming 是专为实时流式处理设计的多语言语音识别模型:

  • —参数量:0.6B (600M)
  • —语言支持:32种语言(含中英日韩及欧洲主要语言)
  • —量化格式:GGUF (llama.cpp 兼容)
  • —特点:流式处理、低延迟、轻量级、多语言
  • —适用场景:实时字幕、直播转写、语音助手、会议实时记录

支持语言 (32种)

语言代码语言代码语言代码
英语(美)en-US英语(英)en-GB中文zh-CN
日语ja-JP韩语ko-KR阿拉伯语ar-AR
德语de-DE法语(法)fr-FR法语(加)fr-CA
西班牙语(美)es-US西班牙语(西)es-ES意大利语it-IT
葡萄牙语(巴)pt-BR葡萄牙语(葡)pt-PT荷兰语nl-NL
土耳其语tr-TR俄语ru-RU印地语hi-IN
越南语vi-VN乌克兰语uk-UA波兰语pl-PL
瑞典语sv-SE捷克语cs-CZ挪威语nb-NO
丹麦语da-DK保加利亚语bg-BG芬兰语fi-FI
克罗地亚语hr-HR斯洛伐克语sk-SK匈牙利语hu-HU
罗马尼亚语ro-RO爱沙尼亚语et-EE--

可用量化版本

文件名量化类型文件大小说明
nemotron-3.5-asr-streaming-0.6b-Q4KM.ggufQ4KM~最小推荐实时应用
nemotron-3.5-asr-streaming-0.6b-Q5KM.ggufQ5KM~小平衡选择
nemotron-3.5-asr-streaming-0.6b-Q6_K.ggufQ6_K~中更高精度
nemotron-3.5-asr-streaming-0.6b-Q8_0.ggufQ8_0~中高最高量化精度
注意:F16/F32 版本已排除,推荐使用量化版本以获得最佳流式性能。

使用方法

实时流式转录

python
from llama_cpp import Llama
import sounddevice as sd
import numpy as np

llm = Llama(
    model_path="nemotron-3.5-asr-streaming-0.6b-Q4_K_M.gguf",
    n_gpu_layers=-1,
)

# 实时录音转写
def callback(indata, frames, time, status):
    # 流式处理音频
    result = llm.transcribe_buffer(indata)
    if result["text"]:
        print(result["text"], end="", flush=True)

with sd.InputStream(callback=callback):
    input("按 Enter 停止...")

离线批处理

bash
./main -m nemotron-3.5-asr-streaming-0.6b-Q4_K_M.gguf -f audio.wav --output-txt

性能特点

  • —低延迟:专为实时处理优化,延迟极低
  • —轻量级:模型小巧,资源占用少
  • —多语言:支持32种语言,覆盖全球主要语种
  • —流式友好:支持音频流逐步输入
  • —边缘部署:适合在边缘设备上运行

技术规格

  • —架构:基于 Transformer 的流式编码器
  • —采样率:16kHz
  • —延迟:<100ms (取决于硬件)
  • —内存占用:最低约 500MB (Q4KM)

应用场景

  1. 1.实时字幕:直播、视频会议实时字幕
  2. 2.语音助手:智能家居、车载系统
  3. 3.客服系统:实时通话转写
  4. 4.无障碍辅助:听力障碍辅助工具

许可证

CC BY 4.0 License

致谢