hungyilee/spoken-llm-leaderboard
0
🎤 Spoken LLM Leaderboard
  
这是一个综合评估语音大语言模型性能的交互式排行榜,展示了当前主流语音LLM在多个标准化基准测试上的表现。
✨ 特性
- 🏆 实时排行榜: 展示语音LLM在各种任务上的性能排名
- 📊 交互式可视化: 提供雷达图、分布图等多种数据可视化
- 🔍 灵活筛选: 支持按基准测试类型筛选显示结果
- 📈 趋势追踪: 标识热门和新兴模型
- 🔗 直接链接: 点击即可访问模型的HuggingFace页面
- 🌏 中文界面: 完全中文化的用户界面
📋 支持的基准测试
我们的排行榜涵盖了以下重要的语音理解和生成基准测试:
🎯 综合评估
- Dynamic-SUPERB: 180个任务的综合语音理解评估
- MMSU: 大规模多任务口语理解和推理基准
🗣️ 语音理解
- SLUE: 自然语音的口语理解评估
- Speech QA: 语音问答理解能力测试
- CCFQA: 跨语言跨模态语音文本事实性评估
🎵 声学特征
- SALMon: 声学语言模型评估(背景噪音、情感、说话人身份)
- Emotion Recognition: 语音情感识别准确率
- Speaker ID: 说话人识别准确率
📊 当前收录模型
排行榜目前包含以下语音LLM:
🚀 快速开始
在线使用
直接访问我们的 Hugging Face Spaces 即可使用。
本地运行
# 克隆仓库
git clone https://huggingface.co/spaces/hungyilee/spoken-llm-leaderboard
cd spoken-llm-leaderboard
# 安装依赖
pip install -r requirements.txt
# 运行应用
python app.py📝 提交新模型
我们欢迎社区贡献新的模型评测结果!如果您想将您的模型添加到排行榜中,请:
- 准备评测数据: 在我们支持的基准测试上评估您的模型
- 创建Issue: 在GitHub仓库中创建新issue,包含:
- 模型基本信息(名称、组织、参数量、许可证)
- 各基准测试的详细分数
- HuggingFace模型链接(如有)
- 相关论文链接(如有)
- 等待审核: 我们会验证数据并更新排行榜
评测要求
- 使用标准的基准测试协议
- 提供可复现的评测方法
- 包含足够的实验细节
🔬 技术实现
- 前端框架: Gradio 4.44.0
- 数据处理: Pandas + NumPy
- 可视化: Plotly
- 部署平台: Hugging Face Spaces
📚 相关资源
学术论文
- Dynamic-SUPERB Phase-2 - 协作扩展的语音模型能力评估基准
- SLUE: New Benchmark Tasks - 自然语音的口语理解评估
- A Suite for Acoustic Language Model Evaluation - SALMon评估套件
- MMSU: A Massive Multi-task Benchmark - 大规模多任务口语理解基准
相关项目
🤝 贡献指南
我们欢迎各种形式的贡献:
- 🐛 报告bug或提出改进建议
- 📊 提交新的模型评测结果
- 🔧 代码优化和功能增强
- 📝 文档改进和翻译
📄 许可证
本项目采用 Apache 2.0 许可证。
👨💻 维护者
- @hungyilee - 项目创建者和主要维护者
📞 联系方式
如有问题或建议,请通过以下方式联系:
- 📧 通过 Hugging Face 私信
- 🐛 创建 GitHub Issue
- 💬 在 Hugging Face Spaces 评论区留言
⭐ 如果这个项目对您有帮助,请给我们点个星!
🔄 最后更新:2025年9月1日
