新浪新闻客户端

Step-Audio-Chat开源发布:1300亿参数多模态大模型重塑语音交互体验-CSDN博客

Step-Audio-Chat开源发布:1300亿参数多模态大模型重塑语音交互体验-CSDN博客
2026年05月04日 21:41 新浪网 作者
avatar
天天值得买

  近日,StepFun团队正式开源其重磅语音交互大模型Step-Audio-Chat,该模型以1300亿参数规模构建了业界领先的多模态语音理解与生成体系。作为Step-Audio项目的核心组件,该模型突破性地实现了语音识别、语义理解、对话管理、声音合成及语音生成五大功能的无缝融合,为智能语音交互领域树立了新的技术标杆。

  在权威评测基准StepEval-Audio-360中,Step-Audio-Chat展现出压倒性的性能优势。通过GPT-4o作为评测裁判的多维度评估显示,该模型在事实准确性指标上达到66.4%,较第二名GLM4-Voice提升11.7个百分点;相关性得分75.2%,领先同类产品8.8个百分点;综合对话评分更是以4.11分的成绩,显著超越GLM4-Voice(3.49分)和Qwen2-Audio(2.27分)等竞品。值得注意的是,对比组中标记为"*"的Moshi模型因测试条件差异,其1.0%的事实准确率和1.49分的对话评分仅供参考。

  跨模态知识理解能力测试进一步验证了模型的综合实力。在Llama Questions常识问答任务中,Step-Audio-Chat以81.0%的正确率大幅领先MinMo(78.9%)和Freeze-Omni(72.0%);Web Questions网络问答任务中75.1%的得分,较第二名MinMo(55.0%)提升20.1个百分点;TriviaQA数据集(标记"*")上58.0%的表现,超越Freeze-Omni的53.9%;HSK-6中文水平考试中更是取得86.0%的优异成绩,展现出卓越的多语言处理能力。这些数据充分证明,该模型不仅在语音领域表现突出,更具备强大的跨模态知识整合与推理能力。

  音频指令遵循测试揭示了模型在实际应用场景中的落地价值。在多语言支持方面,Step-Audio-Chat获得3.8分,是GLM-4-Voice(1.9分)的两倍;角色扮演场景评分4.2分,展现出细腻的情感交互能力;语音控制任务中4.1分的音频质量评分,配合4.4分的指令遵循度,为智能家居、车载交互等场景提供了可靠的技术支撑。特别值得关注的是,在歌唱/说唱这类高难度任务中,该模型音频质量评分达到4.0分,较GLM-4-Voice(2.4分)提升66.7%,显示出在创意内容生成领域的巨大潜力。

  Step-Audio-Chat的开源发布,不仅为学术界提供了研究多模态语音交互的优质样本,更为产业界带来了可直接落地的技术方案。其模块化的架构设计支持开发者根据实际需求灵活调用各项功能,从智能客服到虚拟主播,从语言学习助手到个性化语音助手,广泛的应用前景正等待开发者探索。感兴趣的研究者和工程师可通过访问项目仓库https://gitcode.com/StepFun/Step-Audio-Chat获取完整代码与技术文档,共同推动智能语音交互技术的创新发展。随着该模型的开源迭代,我们有理由相信,人机语音交互将迎来更自然、更智能、更富有人性化的全新阶段。

特别声明:以上文章内容仅代表作者本人观点,不代表新浪网观点或立场。如有关于作品内容、版权或其它问题请于作品发表后的30日内与新浪网联系。
权利保护声明页/Notice to Right Holders

举报邮箱:jubao@vip.sina.com

Copyright © 1996-2026 SINA Corporation

All Rights Reserved 新浪公司 版权所有