9月15日,阶跃星辰正式发布 Step Audio 3系列模型,包括 StepAudio 3 Realtime、StepAudio 3 ASR、StepAudio 3 TTS、StepAudio 3 Gen和StepAudio 3 Music,涵盖实时语音交互、语音识别、语音生成、音频内容生成以及音乐创作等多个方向,其中多款模型在Artificial Analysis相关评测榜单中位列全球第一。
据介绍,StepAudio 3 Realtime主打实时语音交互能力,支持原生全双工实时对话,能够在持续交流过程中理解用户语义、语气、情绪以及环境声音,并同步完成推理和任务执行。
在Artificial Analysis Conversational Dynamics榜单中,StepAudio 3 Realtime综合得分达到98.9%,排名全球第一,在Speech Reasoning榜单中,其语音推理准确率达到99.7%,同样位列全球第一。
在语音识别领域,StepAudio 3 ASR进一步强化了语音理解能力。该模型支持中文、英文、方言、中英混说、长音频以及专业领域语音识别,并结合大语言模型的知识理解能力,提高对人名、地名和专业术语等复杂内容的识别效果。官方数据显示,该模型在Artificial Analysis非流式语音识别准确性测试中,WER达到1.7%,并列全球第一。
语音生成方面,StepAudio 3 TTS则聚焦更加自然的人机交流体验。相比传统文本转语音技术主要关注发音准确度,该模型进一步强化语气、节奏、停顿以及笑声、迟疑等副语言表达,使AI生成声音更加接近真实交流场景。同时,该模型支持流式生成,可应用于实时语音助手、数字人等场景。
此外,阶跃星辰此次还推出面向音频内容生产的StepAudio 3 Gen模型。该模型能够根据自然语言描述和参考音频,一次生成包含人声、环境音、音效和背景音乐的完整音频内容。对于影视、动画、游戏、有声书以及短视频创作者而言,传统需要多环节完成的声音制作流程,有望通过生成式音频模型进一步压缩。
在音乐创作领域,StepAudio 3 Music支持歌曲生成、清唱配乐、歌曲翻唱等功能,用户可以通过歌词、清唱片段、参考音乐或ABC记谱法等输入,对曲风、人声、旋律、节奏和乐器进行控制。









