星知

logo
logo
登录

阶跃星辰王炸发布 StepAudio 3 系列语音大模型,强势斩获多项全球第一!

阶跃星辰发布 StepAudio3 系列五款语音大模型,覆盖实时对话、语音识别、语音生成、音频综合生成与音乐创作,多项指标在 Artificial Analysis 登顶全球第一。
发布时间:2026/09/16 03:42|分类:人工智能
阶跃星辰于9月15日正式发布全新 StepAudio3 系列语音大模型,包含 StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen、StepAudio3Music 五款产品,已在阶跃星辰开放平台全面上线,多款模型在权威评测榜单 Artificial Analysis 中登顶全球第一。 - **StepAudio3Realtime**:面向全双工原生实时对话,在 Artificial Analysis Conversational Dynamics 榜单以98.9%综合得分全球第一;语音推理准确率99.7%,位列 Speech Reasoning 榜单全球第一。支持语义、语气、情绪、副语言和环境声音综合理解,并支持推理与语音生成并行、工具调用与长任务异步执行。 - **StepAudio3ASR**:将高精度语音识别与大语言模型知识推理融合,支持中英文、方言、中英混说、长音频及医疗、法律、金融、汽车、编程等专业领域;非流式语音识别词错误率(WER)仅1.7%,并列全球第一。 - **StepAudio3TTS**:真人级语音生成模型,可还原笑声、迟疑、结巴、重复、改口等副语言表现,并根据语义自动调整情绪语气,支持流式生成与播放同步。 - **StepAudio3Gen**:通过自然语言描述和参考音频,一次性统一生成人声、音效、环境音和背景音乐,支持精细控制角色音色、说话方式、情绪、方言及笑声,并指定声音元素出现时间与顺序。 - **StepAudio3Music**:支持从零生成和基于 ABC 记谱法的多轮交互创作,可通过歌词、清唱、参考歌曲或记谱法输入,控制曲风、人声、旋律、节奏、乐器和情绪;清唱配乐场景可自动补充和声、节奏、乐器及完整编曲。
人工智能星知