星知

logo
logo
登录

首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放

阿里通义千问重磅推出语音合成模型Qwen-Audio-3.0-TTS,Plus版全球评测夺冠。该模型兼具300ms超低首包延迟与20种方言的高保真合成能力,支持自然语言指令与细粒度情感标签,突破性地解决了噪声环境下的音色还原难题,标志着语音合成进入更自然、更具表现力的实时交互新阶段。
发布时间:2026/07/21 03:23|分类:人工智能
阿里通义千问团队发布新一代实时语音合成模型Qwen-Audio-3.0-TTS。其中Plus版本在Artificial Analysis的Speech Arena榜单中斩获全球第一,综合表现超越Gemini3.1TTS、ElevenLabs v3等主流模型。本次发布包含双版本:Flash版首包延迟约300ms,适配实时交互场景;Plus版聚焦高质量合成,自然度与音色还原更优。核心能力四大突破:1.多语种与方言覆盖,支持16种语言和20种中文方言,Plus版平均说话人相似度达82.75;2.支持Free-style自然语言指令,用日常语气描述即可生成对应语音;3.细粒度标签控制,支持呼吸、笑声等非语言细节;4.复杂声学鲁棒性强,可过滤高噪声参考音频中的杂音。配套提供精品音色库,支持48K高清音频输出(预计7月24日开放),单次合成最长3分钟文本。模型已在阿里云百炼平台开放。
人工智能星知