讯飞星火语音基座大模型上线:0.65B 编码器配 30B MoE,纯国产算力训练
科大讯飞发布全国产算力训练的语音基座大模型 Spark-Audio-1.0-Preview,采用 0.65B 音频编码器与 30B MoE 大语言模型,支持 99 种语言和 202 种方言,在复杂噪声、小声说话等真实场景中展现优势。
发布时间:2026/09/17 03:45|分类:人工智能
科大讯飞宣布 Spark-Audio-1.0-Preview 上线,这是一款基于全国产化算力训练的语音基座大模型。该模型采用 0.65B(Dense 结构)音频编码器,搭配 30B-A3B(MoE 结构)大语言模型,使用 1300 万小时音频及大量文本数据训练。它不再只做语音转文字,而是直接理解语音,可同时输入文本和语音,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析及音频问答等任务。官方称其支持 99 种语言及 202 种方言识别,在复杂场景高噪声、小声说等真实应用类任务上明显领先;与同尺寸 Qwen3.5-omni-flash 相比,在多语言、多方言语音识别平均效果上表现优势;与尺寸更大的 Qwen3.5-omni-plus 效果接近。在 Fleurs、Kespeech、LibriSpeech 等评测中,其得分高于 Gemini-3.1 Pro,并在 Fleurs 中文测试集中取得 SOTA。讯飞也坦言,该版本在指令遵循、对话、音频理解等任务上仍有追赶空间。目前 Spark-Audio-1.0-Preview 已开放体验,API 后续将上线讯飞开放平台。