星知

logo
logo
登录

小米开源工业级目标说话人语音识别大模型 CocktailASR-1

小米开源 CocktailASR-1,通过参考声纹在多人混合音频中只识别目标说话人,多项基准测试大幅领先,并具备负样本拒识与思维链推理能力,推动语音识别进入“锁定一个声音”阶段。
发布时间:2026/09/12 04:06|分类:人工智能
小米近日正式开源工业级目标说话人语音识别大模型 CocktailASR-1,旨在解决多人同时讲话的“鸡尾酒会难题”。该模型采用基于参考声纹的目标说话人识别机制,用户提供参考音频后,利用声纹嵌入精准锁定目标说话人,只转录该特定人物语音,过滤其他人声、混响及背景噪声。底层架构上,CocktailASR-1 采用端到端大语言模型架构,由 D2V2 音频编码器、Adapter 与大模型解码器串联组成,所有权重整合在同一检查点中;输入时将参考音频与目标单声道音频拼接,中间插入一秒静音作为分隔。基准测试显示,在 LibriMix2mix 和 LibriSpeechMix2mix 数据集上字错率分别低至 4.11% 和 2.90%;在 LibriMix3mix 测试中仅 12.29%,而部分竞品高达 76% 至 121%。在 AMI SDM、AliMeeting Far 等真实会议场景及 LibriSpeech、WenetSpeech、CommonVoice-zh 等单人场景中也全面领先。工程上具备负样本拒识能力,参考音频对应人物不在对话中时输出空文本,防止智能设备误触发;并支持思维链推理,展示判断说话人的推理过程,提升可解释性。目前代码已在 GitHub 按 Apache2.0 协议开源,依赖简单,可从 HuggingFace 加载部署。
人工智能星知