星知

logo
logo
登录

音频大模型记不住谁在说话?墨大新基准VoxMem揭穿:32K上下文下全员不及格

墨尔本大学与新南威尔士大学团队推出VoxMem基准,用“声学证据×记忆操作”二维分类法测试15个主流音频大模型。结果显示32K上下文下准确率均未超过40%,语义记忆明显强于说话人身份、语气和环境声记忆;瓶颈集中在识别、定位和关联绑定,而非推理本身。
发布时间:2026/10/10 03:07|分类:人工智能
当语音AI被拉进真实长时间对话,能不能记住“谁说的、语气、背景声音”?墨尔本大学与新南威尔士大学团队推出基准VoxMem。现有评测两道硬伤:只盯文字转写,丢弃声音中的身份、情绪、环境声;无法单独剥离历史长度变量。VoxMem用“声学证据 × 记忆操作”二维分类法,覆盖15种组合,题目在8K到64K历史长度下保持不变,只改变对话长度,便于把记忆效果归因于长度。该基准包含3196个评测实例、34743个语音会话,约177小时音频。对15个主流音频大模型实测显示:32K上下文下准确率均未超过40%。模型对“说了什么”的语义记忆明显强于说话人身份、副语言线索(语气、情绪)和环境声;追踪语气起伏、背景声变化的准确率极低。历史长度增加时,各类记忆准确率全部下降。团队判断,当前音频大模型的语音记忆瓶颈主要在识别、定位、关联绑定环节,而非推理操作本身。模型不是不会想,而是连“谁在何时、以什么方式说了什么”等底层事实都没接稳。VoxMem等于给语音AI量体温换了更细的体温计,逼业界正视:听得懂词,不等于记得住人、语气和整个世界。
人工智能星知