多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」
8314点击    2026-10-09 16:23

在语音助手、多用户共享的家庭助理等长期对话场景中,模型需要跨越多次会话记住用户的信息,但现有评测常遭遇两大难题:


一是语音中的关键信息不止于文字,说话人身份、语气和背景声只存在于音频信号里,转写后即丢失,而现有基准大多只考词汇内容;


二是真实交互分布在相隔一段时间的多个会话中,现有基准却局限于单段录音或单段连续对话,且在不同长度下使用不同题目,无法分离历史长度本身的影响。


为突破这两道关卡,墨尔本大学与新南威尔士大学联合团队提出多会话语音记忆基准VoxMem,以「声学证据×记忆操作」的二维分类法覆盖15种考察组合,并让每道题在8K到64K token的历史长度下保持不变。VoxMem包含3,196个评测实例、34,743个语音会话(约177小时)。对15个音频大模型的评测显示,32K下无一整体准确率超过40%,追踪语气变化和背景声变化的平均准确率仅为3.4%与1.2%。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」

论文链接:https://arxiv.org/abs/2609.32607

代码链接:https://github.com/swagshaw/voxmem


一句话里

藏着三种文字记不下的信息


设想家里有一台语音助手,同时为一家人服务。某天你随口问它:「我之前说灯具更换那件事,后来怎么样了?」


要答对这个问题,助手得先做一件文字处理不了的事:听出提问的人是你。因为就在几天前,家里另一个人也跟它聊过灯具更换,说的是「已经批准了」;而你当时说的是「先暂停」。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


这正是语音和文字最大的不同。会议纪要能记下每个人说了什么,却记不下说话时的犹豫、惊讶,也记不下窗外的施工声。语音转写也是如此:一句话转成文字后,说话人是谁、用什么语气说的、背景里能听到什么,都随之消失。


而这些信息,恰恰可能是之后某个问题的答案。「上次聊入住的时候,我听起来是不是有点不情愿?」「那两次聊喂猫计划的对话,背景里是不是同一台洗衣机的声音?」这类问题,在文字记录里找不到答案。


上下文越来越长

记忆未必跟得上


如今的音频大模型(Large Audio Language Model,LALM)上下文窗口越拉越长,一次能装下几十分钟的音频。直觉上,把所有历史对话都塞进去,模型就能「记住」一切。


但书架变大,不等于能找到那本书。能装下历史,和能在需要时准确取回、正确使用其中的信息,是两回事。


要回答「模型到底记住了多少」,首先需要一把合适的尺子。研究团队梳理了现有的长音频理解基准和语音对话基准,发现它们在三方面都不够用。


第一,考的大多是「说了什么」,只零星涉及少数声学线索,很少系统地考察谁在说、怎么说、周围能听到什么。


第二,记忆操作是临时挑选的。有的基准只考检索,有的考整合,没有统一的框架。于是当模型答错时,很难判断问题出在某类信息、某种操作,还是两者的组合。


第三,它们都建立在一段长录音或一段连续对话之上。真实的语音交互却分布在相隔数天的多次会话中:同一个人反复出现,话题来回切换,早先的计划会被更新。


此外,分析历史长度影响的基准,往往在不同长度档里放的是不同的题。这就像用两套不同的试卷比较成绩,分数下降究竟是因为「内容变多」还是「题变难」,说不清楚。


把「记住什么」和「怎么用」拆开


VoxMem的第一步,是给语音记忆画一张完整的地图。它用两个维度刻画每一道题。


第一个维度是声学证据,即要从过去的语音里记住什么:


  • 语音语义:说了什么,比如计划、数量、偏好;
  • 说话人身份:谁说的,需要把内容和声音对应起来;
  • 副语言线索:怎么说的,比如犹豫、惊讶、强调、语速、笑声;
  • 环境声:说话时周围能听到什么,比如交通声、警报声、家电声。


其中语音语义从文字就能恢复,作为参照;后三类是「音频原生」的,答案不在转写里。


第二个维度是记忆操作,即要怎么使用这些记忆:


  • 信息抽取(IE):从某一次过去的会话中取回信息;
  • 多会话推理(MSR):把几次会话的证据结合起来,比如计数、匹配、比较;
  • 时序演变追踪(TET):追踪某个状态如何随会话变化,比如最近一次是什么语气;
  • 拒答(AR):当历史不足以给出唯一答案时,要能说「无法确定」。


两个维度交叉,得到一张4×4的表。其中「语义×信息抽取」被刻意去掉:如果检索线索和答案都是文字,题目就退化成了纯文本检索,测不出声音与内容之间的关联。剩下的15个格子,就是VoxMem的全部考点。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


同一道题

只让历史变长


有了地图,下一步是出题。研究团队在设计上花了很多心思,确保题目「必须用耳朵答」,而且分数的变化能被准确归因。


在海里放假针。每段对话历史由三类会话组成:含有答案的证据会话;话题相近、但不给答案或给出不同取值的干扰会话;以及与问题无关的日常填充会话。


这有点像「大海捞针」的升级版:针不再是一句话,而是一个声音、一种语气或一段背景声,海里还放了长得很像的假针。研究团队专门检验过干扰会话的难度:一个只看文本的分类器区分证据会话和干扰会话,准确率只有51%–56%,与打乱标签时的47%–49%相差无几。


同一句话,录两个版本。用户语音由TTS合成:每位用户在所有会话中固定使用同一个音色,语气通过风格控制注入,环境声按固定信噪比混入。每个带有声学线索的轮次,都会同时保留一个「配对版本」:文字相同、音色相同,只去掉那条线索。这相当于为每条线索准备了一组对照实验,质检时用来确认答案确实由线索决定,而不是由文字决定。


卷子不变,只加页数。每道题都被放进8K、16K、32K、64K四种长度的历史中,大约相当于2.5到20分钟的音频。长历史严格包含短历史的全部会话,只往里增加干扰和填充会话。问题、答案和证据在四个长度下完全相同,分数下降只能归因于历史变长。证据会话和干扰会话在历史中均匀分布,位置和时间戳都不会透露答案在哪里。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


为了确认「音频原生题」名副其实,研究团队还做了一个直接的检验:把每个用户轮次换成它的精确文字,其余不变,再让模型作答。结果,音频原生题的准确率从46.2%骤降到4.4%,而语音语义题只从75.9%降到71.0%。也就是说,即使给出完美的转写,这些题也基本答不出来。


此外,每道题还要经过两级质量控制:会话级检查转写是否准确、说话人是否一致、线索能否被听出;题目级检查答案是否唯一、是否真的需要相应的记忆操作和声音信息、整段历史中有没有泄露答案。最终,VoxMem包含799道题、3,196个评测实例、34,743个语音会话,约177小时音频,覆盖20类日常话题。


15个模型

没有一个超过40%


研究团队评测了15个音频大模型,其中5个闭源(3个Gemini、2个Qwen),10个开源,覆盖音频专用和全模态两类架构。所有模型使用相同的输入和指令,回答由LLM裁判按答案类型判分,换用另一个模型复判的一致性κ达到0.95。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


第一个结论很直接:在32K长度下,没有一个模型的整体准确率超过40%。排名第一的Qwen3.8-Omni-Flash为38.5%,闭源模型平均33.0%,开源模型平均21.9%。低分并不集中在少数模型上,而是普遍现象。


按证据类型拆开看,差距更加明显。32K下,闭源模型在语音语义上平均55.6%,在说话人身份、副语言、环境声上则分别只有32.7%、20.0%和21.9%。开源模型对应为31.6%、26.7%、14.5%和15.5%。


换句话说,模型在「说了什么」上的成绩,掩盖了它们在声音本身上的大量失败。


说出口的变化记得住

没说出口的几乎全忘


把四种操作和四类证据交叉起来,能看到更细的结构。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


一个反直觉的发现是:跨多次会话做推理,并不一定比从单次会话中找信息更难。多会话推理在语义和说话人身份上分别达到41.8%和43.1%,在副语言和环境声上也有26.7%和25.2%,明显高于对应的信息抽取(8.8%和13.5%)。


反差最大的是时序追踪。如果状态的变化是说出口的,比如「入住改到周二了」,15个模型平均能追到44.5%;在说话人身份上降至20.0%;而当变化只体现在声音里,比如这次语气变了、背景声换了,准确率几乎归零:语气变化3.4%,背景声变化1.2%。


论文认为,问题不在于模型不会做时间推理,而在于它们很难维护和更新由语气或环境声承载的「状态」,这可能反映了当前音频大模型在状态建模上的不足。


拒答率更高

不等于更「谨慎」


VoxMem还专门设计了「证据不足、应该拒答」的题。这些题由可答题派生而来,比如删掉关键的证据会话,或者保留文字、只去掉能锁定答案的那条声学线索。


有意思的是,模型在副语言和环境声题上的拒答准确率(34.3%和34.2%),反而高于语义和说话人题(19.9%和16.2%),与可答题的规律正好相反。


这并不说明模型在声学问题上更「谨慎」。论文的解读是:模型拒答往往不是因为判断出证据缺失,而是因为即使证据就在那里,它也难以识别和使用声学信息。


越聊越忘

但忘的方式不一样


由于题目和证据固定不变,VoxMem可以干净地观察「历史变长」这一个因素的影响。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


从8K到32K,闭源模型平均准确率从40.1%降到33.0%,开源模型从26.6%降到21.9%。在能处理完整64K历史的10个模型上,四类证据都在持续下降。到64K时,模型在语义上保留了8K时70.3%的准确率,副语言为69.8%,说话人为66.5%,环境声只有63.2%。


值得注意的是,副语言的绝对准确率最低,衰减速度却和语义差不多;说话人和环境声则衰减得最快。这说明「基线低」和「对长度敏感」是两种不同的失败:模型在任何长度下都很难处理语气信息,而说话人和环境声的记忆,则是随着历史增长被逐渐侵蚀。


错在哪一步?

多数在「听进去」之前


准确率告诉我们模型错了,错误分析则试图回答错在哪里。研究团队按一次记忆查询可能失败的先后顺序,把64K下的错误回答分成几类:没找到证据(识别或定位失败);找到了,但挂错了人或会话(绑定错误);找到也挂对了,但操作做错了(操作执行错误);以及答出了历史里根本没有的内容(无依据答案)。


多会话语音记忆基准VoxMem,专治音频大模型记不住「谁说的、怎么说」


结果显示,三类声学信息的「病因」各不相同。说话人题的错误有48%是绑定错误:内容记对了,却记到了别人头上,或挂错了会话。副语言题的错误有63%是定位失败:答案所需的语气线索根本没被找回来。环境声题的错误则分布在定位失败(41%)和无依据答案(39%)之间。


论文附录记录了几个典型案例。一道说话人计数题的正确答案是2,某开源模型却回答10:历史里有10次会话聊过这个话题,但只有2次满足题目要求的说话人条件,模型数的是话题,不是说话人。另一道环境声题中,证据会话的背景声是引擎声和母鸡叫,某闭源模型却编出了「厨房清洁声」的分组和计数。


从操作看,时序追踪的错误有55%是定位失败,操作执行错误只占5%。在全部被归因的错误中,「证据找到了、也绑定对了、只是操作出错」的情况仅占8.4%。这意味着,当前音频大模型在语音记忆上的瓶颈,大多不在「想」,而在「听进去并记住」。


结语


过去几年,音频大模型的进步有目共睹:能听懂指令、能流畅对话、能处理越来越长的音频。但当语音助手从一问一答走向长期陪伴,它面对的不再是一段孤立的录音,而是跨越数天乃至数周的交互历史。


VoxMem的结果表明,只把上下文窗口拉长,并不足以带来真正的长期记忆。模型对「说了什么」的记忆远好于对「谁说的、怎么说的、听到了什么」的记忆;只有当变化被说出口时,它们才能较可靠地追踪;历史越长,已有的证据越难取回。


论文指出,未来的系统需要保留文字之外的声学信息,并在时间上维护它与说话人、事件和会话之间的关联。VoxMem希望为衡量和推动这一方向的进展,提供一个系统化的基础。


参考资料:

https://arxiv.org/abs/2609.32607


文章来自于"新智元",作者 "LRST"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales