对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」
8168点击    2026-09-04 10:45

颜水成团队发布语音领域首个实时“流式双脑架构”记忆框架,左脑记信息,右脑记住你。


科幻电影曾无数次预演过AI与人类共生的场景。但在2026年的今天,尽管GPT-4o、全双工模型、Interaction Model 已经让对话流畅无比,一个尖锐的矛盾依然存在:AI 只有瞬时反应,没有长期记忆。


你和它聊了一整夜的心事,第二天醒来,它依然会像面对陌生人一样重新问你是谁;说过不吃坚果,明天照样推荐给你。


这种记忆断裂让AI始终困在工具属性里,无法进化为真正人类共生的AGI Being。AI现有记忆只记录“你说过什么”,却捕捉不到“你为什么这么说”——交互的另一半是情感,你说「我没事」时的语气,提到某个人时不自觉的停顿,这些情感褶皱,才是通向 AGI Being 的关键入口。


没有记忆的交互系统是没有灵魂的,信任每次都会被清零,消耗的是刚建立起来的那点连接;AI

只会「答对」,学不会「懂你」。


近日,由颜水成教授领衔的Open Interaction Lab, 联合四家顶级高校,正式发布了全球首个专为实时交互打造的多模态流式双脑记忆框架VoiceMem。它用“左脑记信息,右脑记情绪”的方式,补全 Digital Embodiment 的第三根支柱,让AI第一次真正拥有了“长期陪伴”的资格。


这不是一个概念故事。VoiceMem的工程优化充分,一行代码就能跑。其目标很明确:做实时交互版的「Mem0」。


对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」


Project page: https://xzf-thu.github.io/VoiceMem


Code: https://github.com/xzf-thu/VoiceMem


Report: https://arxiv.org/pdf/2608.26005


为什么是VoiceMem


Mem0、Zep、MemOS 直接用不行吗?


不行,两个原因。


一、应用上,时间和信息输出都不可用。


语音留给「想一想」的时间太短。从你说完到 AI 开口,总预算约 400 毫秒,现有系统查一次要 2000 毫秒。而且文本 Agent 习惯一次返回上百条让模型自己挑,语音模型吃不下;少了,则有用信息锐减。


VoiceMem 把检索压到 VAD 后 134 毫秒(降低 65%),拆成四个子阶段执行,延迟几乎降到 0。左脑在 LongMemEval 上 Top-10 就能对应 Mem0 top-200 的精度,成本骤降 95%。


二、也是真正核心的,这些系统只管「信息」,接不住「情感」。


你是压力一大就闭口不谈的人,还是必须找人倾诉的人?这不是信息,这是「你」这个人本身。


VoiceMem 的解法是「流式双脑架构」。别害怕,原理很简单:


  • 信息左脑|Informative Left Brain —— 双层图检索:上层联想层 + 下层检索层(兼容 Mem0 / Zep),节点是实体、人物、知识,毫秒级取回事实。
  • 情感右脑|Emotional Right Brain —— Identity nodes 沉淀稳定人格,Joint nodes 把情绪与偏好绑定到左脑的每一条记忆之上。


两个脑并行处理、独立维护,再通过联合节点作为【桥梁】共享信息。


所以当 AI 想起「上周三你提过的那个项目」,它同时想起的是你当时的语气。事实和情绪一起被取回。


当 AI 记得住昨天,它才第一次真正「认识」你;当它记得住你的一生,它才可能成为你的另一个自己。记忆不是 AGI Being 的一个功能,而是它成立的前提。如果你在用语音助手,千万别错过。


对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」


下面分别介绍左脑、右脑的管理机制,以及 VoiceMem 为什么能「流起来」。


左脑:通过涌现机制控制信息密度


日常检索最容易翻车的地方,是"搜得到但搜不对"。比如你问"上次体检结果怎么样",系统按字面相似度捞回来几条记忆,结果一大半只是沾了"体检"这个词的边,真正有用的都被挤了出去。


问题不是排序不够聪明,是搜索的范围。


VoiceMem 的做法是先给记忆用簇-实体来组织,并建立内部的粗-细粒度关联。问题一来,先顺着多层联合搜索把范围收窄,再在这个小圈子里搜。


他们左脑最核心的算法,叫

涌现

。是专门用来适应长期信息积累的。涌现机制根据节点的被搜索情况建立内部关系子图,再用LLM对重要性,必要性和相关性和评估,做最适合长期的簇的划分。


效果很直接:在权威的长对话记忆测试 LoCoMo 上,左脑只用五条记忆就拿到 91.2 分,而 Mem0 就算给到上百条记忆,也只有 61.68 分。


对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」


右脑:记住你的情绪,更记住“你”究竟是谁


左脑记的是发生过什么,右脑记的是你是一个什么样的人:你的性格、你的情绪习惯,以及这些情绪是冲着谁、冲着哪件事去的。「他不喜欢每周的例会」和「他这个人容易焦虑」,是两种东西,得分开记。


VoiceMem 右脑的核心算法是长短期情绪归因。一边在短期对话里实时捕捉情绪,一边在长期维护中回头观察、归因、总结,把反复出现的情绪沉淀下来,变成对这个人的稳定认识。


时间一长,它才算是个懂你的陪伴者。


测试里有个现象值得说:有些冲突和用户偏好,答案其实全写在对话记录里,但普通模型并不在意。


VoiceMem 靠右脑把分数从一成多拉到七成以上。反过来,把右脑整个拿掉,纯信息类的题目分数也会跟着掉。情绪和人格里藏着事实库里没有的信息。


对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」


流式记忆架构-搜索机制协同设计


时间是记忆系统的核心挑战之一:用户期待记忆被即时调用,但真正的“零延迟”几乎是不可能完成的任务。


VoiceMem 从三个层面解决这个问题。前两点很直接:一方面将查询收敛到 Top-5,减少检索开销;另一方面控制返回信息量,让记忆读取足够快。


更关键的是第三点,从机制上打掉延迟:VoiceMem 的记忆架构本身就是围绕检索时延设计的。整个检索过程被拆成 listening、speech tail(0–200 ms)、anticipation(200–300 ms)和 searching(300–340 ms)四个阶段,在用户还没有说完时,就已经并行完成 ASR、实体与 schema 匹配以及图扩展,只把真正的后端搜索留到最后。


最终,完整的双脑检索过程被压缩到仅 134 ms,并进一步完全隐藏在标准 VAD 的 300 ms 静音等待窗口内,因此不会给对话增加可感知的额外延迟。


好玩的是,研究人员为了让voicemem更容易上说,还真把它的流式代码和vad做的完全一样,一行运行。


实验:更快,更准,更懂你


除了在学术界经典benchmark上面进行跑分,我们更想知道它在真实场景里好不好用。为此,我们专门做了一套贴近真实生活的评测集,涵盖信息、人格、情感归因、副语言和环境等多个维度。


对话已死,共生永生:颜水成团队发布 VoiceMem,为 AGI 找回「丢掉的昨天」


结语


VoiceMem,据我们所知是目前唯一的实时交互可用的记忆。但我们的目标,远远不只是给语音模型外挂一层 Memory,而是让记忆真正成为实时交互系统的一部分。


接下来,我们会继续沿着三个方向持续探索。


第一,扩展多模态记忆的边界。从今天对语音、语义与情感线索的理解,走向更完整的 Moments。


第二,继续优化“左右脑”的长期进化能力。人的记忆从来不是一个不断膨胀的数据库,而是在遗忘、强化、抽象、联想与重构中持续变化。


第三,把实时 Memory 做到真正可部署。我们会继续压低推理成本与延迟,优化一卡多进程、多 Agent 并发和长期运行能力,让voicemem成为语音陪伴、具身智能、智能硬件与实时 Agent 的基础设施。


我们一直在想一个问题:如果有一天 AI 真的成为一种 Being,什么构成它的意识与自我? 最终的答案就是记忆。


因为没有记忆,就没有过去;没有过去,就没有连续的自我。某种意义上,记忆就是意识得以发生的前提。


VoiceMem的目标,不在此刻,是把实时交互领域即插即用,稳定可用、实时、能够长期进化的 Memory 做出来。


我们期待有一天,agi being 出现,并和人类产生真正的链接。


文章来自于微信公众号 “AI科技评论”,作者 “AI科技评论”

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

2
免费使用GPT-4o

【免费】ffa.chat是一个完全免费的GPT-4o镜像站点,无需魔法付费,即可无限制使用GPT-4o等多个海外模型产品。

在线使用:https://ffa.chat/

3
无人直播

【开源免费】VideoChat是一个开源数字人实时对话,该项目支持支持语音输入和实时对话,数字人形象可自定义等功能,首次对话延迟低至3s。

项目地址:https://github.com/Henry-23/VideoChat

在线体验:https://www.modelscope.cn/studios/AI-ModelScope/video_chat


【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案,生成数字人形象进行直播,并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。

项目地址:https://github.com/PeterH0323/Streamer-Sales