国内唯一做多模态长记忆的公司,丘脑智能完成千万融资

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
国内唯一做多模态长记忆的公司,丘脑智能完成千万融资
10077点击    2026-08-06 10:40

国内唯一做多模态长记忆的公司,融资数千万,押注主动智能|涌现新项目


一句话介绍


国内唯一做多模态长记忆的公司——丘脑智能,推出原生多模态记忆基座,押注AI从通用走向个性化,最终走向主动智能。


主动智能,指的是AI能在足够了解用户的基础上,在合适的时间、以恰当的方式主动跟用户交互。要实现主动智能,Memory是必须要跨过的门槛。


融资情况


近日,丘脑智能已完成数千万元种子轮融资,投资方包括深圳一线基金和产业资本,本轮融资主要用于技术研发以及人才队伍补充。


团队介绍


丘脑智能创立于2025年11月,创始人兼CEO张源毕业于北京大学,是电子与经济双学科背景,曾在一家自动驾驶公司担任COO,也有过创投行业、具身智能的工作经历。


团队平均年龄约26岁,核心人员主要来自阿里达摩院、腾讯、商汤、港中文、港中深、北大、西交大、KIT、复旦等企业和高校。


产品及业务


Memory领域的行业共识,最早于2025年底在学术界率先形成。这是一个非常新的领域,在面对投资人时,张源常常被问到一些问题,比如,基模会不会自己把记忆做了?Memory这一层到底会不会独立存在?基模和记忆企业之间应该怎么分工?


这些问题,张源有一个坚定的回答:记忆层一定会作为独立的基础设施长期存在。


她对此解释,不同厂商的基模基因和训练语料各有差异,擅长的任务也各有侧重,用户不断在几家模型之间切换,这导致记忆孤岛的问题长期存在。AI从通用走向个性化的过程中,缺少一个能持续学习记住用户的中间层。因此,以用户为中心的第三方记忆层必然会独立于基模之外而存在。这恰恰是张源看到的机会。


不过,对于她而言,首先要做的是直面行业尚未解决的问题。现阶段,Memory领域存在着一定痛点:


一是成本问题,多数方案直接把海量上下文全量塞入窗口,导致推理成本非常高;二是上下文断裂问题,跨session、跨任务的对话难以有效衔接;三是模态缺失问题,现有记忆方案大多局限于纯文本,无法处理视觉、音频等多模态信息。


不仅如此,由于Transformer架构导致了持续的时序错乱,目前大模型无法理解时间。在Agent的协作中,记忆孤岛往往也影响着任务执行效果,用户信息被封锁在各个Agent之中,难以实现互通。


张源认为,AI要真正融入物理世界,就必须从设计之初就以人类的多模态感知为参照。记忆架构从一开始就应该是原生多模态的,而不是先把信息转成文本再存储。


因此,丘脑智能在6月上线了一个名为MemAura的记忆基座,向客户提供ADK(智能体开发包)和API(应用程序编程接口)的服务。


MemAura能支持长记忆的积累和快速的记忆调用,采用高效的上下文机制,还能有效降低推理成本。从成绩上来看,MemAura的性能表现亮眼:输入侧Token综合消耗降低40%-49%,记忆检索延迟控制在400毫秒以内,端到端首次回答可做到1秒以内,综合准确率可以达到80%以上。


在记忆处理流程上,MemAura的做法和传统记忆系统的处理有很大的不同。


传统记忆系统通常会对用户输入进行抽取、压缩与摘要,然后存入原始信息库,再通过特定架构或图谱进行存储,最终依赖Agent模式进行检索。


不过,MemAura采取的策略是,他们做了一套仿生的记忆处理机制,具体流程分为三步:首先是对事件进行识别,模仿人类记忆机制,保留关键信息,并过滤掉冗余的噪声;随后,MemAura会对过滤后的信息进行编码;第三步是,做好信息的分区,对隐私与非隐私记忆进行分区隔离。


此外,他们还采用了冷热存储的策略:对于高频访问的证据,采用热存储以实现快速检索;而对于低频数据,进行冷存储以节约资源。这样既能确保核心数据随时可访问,又能有效控制整体成本。


张源告诉我们,在多模态记忆领域这个万亿级的赛道上,丘脑智能目前还没有面临着直面竞争。尽管这个赛道可以容纳下很多选手,但现在只有几家创业公司在关注这一赛道,估值最高的公司仅不到20亿元,竞争谈不上激烈。


丘脑智能现阶段主要的客户包括一些出货量比较大的陪伴硬件,如陪伴机器人等,以及一些垂类Agent场景,如AI客服、数字员工等领域,客户通过记忆API,帮助基模在回答与执行任务时调用原始信息,从而提升交互效果。


因为不同场景对于记忆能力的侧重点各有不同,比如3-5岁的儿童陪伴型产品与18-25岁的陪伴型产品,其中的要求差异相当大。张源告诉我们,“我们不想做更高的定制化,因此,我们把Memory能力按照场景地图的权重,封装成了不同的ADK,客户可以选择ADK接入。”


在商业模式上,MemAura以API调用量及场景授权组合的方式收费,客户可按需选择不同层级的记忆能力。


“现在我们客户大部分还聚焦在纯文本或文本加语音。随着多模态相关技术的成熟,客户的模态会更丰富,也会有更多具身场景的客户前来验证。”张源说。


核心壁垒


从公司成立至今,他们的技术路线已完成两次迭代,正逐步探索第三次迭代。


第一代是STKG时空知识图谱具体做法是:他们将时间和空间放在物理层,把多模态感知信息放在感知层,并构建起一个认知层形成认知网络,进行前向推理。


其Benchmark表现非常不错,在LoCoMo(推理与时序)与LongMemEval(交互与偏好)两个测试中均拿到了SOTA。


不过,对于客户而言,到达一定临界值后,Benchmark提高分值的意义并没有那么大,客户更在意的是延迟和Token支出。因此,他们做了一些工程化上的权衡,进行了架构层的迭代,转向模仿人类海马体的编码与认知地图、皮质层整合的方式构建记忆体系,建立起仿生记忆架构MemAura


在数据上,MemAura实现了一个量级的领先。现在传统的线上客服场景,其延迟可能会达到10秒左右,在陪伴场景的延迟会在2秒左右,而MemAura可以做到延迟控制在400毫秒以内。


目前,关于Memory的技术,丘脑智能仍在不断探索之中,他们正在通过E2P(Embedding-to-Prefix)的相关技术方式以及对transformer架构进行微调来实现下一步的迭代;目前在实验室环境下做到大幅度节省Token支出以及偏好抽取领域近似持续学习的效果。


2026年5月,丘脑智能还联合英伟达、港科大、港中文发布了全球首个做多模态长记忆Benchmark,名为MEMLENS目前已开源,并拿到了Hugging Face AI领域Daily Paper的前三。


他们把27个视觉语言大模型和7个Memory Agent第一次放在同一套多模态数据下,分成4档标准的上下文长度(32、100、128、256K),进行了一次完整的对照实验,并得出了以下发现:


第一,视觉语言大模型往往不做任何压缩,直接将内容全量塞入上下文窗口,但随着长度增加,模型表现急剧下降;Memory Agent的表现虽相对稳定,但由于记忆架构设计缺陷,大量视觉与多模态数据在写入阶段就已损失。


第二,随着上下文长度的增长,无论是Memory Agent还是视觉大语言模型,都更倾向于产生幻觉,面对缺乏充分证据的问题时,更倾向于自信地胡说。


第三,许多针对Memory的后训练方法,在训练后削弱了模型拒绝回答的能力,这反而增加了幻觉风险。


值得关注的是,这一Benchmark证明了基模厂商和记忆公司应该各有分工,各自做好自身擅长的领域,在行业中也有着自身无法被替代的生态位:基模应该做好视觉感知、图文对齐和底层推理;记忆企业应该做好跨模态信息检索、证据组织和状态更新。


Founder思考


  • 个性化的终点是主动智能。


因此我们判断,Agent的终局不应该是任务驱动的,而是状态驱动的。未来的Agent能基于你的历史记忆帮用户做Planning,自我驱动完成任务。


不久的将来我们可以看到一些主动智能的产品或者能力,主动智能如果出现,应该会出现在做Memory的公司里。


  • 未来的Memory应该做的事是——沉淀用户和任务偏好、区分长期状态和短期波动,以更好地支撑主动智能。


目前大部分做Memory的企业都在聚焦上下文窗口和RAG(检索增强生成)。然而,我并不认为上下文窗口等同于真正的记忆,它本质上依赖于前端交互和短期上下文来维持的一种临时性工作记忆。至于RAG,目前主流的内存实现方案多采用GraphRAG(基于知识图谱做RAG)架构,但其本质不过是外挂的向量数据库,通过向量检索完成相似性召回。


当前许多企业,如硅谷的开源项目,如Mem0、MemGPT,仍采用向量原生(Vector Native)或GraphRAG的方式来实现记忆功能。


这类方案存在明显局限。以纯向量检索为例,它缺乏对信息关联性的建模,本质上更像一个知识库,只能应对简单的一问一答场景。真正的记忆并非静态的问答,而是需要追踪动态变化的时间线与用户意图,不断更新调整。


  • Long Context(长上下文)和Memory Agent(记忆)并非是二选一的取舍,而是可以做工程化的权衡。


DeepSeek V4拥有1M的上下文窗口,这一模型推出后,不少人会很自然的想到一个问题,就是基模会不会做记忆,或者未来的基模中会不会存在单独的Memory层?


我们的Benchmark对此做出了解答:基模要做的是把上下文做的更长,做好KV cache(一种数据缓存机制)相关的工作,更侧重于做好底层推理能力,如视觉感知和图文对齐。而记忆企业应该做的是找到跨模态信息,更好的为用户提供帮助。两者各有分工。


  • Memory的核心,不是存储,而是决策。


如果只是简单的存储,传统数据库和存储系统早已能够实现,完全不需要AI记忆。但是真正让Memory发挥价值的点在于,它能做出一系列判断:是否写入记忆、哪部分写入记忆、召回什么样的记忆、在回答什么样的问题的时候应该主动发起召回等。基于此,Memory承载着两大核心价值:


第一个价值是,释放AI潜力的上限。基模的上限到AI真正能够触达的上限之间,存在一个关键的中间层,这个中间层包括AI系统的复杂度,以及个性化的数据闭环(即Memory)。个性化的数据闭环,是释放AI潜力上限的核心基础设施。


第二个价值是,支撑主动智能。AI的落脚点始终在人身上,服务于人、取悦于人、加速于人,这是它不变的使命。Agent也好,物理或者非物理AI也好,最终都需要主动智能来支撑。而主动智能的本质就是决策,即在充分理解用户个性化数据闭环的基础上,决策什么时候发起交互,如何发起,发起什么样的内容。


  • 在家庭机器人落地的前期,具身的Memory需求会暴增。


在AI走向物理世界的过程中,其交互入口是多模态的,因此,多模态长记忆是一个必然趋势。任何与人进行的交互都不可能绕开记忆,尤其是交互时间越长、任务链条越长、涉及模态越丰富,记忆所扮演的角色就越发关键。


此外,在长程工作流中,无论是Agent的长周期任务,还是具身智能的长程任务,数据模态越丰富、记忆跨度越长,其数据价值就越高。换句话说,数据越贴近物理世界的真实状态,所构建的壁垒也就越高。


  • AI需要和物理世界有一个映射的锚点,这个锚点必须是时间。


因为时间具有唯一性,Memory没有办法脱离时间单独存在,不管我们范式如何改变,我们都把时间看的非常重。


文章来自于"智能涌现",作者 "王欣逸"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI代理

【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。

项目地址:https://github.com/browser-use/browser-use


2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

5
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

6
微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台,可以对大语言模型(LLM)和多模态图文模型(VLM)进行预训练和轻量级微调。XTuner 支持多种微调算法,如 QLoRA、LoRA 和全量参数微调。

项目地址:https://github.com/InternLM/xtuner