融资数千万押注主动智能,这家公司要做AI的“记忆层”

当大模型竞争进入下半场,一个被长期忽视的问题浮出水面:人工智能如何记住用户?国内公司丘脑智能给出的答案是”记忆层”——一家专注于多模态长记忆的创业公司,近期完成数千万元种子轮融资,投资方包括深圳一线基金与产业资本,资金主要用于技术研发与人才队伍补充。

丘脑智能成立于二〇二五年十一月,创始人兼首席执行官张源毕业于北京大学,拥有电子与经济双学科背景,曾在一家自动驾驶公司担任首席运营官,也有过创投与具身智能的工作经历。团队平均年龄约二十六岁,核心人员主要来自阿里达摩院、腾讯、商汤、香港中文大学、香港中文大学(深圳)、北京大学、西安交大、卡尔斯鲁厄理工学院、复旦大学等企业与高校。

记忆层会独立存在吗

记忆领域的行业共识,最早于二〇二五年底在学术界形成,这是一个非常新的方向。面对投资人,张源常被问到:基础模型会不会自己把记忆做了?记忆这一层到底会不会独立存在?

她的回答很坚定:记忆层一定会作为独立的基础设施长期存在。不同厂商的基础模型,基因与训练语料各有差异,擅长的任务也各有侧重,用户不断在几家模型之间切换,导致”记忆孤岛”问题长期存在。人工智能从通用走向个性化的过程中,缺少一个能持续学习、记住用户的中间层。因此,以用户为中心的第三方记忆层,必然独立于基础模型之外而存在。

现阶段,记忆领域存在三个痛点:一是成本,多数方案直接把海量上下文全量塞入窗口,推理成本极高;二是上下文断裂,跨会话、跨任务的对话难以有效衔接;三是模态缺失,现有方案大多局限于纯文本,无法处理视觉、音频等多模态信息。再加上变换器架构导致的持续时序错乱,大模型目前难以真正理解时间。

MemAura:仿生记忆基座

今年六月,丘脑智能上线了名为 MemAura 的记忆基座,向客户提供智能体开发包与应用程序接口服务。它能支持长记忆的积累与快速调用,采用高效的上下文机制,有效降低推理成本。

从成绩看,MemAura 表现亮眼:输入侧 token(模型处理的最小文本单位)综合消耗降低百分之四十至四十九,记忆检索延迟控制在四百毫秒以内,端到端首次回答可做到一秒以内,综合准确率达到八成以上。

在记忆处理流程上,MemAura 采取了一套仿生机制:首先对事件进行识别,模仿人类记忆保留关键信息、过滤冗余噪声;随后对过滤后的信息编码;第三步做好信息分区,对隐私与非隐私记忆进行隔离。此外还采用冷热存储策略——高频访问的证据用热存储实现快速检索,低频数据用冷存储节约资源。

两次迭代与一份基准

从成立至今,丘脑智能的技术路线已完成两次迭代,正探索第三次。第一代是时空知识图谱,把时间与空间放在物理层、多模态感知信息放在感知层,并构建认知层进行前向推理,在两项权威长记忆测试中都拿到了领先成绩。

但到达一定临界值后,基准分数的提升对客户意义有限,客户更在意延迟与 token 支出。于是团队做了工程化权衡,转向模仿人类海马体的编码与认知地图、皮质层整合的方式,构建起仿生记忆架构 MemAura。在传统线上客服场景延迟可能达十秒左右、陪伴场景约两秒的情况下,MemAura 能把延迟压到四百毫秒以内。

今年五月,丘脑智能联合英伟达、香港科技大学、香港中文大学,发布了全球首个多模态长记忆基准 MEMLENS,目前已开源,并登上人工智能社区论文日榜前三。他们把二十七个视觉语言大模型和七个记忆智能体,第一次放在同一套多模态数据下,分成四档上下文长度进行完整对照实验,得出三点发现:视觉语言大模型往往不做压缩直接塞满窗口,但长度增加后表现急剧下降;随着上下文变长,模型更倾向于产生幻觉;许多后训练方法削弱了模型拒绝回答的能力,反而增加了幻觉风险。这份基准证明,基础模型厂商与记忆公司应当各有分工——前者做好视觉感知与底层推理,后者做好跨模态检索、证据组织与状态更新。

个性化的终点是主动智能

张源的判断是:个性化的终点是主动智能。所谓主动智能,是指人工智能在足够了解用户的基础上,在合适的时间、以恰当的方式主动交互。而要支撑主动智能,记忆是必须跨过的门槛。

她认为,记忆的核心不是存储,而是决策——是否写入、写入哪部分、召回什么、在什么问题下主动发起召回。基于此,记忆承载两大价值:一是释放人工智能潜力的上限,个性化的数据闭环是核心基础设施;二是支撑主动智能,人工智能的落脚点始终在人身上。

在家庭机器人落地前期,具身场景的记忆需求会暴增。人工智能走向物理世界,交互入口是多模态的,任何与人的交互都无法绕开记忆,尤其是交互时间越长、任务链条越长、涉及模态越丰富,记忆所扮演的角色就越关键。而这一切的锚点,必须是时间——因为时间具有唯一性,记忆无法脱离时间单独存在。

来源:36氪(涌现新项目)


发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注