核心内容摘要
😹🔥金玉良缘🔥地址:pcautocomcn✔️门页单独做给广告,自然结果另做说明页。门页隔离人人操蝌蚪网粉嫩Av一区二区三区四区免费两套页面两套统计。混用最容易连坐。♑️
羞羞漫画在线入口第13话,尽享精彩漫画内容,轻松阅读无限乐趣。,未满十八岁不能观看的黄色网站
免费观看a级视频,粉嫩Av一区二区三区四区免费,羞羞漫画在线入口第13话是一个极其受欢迎的漫画平台,专为喜欢漫画的朋友们设计。这是一个可以随时随地在线阅读的入口,海量漫画资源应有尽有。无论你是喜欢搞笑、爱情还是冒险类型,这里都能满足你的需求。特别是第13话,带来全新的故事情节,吸引了大量粉丝。用户可以轻松找到自己喜欢的章节,随心所欲地翻阅。羞羞漫画在线入口第13话的界面友好,操作简单,适合所有年龄段的漫画爱好者。不论是休闲娱乐还是打发时间,这里都是一个不错的选择。
🕙,羞羞漫画在线入口第13话🌙,💯已认证💯地址:pcautocomcn✅文心一格人物和场景要写清楚数量,减少跑图次数。文心一格 人人操蝌蚪网粉嫩Av一区二区三区四区免费正式版。提示词分行写。教程强调描述完整。纯新手如何利用蜘蛛池快速提升店铺SEO排名?实战操作技巧全解析
直播黄色软件免费官方版,〖One〗在现代电商竞争激烈的环境下,SEO优化成为店铺推广的关键环节,而蜘蛛池作为一个重要的技术手段,逐渐受到广泛关注。对于纯新手而言,蜘蛛池到底是什么?它是如何影响店铺SEO排名的?又该如何实战打造高效的蜘蛛池系统?本节课将从基础知识入手,带你了解什么是蜘蛛池,以及它的运作原理,帮助你快速从零起步掌握排名技巧。
〖Two〗蜘蛛池,通俗来说,就是利用一批模拟蜘蛛的程序,自动访问你的店铺链接,模拟真实用户和搜索引擎蜘蛛的访问行为,以此提高页面抓取频率和权重评分,从而达到提升网站在搜索引擎中的排名。通过合理规划与运作蜘蛛池,可以增加页面曝光机会,促进内容索引,增强店铺的综合竞争力。,蜜桃55
〖Three〗正因为蜘蛛池能带来访问的“真实感”和“活跃度”,它在SEO优化中被当作加速排名的利器。同时,需要注意的是,合理使用蜘蛛池和滥用之间有非常敏感的界线,多数搜索引擎都有反作弊策略,对异常爬取行为持严厉措施,因此系统设计和操作细节至关重要。歪歪漫画在线,新手必须要系统学习蜘蛛池的架构,避免踩坑,荣耀获得良性效益。
纯新手如何在9天内快速搭建店铺蜘蛛池系统?详细分步骤操作指南
〖One〗想要在9天内从零搭建完成一个高效的店铺蜘蛛池系统,流程规划和目标拆解非常关键。类似nico的聊骚app,第一步,新手需明确系统核心功能:高速模拟蜘蛛访问、多IP多用户环境切换、访问模式智能控制、日志数据分析等。
〖Two〗第1-3天主要聚焦技术基础环境搭建,包括购买或申请代理IP资源、搭建爬虫模拟框架、服务器环境准备等。满18岁免费观看高清电视剧,此阶段最重要的是装配稳定的模拟访问工具,为后续自动访问做保障。
〖Three〗第4-6天进入自动化脚本编写与调试阶段。针对店铺URL结构,设计路径规则,实现多页面自动访问和定时任务。调试爬行时间间隔,避免高频访问被识别为异常,合理利用代理IP轮换,防止封禁。
〖Four〗第7-9天则对数据进行有效监测与反馈,优化访问策略。观察搜索引擎更新频率,以及店铺关键词排名的变化,由此调整访问节奏或页面优化方向。同时完善日志系统,记录浏览数据与搜索引擎抓取反馈,确保蜘蛛池运维稳定。新手通过这9天系统化的训练,能切实掌握从搭建到运营的完整流程。
纯新手如何理解蜘蛛池运作原理以避免SEO优化中的常见坑?全面原理解析
〖One〗蜘蛛池的核心原理基于搜索引擎蜘蛛抓取机制。搜索引擎采用分布式爬虫自动浏览互联网网页,通过抓取网页内容进行索引和排名。蜘蛛池通过模拟这些搜索引擎蜘蛛的真实访问行为,提高抓取频率和频次,促进页面快速收录。
〖Two〗理解蜘蛛的抓取频率、抓取深度和抓取间隔对于新手来说尤为重要,因为不合理的抓取策略容易导致蜘蛛池被搜索引擎识别为作弊。例如,单一IP短时间反复访问同一页面,缺乏变化的请求头或行为模式都会 raise red flags。
〖Three〗为避免被搜索引擎判定为作弊行为,蜘蛛池设计通常会结合多节点IP代理、随机化访问时长、模拟用户多样化行为、动态请求路径等技术策略,使访问模式尽可能贴近真实用户,从而达到安全性和有效性的平衡。
〖Four〗此外,新手需要明白,蜘蛛池只是辅助SEO手段,不能替代优质内容和正常的用户体验优化。错误使用蜘蛛池会带来降权风险,甚至导致店铺被搜索引擎屏蔽。因此,掌握蜘蛛池运作原理,科学规划“爬取节奏”与“访问路径”至关重 要,是避免踩坑的关键。
纯新手店铺SEO蜘蛛池实战课中必须了解的关键词布局与内容优化技巧
〖One〗关键词布局是网页SEO基础,也是蜘蛛池实战课不可忽视的一环。只靠蜘蛛池提升访问量,而忽视关键词合理分布,将无法达到预期排名效果。新手需要掌握关键词密度、长尾关键词选择和语义相关性等技巧。
〖Two〗,主关键词应分布在标题、描述、正文、图片Alt属性中,确保页面核心主题明确。长尾关键词则安排在内容中,提升针对具体搜索意图的匹配度。蜘蛛池模拟爬虫抓取间,搜索引擎将结合关键词热度与布局判断页面相关性。
〖Three〗然后,通过定期内容更新,结合店铺热销商品或促销信息,增强页面活跃度,配合蜘蛛池提高抓取频率,能有效促进关键词排名增长。避免死板堆砌关键词,应注重自然流畅的用户体验,防止被判定为垃圾信息。
〖Four〗蜘蛛池的实时访问不仅带来抓取量提升,也使页面权重分配更精准,搜索引擎“喜欢”有业务频繁更新的页面,结合科学优化的关键词布局,对纯新手快速达成店铺SEO目标有极大帮助。
纯新手实战打造高效蜘蛛池系统时如何避免搜索引擎封禁风险?必坑规避技巧和操作准则
〖One〗在蜘蛛池系统建设过程中,许多新手会因为操作失误而遭遇搜索引擎封禁,影响店铺声誉及排名。了解并避免这些陷阱,是保证蜘蛛池安全稳定运行的核心。
〖Two〗,千万不要过度频繁且单一IP访问同一链路,合理分配访问频率和切换代理IP是防止封禁的基础。此外,模拟访问行为要多元化,最好能模拟不同设备类型、浏览器版本、停留时间及用户点击路径,增加“人性化”特征。
〖Three〗其次,系统必须具备动态调整功能,根据搜索引擎反馈实时调整访问策略,防止异常访问被捕捉。避免固定化、重复性强的访问行为,增加随机停顿、跳转等机制。
〖Four〗最后,搭配内容质量提升、外链优化和用户互动数据,形成SEO综合闭环,能有效降低被判定作弊的风险。通过课程中讲授的实战方法,纯新手也能掌握安全高效运营蜘蛛池的准则,从而实现持续稳定的店铺SEO增长。
纯新手从零起步快速掌握蜘蛛池系统实操技巧的总结与实战建议
〖One〗经过以上章节的系统学习,纯新手已经掌握蜘蛛池的基本原理、搭建流程、关键词优化及风险规避技巧。总结来看,蜘蛛池虽利于SEO排名,但更依赖于科学的战术设计和安全的操作规范。
〖Two〗实操过程中,新手应重视前期的环境搭建和代理IP资源选择,确保基础稳定,然后循序渐进地增加访问频率和复杂度,及时观察搜索引擎反馈,改进策略。
〖Three〗同时,不可忽视内容和用户体验优化,蜘蛛池只是加速器,不是万能钥匙。结合课程内容,规划好每日9天学习计划,边学边练,反馈实时调整,可以最快速形成自己的高效蜘蛛池系统。
〖Four〗建议新手在实战中保持耐心,避免短期内急功近利的过度刷取行为,注重系统稳定与长远效益。通过科学、合理使用蜘蛛池技术,将有效提升店铺在百度等主流搜索引擎中的可见度和流量,实现真正的SEO价值。
---
以上内容系统地解析了“纯新手9天店铺SEO蜘蛛池实战课专题课:从零起步快速掌握排名技巧,实战打造高效蜘蛛池系统”相关知识,结合实操细节和防坑指南,助力新手快速上手SEO蜘蛛池技术,打造高效稳健的电商店铺排名体系。
直播黄色软件免费官方版,羞羞漫画在线入口第13话,尽享精彩漫画内容,轻松阅读无限乐趣。歪歪漫画在线,
羞羞漫画在线入口第13话是一个极其受欢迎的漫画平台,专为喜欢漫画的朋友们设计。这是一个可以随时随地在线阅读的入口,海量漫画资源应有尽有。无论你是喜欢搞笑、爱情还是冒险类型,这里都能满足你的需求。特别是第13话,带来全新的故事情节,吸引了大量粉丝。类似nico的聊骚app,用户可以轻松找到自己喜欢的章节,随心所欲地翻阅。羞羞漫画在线入口第13话的界面友好,操作简单,适合所有年龄段的漫画爱好者。不论是休闲娱乐还是打发时间,这里都是一个不错的选择。,蜜桃55
百度收录网站需要多久深度 test.chaofei.store 百度收录网站需要多久深度蜘蛛池是什么?必坑指南揭秘电商54套谷歌SEO关键词实战教程助力排名提升
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
自媒体站长必看!蜘蛛池到底是什么?原创文案优化必坑指南,全面提升内容质量快速突破流量瓶颈的秘籍
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
卡神携手碧梨开启梦幻合作!詹姆斯·卡梅隆执导的《比莉·艾莉什:温柔重击巡回演唱会3D电影》正式发布首支预告。曾以《阿凡达》重塑观众3D观影体验的卡神,此次运用全新3D技术,捕捉比莉·艾莉什多场震撼演出,旨在通过影院大银幕重新定义现场音乐的沉浸感受!影片定于2026年3月20日在北美上映。
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
网站运营中到底什么是蜘蛛池及其工作原理详细解析
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
刚接触优化必看?89套SEO优化蜘蛛池视频教程全面掌握SEO技巧,快速提升网站排名终极坑指南!
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
昆山老板别再被坑了!我的网站建站与SEO血泪史
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
什么是蜘蛛池及其在电商SEO排名中的核心作用解析
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
电商SEO中蜘蛛池是什么?新手必看蜘蛛池原理与应用全面解析
直播黄色软件免费官方版,Agent 的能力越来越强,但使用体验仍有一个尴尬之处:
每换一个 Agent 甚至换一个 session,就像换了一个完全不了解你的新员工。,蜜桃55
用户偏好、项目背景和踩坑经验无法迁移,只能从头解释,再把新 Agent" 重新养一遍 "。,歪歪漫画在线
真正的挑战不只在于 " 有没有记忆 ",还在于四件事:,类似nico的聊骚app
记忆带不走:记忆依附于单个 Agent,无法跨应用和框架复用。,满18岁免费观看高清电视剧
记忆视角不同:不同业务关注的实体、属性和提取规则完全不同,一套固定模板难以通用。
记忆系统不会成长:提取、检索和组织策略在开发完成后便基本固化,无法从真实使用与用户纠偏中持续演进。
记忆缺少时间维度:系统既要知道最新事实,也要保留事实如何变化、旧状态如何被新状态取代的过程。
为此,华为诺亚方舟实验室推出了面向 AI Agent 的可迁移、自演进记忆操作层 MindMemOS:
它将记忆从单个 Agent 中解耦;
记忆建模以实体、属性、时间三维结构同时保存最新状态与完整演化轨迹;
通过 MindSchema 记忆模式预设记忆提取规则,或围绕给定任务与标注问答离线演化提取策略;
Feedback 挖掘用户隐式的纠正性反馈,有选择地强化或降级已有记忆,从而提升记忆的可靠性及其与用户意图的一致性。
Dreaming 离线巩固记忆,消解冲突,持续提升记忆质量。
MindMemOS 想解决的不只是 " 怎样让 Agent 记住 ",而是记忆怎样带得走,系统怎样知道该记什么,以及记忆与记忆系统怎样一起进化。
更直接的是结果:
MindMemOS 在 LoCoMo 上取得94.03分,在 PersonaMem 上达到70.63%;
在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 压缩19.4%-23.5%活跃记忆的同时,将问答准确率最高提升10.3 个百分点;
基于真实执行轨迹的 Skill 演进,则把 SpreadsheetBench-Verified 的任务成功率提升至57.2% ± 2.4%。
项目地址:https://github.com/mindscale-noah/MindMemOS
项目官网:https://mindmemos.cn
△MindMemOS 将 Agent 接入、记忆算法与底层记忆结构解耦,并把质量优化和 Skill Evolution 纳入同一系统。用「实体 - 属性 - 时间」重建记忆中的世界
MindMemOS 首先改变了记忆的基本组织方式。
传统方案常把记忆保存为一组文本片段或向量块。MindMemOS 则用一个三维结构描述开放世界的信息流:
实体(Entity):人、项目、文件、工具、组织等持续存在的对象;
属性(Property):对象的事实、偏好、状态和高阶特征;
时间(Time):属性在什么时间成立,又在何时发生变化。
△每条记忆都可以落到 " 实体、属性、时间 " 的唯一坐标,同时保留实体关系和属性演变轨迹。
这相当于不再把 " 用户以前喜欢 X" 和 " 用户现在改用 Y" 当成两段互不相干的文本,而是把它们放回同一实体、同一属性的时间轴上。
实体之间可以建立语义关联,每个属性的演变也能被追踪。
在此之上,MindMemOS 提供两条互补的记忆生成路径。
一条是MindVanilla 模式。
它不依赖预先定义的建模模板,可以接收对话、文本和工具执行轨迹,适合开放域信息快速进入统一记忆库。
另一条是MindSchema 模式。
系统先通过实体建模规定当前领域关注哪些实体和属性,再完成话题片段切分、属性级记忆生成、等价实体融合和图结构合并。
不同场景可以调整记忆提取规则种子,让同一套系统适配不同任务,而不必重写整个记忆基础设施。
检索时,MindMemOS 也不是只做一次向量相似度匹配。
它设计了一套 Compact Search:
外层 Agentic 模块负责分析查询、规划检索路径和判断信息是否充分;
内层工具则执行从实体到属性、从属性反查实体、多跳关系扩展和属性时间线追踪等多路径搜索。
简单来说,系统不只是寻找 " 最像问题的一段话 ",而是在记忆图中寻找抵达答案最短、同时覆盖信息最充分的路径。
Dreaming:让 Agent 在「空闲时间」整理记忆
人类不会永久保留每个细节。我们会在回顾中合并重复信息、淘汰过时判断,并从多次经历中形成更抽象的认识。
业界把类似过程称为Dreaming。
Dreaming 在离线阶段从尚未整理的记忆出发,围绕相关实体扩展局部范围,识别重复、冲突和演化关系,再生成具体操作:合并冗余内容、归档被新事实取代的旧记忆、补充关系,或发现更高阶的模式。
关键在于,这种整理结果会变成持久的记忆状态,而不是把判断压力留给每一次回答时的语言模型。
例如,当同一个实体对应两条相互冲突的事实时,普通检索可能把两条内容一起返回,再期待回答模型临场判断。
MindMemOS 会在 Dreaming 阶段识别其中的替代关系,归档已经失效的版本,并保留 supersedes 关系。之后的普通检索拿到的是更干净、没有歧义的上下文。
这里有一个更直观的 Case Study。
MemoryAgentBench 先后写入两条互相冲突的事实,并规定后写入的事实应当覆盖旧版本。
Dreaming 之前,两条记忆都会进入检索上下文,回答模型受到现实世界知识干扰而选择了旧答案;
Dreaming 之后,系统把较早版本归档、建立 supersedes 关系,同一查询便只会得到当前有效的事实。
△Dreaming 将冲突判断从每次查询时的临场推理,前移为可持续保存的离线记忆状态。
MindMemOS 在 MemoryAgentBench 的 FactConsolidation 子集上,测试了这一机制:
结果显示,Dreaming 并不是通过 " 记得更多 " 换取提升。
相反,它在提高 Single-hop 和 Multi-hop 得分的同时,将大约五分之一的活跃记忆转入归档(归档则不会被主动召回)。
这是一种典型的 " 少即是多 ":减少干扰,本身就是提升记忆质量的一部分。
Feedback:用户的一次纠正,不应该只修一条答案
Dreaming 负责系统主动整理,Feedback 则让用户交互中的纠错信号回到记忆系统。
MindMemOS 同时支持显式与隐式反馈。
用户可以直接用自然语言指出某条记忆错误,也可以在后续对话中表达不满、修正或新的偏好。
系统会判断这条信号是当前任务临时信息、特定场景偏好,还是适合长期保留的规律,再决定新增、更新、归档、删除或强化相关记忆。
这一步很重要,因为用户偏好往往不只是一个 " 是什么 " 的事实。
一个用户说自己偏好临时约见,真正影响推荐的可能是背后的原因:低压力安排反而能让其更可靠地赴约。
随着更多交互出现,系统需要逐渐补全 " 为什么 " 和 " 在什么场景下成立 ",而不是无限新增相似的碎片。
论文中的 PersonaMem-Evo 案例展示了这种变化。
Feedback 之前,系统只留下 " 偏好临时安排 " 这条表层信息,在 Top-10 中仅召回一条模糊相关记忆,最终给出了结构化群体活动这一错误选项。
Feedback 从多轮交互中识别出真正稳定的关系是 " 喜欢临时或当天计划,担心长期计划有变 ",并为其补上社交场景边界。
更新后,三条一致的社交规划记忆共同进入 Top-10,答案也转向正确的 " 自发一对一活动 "。
△Feedback 不只是增加一条记忆,而是更新原记忆的语义结构、归档旧版本,并改变后续检索结果。
因此,Feedback 的目标不只是修改单条记忆。
期望是让反馈继续作用于记忆提取、检索和组织策略,实现记忆内容与记忆系统的共同演进。
不只记住发生过什么,还要沉淀「下一次怎么做」,持续优化 Skills
如果说事实和偏好让 Agent 更懂用户,那么 Skill 决定了它能否把经验真正变成能力。
MindMemOS 将 Skill 视为记忆系统的一个关键应用。
系统提供云端 Skill 注册、版本链、同步和回滚能力,并通过统一的 Memory Add 接口收集真实任务轨迹。
不同 Agent 框架只需在轨迹中附带本次使用的 Skill 上下文,系统便能把执行结果绑定到对应版本。
当轨迹积累到一定数量后,MindMemOS 会依次完成:
真实任务轨迹→ 提取目标、关键转折、工具使用和最终结果→ 聚合反复成功的策略与反复出现的失败→ 生成针对当前 SKILL.md 的修改计划→ 应用编辑并生成新的 Skill 版本→ 同步回后续任务
如果轨迹没有任务得分,系统可以从反复出现的成功路径和失败模式中做无监督演进(MindEvolve-Unsup);
如果有评分,则会强化高分轨迹中的有效行为,并抑制低分轨迹里的常见错误(MindEvolve-Sup)。
论文在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上。进行了三次重复实验:
△SpreadsheetBench-Verified 任务成功率。结果为三次重复实验的均值与标准差;亮蓝和深蓝分别代表 MindEvolve 的无监督与监督演进配置。
这里有一个颇有意思的结果:未经优化的初始 Skill 甚至低于 No-skill。
换句话说,给 Agent 一份操作指南并不必然带来提升,过时、冗余或不适配任务分布的规则反而可能制造干扰。
而 MindMemOS 的无监督演进仅依靠执行轨迹,就将成功率从 51.3% 提升到 55.3%;加入任务评分后进一步达到 57.2%,相比 No-skill 提升 5.9 个百分点,相比未经演进的 Init-skill 提升 9.2 个百分点。
这进一步解释了这些数字从何而来:
最初的表格 Skill 主要是一份 openpyxl、pandas 使用说明,只告诉 Agent 怎样打开、编辑和保存工作簿,却没有覆盖真实任务中反复出现的失败:公式不会被 openpyxl 自动重算、格式化空行会让 ws.max_row 虚高、在活动工作表上一边读取一边写入可能移动行或覆盖源数据,保存成功也不代表结果已经通过验证。
无监督演进从失败轨迹中把这些经验改写成可执行约束,例如:不要把公式文本当作数值;筛选、排序和删除时先从源表构造稳定快照;保存后必须重新打开文件并按评测读取方式复核。
它完成的不是 " 增加更多 API 教程 ",而是把反复踩坑的历史压缩成通用避错规则。
加入任务分数后,监督式演进又学会了规则的适用边界。
例如,它不会为了通过缓存值检查而把所有公式粗暴替换成硬编码数值;写入复杂工作簿前,还要先确认源列、目标列和映射关系。
也就是说,监督信号带来的不只是更多规则,而是让 Skill 逐渐知道一条规则何时应该使用、何时应该停止。
Skill 不再是一份写完就不动的提示词文件,而可以成为一项带版本、带证据、可持续更新的长期能力资产。
记忆基准 SOTA
除了 Dreaming 与 Skill 演进,MindMemOS 还在两项主流长期记忆基准上评估了基础记忆能力。
LoCoMo 包含 10 组超长多会话对话。使用 gpt-4.1-mini 作为回答模型,并将系统、检索、回答和评判配置与 EverOS 默认实现对齐。
MindMemOS-Modeling 的 Overall Accuracy 达到94.03,成为所有对比方法中的最高结果。
△LoCoMo Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置。
在面向长期个性化的 PersonaMem 上,MindMemOS-MindSchema 的 Overall Accuracy 为70.63%;MindMemOS-MindVanilla 也以 67.74% 略高于 Baseline。
△PersonaMem Overall Accuracy。灰色为对比方法,蓝色为 MindMemOS 两种配置
这些结果共同指向一个结论:结构化建模的价值,不只是让记忆 " 看起来更整齐 ",而是让系统在长期事实召回、用户画像和个性化推断中获得可测量的提升。
从 API、SDK 到插件:记忆应该独立于某个 Agent
MindMemOS 在架构上将 Agent 接入层、记忆算法层与记忆结构层解耦。
当前开源代码提供 FastAPI HTTP 接口、Python SDK、CLI、Skills 以及 OpenClaw 插件等接入方式,覆盖 add、search、update、delete、feedback 和 dreaming 等完整记忆生命周期操作。
这种解耦带来的直接价值是可迁移性:记忆不必继续绑定在某个 Agent 的私有实现中,而可以作为用户、项目或组织独立维护的长期资产,在不同应用和 Agent 框架之间复用。
开发者既可以本地部署完整服务,也可以从云端 API、SDK 或 CLI 开始接入。
项目采用 MIT License,详细部署配置与评测流程均已随代码公开。
Tips:MindMemOS 云服务现已开放注册试用;
在 GitHub 为项目点亮 Star 后,还可获得更多使用额度。
项目官网:https://mindmemos.cn
当自动算法设计开始积累经验:MindMemOS 在 LLM4AD NEXT 中的应用
基于大模型的自动算法设计正在展现潜力,但这类任务通常需要经历大量候选生成、评测与迭代。
若缺少长期记忆,模型很容易反复尝试已经被证明无效的方案;切换任务后,上一轮探索积累的设计经验也可能随上下文一起消失。
为此,MindMemOS 已接入自动算法设计平台LLM4AD_Next,将算法搜索过程中产生的反馈转化为可存储、可检索、可复用的经验资产。
针对算法设计任务层次多、周期长的特点,平台构建了三层记忆:
任务记忆(Task Memory):动态捕捉并提炼当前算法设计任务中的即时灵感与失败教训。
项目记忆(Project Memory):深度沉淀特定应用场景(如组合优化任务等)下的专家共识与先验知识。
全局记忆(Global Memory):固化跨项目、普适性的底层算法设计规范与基本范式。
基于该架构,平台能够将从高分结果中提炼的 " 有效经验 " 与从低分试错中总结的 " 避坑指南 " 进行系统化存储。
为了精准适配复杂多变的科研场景,系统支持两种灵活的记忆调度机制:
LLM4AD_Next 提供两种记忆调度方式:Auto Mode根据当前任务和上下文自动匹配历史经验,Manual Mode则允许研究人员精确选择需要注入的记忆。
记忆的调用、注入与流转过程全程可视化,使研究人员能够观察某条经验如何影响算法生成,也更方便开展消融实验与对照分析。
MindMemOS 的核心愿景,是确保大模型的每一份反馈都能转化为高价值、可复用的数字资产。
在 MindMemOS 的赋能下,LLM4AD_Next 所执行的每一次算法搜索,都不再是孤立的尝试,而是通往下一次 " 进化 " 的坚实起点。
由 MindMemOS 赋能的全新自动算法发现平台 LLM4AD_Next 已开放体验,欢迎广大研究者前往探索:
GitHub 开源项目:https://github.com/Optima-CityU/LLM4AD_Next
在线体验地址:https://llm4ad-next.cn/
Coming Features
技术报告:MindMemOS 完整技术报告即将发布,将进一步披露算法设计、系统实现、评测设置与更多案例分析。
Skills 系统:与经验记忆联动,自动合成 Skills;基于真实执行轨迹持续演化,并针对新问题智能分发和推荐合适的 Skills。
文件系统记忆:把散落在本地文件、文档、项目产物和 Agent 输出中的知识结构化为可检索、可关联的知识对象或知识图谱,让 Agent 更可靠地使用用户的文件知识。
结语:Agent 的下一场竞争,可能是「谁更会积累」
今天的 Agent 已经拥有越来越强的模型和越来越丰富的工具,但长期智能并不只取决于一次任务能做多好。
真正拉开差距的,可能是完成一百次任务之后,它留下了什么。
是越来越长、越来越混乱的历史记录,还是一套能追踪变化、主动整理、接受纠正,并把成功与失败继续沉淀为 Skill 的记忆系统?
MindMemOS 的答案,是把记忆从 Agent 的附属缓存提升为独立的操作层:信息可以跨场景建模,冲突可以在离线阶段被消解,反馈可以反向修改记忆,任务轨迹还能继续推动 Skill 演进。
从 " 记住用户 " 到 " 学会做事 ",这或许也是 Agent 从一次性工具走向长期协作者必须补上的一层基础设施。
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见
优化核心要点
seo关键词优化学习





