news 2026/10/8 7:17:49

Agent 记忆到底怎么做?一文讲透 8 种 Memory 策略,从窗口到 Memory OS

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Agent 记忆到底怎么做?一文讲透 8 种 Memory 策略,从窗口到 Memory OS

给 Agent 接个向量数据库 ,并不等于它 就有了记忆 。

你是不是也遇到过这样的场景。

你和一个 Agent 聊了一下午,中途去吃了顿饭,回来接着问: “我上周说的那个项目,你还记得吗?”

它回你:“抱歉,我无法访问之前的对话。”

这时候大部分人的第一反应是: 给它接个向量数据库不就完了 。

我一开始也是这么想的。直到真正去搭一套长期记忆系统才发现, 这个问题比想象中麻烦得多 。因为“记忆”这两个字底下,其实压着一堆完全不同的子问题:

什么东西应该留在当前对话里?

什么东西该被忘掉?

什么该压缩,什么不能压缩?

哪些信息值得长期保存?

保存了之后,什么时候该把它翻出来?

记忆和记忆之间有没有关联?

上下文快满了,该怎么办?

向量数据库只回答了其中一小部分 。剩下那些问题,才是 真正决定一个 Agent 用起来“聪不聪明”的地方 。

所以这篇文章想聊的其实是一句话:

「记忆从来不是“把历史存起来”,而是怎么管理一块有限的认知空间。」

📌 本文看点

01

八种记忆方案演进

02

记忆本质是注意力管理

03

企业级选型五个 Level

01

FOUNDATION

LLM 本身是没有记忆的

先说一个容易被忽略的底层事实:模型每次推理, 看到的只有这一次输入的上下文 。没有中间态,没有隐藏的“意识流”。可以简单写成一个公式:

...公式

LLM + Context = 这一次对话里的“记忆”

于是所有 Agent Memory 要解决的问题, 本质上都是同一件事 :

「怎么把过去有价值的信息,在合适的时间点,用合适的形式,重新塞回 Context 里。」

围绕这一件事,业界大概走出了八条路, 一条比一条聪明,也一条比一条复杂 :

接下来一个个拆。

02

THROTTLING

前四种:怎么“节流”

这四种方案解决的都是同一类问题—— 留什么、忘什么、怎么压缩得更省 。

01 全量记忆:我什么都不忘

最朴素的做法: 把所有对话历史原样保留 ,每次请求都整段喂给模型。

好处很直接—— 没有遗忘,就没有信息损失 ,用户说过的任何一句话,模型理论上都看得到。

但代价也很直接:对话越长,Token 越多,成本越高,速度越慢,最后一定会 撞到 Context Window 的天花板 。

这种方案只适合短对话、一次性问答这类“用完就走”的场景。一旦对话拉长到几十轮,它就成了 最先失效的那个答案 。

02 滑动窗口:旧的先忘掉

既然不能无限堆,那就 只留最近 N 轮 ,像一个不断往前挪的窗口。

优点很明显: 长度可控,成本稳定 ,实现起来几乎不用动脑子。

问题也很明显:它唯一的判断标准是“新旧”,不懂“重要与否”。用户三分钟前说的话可能是废话,三小时前说的话可能是这次任务的核心背景——但窗口机制不管这些, 它只认时间戳 。

这类方案常见于 在线客服、实时问答 这种短周期场景。

03 相关性过滤:不重要的,我忘掉

于是有了更聪明的一步: 给每条记忆打分 ,按相关性、重要性、和当前任务的匹配度来决定留不留。

这一步的转变其实挺关键——从“时间驱动的遗忘”变成了 “价值驱动的遗忘” 。

但新的风险也随之而来:万一判断错了呢?一条看起来无关紧要、实际却很关键的信息被过滤掉了,Agent 后面就会在不知不觉中“失忆”,而且 这种失忆很难被发现 ,因为它表现得一切正常。

这也是为什么很多人做 RAG、做知识问答做到后面会发现:记忆系统真正难的部分, 从来不是怎么存,而是怎么判断“该忘掉什么” 。

04 摘要压缩:不留原文,留意思

前三种方案都在回答“留下什么”,摘要开始回答一个新问题: 能不能把留下的内容变得更短 ?

思路很直接:长对话丢给 LLM 做摘要,压缩后的版本再进入下一轮上下文。原本可能要占用几万 Token 的历史, 压缩完可能只要几千 。像 ChatGPT、Claude 这类产品在处理长对话时,背后或多或少都有类似的摘要机制在起作用。

但这里有个绕不开的矛盾: 压缩必然意味着信息损失 。Token 省得越多,细节往往丢得越多。这是一个没有标准答案的权衡题,只能根据场景去调。

到这里,前四种方案有一个共同的短板—— 一旦某条记忆不在当前 Context 里,就彻底找不回来了 。窗口滑走了,过滤掉了,压缩没保留细节,这些信息就是真的消失了。

这就引出了下一个问题:

能不能把记忆先存起来,需要的时候再去找?

03

STRUCTURE

后四种:怎么“建结构”

05 向量数据库:记忆不必一直放在脑子里

这是大多数开发者最熟悉的方案,但 有个误解需要先澄清 :

VectorDB 解决的其实 不是“记忆”本身,而是“长期记忆的存取方式” 。

流程也不复杂:对话内容转成 Embedding 存进 VectorDB;需要用的时候, 拿当前的问题做语义检索 ,取出 Top-K 条相关记忆,塞进 Context,交给模型。

这一步带来的最大变化是:Agent 不再需要把所有历史都放进上下文,而是变成了 “需要什么,找什么” 。LangChain 的 Memory 模块、Mem0 这类工具,走的基本都是这条路。

但也 别把向量数据库想得太神 。它背后一堆细节问题都会实实在在影响效果:Embedding 准不准?文本怎么切块?Top-K 取多少合适?召回的内容是不是真的完整?相关性判断有没有跑偏?

接进一个向量数据库,不代表 Agent 就自动拥有了可靠的记忆。这中间的 调优工作量,往往比接入本身大得多 。

06 知识图谱:记住的不只是信息,还有关系

向量检索擅长回答“这段话和我的问题像不像”,但它不太擅长表达复杂的关系结构。于是有了更进一步的做法—— 把记忆结构化成图 。

流程是:对话 → 抽取实体和关系 → 存进图数据库 → 需要时做查询或推理 → 交给模型。

举个例子,图谱里可能存着这样的结构:张三是项目负责人,项目 A 属于公司 B,公司 B 的客户是李四。这种关系, 靠语义相似度是很难精确表达的 。

这一步的价值跃迁在于:从“这段文字相似吗”变成了 “这些实体之间到底是什么关系” 。GraphRAG 一类的实践,本质上就是在往这个方向走。

适合企业知识管理、专家系统,金融、医疗、科研这类 关系密集的领域 。但代价也不小——构建复杂,实体抽取成本高,关系维护起来很麻烦,数据一变,图也得跟着动。

07 分层记忆:短期记忆 + 长期记忆

到这一步,可以开始借用一个 更贴近人类认知的类比 了:人有工作记忆,负责当下正在处理的事情;也有长期记忆,存着很久以前、但未来可能还会用到的东西。

对应到系统设计上:短期记忆用滑动窗口管,长期记忆用向量数据库或知识图谱管, 两者按需组合 ,一起送进 LLM。

再细拆的话,还能分出 工作记忆、情景记忆、语义记忆、长期记忆 这几层,各自负责不同性质的信息。

这一步之所以重要,是因为系统第一次开始具备 分层管理记忆 的意识——不再是所有信息都塞在同一个地方,而是 按性质分区存放 。这类设计常见于长期陪伴型 Agent、个性化助手、复杂的企业级系统。

08 类操作系统的内存管理:Agent 开始像电脑一样思考

这是整篇文章我觉得最值得展开讲的一部分。因为走到这一步,记忆已经 不再是一个数据库问题,而是变成了一个资源管理问题 。

可以直接借用操作系统的概念来理解:电脑有 RAM,负责当前正在跑的数据;也有 Disk,负责长期保存的数据。当 RAM 不够用了,系统会 把暂时用不上的数据 Page Out 换到硬盘里 ;等再需要的时候,又 Page In 换回来。

这套逻辑几乎可以 原封不动地映射到 Agent 身上 :

...映射

Context Window ≈ RAM

长期记忆库 ≈ Disk

Memory Manager ≈ 操作系统本身

活跃记忆和持久化记忆之间,不断地在做换入换出。这个思路并不是凭空想出来的类比——MemGPT(也就是后来的 Letta)这篇论文,正是 最早把“记忆即操作系统”这个想法系统化提出来 的地方,值得去读一读原文。

走到这一步, Agent 问自己的问题也变了 。它不再是“我有没有记住这件事”,而是变成了:

「当前这个时刻,哪些记忆应该被放进我的工作区里?」

这已经很接近一个真正意义上的 Memory Operating System 了。

04

COMPARISON

八种方案放一起看

如果说前七种方案解决的都是“怎么管理内容”,那 第八种是第一次开始“管理资源本身” ——这也是为什么它会被放在压轴的位置。

把八种方案摆在一张表里对比一下:

方案核心策略解决的问题
全量记忆全部保留不遗忘
滑动窗口最近优先控制长度
相关性过滤重要优先减少无关信息
摘要压缩信息压缩降低 Token
向量数据库按需召回长期存储
知识图谱结构化关系复杂推理
分层记忆分级管理短期 + 长期
类 OS 管理动态换入换出超长记忆管理

「这八种方案不是互相替代的关系,而是不断叠加的关系。」

真正成熟的 Agent Memory 系统,很少是单一某种方案的产物,往往是“滑动窗口 + 摘要 + 向量检索 + 图谱 + 记忆管理器” 拼出来的一套组合拳 。

05

INSIGHT

往深了想一层:记忆的本质是管理注意力

把前面八种方案抽象一下,其实 都在回答四个问题 :

Remember

什么值得记住?

Forget

什么可以忘掉?

Retrieve

什么时候该把它找回来?

Compress

怎么用更少的 Token 表达更多的信息?

想清楚这四个问题之后,会发现 一个挺反直觉的结论 :

「Memory Engineering 的本质,其实不是 Storage Engineering,而是 Context Engineering。」

因为不管记忆存在哪儿、用什么方式存,它最终都要经过同一个动作才能起作用—— 重新进入 Context 。存储只是手段, 能不能在正确的时刻出现在正确的位置 ,才是真正的难点。

06

PRACTICE

落地参考:企业级 Agent 该怎么选

聊了这么多架构,最后还是要落到实际选型上。可以 按复杂度分成五个档位 :

Level 1:简单 Chatbot

全量记忆或滑动窗口就够用,不用想太多。

Level 2:长对话 Agent

滑动窗口 + 摘要压缩,把 Context 长度控制住。

Level 3:知识型 Agent

短期窗口 + 向量数据库,开始具备长期记忆能力。

Level 4:复杂企业 Agent

短期记忆 + 摘要 + 向量数据库 + 知识图谱,开始做分层管理。

Level 5:长期运行 Agent

在以上基础上再加一层 Memory Manager,负责写入、召回、压缩、淘汰、换入、换出、优先级排序这一整套调度逻辑。

走到 Level 5, 才算真正进入 Agent Memory Engineering 这个领域 ——它已经不是“接个数据库”能解决的问题了。

∞

THE END

写在最后

这几年大家讨论 Agent, 关注点其实一直在变 :先是模型够不够聪明,后来是能调用多少工具,再后来是 Context 能不能拉得更长。而下一个真正值得关注的问题可能是:

「Agent 能不能长期、稳定、低成本地管理自己的记忆?」

一个真正能长期工作的 Agent, 不可能每次醒来都从零开始 。它得知道自己刚才在做什么,之前做过什么,哪些事情重要,哪些可以放下,什么时候该把过去的经验重新翻出来用。

所以 Agent Memory 最后大概率不会只是一个向量数据库那么简单,它更可能 长成一套完整的 Memory Operating System 。这可能才是下一阶段 Agent 工程里, 真正值得花时间研究的基础设施 。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 7:17:35

AI机器学习学习包:核心知识点全解析

最近在学习AI机器学习,发现其实入门并没有想象中那么难。今天整理了一份学习包,涵盖了从基础到进阶的核心知识点,希望能帮到正在入门的小伙伴。 AI的核心目标是让机器表现出智能行为。从最初的图灵测试到现代的深度学习,AI经历了三…

作者头像 李华
网站建设 2026/10/8 7:16:55

第 6 章 · 快乐发生器:让 AI 给你写段子 / 表情包文案

🎬 生活化引入朋友圈发图不知道配啥字?想怼人又词穷?老板聚会让你整两句段子暖场,你憋半天只憋出个"哈哈"?现在谁还自己想梗啊。这一章给你装一个"快乐发生器"——你说个主题,AI 咔咔吐…

作者头像 李华
网站建设 2026/10/8 7:16:34

308.Python 自动化刷机工具,解放双手、杜绝人工刷机翻车

摘要: 本文面向具备一定计算机基础的开发人员与维修工程师,系统性地阐述安卓手机刷机与底层维修的核心原理。文章摒弃图形化工具的“黑盒”操作,直接从分区表、Bootloader、Fastboot协议及Recovery机制切入,结合真实变砖修复案例,提供基于命令行的完整操作流程与自动化脚本…

作者头像 李华