2023年7月
[2307.03172] Lost in the Middle: How Language Models Use Long Contexts
这篇论文的核心发现是:语言模型虽然能接收长上下文,但并不能稳定、充分地利用其中任意位置的信息。作者通过多文档问答和键值检索两类需要定位相关信息的任务发现,模型的表现会随着相关信息在输入上下文中的位置变化而发生显著波动——当相关信息出现在上下文的开头或结尾时,模型表现通常最好;而当相关信息被放在长上下文的中间时,性能会明显下降。这一“中间迷失”现象即使在专门针对长上下文优化的模型上同样存在。因此,论文指出当前语言模型对长上下文的信息利用并不稳健,并提出了新的评估协议,用于更好地衡量和推动未来长上下文模型的发展。
2025年9月 Anthropic
Effective context engineering for AI agents \ Anthropic
这篇文章提出,随着 AI 智能体从单轮提示走向多轮自主循环,工程重点正从“怎么写提示”转向“怎么管理上下文”。作者用“注意力预算”比喻 LLM 处理长上下文的固有局限:上下文越长,模型对任意位置信息的提取和推理能力越会下降(即“上下文腐化”现象)。因此,上下文必须被当作有限且边际收益递减的资源来精心策展。
文章给出了上下文工程的核心原则:寻找最小但高信号的 token 集合,最大化期望行为出现的概率。具体实践包括:
系统提示:清晰、直接,避免过度硬编码或过于模糊,用 XML 标签或 Markdown 组织内容;从最小提示开始,根据失败模式逐步添加规则和示例。
工具设计:工具应自包含、职责清晰、返回 token 高效;避免工具集臃肿导致模型选择困难。
示例:少而精,用多样化、典型的示例代替冗长的边界情况清单。
动态检索与“即时上下文”:不预先加载所有数据,而是让智能体通过轻量标识符(文件路径、查询等)在运行时按需加载信息,类似人类使用索引和书签。Claude Code 的混合策略(预加载少量核心信息 + 运行时用
grep、glob等工具探索)是典型例子。长程任务三大技术:
压缩(Compaction):在接近上下文窗口上限时,总结关键内容并开启新上下文,保留架构决策、未解决问题等,丢弃冗余工具输出。
结构化笔记(Agentic Memory):智能体定期将笔记写入上下文之外的文件,在需要时读取,实现跨上下文的持久记忆(如 Claude 玩 Pokémon 时维护训练进度)。
子代理架构:多个专用子代理各自在干净的上下文中完成探索或深度工作,只向主代理返回精简摘要,实现关注点分离。
文章最后强调,无论模型能力如何提升,把上下文视为珍贵、有限的资源,并围绕这一理念持续优化,始终是构建可靠、高效智能体的核心。
2025年2月10日
[2502.06975] Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents
该论文提出情景记忆是长期 LLM 智能体所缺失的关键环节,主张围绕情景记忆的五个核心属性构建显式的记忆框架,以推动能够持续学习和适应动态环境的长期智能体发展
2025年7月
Agent Memory: How to Build Agents That Learn and Remember | Letta
这篇文章系统阐述了智能体记忆的本质是上下文工程——智能体“记住”什么完全取决于其上下文窗口中的 token,因此记忆设计的核心是决定哪些信息进入上下文、如何组织以及如何按需检索。
文章将智能体记忆分为四类:消息缓冲区(最近对话)、核心记忆(固定于上下文窗口的可编辑记忆块)、回忆记忆(完整对话历史,存于外部可按需检索)和归档记忆(经处理的结构化知识,存于外部数据库)。技术层面包括消息驱逐与递归摘要以应对上下文限制、记忆块的结构化管理与重写、以及基于向量或图数据库的外部存储与检索。
在系统工程上,文章介绍了MemGPT的分层记忆架构(核心记忆类比 RAM,外部存储类比磁盘),以及休眠期计算的改进——通过异步专用智能体在空闲时整理记忆,避免阻塞主交互并提高记忆质量。
文章强调不应简单类比人类记忆,而应聚焦于上下文工程:设计上下文组织方式、检索工具和提示,让智能体能有效利用有限的 token 预算。短期记忆即消息缓冲区中会被驱逐的内容,长期记忆则包括其他所有持久化组件。最终,构建有效智能体记忆的关键在于组合多种技术,动态选择最有价值的 token 放入上下文窗口。