news 2026/8/28 1:21:26

AI相关论文学习总结

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI相关论文学习总结

2023年7月

[2307.03172] Lost in the Middle: How Language Models Use Long Contexts

这篇论文的核心发现是:语言模型虽然能接收长上下文,但并不能稳定、充分地利用其中任意位置的信息。作者通过多文档问答和键值检索两类需要定位相关信息的任务发现,模型的表现会随着相关信息在输入上下文中的位置变化而发生显著波动——当相关信息出现在上下文的开头或结尾时,模型表现通常最好;而当相关信息被放在长上下文的中间时,性能会明显下降。这一“中间迷失”现象即使在专门针对长上下文优化的模型上同样存在。因此,论文指出当前语言模型对长上下文的信息利用并不稳健,并提出了新的评估协议,用于更好地衡量和推动未来长上下文模型的发展。

2025年9月 Anthropic

Effective context engineering for AI agents \ Anthropic

这篇文章提出,随着 AI 智能体从单轮提示走向多轮自主循环,工程重点正从“怎么写提示”转向“怎么管理上下文”。作者用“注意力预算”比喻 LLM 处理长上下文的固有局限:上下文越长,模型对任意位置信息的提取和推理能力越会下降(即“上下文腐化”现象)。因此,上下文必须被当作有限且边际收益递减的资源来精心策展。

文章给出了上下文工程的核心原则:寻找最小但高信号的 token 集合,最大化期望行为出现的概率。具体实践包括:

  • 系统提示:清晰、直接,避免过度硬编码或过于模糊,用 XML 标签或 Markdown 组织内容;从最小提示开始,根据失败模式逐步添加规则和示例。

  • 工具设计:工具应自包含、职责清晰、返回 token 高效;避免工具集臃肿导致模型选择困难。

  • 示例:少而精,用多样化、典型的示例代替冗长的边界情况清单。

  • 动态检索与“即时上下文”:不预先加载所有数据,而是让智能体通过轻量标识符(文件路径、查询等)在运行时按需加载信息,类似人类使用索引和书签。Claude Code 的混合策略(预加载少量核心信息 + 运行时用grepglob等工具探索)是典型例子。

  • 长程任务三大技术

    1. 压缩(Compaction):在接近上下文窗口上限时,总结关键内容并开启新上下文,保留架构决策、未解决问题等,丢弃冗余工具输出。

    2. 结构化笔记(Agentic Memory):智能体定期将笔记写入上下文之外的文件,在需要时读取,实现跨上下文的持久记忆(如 Claude 玩 Pokémon 时维护训练进度)。

    3. 子代理架构:多个专用子代理各自在干净的上下文中完成探索或深度工作,只向主代理返回精简摘要,实现关注点分离。

文章最后强调,无论模型能力如何提升,把上下文视为珍贵、有限的资源,并围绕这一理念持续优化,始终是构建可靠、高效智能体的核心。

2025年2月10日

[2502.06975] Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents

该论文提出情景记忆是长期 LLM 智能体所缺失的关键环节,主张围绕情景记忆的五个核心属性构建显式的记忆框架,以推动能够持续学习和适应动态环境的长期智能体发展

2025年7月

Agent Memory: How to Build Agents That Learn and Remember | Letta

这篇文章系统阐述了智能体记忆的本质是上下文工程——智能体“记住”什么完全取决于其上下文窗口中的 token,因此记忆设计的核心是决定哪些信息进入上下文、如何组织以及如何按需检索。

文章将智能体记忆分为四类:消息缓冲区(最近对话)、核心记忆(固定于上下文窗口的可编辑记忆块)、回忆记忆(完整对话历史,存于外部可按需检索)和归档记忆(经处理的结构化知识,存于外部数据库)。技术层面包括消息驱逐与递归摘要以应对上下文限制、记忆块的结构化管理与重写、以及基于向量或图数据库的外部存储与检索。

在系统工程上,文章介绍了MemGPT的分层记忆架构(核心记忆类比 RAM,外部存储类比磁盘),以及休眠期计算的改进——通过异步专用智能体在空闲时整理记忆,避免阻塞主交互并提高记忆质量。

文章强调不应简单类比人类记忆,而应聚焦于上下文工程:设计上下文组织方式、检索工具和提示,让智能体能有效利用有限的 token 预算。短期记忆即消息缓冲区中会被驱逐的内容,长期记忆则包括其他所有持久化组件。最终,构建有效智能体记忆的关键在于组合多种技术,动态选择最有价值的 token 放入上下文窗口。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/28 1:19:42

Python网络分析与AHP模型:解决SDGs优先级问题的数学建模实战

1. 项目概述:从赛题到解题的思维跃迁每年一度的美国大学生数学建模竞赛(MCM/ICM),对于众多理工科学生而言,不亚于一场学术上的“奥林匹克”。其中,ICM(交叉学科建模竞赛)的题目往往更…

作者头像 李华
网站建设 2026/8/28 1:17:31

C++模板与STL核心实战:从泛型编程到容器高效应用

1. 项目概述:一次高效的C核心语法与STL实战复习 最近在整理自己的C知识体系,翻到了当年学习时参考的黑马程序员教程P167到P200这部分内容。这部分内容,可以说是C从“会写代码”到“写好代码”的一个关键分水岭,它深入讲解了 模板…

作者头像 李华
网站建设 2026/8/28 1:15:37

无服务器架构迁移别一次切换

无服务器架构迁移别一次切换Serverless 适合按需扩缩、运维边界清晰的工作负载,但并不意味着不需要容量和发布管理。将 Node.js 或 Java 常驻服务迁过去时,最难的往往不是改部署描述,而是重新处理连接、状态、超时和观测。 一次切走全部流量会…

作者头像 李华
网站建设 2026/8/28 1:15:23

智能体编排的分层测试方法

智能体编排的分层测试方法智能体演示成功,并不说明它能稳定地完成业务任务。工具参数、上下文、权限和外部服务同时变化时,问题才会出现,因此测试要按职责拆开。 单元测试覆盖提示词组装、参数校验、状态转换和权限判断,可以用固定…

作者头像 李华
网站建设 2026/8/28 1:15:18

存量工作流如何分阶段迁移

存量工作流如何分阶段迁移旧工作流里常藏着未文档化的例外和人工补救,挑个周末全量切换,往往是把未知集中到同一个时刻爆发。 迁移前先画出真实链路:触发入口、输入来源、人工判断、外部写入和交付物。再从低风险任务开始并行运行&#xff0c…

作者头像 李华
网站建设 2026/8/28 1:15:06

从用户反馈到产品闭环

从用户反馈到产品闭环给每条反馈留下上下文 闭环完成后保留复查日期。产品使用环境、客户流程和外部依赖都会变化,过去合理的暂缓决定不一定永远有效。负责人交接时也要交接未解决问题和证据,避免新成员因缺少背景重复做出已验证无效的改动。定期回看高影…

作者头像 李华