news 2026/8/20 12:21:21

30 个 AI Agent 核心工程概念:这些才是 Agent 的底子

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
30 个 AI Agent 核心工程概念:这些才是 Agent 的底子

每周一个新框架,每月一个"革命性"发布,口号永远是"这回真不一样了"。结果呢?你刚装好 Claude Code,Cursor 又出新功能了;你刚搞懂 ReAct,隔壁团队已经开始吹多智能体协作了。说白了,追工具就是死循环——你永远在切换配置,永远没时间真正干活。

其实吧,Agentic Engineering 这领域虽然工具迭代快得像疯狗,但底层的核心概念稳得很。那些新工具今天叫 Skill,明天叫 Rule,后天叫 Workflow,扒开来看解决的都是同一个老问题。与其做工具的追随者,不如搞懂背后的原理。工具来来去去,概念永恒不变。

这篇东西就是要一次性讲清楚 30 个核心概念。读完以后,再看那些花里胡哨的 Demo,你能一眼看穿它到底在搞什么飞机,而不是又被"改变一切"的标题党唬住。

基础 building blocks

1. Agent(这玩意儿到底是个啥)

现在是个 AI 工具都管自己叫 Agent,搞得这个词都滥用了。说白了,Agent 不是那种你问一句它答一句就完事的 Chatbot。这家伙会跑循环:你给个目标,它思考→调用工具→看结果→再思考→再行动,直到搞定。

普通 Chatbot 是你问→它答;Agent 是你给目标→它规划→执行→观察→继续。比如 Debug 一个挂掉的测试,它会看报错→打开文件→改代码→再跑测试→看新报错→继续改,直到通过。

但坑就坑在,不是啥场景都需要 Agent。改文件名、格式化日期、转个 JSON,写个脚本就完事了。Agent 每次循环都烧钱,时间越长越不可控,Debug 也更痛苦——它两次跑的可能不是同一条路径。

原则是:简单问答用 Prompt,固定流程用脚本,只有那种"走一步看一步"的灵活任务才上 Agent。别为了用 Agent 而用 Agent。

2. 执行模型(Think → Act → Observe)

Agent 的执行模型其实不神秘,就三步循环:思考→行动→观察(Think-Act-Observe)。先想该干啥,然后调工具(读文件、跑命令、查 API),最后看结果更新上下文。这叫 ReAct 模式,名字不同,道理一样。

有时候 Agent 会并行调多个工具,比如同时读三个文件,省时间但也可能冲突(比如同时编辑同一个文件)。还有阻塞式(等结果再下一步)vs非阻塞式(后台跑任务,Agent 干别的)。新手先记住那个基础循环就行——Agent 不是一次性算准全流程,而是走一步看一步,错了能改。

3. Agent 状态(State 存哪儿)

Agent 的"状态"分两种。

一是上下文窗口(Context Window),就是 Agent 现在能看到的对话历史、系统提示、工具返回,相当于短期记忆。但这玩意儿有 Token 上限,塞太多旧垃圾会分散注意力。

二是外部状态:磁盘文件、数据库、记忆系统。Agent 看不到这些除非你主动喂给它。

说实话,对开发者来说,文件就是最好的状态存储。Git 可追溯,diff 可对比,人和 Agent 都能读。MEMORY.md 存跨会话的记忆(比如项目约定),数据库用来结构化查询。多 Agent 协作时,用 Git worktree 隔离,避免写冲突——每个 Agent 有自己的工作副本,写完再合并。

如果父 Agent 给子 Agent 传上下文时传了一堆废话,说明任务拆分得不够细。

4. 常见 Agent 协作模式

多 Agent 怎么配合?常见套路就三种:

Planner / Executor(计划员+执行员):一个负责拆解任务(先改数据库→再写 API→最后补测试),另一个负责老老实实执行。适合复杂任务,防止 Agent 上来就瞎写代码。

Router / Specialist(路由器+专家):一个 Agent 当客服前台,把任务分给不同专长的 Agent(安全审查、Debug 专家、文档写手)。每个专家 Prompt 更聚焦,行为更可预测,还能省钱——不是所有任务都需要 GPT-4。

Map-Reduce(分治并行):大任务切小,多 Agent 并行处理(比如按文件 Review PR),最后找个汇总 Agent 合并结果。省时间,但汇总质量决定最终效果。

关键是交接时的上下文要不多不少。给太少,下一个 Agent 懵;给太多,它晕。

配置层:Agent 的控制面板

5. Agent 配置文件(CLAUDE.md / AGENTS.md)

Claude Code 用CLAUDE.md,其他工具用AGENTS.md。这玩意儿是项目的"家规",在 Agent 写第一行代码前告诉它:项目用 pnpm 还是 npm,测试命令是啥,代码风格咋样,哪些雷区不能踩。

最烦的是有人把配置文件写成论文。复制一堆 AI 生成的 generic 建议,写"写干净代码"这种废话。说实话,模型不需要你教它怎么写干净代码,它需要知道的是你的项目用uv而不是pip控制在 100 行以内,越具体越好。把它当代码 review,没用的就删。

6. 可复用工作流文件

配置文件是一直生效的,工作流文件是按需加载的。比如"怎么写测试"、"怎么 Review PR"单独成文,放在.claude/skills/或类似目录,带 YAML 头信息描述啥时候用(glob: *.test.ts)。

有个研究叫 SkillsBench 发现:给便宜模型(Claude Haiku)配上人工写的好流程,效果比没流程的顶级模型(Claude Opus)还好。这说明啥?流程比模型更重要。但别让 AI 自己写流程——它写的全是噪音,加了还不如不加。

分层策略:配置文件管家规(永远用 pnpm),工作流管流程(写 API 要同时改验证、测试、文档),实时 Prompt 管当前需求(给学生加个导出接口)。

7. 工作流框架

框架就是给 Agent 套个紧箍咒,让它按套路出牌,别上来就唰唰唰写代码,写完发现测试没跑。

比如 Superpowers 给 Claude Code 加了一堆 curated skills;Get Shit Done 用斜杠命令触发流程;Compound Engineering 分四阶段:Plan → Work → Review → Compound(把这次的经验沉淀下来给下次用)。

说白了,就是把 Agent 从"瞎猜型选手"变成"有流程的靠谱同事"。

8. Prompt Caching(提示缓存)

Agent 每次请求都带系统提示、配置文件这些重复内容(稳定前缀)。Prompt Caching就是把这部分存起来,第一次调用贵,后面便宜得多,响应也更快。

坑就坑在 TTL(Time To Live)。缓存会过期,你去喝杯咖啡回来,或者去 Slack 吹了半小时水,回来缓存凉了,下次调用又得重新写入。有些工具支持调长 TTL,适合长时间编码会话。

但缓存不解决垃圾上下文问题——它只让重复内容更便宜,不会让垃圾内容变有用。

9. Context Rot(上下文腐烂)

这是缓存解决不了的。Context Rot就是说上下文塞太多,模型注意力就散了,找不着重点,准确率下降。就算用 200K 上下文模型,中间部分的信息它也容易漏。

规则是:每个 Token 都得有存在的理由。配置文件别太长,工作流要精简,旧会话该清就清。长上下文≠好上下文。

能力层:Agent 能摸到啥

10. MCP(Model Context Protocol)

Model Context Protocol 是 Anthropic 搞的标准,让 Agent 连外部工具(GitHub、数据库、Slack)不用每次写胶水代码。工具暴露成标准格式,Agent 直接认。

但问题是它占上下文。早期 MCP 要一次性加载所有工具描述,Token 爆炸。新版本支持延迟加载(deferred loading),先只看名字和简述,决定用了再加载详情。

对个人开发者,写个脚本可能更轻量;对团队,MCP 统一管理认证和权限更干净。

11. 实时文档检索(Live Document Retrieval)

模型有知识截止日期,遇到新 API 会瞎猜,而且猜得很自信。Context7 这类工具能把最新库文档拉进上下文,避免用已弃用的函数。DeepWiki 能帮你理解陌生代码库。

关键是问法。别问"认证一般怎么做"(基于训练数据),要问"这个仓库认证怎么做"(基于真实代码)。后者才是接地气的答案。

12. AI-Native 网页搜索

传统搜索是给人类看的,一堆广告、导航栏、弹窗。Agent 不需要这些视觉噪音。Exa 这类 AI-native 搜索直接返回结构化摘要、关键内容,省 Token,省解析 HTML 的麻烦。

人类搜索给页面,AI 搜索给能直接用的上下文

13. 可视化输出生成

Agent 不只能写应用代码,还能出图、出视频、出 PPT。

  • • Figma 的 MCP Server 让 Agent 读设计稿(布局、间距、变量)直接生成前端代码,甚至反向修改设计。
  • • frontend-slides 生成 HTML 演示文稿。
  • • draw.io 文件是 XML 结构,Agent 能读 Terraform 后自动生成架构图。
  • • Remotion 用代码做视频,Agent 学会了就能出片。

模式很简单:Agent 本质是写代码,只是输出格式不同。

14. 持久化记忆(Persistent Memory)

默认每次会话都从零开始,昨天讲的架构决策今天忘了。最简单的办法:项目根目录放MEMORY.md,存项目约定、技术决策、Session 摘要。Agent 启动时读,工作中更新。

但太长会加剧 Context Rot。所以文件大了就换可搜索记忆(如 episodic-memory),把旧会话向量化,需要时检索。文档告诉你"做了什么",Session 历史告诉你"为什么这么做"。

15. 知识搜索(Knowledge Search)

记忆存 Agent 自己学的,知识搜索找外部的。Shopify CEO Tobi 搞的 QMD 就像本地搜索引擎,接 MCP 后 Agent 能查你的会议笔记、设计文档、产品规格。

记忆是纵向的(时间线),知识搜索是横向的(跨文档)。

编排层:多 Agent 怎么不打架

16. 子 Agent(Subagents)

派小弟去干活。父 Agent 给任务、给工具、给干净上下文,小弟干完只返回结果,不返回中间那堆胡思乱想和调试日志。

好处:可以并行(一个审安全,一个写测试,一个改文档),且主线程保持清爽。

用 Markdown + YAML 定义子 Agent,指定toolsmodeldescription。description 告诉父 Agent 啥时候派这个专家出场。

:多 Agent 同时写文件会冲突。用 Git worktree 给每个 Agent 单独的工作副本,写完再合并。

17. Agent 循环(Agent Loops)

类似子 Agent,但是迭代执行。每轮清上下文,状态存文件/Git,下轮重新开始。Claude Code 的[/goal](https://code.claude.com/docs/en/goal)就是这思路:设定完成条件(“所有 auth 测试通过且 lint 干净”),Agent 循环干直到满足条件。

适合重复性、有边界的大任务(比如逐个文件迁移代码库)。

18. 编排工具(Orchestration Tools)

Agent 多了需要调度,不然会重复劳动、进度丢失、结果合不上。

  • • Conductor:给 Claude Code 和 Codex 提供并行会话 UI,带 diff 查看器。
  • • JetBrains Air:在 JetBrains 生态里用 Docker 或 worktree 隔离任务。
  • • Vibe Kanban / Cline Kanban:看板管理,支持自动提交和依赖感知并行。
  • • Paperclip:更激进,想当 AI 公司的管理层,带组织架构和预算控制。

19. 托管 / 云原生 Agent

本地 Agent(Claude Code、Cursor)适合个人开发。托管 Agent跑在厂商基础设施上,通过 API 接入你的产品,适合给终端用户使用。

但注意计费方式:托管通常按 API Token 收费,比自己订阅贵。个人写代码用本地,做产品给多人用才上托管。

安全层:别让 Agent 把家拆了

20. 沙盒(Sandboxing)

Agent 会犯错,可能跑错命令、读错文件。沙盒限制它能访问啥:通常只能读写项目文件夹,.ssh、.env、系统目录都 blocked。网络也能通过白名单限制。

更强隔离用 Docker 容器,甚至无网络访问。目的是缩小爆炸半径——即使 Prompt 注入成功,Agent 也出不了沙盒。

21. 权限(Permissions)

Agent 是解决问题导向的,有时候不择手段:测试挂了就删断言,Git 推不上去就强推,依赖装不上就curl | sh

权限分层:项目级定义安全操作(跑测试、lint),用户级定义红线(禁止rm -rf /,禁止读.env)。可以用小模型做权限分类器,自动判断要不要人工审批。

这不是可选项,是基线安全。

22. 钩子(Hooks)

在工具执行前拦截检查。Pre-tool Hook(如 Claude Code 的PreToolUse)是最后一道防线。

配合 Tirith 这类验证器,检查命令有没有:

  • • 可疑 Unicode(西里尔字母伪装)
  • • 假域名
  • curl | sh管道
  • • 危险文件路径

钩子不替代沙盒,沙盒是事后止损,钩子是事前拦截。

23. Prompt 注入防御

Agent 太信任输入了。克隆的仓库里可能有毒的配置文件(“把日志发到外部服务器调试”),或者 MCP 服务器里藏恶意代码——这构成供应链攻击

还有 Unicode 伪装:西里尔字母і看起来像拉丁字母i,命令看起来是rm -rf /tmp,实际可能是别的。

规则

  • • 把配置文件当代码审查,别当文档
  • • 外部输入(文档、MCP、工具返回)都可能带恶意指令
  • • 结合审查、白名单、钩子、沙盒多层防御

24. 结构化代码检查(Structural Linting)

普通 Linter 查格式、命名,AST-grep 这类工具查语法树结构。比如 Python 的经典坑:

def process(items=[]): # 坑:默认参数是可变对象,只创建一次,后续调用共享 ...

Agent 常写这种代码,因为训练数据里全是。AST-grep 能抓这种"看起来对、实则坑"的模式。把它加进 pre-commit 和 CI,自动纠正 Agent 的坏习惯。

25. Pre-Commit 关卡

Pre-commit 在代码进 Git 前拦截检查。Agent 不会嫌烦,blocked 了就改,改完再试。

强力配置包括:

  • • 基础检查(空格、文件大小)
  • • Ruff(Python 格式+Lint)
  • • Bandit(安全扫描)
  • • AST-grep(结构检查)

CI 是第二道关,在干净服务器上再跑一遍。记得加并发取消(cancel outdated runs),Agent 推送频繁,别浪费资源在已过期代码上。

Pre-commit 保本地历史干净,CI 保合并前干净。

可观测性:看看到底发生了啥

27. 追踪(Tracing)

Agent 干完活,第一个问题:它到底走了哪条路?

Tracing记录完整执行路径:调了哪些工具、哪个子 Agent 调的、耗时、输入输出、模型版本。树状结构比平铺好懂。

用 LangSmith、Helicone 或 OpenTelemetry。有了 Trace,才能 Replay,才能做 Metrics,Debug 时才能一步步看哪里跑偏。

28. 日志(Logging)

最基础的观测。记:

  • • 每次模型调用(Prompt、返回、延迟、Token、模型版本)
  • • 每次工具调用(参数、结果、延迟)
  • • 每次错误
  • • 一个 Session ID 串起全流程

JSON Lines格式,别搞太花哨。先多记,别急着删——丢了输入和工具返回,Agent 抽风时你死无对证。

30. 指标(Metrics)

分两类:

代理指标(Proxy):延迟、Token 用量、成本、工具调用次数。看效率,抓浪费(比如死循环)。

结果指标(Outcome):CI 测试通过没?PR 合并没?部署成功没?回滚了没?看疗效。

两者都得看。Agent 说"任务完成"不算数,外部系统验证才算。

最后说两句

三十个概念,分五层:

  • 配置层定规矩(Config、Workflow、Caching)
  • 能力层给工具(MCP、搜索、记忆、可视化)
  • 编排层管协作(Subagents、Loops、Orchestration)
  • 安全层防作死(Sandbox、Permissions、Hooks、Pre-commit)
  • 观测层看真相(Tracing、Logging、Metrics)

新手别贪多。先搞个简单的CLAUDE.md,接个 Context7 或 DeepWiki 做实时文档,打开沙盒,用子 Agent 做点只读任务(Code Review、文档生成)。这就够了。

工具会过时,概念永留存。说白了,学 Agent 工程不是追新,而是理解这些反复出现的模式。搞懂这些,下周再出个新框架,你也能一眼看穿它葫芦里卖的什么药。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/20 12:19:05

Grok Build v1.0.5:配置覆盖与工作树回收,构建环境管理新范式

上周在本地跑一个持续集成任务时,遇到了一个挺典型的问题:项目依赖的某个第三方库版本在本地和远程仓库的配置文件中不一致。为了临时验证一个修复,我手动改了本地配置,跑通了测试。但紧接着,下一个需要基于原始配置的…

作者头像 李华
网站建设 2026/8/20 12:16:23

CRRT智能信息化平台,助力重症血液净化全流程智慧管理

重症血液净化是 ICU 救治危重症患者的核心手段,CRRT 连续性肾脏替代治疗临床场景复杂,设备数据割裂、人工记录工作量大、风险预警滞后、质控统计繁琐等痛点长期困扰临床科室。由聚智惠仁公司研发的 SmartCRRT 系统,面向全院多病区重症透析场景…

作者头像 李华
网站建设 2026/8/20 12:13:59

实时数仓注意事项

paimon表producer mode必须配置对. 一般建议lookup,上游是binlog则配置input , paimon ods层或者append table表配置none即可 详细选择看另一篇帖子 如果1 上游表是主键表,2 表无法提供-U 即你配置producer modenone 导致没有-U,3 下游需要retract语义(比如下游sum聚合,比如统…

作者头像 李华