最近几年,AI 圈的新词更新得比产品版本还快。
刚学会把 Prompt 写清楚,讨论里又冒出 Context、RAG、Memory;准备让 AI 帮忙做点事,Tool、MCP、Skills、Agent、Harness 又排着队出现。
每个词单独看都像能懂,放到一起就开始犯迷糊:它们说的到底是模型的能力、资料的来源、外部的工具,还是一套产品怎么运行?
其实这些词说的是同一套 AI 系统里的不同分工,把它们放进一个真实任务里,关系一下子就清楚了。
比如,你对 AI 助手说了这么一句话:
会议任务
“整理本周会议,生成待办,经我确认后发给相关同事。”
听起来挺简单,对吧?但你细想一下,这句话只交代了目标,真正要把事情做完,AI 还得找到本周的会议记录,读懂项目背景,认出谁负责、哪天截止,再调用任务系统和消息系统,碰到缺失或冲突的信息还得处理,最后在正式发送前,停下来等你点头。
你看,Prompt、Context、RAG、Memory、Tool、MCP、Skills、Agent、Harness,全都藏在这一条任务链里。这篇文章就顺着事情发生的顺序,看它们一个个什么时候登场,又怎么配合。
先把这些词放回各自的位置
先别急着背定义,我们按干的活儿把它们分成四组:准备信息的、接工具和做法的、推进任务的、控制运行的。
当然,这只是方便理解的分法,真实产品里这些活儿经常交叉,有时一个组件身兼数职,有时又拆成好几个服务。先看一眼全景图,心里有个底:
整套系统的职责分工四组职责可以由同一组件承担,也可以拆给多个组件01 当前信息Prompt · Context · RAG · Memory02 工具与做法Tool · MCP · Skills03 任务推进Workflow · Agent04 运行与控制Harness(State · Permission · Eval)模型处理输入,生成内容或候选动作
正式开讲前,还有三个最容易混着叫的说法,先掰开:
模型、AI 系统、AI 产品,别混在一起
**模型:**接收输入,生成文本、代码、图像或候选动作。
**AI 系统:**组合模型、上下文、数据、工具、状态和控制机制。
**AI 产品:**在系统之上加入界面、账号、协作、价格和服务体验。
为什么要分这么细?因为同一个模型装进不同系统,表现能差出一大截,换一套资料、换一批工具、换一种重试和验证方式,它能做的事、容易犯的错,都会跟着变。
一、Prompt 与 Context:模型这一轮实际能看到什么
Prompt:给模型的任务说明
先从最熟悉的 Prompt 说起。它就是你这一次交给模型的任务说明,目标、背景、示例、输出格式、各种限制,都可以写进去。放在会议任务里,大概长这样:
请整理本周全部会议,提取待办、负责人和截止时间。
先生成草稿;我确认后,再创建任务并发送消息。
写代码的同学会发现,API 常把指令分成 system、developer、user 这些角色,名字和优先级各家平台自己定。
还有个容易踩的坑:有些论文和 API 会把整次输入统统叫 prompt。所以下次看到这个词,先留个心眼,对方说的是任务说明,还是全部输入。
Context:模型这次调用能使用的全部信息
那 Context 又是什么呢?简单说,就是模型这一次调用能看到的全部信息。在会议任务里,它可能装着这些东西:
系统与开发者指令
用户的任务、格式要求和确认规则
会议记录、联系人与项目资料
RAG 检索结果与 Memory 召回内容
工具名称、参数说明与系统告知的权限范围
工具刚刚返回的结果与已传入的任务状态
所以按这个叫法,你写的 Prompt,其实只是 Context 的一部分。
要注意的是,账户权限、密钥、应用内部的状态,通常不会直接交给模型,只有被整理成输入的那部分才算 Context,真正的权限检查还是在应用里完成的。
再说一个常见的疑问:改 Prompt 和微调模型,到底差在哪?可以这么记,模型参数存的是训练阶段学到的模式,Context 装的是这一次调用的材料。Fine-tuning 改的是前者,Prompt、RAG、Memory 改的是后者。
Token 与 Context Window
Token 是模型处理输入和输出的编码单位,Context Window 就是一次推理能装下多少 Token。输入、历史消息、工具说明和输出,通常都要一起挤这个容量,各家的计算规则还不太一样。
窗口大,只说明能放的东西多。材料放在哪个位置、夹了多少噪声、内容靠不靠谱,照样会影响结果。
Context Engineering:为下一步准备信息
既然窗口装不下所有东西,就得有人来安排:哪些历史要保留,哪些资料要检索,工具和 Skill 什么时候加载,结果怎么压缩,哪些活儿干脆分给独立的 Subagent 去干。这门手艺,就叫上下文工程。
目标很朴素:该看的要看到,无关的别塞太多,来源也要靠得住。
二、RAG 与 Memory:资料怎样取回,状态怎样保留
RAG:先检索,再生成
模型自己不知道你本周开了什么会,这些资料得有人去找,这就轮到 RAG 出场了。
RAG 的全称是 Retrieval-Augmented Generation,中文一般叫“检索增强生成”,名字来自 2020 年的一篇同名论文。放在会议任务里,它干的活儿就是从本周会议、项目文档、历史决定里,把可能相关的资料找回来。
很多人一听 RAG 就想到向量数据库,其实找资料的路子多得很,关键词、BM25、向量搜索、SQL、知识图谱、搜索引擎,都能用。向量数据库只是其中一个组件,代表不了整套 RAG。
顺便说说 Embedding 与 Vector Search
Embedding 模型把文本、图片这些内容编码成数值向量,Vector Search 再在这个空间里比较相似度,返回最接近的候选。完整的检索系统通常还会叠上关键词、过滤、重排和权限检查。
RAG 最大的好处,是能把训练结束之后才出现的新资料送到模型面前。不过资料源和索引要是不更新,答案照样会过时。
还有一点容易被忽略:检索回来的片段只是候选资料,不等于证据。来源靠不靠谱、能不能撑住结论,都得检查,所以系统还要保留来源,逐条核对回答有没有被原文真正支持。
Memory:保存并召回状态
RAG 管的是“这次去哪找资料”,那上次你告诉过 AI 的事,它凭什么还记得?靠的就是 Memory。这个词目前没有跨平台的统一定义,开发者习惯把当前会话和任务状态叫短期记忆,把跨会话保存的偏好、项目事实、历史经验叫长期记忆。
回到会议任务,Memory 里存的可能是“待办必须有负责人和截止时间”“发送前先确认”这类稳定偏好,你说过一次,之后每次它都照着办。
但别误会,这些内容是应用替模型写入、更新、取回、删除的,模型自己可不会永久记住。
这一段信息量有点大,我们用一张图把资料的流动路线捋一遍:
RAG 把资料送进当前 Context检索结果经过筛选后,作为候选资料交给模型01提出问题确定要查什么02检索资料关键词 · 向量 · SQL · 搜索03筛选资料过滤 · 重排 · 权限检查04当前 Context只装入相关片段05模型生成依据候选资料生成结果Memory 保存跨步骤或跨会话的状态;召回内容仍需进入 Context。引用可靠性取决于来源记录,以及证据与最终输出之间的核对。
到这里,几个容易混的词可以一句话收个尾:Context Window 管一次能装多少,RAG 管这次去哪找资料,Memory 管以后记住什么,Cache 管哪些算过的东西可以直接复用。各管各的,谁也替不了谁。
如果还想更直观一点,下面这张图把 Context、RAG、Memory 画成了一间厨房:
解释图 P02 · Context、RAG 与 Memory 为什么不同
三、Tool、MCP 与 Skills:动作、连接与做法怎样分工
Tool Calling:模型提出动作,运行程序负责执行
资料备齐了,接下来该干活了。模型只会生成文字,查日历、建待办、发消息这些实际动作,得靠工具来完成。
工具调用的过程很直白:应用先告诉模型有哪些工具、参数怎么写,模型提出调用请求,运行程序检查后执行,再把结果送回来。注意这里有个关键细节,模型自己从头到尾没碰过工具,它只是提要求,真正动手的是应用。
01 应用提供工具名称、用途与参数格式
02 模型生成结构化调用请求
03 应用检查参数、权限与审批条件
04 应用或外部服务执行动作
05 执行结果返回当前 Context
06 模型根据结果决定下一步
这套机制在不同厂商那儿名字还不一样,Function Calling、Tool Calling、Tool Use 都很常见,范围也不完全重合。Function Calling 常特指按模式定义的自定义函数,Tool Calling 还可能包括平台托管的搜索、代码执行或 Computer Use。
再提醒一句,结构化输出能管住格式,管不住事实真假和业务对错。拒绝、截断、权限检查、高影响动作的确认,这些还是得应用自己处理。
那要是想让 AI 直接操作网页呢?路子也有好几条,读 DOM、读可访问性树、调用浏览器协议、看截图,或者混着用。顺便一提,“Browser Use”有时候还是某个具体产品的名字。
Computer Use 的范围更大,浏览器和桌面应用都算。模型提出点击、输入、滚动这些动作,运行环境执行完,再把新画面交还给模型看。
不过经验上,有 API 就优先走 API,更稳,也更容易审计。目标系统实在没接口,才更多靠界面操作兜底。
MCP:用统一协议连接外部系统
工具多了,新问题又来了:每个工具接法都不一样,接十个工具就得写十套对接代码。MCP 想解决的就是这个麻烦。
它的全称是 Model Context Protocol,Anthropic 在 2024 年 11 月 25 日公开发布,2025 年 12 月捐给了 Linux Foundation 旗下的 AAIF,进入社区化治理。你可以把它理解成 AI 世界的通用插座,接口统一了,谁来都能插。
协议里有三个角色。Host 是承载 AI 的应用,负责协调模型、权限和连接;它会为每个 MCP Server 建一个独立的 Client;Server 提供具体能力,跑在本机或远端都行。Server 能提供的东西分三类:
**Resources:**提供数据与上下文资源。
**Prompts:**提供可参数化的消息模板。
**Tools:**提供可调用的外部能力。
除此之外,MCP 还规范了生命周期、能力协商、传输、消息交换和部分授权机制。但说到底,它管的只是双方怎么连接、怎么说话。Agent 怎么思考、业务权限怎么检查、审批沙箱怎么落地,这些都得靠协议外面的系统继续负责。
Agent Skills:把任务做法打包复用
工具有了,连接方式也统一了,还差一样东西:做事的方法。同样一批工具,交给老手和新手,干出来的活儿差别很大,差的就是经验。Agent Skills 干的事,就是把这份经验写成一本 Agent 随时能翻的工作手册。
按开放规范,一个 Skill 是一个目录,入口文件必须叫SKILL.md,里面可以打包任务指令、脚本、参考资料和模板。至于它放在哪、能用哪些工具、脚本在哪运行,要看客户端怎么实现。
它有个很聪明的设计:不会一上来就把所有内容塞进 Context。系统先只看名称和描述,任务对得上,再打开完整说明,脚本和参考资料等真用到了再读。这样技能可以攒很多,上下文也不会立刻被挤满。
提醒一下,这里说的 Agent Skills,特指以SKILL.md为核心的开放格式。别的产品也爱把自家能力叫 skill,但文件长什么样、怎么加载,可能完全是两回事。
放到会议任务里,“会议转待办”这个 Skill 会写清楚:要抽哪些字段,碰到歧义怎么办,什么时候找人确认,失败了怎么重试。Agent 照着这本手册,去调用任务和消息工具。
绕了一圈,三个词各自站哪个位置,可以用一句话说清:
三者的分工
Tool 是能调用的动作,
MCP 是统一的连接方式,
Skill 是可复用的做事方法。
下面这张图,把三座“工作站”摆在了一起:
解释图 P03 · Tool、MCP 与 Skill 各管哪件事
四、Workflow 与 Agent:固定流程和动态决策怎样配合
信息、工具、做法都到位了,接下来的问题是:整件事由谁来推着走?这就说到 Agent 了。
Agent 在人工智能领域是个老词,这里讲的是现在最常见的 LLM Agent:模型看着目标、Context 和环境反馈,提出下一步,运行程序执行工具,再把结果送回去,就这样一圈一圈循环,直到任务完成、触发停止条件,或者需要人来拿主意。
和它经常一起出现的还有 Workflow。两条路线放在一起看,区别很明显:
Workflow · 路线由程序预先定义
步骤、分支、并行、循环、审批路径,全部由代码提前写好。流程稳定、边界明确、审计要求高的任务,交给它最放心。
Agent · 路线根据反馈动态变化
模型读取目标和状态,自己选下一步和工具,再根据执行结果调整计划。分支没法提前列全、需要边走边判断的任务,Agent 更顺手。
顺带提一个老朋友:ReAct,Agent 的经典实现思路之一,模型交替进行推理和行动,环境返回观察结果,再据此调整下一步。现在的 Agent 大多直接用工具调用,内部推理过程未必公开。
一次工具调用里到底谁管什么,这张图说得最清楚:
Agent 调用工具时,谁负责什么模型提出下一步,应用检查并执行,结果再回到 ContextHARNESSSkill / Rule提供步骤、约束和模板Agent读取 Context,选择下一步Host / 应用检查参数与权限,按需经 MCP 路由Tool / 外部系统真正读取、写入或发送结果写回 Context继续、停止或请求确认Harness 贯穿全过程状态 · 权限 · 沙箱 · 超时 · 重试 · 审批 · Trace · Eval
这套区分来自 Anthropic 的工程文章:Workflow 的整体路径由代码预设,Agent 让模型动态决定过程和工具。当然,也有人把 workflow 当成更宽的总称,把固定步骤和 Agent 步骤全装进去。
真正上线的产品呢?经常是两个一起用。Workflow 固定关键顺序和审批点,Agent 处理开放问题,Harness 或 Runtime 再管轮数、超时、预算、状态和权限,各干各的,配合得刚刚好。
顺便认识一下 Hook
Hook 是绑定到生命周期事件的处理器,比如“会话开始时加载项目规则”“文件修改后跑一遍检查”“长任务完成后发通知”。它也能观察、阻止或修改操作,支持哪些事件、能管到什么程度,看具体产品。
五、Harness:谁来管理循环、权限和失败
最后压轴的,是这批新词里最陌生的一个:Harness。
先说清楚:Harness 这个词,目前没有统一边界。
为了把整套系统讲完整,这里把范围放宽一些:模型外面,凡是负责组织 Agent Loop、连接 Context、工具、状态和控制机制的软件,都算进 Harness。
具体到某个产品,Session、Sandbox、Runtime 和基础设施也可能各自独立。
听着抽象?拆开看,它管的就是六摊子事:
**01 循环:**Agent Loop、停止条件、超时与预算。
**02 信息:**Context、Memory、Rules 与 Skills 的加载。
**03 行动:**Tools、MCP、浏览器、终端与执行环境。
**04 状态:**Session、State、Checkpoint、重试与恢复。
**05 控制:**Permission、Sandbox、Approval 与 Guardrail。
**06 记录与评测:**Trace、Eval、日志、测试与失败样本。
这个词是从软件工程借来的,原意是“运行或测试支架”。窄义的 Harness 只指 Agent Loop 和工具执行逻辑,广义的用法能覆盖围绕模型的整套运行与控制系统。
两种用法都有出处。OpenAI 在 2026 年 1 月讲 Codex Agent Loop 时,把 Codex harness 描述为核心循环与执行逻辑;到了 2 月的 Harness Engineering 案例,又把环境、文档、约束、反馈回路和可观测性都装进了更大的框。
Harness 与 Infra:运行逻辑和基础环境
还有个常被拿来比较的词是 Infra。简单区分一下,Harness 关心一次任务怎么被组织和控制,Infra 提供计算、存储、网络、身份、沙箱、部署和扩缩容,有的产品两边都做。所以看到宣传页上的名词别急着对号入座,直接看它到底提供了哪些能力,比纠结名字有用得多。
权限、沙箱、审批、轨迹与评测
为什么控制这么重要?想想看,工具让 AI 能读文件、写系统、发消息,甚至删数据、付款、发布内容。能做的事越多,越要管住权限,也越要留下能查的记录。
**Permission:**由 Host、操作系统或外部服务强制执行,限定主体能读取什么、能执行什么。
**Sandbox:**通过文件、网络、进程和计算配额等限制,把执行约束在受控环境。
**Approval:**让高影响动作等待人工确认;它不能替代底层权限与沙箱。
**Trace:**按一次运行关联记录模型调用、工具调用、交接、耗时与异常。
**Eval:**用明确任务、数据和指标衡量成功率、质量、成本、安全与副作用。
安全上还有个必须知道的坑:网页、邮件、会议文档、工具结果,都可能夹带诱导指令,OWASP 把这类 Prompt Injection 列为 2025 年 LLM 应用的头号风险。所以系统得把外部内容当成低信任数据,配上内容隔离、最小权限、审批、输出验证和审计。
风险最高的执行路径,通常同时踩中三个条件:能读私有数据,会接触不可信内容,还能往外发消息。三样凑齐就危险了,办法是把这些权限拆开,在涉及外发或写入的步骤加上人工确认。
模型、循环、控制这三层怎么套在一起,看这张“控制中心剖面图”就够了:
解释图 P04 · 模型、Agent Loop 与 Harness 怎样配合
最后
对于正在迷茫择业、想转行提升,或是刚入门的程序员、编程小白来说,有一个问题几乎人人都在问:未来10年,什么领域的职业发展潜力最大?
答案只有一个:人工智能(尤其是大模型方向)
当下,人工智能行业正处于爆发式增长期,其中大模型相关岗位更是供不应求,薪资待遇直接拉满——字节跳动作为AI领域的头部玩家,给硕士毕业的优质AI人才(含大模型相关方向)开出的月基础工资高达5万—6万元;即便是非“人才计划”的普通应聘者,月基础工资也能稳定在4万元左右。
再看阿里、腾讯两大互联网大厂,非“人才计划”的AI相关岗位应聘者,月基础工资也约有3万元,远超其他行业同资历岗位的薪资水平,对于程序员、小白来说,无疑是绝佳的转型和提升赛道。
如果你还不知道从何开始,我自己整理一套全网最全最细的大模型零基础教程,我也是一路自学走过来的,很清楚小白前期学习的痛楚,你要是没有方向还没有好的资源,根本学不到东西!
下面是我整理的大模型学习资源,希望能帮到你。
👇👇扫码免费领取全部内容👇👇
最后
1、大模型学习路线
2、从0到进阶大模型学习视频教程
从入门到进阶这里都有,跟着老师学习事半功倍。
3、 入门必看大模型学习书籍&文档.pdf(书面上的技术书籍确实太多了,这些是我精选出来的,还有很多不在图里)
4、AI大模型最新行业报告
2026最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。
5、面试试题/经验
【大厂 AI 岗位面经分享(107 道)】
【AI 大模型面试真题(102 道)】
【LLMs 面试真题(97 道)】
6、大模型项目实战&配套源码
适用人群
四阶段学习规划(共90天,可落地执行)
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
硬件选型
带你了解全球大模型
使用国产大模型服务
搭建 OpenAI 代理
热身:基于阿里云 PAI 部署 Stable Diffusion
在本地计算机运行大模型
大模型的私有化部署
基于 vLLM 部署大模型
案例:如何优雅地在阿里云私有部署开源大模型
部署一套开源 LLM 项目
内容安全
互联网信息服务算法备案
…
👇👇扫码免费领取全部内容👇👇
3、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】