news 2026/8/14 15:13:15

从提示词到 Agent:用一个真实任务吃透 Prompt、Context、Harness、Loop 四个工程

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从提示词到 Agent:用一个真实任务吃透 Prompt、Context、Harness、Loop 四个工程

最近 Prompt、Context、Harness、Loop 一起火了,很多人会误以为它们在抢同一块地盘。

先说结论:它们不是替代关系,而是让大模型从“回答问题”升级为“可靠完成任务”的四个工程面。

你可以这样记:Prompt 管意图,Context 管工作记忆,Harness 管手脚和规矩,Loop 管做事节奏。

这篇内容用一个统一任务讲透它们:读取仓库,修复登录 bug,运行测试,提交报告。

一、先建立直觉:一句 Prompt 为什么不够

1.1 Demo 能跑,不等于任务能交付

如果只对模型说:

请修复这个仓库的登录 bug,运行测试,告诉我结果。

它也许能写出不错的代码,但依然不知道测试入口、可修改范围、失败后该怎么办,以及什么才算任务完成。

ℹ️读者

模型已经很强了,为什么还要这么多工程?

ℹ️作者

模型负责生成下一步;系统还要给它正确的信息、工具、边界、反馈和验收。

1.2 同一个任务,四次升级

工程新增能力解决的问题
Prompt目标、限制、交付格式不知道做什么、怎样算完成
Context代码摘要、测试说明、当前状态看不见或误用关键信息
Harness工具、权限、沙箱、日志、验证器不能安全动手,也不能证明结果
Loop计划、行动、观察、修正、退出多步任务遇到反馈后不会继续处理

从单句 Prompt 到四层 Agent 系统

重点不是按顺序淘汰旧能力,而是让四层一起为同一件任务服务。

二、四个工程分别管什么

2.1 Prompt:把意图说清楚

Prompt 工程解决的是:模型这一次应该怎样理解任务。

目标:修复登录接口空邮箱导致 500 的问题。

限制:不要修改依赖;先阅读现有测试。

完成标准:更新测试,运行测试命令;报告修改文件、结果和遗留风险。

不要把 Prompt 当成神奇咒语。它更像一份可版本管理、可评审、可复用的任务契约。

2.2 Context:管理模型此刻的工作记忆

Prompt 解决“做什么”,Context 工程解决“这一轮该看什么”。

模型除了看到指令,还可能看到工具说明、代码、检索资料、历史消息、测试日志和任务状态。关键是选择、压缩、更新,而不是全部塞进去。

目标:修复 POST /login 的空邮箱 500

已确认:入口在 src/auth/login.ts

已读:tests/login.test.ts

待验证:空邮箱应返回 400;全量测试未跑

禁止:不要打印 token;不要修改 package.json

⚠️注意

长上下文只是更大的仓库,不是更好的管理员。无关、过期和矛盾的信息照样会让模型跑偏。

2.3 Harness:让 Agent 有手脚,也有规矩

Harness 是模型外面的运行底座。它决定 Agent 有哪些工具、在什么权限内执行、如何记录过程、怎样验证结果。

  • 工具:读文件、搜索、编辑、运行测试;
  • 权限:哪些目录可写,哪些命令禁止;
  • 隔离:受控工作区或沙箱;
  • 证据:工具调用、错误和测试结果;
  • 兜底:发布、删除、付费等动作必须能暂停确认。

**模型决定:下一步试什么。

Harness 决定:能不能做、怎样留下证据、失败后怎样追溯。**

Harness 运行底座:模型、工具、权限、沙箱和验证

没有 Harness 的 Agent 很容易停在演示级;有了 Harness,才有机会变成可控、可审计的系统。

2.4 Loop:让它根据结果继续做事

Loop 工程解决的是连续行动。一次模型输出结束后,系统要将工具结果和验证结果送回下一轮,让它继续判断。

1 2 3 4 5 6 7 while 未完成 且 未超预算: 读取当前状态和必要 Context 生成下一步 调用工具,或请求人工确认 记录观察结果 更新状态与 Context 验证是否满足完成条件

Loop 不是让模型一直跑;Loop 是设计它为什么继续、何时停止。

Agent Loop:计划、工具、观察、状态更新、验证与退出条件

三、这四个工程是怎样被逼出来的

3.1 从单轮 Prompt,到工具调用的 Loop

早期 LLM 主要做问答、分类和文案生成,任务通常一两次调用就结束,所以 Prompt 是工程重点。

当模型开始搜索、查库、编辑文件和运行代码,工具返回的结果会改变下一步决策。ReAct 在 2022 年将推理、行动和环境观察交错起来,是理解这一变化的代表性范式。ReAct

3.2 从 RAG 和长任务,到 Context 瓶颈

多轮会话、RAG 和长任务不断产生信息。此时最大问题不再是“提示词够不够漂亮”,而是“有限窗口里到底放哪些内容”。Anthropic 将 Context 工程描述为 Prompt 工程的自然延伸:它管理每次推理时进入上下文窗口的全部信息,而不仅是一段系统提示词。Anthropic:Context Engineering

3.3 从 Demo 到生产,Harness 走到台前

当 Agent 能碰真实文件、账号、数据库或发布流程,问题就变成权限、沙箱、审计、验证和人工接管。此时模型能力仍重要,但系统是否值得信任,更多取决于运行底座是否可靠。

四、如何判断它真的变可靠

4.1 记录五个指标

指标要问的问题
成功率是否满足明确验收标准?
成本token、工具调用和人工时间花了多少?
时延从启动到可验证交付用了多久?
人工介入人通常在哪一环纠错或授权?
可审计性能追溯读了什么、改了什么、为何完成吗?

失败时,不要条件反射只改 Prompt。先看轨迹:是少了 Context?权限没配?验证没覆盖?还是 Loop 没有正确停止?

4.2 一条务实的建设顺序

  1. 先补 Prompt:固定目标、边界、输出格式。
  2. 再补 Context:维护任务状态、资料来源和历史摘要。
  3. 再补 Harness:工具 schema、权限、日志、验证与人工确认。
  4. 最后补 Loop:预算、重试、回退、退出条件和评估集。
  5. 用真实运行轨迹持续改进前面四层。

OpenAI 的 Agent 指南把一次 run 通常实现为 loop,并强调明确的退出条件、错误与最大轮数控制。OpenAI:A practical guide to building agents

五、三个不要硬上的坑

5.1 不要把所有资料都塞进 Context

先保证相关性、时效性、来源,再谈窗口容量。

5.2 不要为了“智能”过早上多 Agent

多 Agent 会带来角色切分、状态同步、评估和故障定位成本。单 Agent 加好工具与验证,往往是更稳的第一步。

5.3 不要把测试通过当作全部安全

涉及真实副作用时,仍然需要最小权限、审计日志和必要的人工确认。

最后记住一句话:

Prompt 定义意图,Context 提供工作记忆,Harness 约束能力边界,Loop 把反馈变成行动。

真正可靠的 AI 系统,不是模型多会说,而是它能在受控环境里拿到正确的信息,做出可验证的下一步,并在该停的时候停下来。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 15:12:26

继承(全)

目录 一. 继承的概念及定义 1.1 继承的概念 1.2 继承的机制 1.3 继承的定义 1.3.1 定义格式​编辑 1.3.2 继承父类成员访问方式的变化 1.4 继承类模板 二. 父类和子类对象赋值兼容转换 2.2 类型转换的特殊处理规则 2.3 应用实例 三. 继承中的作用域 3.1 隐藏规则 …

作者头像 李华
网站建设 2026/8/14 15:10:38

王虹、邓煜、张益唐、韦东奕四位数学家的‌核心成果时间线对照表

以下是王虹、邓煜、张益唐、韦东奕四位数学家的核心成果时间线对照表,完整覆盖他们从学术起步到取得里程碑成果的关键节点,清晰呈现不同成长路径的节奏差异。 一、四位数学家核心成果时间线对照表 时间 节点 王虹(调和分析/几何测度论&…

作者头像 李华
网站建设 2026/8/14 15:03:59

代码实现!教学视频!Python学习者最易上手的机器学习漫游指南

此刻, 你理应已然掌握了线性回归的概念, 随后, 让我们瞧瞧怎样于其中达成它。准备工作fromdf pd.(‘.csv’)df. ‘X’, ‘Y’df.head()可视化sns.(“”, 1.1)sns.(“ticks”)sns.(‘X’,’Y’, datadf)plt.(‘’)plt.(‘’)实现 .() np.(df.X20:len(df.X)).(-1, 1) np.(df.Y20…

作者头像 李华
网站建设 2026/8/14 15:01:57

小米资深Android面经:组件化架构设计、WorkManager的原理、PMS包管理服务的工作原理

小米资深Android面试:小米Android开发覆盖MIUI系统定制、IoT设备互联。技术栈偏底层,面试官喜欢问系统级原理和性能数据。技术方向偏向MIUI定制、IoT互联。特色专项包括MIUI系统定制与IoT设备开发。今天8道题覆盖小米资深Android面试核心考点。 Q1:组件化架构设计和模块间通…

作者头像 李华