第一部分:原理讲解 课程第一章节,我们会拆解这些技术概念背后的设计目的与核心定义; 第二章节我们会落地代码实操,讲解完整实现的操作方法。 我们先从大家都熟悉的 ChatGPT 讲起。ChatGPT 本质由两部分组成:前端聊天交互界面,以及底层搭载的 GPT 大语言模型。 聊天界面本身和市面上普通聊天软件没有区别;而 GPT 就是我们所说的大语言模型,也是整套产品的 AI 核心。 市面上你大概率还听过许多其他大语言模型:Anthropic 公司的 Claude、DeepSeek、Gemini、Llama 等等。本节课不会深入拆解各类大模型的底层细节,后续内容里我们统一将这类 AI 简称为 LLM,文中提到的 LLM 可以指代上述任意一款大模型。 它的基础运行逻辑是:用户在 ChatGPT 对话框提出问题后,前端应用会向底层 LLM 发送请求;大模型生成一段文字回复,再传回界面展示给用户。 我们举一个业务场景举例:假设我们自研一款类似 ChatGPT 的应用 FlyGPT,核心功能是帮用户预订机票。如果我输入需求:“我想飞往北伦敦”,理想状态下程序应当直接帮我完成订票全流程。 按照前面讲的基础逻辑,我们自然会想到用 LLM 作为核心模块,让它理解用户的订票需求。 但实际使用后会发现一个问题:大模型只会返回一段文字操作说明,无法真正完成订票动作。这正是大语言模型原生的局限性: 大模型仅能生成文本、图片、视频类内容,它本身没办法独立执行现实世界里的操作、主动落地真实动作。 那这里所说的 “执行真实动作” 具体指什么? 以订票场景举例:当我说 “我想飞往北伦敦” 时,程序需要完成一整套联动操作:对接 JOYAir、DracAir、AeroGo 这类第三方机票服务商,从平台拉取所有航班信息;再结合我的个人偏好筛选航班 —— 比如优先低价还是高端舱位、座位选择、餐食要求。 程序需要整合全部信息做出最优选择,持续检索补充数据直到信息充足,随后自动完成机票预订,最后向我展示航班详情与预订编号。 简单来说,我们希望 AI 能主动替我们完成真实业务操作。 想要实现这套完整流程,我们就需要一个特殊的工具 ——AI 智能体(AI Agent)。 AI 智能体能够对接第三方平台、网站,采集外部信息;结合历史对话记忆综合分析,再联动底层 LLM(核心 AI)为用户做出决策。 这就是 AI 智能体的核心定位:它可以对接各类第三方工具,留存长期对话记忆,联动大模型进行多轮循环推理与工具调用;持续迭代直到收集到足够信息做出判断,随后执行订票这类真实操作,全程不会中途停止,直到完整完成任务。这就是 AI 智能体的作用。 我们日常使用的代码编辑器,就是最常见的 AI 智能体落地案例。 如果你用过 Cursor、Winder,或是 VS Code 搭配 GitHub Copilot,这些工具都内置了智能体模式,开启后工具就会变成 AI 智能体。 “以智能体模式运行” 到底是什么意思? 在智能体技术出现之前,传统 AI 工具只会单次响应:你提出一个问题,它返回一段答案,交互就此结束。 而智能体模式下,你可以直接交付一整个复杂大型任务,比如搭建完整应用、排查系统故障。 智能体会自动发起多轮大模型调用,按需读取本地代码库、操作终端命令,自主拆解子任务并持续执行,直到完整完成你交付的需求。 这就是普通聊天机器人和 AI 智能体的核心区别:普通聊天机器人只会单次调用大模型,而 AI 智能体能够自主执行一连串关联任务,直到达成最终目标。 AI 智能体真实落地场景:软件开发 举一个开发场景下的实操需求: 我们近期发现页面 UI 丢失了一个按钮,请帮我定位该改动是在哪次提交引入的,同时给出回滚修复方案。 AI 智能体的执行流程:自动扫描前后端完整代码仓库,通过终端工具查询 Git 版本提交记录,精准定位引发 bug 的代码提交节点,甚至直接输出可执行的回滚、修复步骤。 新手如何上手 AI 智能体? 有两种入门路径: 使用预制智能体平台,例如 agent.ai。平台上由开发者搭建了数百款专用智能体,覆盖视频脚本生成、网页设计等各类场景,你可以通过远程接口直接将它们集成到自己的应用中。 使用低代码工具自定义搭建专属智能体,代表工具是 n8n,无需手写代码。 n8n 采用拖拽式可视化画布,用户可以自由搭建专属智能体工作流。平台自带现成模板,例如全自动生成 YouTube AI 视频、基于内容分类的智能邮件整理等自动化场景。
第一章 基础概念:LLM、普通 AI 对话与 AI 智能体核心区分
1.1 从 ChatGPT 拆解 AI 产品基础结构
以大众熟知的 ChatGPT 为切入点,所有同类 AI 产品都由两大模块构成:
- 前端交互界面仅承担对话展示、用户输入接收功能,和普通聊天软件无本质区别,不具备 AI 思考能力。
- 底层大语言模型(LLM)整套产品的 AI 核心,负责理解文字、生成文本回复。 行业主流 LLM 包含:Claude(Anthropic)、DeepSeek、Gemini、Llama 等,课程后续统一用缩写LLM代指所有大语言模型。
LLM 基础原生运行逻辑
用户在界面输入提问 → 前端向 LLM 发送请求 → LLM 生成文字内容 → 内容传回界面展示 单次单向问答,一轮交互结束,模型不会主动延伸、调取外部能力。
1.2 LLM 原生致命局限:仅能生成内容,无法执行真实业务动作
我们以自研机票预订 AI 应用「FlyGPT」举例直观说明: 用户输入需求:我想飞往北伦敦
- 单纯调用 LLM 的结果:仅输出一段文字订票步骤说明;
- 业务真实需求:自动完成全流程订票操作。
完整订票真实动作包含一系列外部联动操作:
- 对接 JOYAir、DracAir、AeroGo 等第三方机票服务商接口;
- 拉取全部航班数据,根据用户偏好(低价 / 高端舱位、座位、餐食)筛选;
- 循环检索补充缺失信息,对比得出最优航班;
- 自动完成下单预订,返回航班详情、预订编号。
可以总结大模型核心短板: LLM 仅具备文本、图像、视频生成能力,无法主动对接外部系统、调取外部数据、执行线上业务操作,没有自主完成复杂多步骤任务的能力。
1.3 AI 智能体(AI Agent)定义与核心定位
为解决 LLM 无法落地真实业务操作的问题,核心解决方案就是AI 智能体。
AI 智能体核心能力
- 对接第三方平台、外部接口、本地工具,采集外部实时数据;
- 持久存储对话历史记忆,结合上下文综合分析用户需求;
- 联动底层 LLM 作为思考核心,自主完成多轮循环推理 + 工具调用;
- 自动拆解复杂任务为多个子步骤,循环执行、补充信息,直至完整完成用户目标,不会中途终止流程。
一句话区分:普通聊天机器人 VS AI 智能体
- 普通聊天机器人:单次 LLM 调用,一问一答,交互单次终止;
- AI 智能体:自主串联多轮 LLM 调用,自动调度各类工具,持续执行连锁子任务,直至达成完整复杂目标。
1.4 落地案例:代码编辑器内置 AI 智能体
Cursor、Winder、VS Code + GitHub Copilot 均搭载智能体模式,是开发者最常用的 Agent 场景。
- 传统 AI 代码工具(非智能体)单独提问代码问题,单次返回代码片段,不会操作本地工程。
- 智能体模式运行逻辑直接交付完整复杂任务(搭建完整应用、排查线上故障、追溯代码 Bug),智能体自动:
- 读取本地完整代码仓库;
- 调用终端执行命令;
- 拆分多步子任务循环执行;
- 自主完成全部需求,无需人工分步下达指令。
开发场景实操示例(AI 智能体完整执行流程)
用户任务:页面缺失按钮,定位引入 Bug 的 Git 提交记录,并输出回滚修复方案 Agent 自动化流程:
- 扫描项目前后端全量代码仓库;
- 调用终端工具查询 Git 提交日志;
- 精准定位触发 Bug 的提交节点;
- 自动生成可直接运行的回滚命令、完整修复代码方案。
第二章 新手两种零门槛上手路径(落地入门方案)
无需深入底层代码,两条主流入门渠道,适配不同开发需求:
路径一:预制智能体平台 ——agent.ai
平台预构建数百套垂直场景专用智能体,覆盖短视频脚本生成、网页设计、内容处理等场景; 支持通过远程 API 接口,直接把现成 Agent 集成到自有软件、网页应用中,开箱即用。
路径二:低代码可视化搭建 ——n8n(自定义专属智能体)
完全不用手写代码,拖拽式画布可视化搭建智能体自动化工作流:
- 内置海量现成模板:全自动生成 AI 短视频、智能分类整理邮件等;
- 自由组合 LLM、第三方接口、本地工具,按需定制专属业务智能体; 适合有个性化业务流程、需要高度自定义 Agent 的新手。