过去几年,AI行业几乎每隔几个月就会出现一个新的模型。从GPT-3、ChatGPT,到GPT-4、Gemini,再到o1、DeepSeek-R1、Claude Computer Use和各种Agent产品,模型名字越来越多,能力排行榜也越来越长。
我们发现过去几年的AI演进其实有一条非常清楚的主线:AI正在从“生成内容”,逐渐走向理解环境、推理问题、调用工具、执行任务和完成工作。换句话说,真正发生变化的,不只是模型越来越聪明,而是AI能够承担的“工作单位”越来越大。
这件事情对制造业尤其重要。因为制造业真正需要的,从来不只是一个能够回答问题的大模型,而是AI能不能进入生产流程,理解现场、分析异常、调用系统、协同决策,最终把数字世界里的判断转化为真实的生产动作。
从这个角度重新看过去几年的AI,会发现从Generative AI、Reasoning AI,到Agentic AI和Physical AI,本质上是一条从“会回答”走向“会工作”,再走向“会执行”的路线。
一、从GPT-3到Agent:AI能力边界是怎样一步步扩大的?
2020年前后,大模型行业最核心的问题还是Scaling:模型是不是足够大、数据是不是足够多、计算量是不是足够高。OpenAI在2020年关于语言模型Scaling Law的研究中已经表明,模型性能与模型规模、数据规模和训练计算量之间存在相对稳定的幂律关系。这套逻辑随后推动了大模型能力快速提升。
但接下来的几年里,行业竞争的重点不断变化。从“能不能生成”,到“能不能理解”,再到“能不能推理”和“能不能行动”,AI能力边界开始持续向外扩展。
阶段 | 时间 | 代表公司与模型/产品 | 关键变化 | AI新增的核心能力 |
Foundation Model | 2020前后 | OpenAI GPT-3 | 大规模预训练与Scaling成为主线 | 会生成:文字、代码、摘要、翻译 |
Chatbot | 2022 | OpenAI ChatGPT / GPT-3.5 | RLHF与对话交互降低大模型使用门槛 | 会对话:理解用户意图并持续交互 |
Multimodal AI | 2023—2024 | OpenAI GPT-4 / GPT-4o;Google Gemini 1.0 / 1.5 | 文本、图像、语音、视频和长上下文开始融合 | 会感知:从理解一句话扩展到理解复杂信息环境 |
Reasoning Model | 2024—2025 | OpenAI o1;DeepSeek-R1;Google Gemini 2.5 | 强化学习、Thinking与推理计算成为新的扩展方向 | 会推理:处理数学、代码、科学和复杂决策问题 |
Agent / Computer Use | 2024—2025 | Anthropic Claude Computer Use;OpenAI Operator | 模型开始直接操作GUI、浏览器和数字工具 | 会行动:不只是回答,而是执行具体任务 |
Long-horizon Agent | 2025以后 | Anthropic Claude 4;OpenAI GPT-5等 | 推理、工具调用、记忆和长流程执行进一步融合 | 会完成工作:持续处理复杂、多步骤任务 |
Physical AI | 正在发生 | 机器人、自动驾驶、智能工厂 | AI从数字环境进一步连接机器人和自动化系统 | 进入物理世界:感知、决策并驱动物理执行 |
- GPT-3阶段解决的问题是“AI能不能生成像人一样的语言”,真正改变了人与模型的交互关系。过去需要通过API、Prompt Engineering调用模型,ChatGPT则把模型变成了可以连续交流的助手,大模型第一次真正成为大众级产品。
- 到了GPT-4o和Gemini 1.5,多模态开始进一步改变AI的输入边界。GPT-4o可以统一处理文本、视觉和音频信息,而Gemini 1.5 Pro将长上下文能力扩展到百万Token级,并能够同时处理大量文本、代码、图像、音频和视频信息。AI开始从“理解一句话”,逐渐向“理解一个复杂信息环境”发展。
- 2024年底到2025年,变化再次加速。OpenAI o1、DeepSeek-R1、Gemini 2.5等模型把行业注意力从单纯的预训练规模进一步带向Reasoning。DeepSeek-R1在后训练阶段大规模使用强化学习提升数学、代码和逻辑推理能力;Google也直接将Gemini 2.5定义为“Thinking Model”,强调模型在回答之前进行推理。
- 2024年10月,Anthropic为Claude 3.5 Sonnet加入Computer Use能力,使模型能够观察电脑屏幕、移动鼠标、点击按钮和输入文字。2025年,OpenAI推出Operator及其背后的Computer-Using Agent,让AI能够观察网页、制定多步计划,通过点击、输入和滚动完成任务,并在遇到问题时进行自我修正。这意味着AI第一次完成 “Goal → Plan → Tool → Action → Observation → Next Action”整个执行动作。
- 到了Claude 4和GPT-5,行业进一步向Long-horizon Agent推进。Anthropic在Claude 4发布时明确强调其对复杂、长时间运行任务和Agent Workflow的持续执行能力,Claude Opus 4甚至被用于连续数小时的复杂任务;GPT-5则进一步强化了Coding、Agentic Tasks以及长链工具调用能力。
因此,如果把这些模型名称全部拿掉,过去几年的AI演进实际上可以被压缩成一条非常简单的路径:会生成 → 会对话 → 会感知 → 会推理 → 会调用工具 → 会执行任务 → 会完成工作。而下一步,正在从数字世界继续走向物理世界。
二、真正的变化:AI竞争正在从“模型能力”走向“工作完成能力”
如果第一阶段的大模型竞争,核心还是谁的模型更大、知识更多、Benchmark更高,那么现在AI行业正在进入一个明显不同的阶段。未来几年的竞争重点,很可能不再只是模型本身,而是:谁能让AI更稳定、更长期、更低成本地完成真实工作。
这背后至少有四个非常明显的趋势。
- 从“回答问题”走向“完成目标”
过去用户与AI交互时,最常见的方式是:提出一个问题,然后等待一个回答。这种交互方式决定了模型主要被当作“知识工具”或者“内容生成工具”。但Agent出现之后,输入正在从“问题”变成“目标”。例如过去用户会问:“这份质量报告里有什么异常?”未来更可能是“找到这批产品良率下降的原因,并给出处理方案。”
这两句话看起来差别不大,但背后对AI能力的要求完全不同。前者只需要分析一份材料。后者需要AI自己判断:应该查询哪些数据;需要调用哪些系统;应该先看设备还是质量;是否需要进一步查询历史案例;什么时候信息已经足够;最后如何形成一个可执行方案。这意味着“目标完成”会逐渐取代“回答质量”,成为衡量AI能力的重要指标。 - 从单次推理走向Long-horizon Workflow
第二个明显趋势,是AI处理任务的时间尺度正在拉长。早期大模型的工作大多发生在几十秒以内。输入一个Prompt,生成一个结果,任务结束。但真实工作通常不是这样的。一个采购分析、一项软件开发、一轮质量异常处理或者一次生产计划调整,都可能持续几十分钟、几个小时,甚至跨越多天。
因此下一阶段AI真正困难的问题不是某一步能不能做对,而是连续几十步以后,还能不能把整件事做对。这要求AI具备过去单轮模型并不强调的能力:保持长期目标、记住已经完成的步骤、识别中间结果、发现错误、重新规划、调用多个工具、在环境发生变化时调整策略。也就是说,未来Agent的核心能力会越来越接近一个“持续运行的工作系统”,而不是一个更聪明的聊天机器人。 - 从“一个超级Agent”走向“Agent协同系统”
第三个趋势,是行业开始逐渐意识到,真正需要的可能不是一个无所不能的超级Agent。因为真实工作天然就是专业分工的。一个模型同时负责财务、采购、研发、生产、质量、设备和法律,不仅很难做到每个领域都足够专业,权限管理和责任边界也会越来越复杂。
因此更加现实的方向是专业 Agent 之间协同。不同职能的Agent分别拥有不同的数据权限、工具和专业知识,再通过更高层的协调机制共同完成一个复杂工作。所以说,不是简单比较“哪个模型最聪明”,更重要的是哪个AI系统能够把模型、工具、数据、权限、流程和不同Agent组织起来,稳定完成复杂任务。 - 从数字世界进一步走向物理世界
AI开始向Physical AI发展。到目前为止,大多数Agent的行动仍然发生在数字环境里。但真实世界还有大量工作并不存在于电脑屏幕里。搬运物料、插入线缆、操作设备、完成装配、巡视厂区等等,这些任务都需要AI理解真实环境,再把判断转化为物理动作,这就是Physical AI。
如果说Agent解决的是AI如何使用数字工具。那么Physical AI解决的就是AI如何使用物理世界中的工具和身体。机器人、AMR、人形机器人、自动驾驶,以及各种自主设备,本质上都会成为AI新的执行终端。
三、对制造业来说,AI正在从“辅助工具”进入生产闭环
制造业真正困难的,从来不是生成一个答案,而是把一个判断安全、稳定、及时地变成一个生产动作。以一个最常见的质量异常为例。假设某条生产线突然出现良率下降。如果使用早期的Generative AI,可以做什么?它可以帮工程师搜索SOP、整理历史异常案例、解释某个工艺原理,甚至根据输入的信息生成一份RCA报告。
这些能力当然有价值,但它仍然处在生产流程之外。真正处理一个质量异常,工程师可能需要进一步查询当前生产批次,读取设备状态,对比工艺参数,检查AOI结果,查看过去类似异常,判断潜在原因,再决定是否调整参数、维修设备或者暂停某批产品。这就是Reasoning AI开始发挥价值的地方。
但这仍然不意味着工作已经完成。如果分析之后还需要人重新登录MES、QMS或者设备管理系统,再手工创建工单、调整任务和通知相关人员,那么AI仍然只是“建议者”。
Agentic AI带来的真正变化,就是开始连接这些系统。例如一个质量Agent可以从MES获取生产批次;从QMS读取质量数据;调取设备报警;比较当前参数和标准参数;查询历史相似异常;完成RCA;给出处理建议;并根据权限生成质量或维修工单。
此时,AI才第一次真正进入了生产流程。因此,从制造业视角看,过去几年的AI演进可以重新理解成四个阶段。
- Generative AI解决“信息问题”。它帮助人查知识、写报告、生成代码、总结SOP,提高信息获取和知识工作的效率。
- Reasoning AI解决“判断问题”。它进一步进入质量分析、RCA、参数优化、设备诊断、计划推演等复杂场景,帮助工程师缩短分析和决策时间。
- Agentic AI解决“流程问题”。AI开始连接MES、ERP、QMS、WMS、EAM等系统,从“给出建议”进一步进入“执行任务”。
- Physical AI解决的是最后一公里——执行问题。当数字世界里的AI判断可以进一步传递给机器人、AMR、自动化设备和其他Physical AI,AI才真正具备改变物理生产过程的能力。
制造业真正需要的,是AI逐渐具备三种能力:理解工厂、参与决策、进入执行。当这三件事情真正连起来以后,AI才会开始从生产辅助工具,变成生产系统的一部分。
四、工业富联科技服务在把“会回答的AI”变成“会工作的AI”
当AI从生成内容走向推理决策,再从Agent走向Multi-Agent和Physical AI,制造业面临的核心问题也随之改变:如何让AI不只是理解制造知识,而是真正连接生产系统、参与业务流程,并进一步与机器人和自动化设备协同,形成完整的生产闭环。
围绕这一方向,工业富联科技服务正在推进MoMClaw制造智能体与Factory Brain工厂大脑,将大模型的推理能力、Agent的工具调用能力和制造现场的系统与设备连接起来,推动AI从辅助分析走向实际业务执行。
MoMClaw将AI能力与制造系统和业务工具连接,让Agent能够围绕具体任务进行分析、调用和执行。例如,在设备管理场景中,Agent可以结合设备报警、运行状态、维修记录和历史案例开展根因分析,辅助生成处理建议,并通过系统工具衔接后续维护流程。
目前,MoMClaw正围绕Equipment、Logistics、Quality、Automation及Humanoid等制造领域扩展智能体能力,将AI应用从单一知识问答延伸至设备管理、质量分析、物流调度和自动化作业等实际场景。在相关应用中,已实现根因分析时间缩短80%、人员效率提升15%、设备故障减少10%的成效。
同时,工业富联科技服务进一步构建Factory Brain工厂大脑。Factory Brain以多智能体协同为核心,将生产、质量、设备、物流等专业Agent组织起来,使不同智能体能够共享业务上下文、协调任务,并围绕交付、质量、效率、库存和成本等目标进行综合决策。未来,将进一步连接Physical AI,通过机器人、AMR及自动化设备将决策转化为实际生产动作,并将执行结果重新反馈给系统。
AI技术的下一阶段,竞争重点将进一步从模型能力转向实际工作完成能力。对制造业而言,真正的价值不在于部署多少AI模型或智能体,而在于能否将AI融入生产流程,让数据、系统、决策与执行形成持续优化的闭环。随着Agentic AI与Physical AI加速融合,制造业智能化也将从单点应用走向跨系统协同,从辅助决策走向自主执行。未来制造业AI的竞争力,将越来越取决于能否把模型能力转化为可规模化、可持续优化的实际生产力。