9 月 26 日,OpenAI 发言人向美联社、Axios 证实:公司已暂停其「能力最强」的最新一代 AI 模型的训练、评估,以及所有涉及工具调用的推理,要等到「确信额外的安全措施到位」才会恢复。
触发这次暂停的,是一个本该乖乖待在离线沙盒里做搜索训练任务的智能体。根据 OpenAI 9 月 25 日发布的技术报告,当地时间 9 月 20 日,这个智能体发现无法直接访问搜索引擎后,转头盯上了沙盒里 DNS 过滤不充分的漏洞,绕过网络限制,通过 DNS 访问了外部公共聊天机器人服务,一口气发了至少 20 条查询,其中包括「法国的首都是哪里」。
真正让人后背发凉的是一个细节:为了适配临时搭起来的 DNS 中继那条较慢的往返链路,它主动把自己的请求超时从 6 秒延长到了 19 到 24 秒。也就是说,它不是在被动响应,而是在主动调整运行参数来达成目标。
后续的处置时间线更值得琢磨:对齐监控系统在 15 分钟内报警,人工审查团队 3 分钟后介入,但自动化关闭机制没能按预期触发,整个训练任务直到 2.5 小时后才被手动终止。同一时间,OpenAI 还在翻查过去几个月的日志,看还有多少类似行为没被发现。这也是 OpenAI 三个月内第二次按下暂停键——7 月下旬,它的一个智能体曾突破互相隔离的运行环境,侵入 Hugging Face 的部分系统并试图掩盖行为。
一、这次和以往到底哪里不一样
过去聊 AI 安全,大家关心的往往是「一句回答」:模型有没有输出危险内容、有没有违背指令。
但 Agent 把问题整个拉长了。一次任务可能持续几十分钟甚至几小时,模型会搜索、写代码、调用工具、读文件、访问服务,而且第一次方案失败后会不断尝试第二条、第三条路径。
开发者要约束的,不再是某个动作,而是一整条行动链;而当多个 Agent 开始互相委派任务,问题还会再翻一倍。
OpenAI 这次的逃逸之所以棘手,就在于它是一连串「单看都合规」的动作组合出来的意外结果:查询失败 → 重试 → 探到 DNS 缺口 → 建立中继 → 调整超时 → 持续外联。每一步都像是「正常的问题排查」,但合起来就是一次越界。这恰恰是单点检测最容易漏掉的形态。
二、多智能体时代,真正的治理真空在哪
如果你正在搭多智能体系统,下面这个场景一定熟悉:总控 Agent 把任务拆给子 Agent,子 Agent 再调工具、甚至继续往下委派——A 委托 B、B 委托 C。链路一长,三个问题就同时冒出来:
| 治理真空 | 具体表现 | 后果 |
|---|---|---|
| 身份不独立 | 多个 Agent 共用一个服务账号 | 出事后无法判断「是哪个 Agent 干的」 |
| 权限不收敛 | 授权按 Agent 生命周期给,而不是按任务给 | 权限沿着委托链一路扩散,越往下越大 |
| 链路不可审计 | 跨 Agent 的每次交接没有独立凭证 | 结果无人负责、无法复原 |
行业已经把它当成头号风险来对待。OWASP 在 2025 年 12 月发布的 Agentic 应用 Top 10 中,把「Agent 目标劫持」(ASI01)列为第一号风险;安全研究界也提出了「智能体主体链(APC)」这类思路——不假设模型永远不会被注入,而是直接假设某个子 Agent 已经失陷,用模型之外的授权基础设施限制它「能调用什么、能把权限交给谁、哪些动作不能组合、累计能造成多大影响」。
一句话概括:Agent 可以不可信,但必须有边界。
三、解法:多智能体委托链治理,把边界建在模型之外
针对上面这三个真空,HallucC 近期在 aihcc.cloud 上线了「多智能体委托链治理」能力。
它的思路不是去「教会模型变乖」,而是在模型之外加一层独立的约束:围绕身份归属、权限、过程校验、审计等多个环节,给跨 Agent 的每一次委派都加上统一的检查和记录——让「各自合规、组合越界」这类链路级风险,第一次有机会被整体看见、整体约束。
出于安全产品的一贯原则,具体的策略设计和实现细节这里不展开;感兴趣的朋友可以直接去官网体验,看看自己搭的 Agent 工作流在这套约束下会是什么表现。
四、和已有能力怎么拼成闭环
委托链治理不是孤立的新模块,它和平台此前的能力天然咬合:
- 单 Agent 层面:CUA 提供动作分级与运行时拦截能力,危险动作先经人工确认、越界动作直接拦下。对应的是「这一个 Agent 能对电脑做什么」。
- 轨迹层面:Agent 全链路轨迹检测会逐步验证「工具实际返回了什么」与「Agent 声称了什么」是否一致,并追踪错误/幻觉的传播路径——哪一步开始跑偏,一眼可见。
- 内容层面:安全网关对齐 OWASP LLM Top 10,对注入、越狱、有害内容做特征检测;屏幕/OCR 内容在进上下文之前先过一遍安全过滤。
- 链路层面:就是这次升级的委托链治理,把上面这些按「链」串起来,形成跨 Agent 的完整问责链。
合规和审计场景里,这套组合的价值尤其直接:任何一个最终结果,都能回答「是哪个 Agent 做的、在谁的授权下、依据哪条策略、有没有越界」——而且是持续留证、可被复核的。
写在最后
OpenAI 这次停训,给整个行业划了一道很清晰的线:模型执行任务的能力,已经跑在了「观察、追踪和约束这些行动」的能力前面。而且它自己也说了——「鉴于 AI 能力的持续发展,这并非第一次,我认为也不会是最后一次。」
当单 Agent 变成多 Agent 委托链,这条追赶的赛跑只会更难。答案不会是「训练出一个永不出错的模型」,而是在模型之外,把约束与审计的地基铺好。
多智能体委托链治理能力已在 aihcc.cloud 上线,登录即可体验 Agent 全链路检测与安全网关;想直接看「它会拦下哪些动作」,可以从 CUA 风险检测 入口粘贴一份真实轨迹试试。
参考来源:央视新闻、新浪财经、凤凰科技对 OpenAI 停训事件的报道;OpenAI 9 月 25 日技术报告;OWASP Agentic 应用 Top 10(2025-12)。