Astra 给开源模型出了一道什么题?从 AGI 到图形世界,DeepSeek、Kimi、Qwen 谁更接近下一代 AI?
GPT-6 Astra 发布以后,很多讨论集中在一个词:AGI。
OpenAI甚至把 Astra 描述成“新一代智能”,并公布了 ARC-AGI-3 99.9%、FrontierMath Tier 4 98% 等成绩;与此同时,Astra 在 computer use、浏览器操作、软件工程和专业工作上的能力,也被放到了非常核心的位置。
但如果站在开源模型的角度,我认为 Astra 真正出的一道题,并不是:
谁的模型更聪明?
而是:
一个 AI 能不能从“理解世界”,进一步发展到“构造世界、操作世界并验证结果”?
这可能比传统意义上的大模型 Benchmark 更重要。
一、Astra 的变化:AGI 不再只是“更聪明的聊天机器人”
过去几年,大模型竞争的逻辑相对容易理解:
参数更多、知识更多、数学更强、代码更强、上下文更长。
但是 Astra 展现出的路线正在发生变化。
它的重要能力之一,是computer use。
也就是说,AI 不只是告诉你“应该怎么做”,而是开始真正进入软件、浏览器和计算机环境中完成任务。OpenAI将 computer use、browsing、software engineering、science 和 professional work 都列为 Astra 的核心能力。
这意味着一个重要变化:
LLM → Reasoning Model → Agent → General Computer Agent
而我认为后面还有一步:
General Computer Agent → Generative World Agent
这一步,就是“图形”。
二、为什么“图形”可能成为下一场真正的竞争
这里说的图形,不只是 AI 画一张漂亮图片。
今天的大模型面对的世界,本身就是图形化的:
网页是图形界面;
Windows 是图形界面;
CAD 是图形;
Blender 是三维图形;
游戏是实时三维世界;
ComfyUI 是节点图;
视频编辑器是 Timeline;
工业数字孪生是三维空间;
甚至企业软件,本质上也是数据结构在 GUI 上的视觉表达。
因此真正通用的 Agent 必须建立一个循环:
理解目标 ↓ 观察环境 ↓ 建立内部世界模型 ↓ 规划 ↓ 操作工具 ↓ 生成/修改图形 ↓ 观察结果 ↓ 判断是否符合目标 ↓ 修正这和传统的:
Prompt → Answer已经完全不是同一种 AI。
Astra 给开源模型真正出的题,可能就在这里。
三、DeepSeek:推理很强,但需要继续补上“眼睛和手”
DeepSeek 的优势一直比较鲜明:
推理、代码、Agent,以及极高的计算效率。
到 2026 年 8 月,DeepSeek V4 Pro 已经明显强化 Agent 能力;随后发布的 V4-Flash-Vision-Exp 又进一步补上视觉 Agent 能力。DeepSeek 官方特别指出,在需要视觉理解的 Agent Benchmark 上,新视觉模型相比纯文本版本有明显提升。
所以 DeepSeek 的演进路线很有意思:
Reasoning → Coding → Agent → Vision Agent
这是非常合理的一条路线。
但面对 Astra 提出的新问题,DeepSeek 下一步需要解决的不只是“看懂图片”。
看懂 GUI,与真正操作 GUI,是两回事。
进一步说:
看懂 Blender,与自己构造一个 Blender Scene,又是两回事。
因此 DeepSeek 最值得观察的是:
能否把强大的推理能力进一步延伸成稳定的Visual Planning + Tool Execution + Verification。
如果做到这一点,它会非常强。
因为它本来的“大脑”已经足够好,下一步主要是给这个大脑安装更加成熟的眼睛和手。
四、Kimi:可能是目前最值得观察的“Agent 化”开源路线
Kimi 的路线与 DeepSeek 有明显区别。
Kimi 更积极地把:
长上下文 + Vision + Coding + Agent + 多 Agent
揉成一个整体。
目前 Kimi K3 已经是原生视觉模型,最高支持 1M context;官方定位也是 long-horizon coding 和 end-to-end knowledge work。
而此前 Kimi K2.5 已经明确提出一个很有意思的概念:
Visual Agentic Intelligence
Kimi甚至专门展示了 Image/Video → Code、视觉调试、前端界面生成以及 Agent Swarm。
这个方向非常重要。
因为下一代 Agent 面临的问题经常不是:
“这个按钮是什么?”
而是:
“我要完成这个目标,现在这个界面处于什么状态?下一步应该操作什么?操作以后结果是否正确?”
这是状态空间推理。
所以 Kimi 的一个潜在优势,是它正在尝试把“看”和“做”放进同一个 Agent 框架里。
如果把这个能力继续扩展到 Blender、CAD、ComfyUI、Premiere、Unreal Engine,那么它距离真正意义上的Visual Creation Agent就会越来越近。
五、Qwen:我反而认为它最值得关注“AI操作系统”方向
Qwen 的优势与前两者又不一样。
它最大的价值可能不是某一个 Benchmark 第一,而是:
模型谱系非常完整。
从很小的模型,到 MoE、Coding、Vision、多模态、Agent,再到图像和视频生态,Qwen 更容易形成一个完整的本地 AI Stack。
例如 AWS 在 2026 年引入的 Qwen3.5/Qwen3.6 系列已经覆盖:
- 多模态视觉推理;
- 图片、视频、文本;
- Agent tool use;
- Coding;
- 1M context;
- 小至 0.8B 的端侧模型;
- 面向 Agentic Coding 的高效率 MoE。
这意味着 Qwen 特别适合另外一种路线:
Qwen Large Model ↓ Planner ↓ ┌──────┼──────┐ ↓ ↓ ↓ Vision Code Small Model ↓ ↓ ↓ GUI Tool Local Control ↓ External Models ↓ Image / Video / 3D这已经不像一个模型了。
它更像一个开源 AI Runtime 的模型家族。
这对于本地 AI 特别重要。
六、Astra 真正领先的地方,可能不是单项能力
因此,如果简单总结四条路线,我会这样描述:
| 路线 | 当前最鲜明的特征 | 下一道题 |
|---|---|---|
| Astra | 通用智能 + Computer Use + Agent | 从操作软件走向构造数字世界 |
| DeepSeek | Reasoning + Code + Agent | 强化视觉闭环和环境执行 |
| Kimi | Vision + Long Context + Agent/Swarm | Visual Agent进一步工具化 |
| Qwen | 完整开源模型生态 | 建立本地AI Runtime/OS |
这里最容易被忽略的一点是:
Astra 的竞争优势未必来自某一个能力特别强,而可能来自能力之间已经开始形成闭环。
例如一个建筑任务。
旧的大模型可能是:
给你建筑设计建议。
再进一步:
给你生成建筑效果图。
而下一代 Agent 应该是:
理解要求 → 规划建筑 → 操作建模工具 → 建立模型 → 渲染 → 检查结果 → 发现问题 → 修改模型。
这时候,AI已经不是“Copilot”。
而是:
Operator + Designer + Reviewer
这才是 AGI 概念真正开始进入应用层的地方。
七、图形为什么尤其重要
我认为未来两三年,一个非常值得关注的词不是单纯的 Multimodal,而是:
Spatial / Visual Agency
因为语言世界相对简单。
语言基本是一维序列:
Token → Token → Token但现实世界不是。
一个三维场景包含:
Object Position Rotation Scale Material Lighting Camera Physics Animation Relationship TimeAI如果能够理解这些变量,并通过软件不断改变这些变量,观察结果,再重新规划,就意味着模型正在获得一种非常不同的能力:
从生成 Token,走向操作 State。
而这恰恰也是图形、视频、机器人、自动驾驶、工业数字孪生甚至 Computer Use 最终汇合的地方。
八、这对开源 AI 反而是一个机会
很多人看到 Astra 后可能得出一个结论:
闭源模型越来越强,开源没机会了。
我并不完全认同。
因为进入 Agent 时代以后,模型本身只是系统的一部分。
一个真正可工作的系统可能是:
Qwen / DeepSeek / Kimi │ ▼ Planner │ ▼ World State │ ┌─────┼─────┐ ▼ ▼ ▼ Browser GUI API │ │ │ └─────┼─────┘ ▼ Execution │ ▼ Observation │ ▼ Verification │ └────────→ Planner真正的竞争开始从:
Model Intelligence
逐渐转向:
System Intelligence
而 System Intelligence 恰恰给开源生态留下了巨大的空间。
ComfyUI、Blender、Playwright、FFmpeg、Unreal、CAD、各种 MCP/Skill、Python生态,本身就是一个庞大的“AI工具世界”。
谁能够让开源模型可靠地理解和使用这些工具,谁就可能构建出另外一种 Astra。
结语:Astra 出的不是一道模型题,而是一道系统题
所以,我认为 Astra 对 DeepSeek、Kimi、Qwen 真正提出的问题不是:
你们什么时候超过我的 Benchmark?
而是:
你们什么时候能够从一个优秀的大脑,变成一个能够观察、规划、行动、检查并持续修正的完整智能系统?
DeepSeek拥有很强的推理底座。
Kimi正在积极推进 Visual Agentic Intelligence。
Qwen拥有非常完整的开源模型生态。
它们都已经拥有这张拼图中的重要部分。
但 Astra 让下一阶段的竞争目标变得越来越清晰:
AI不只是回答世界的问题。
AI开始操作数字世界。
而当视觉理解、图形生成、软件操作、空间推理和长期规划真正汇合之后,我们讨论的可能就不再是:
“哪个大模型最好?”
而是:
“谁最先构建出真正可工作的通用智能系统?”
这可能才是 Astra 给整个开源模型生态出的一道真正的题