AI前沿测评· 2026.07
三张真实测试截图,拆解编码、智能体、长上下文与独立榜单表现
先说结论:Kimi K3已经进入全球前沿模型梯队,强项不是“更会聊天”,而是能把编码、搜索、表格、研究和多模态串成长链路任务。但它并非全项目第一,速度、成本与权重发布时间也需要理性看待。 |
7 月 16 日,月之暗面发布 Kimi K3。与上一代相比,这次升级不是简单加大上下文,而是把目标直接指向长程编程、知识工作和深度推理。官方给出的核心数字很醒目:2.8 万亿参数、原生多模态、100 万 token 上下文,并计划在 7 月 27 日前释放完整模型权重。
但参数大不等于体验一定好,官方榜单也不能等同于真实使用。于是这篇测评不只看发布会口号,而是交叉检查 Kimi 官方基准图、官方技术文档和 Artificial Analysis 的独立评测,重点回答三个问题:它到底强在哪里?有没有明显短板?普通用户和企业现在值不值得用?
01 Kimi K3到底升级了什么?
K3 采用 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes),核心目标是让信息在更长序列和更深网络中流动得更稳定。它仍是稀疏 MoE 架构:共有 896 个专家,推理时激活其中 16 个。官方称,结合 Stable LatentMoE、训练方法与数据配方优化,相比 K2 的整体扩展效率约提升 2.5 倍。
真正值得注意的,是产品方向的改变。K3 始终开启思考模式,可设置 low、high、max 三档推理强度;支持视觉输入、严格 JSON Schema、工具调用、动态加载工具和自动上下文缓存。换句话说,它不是只负责给答案,而是被设计成能够持续读资料、调用工具、修改结果并完成交付物的“工作型模型”。
需要特别说明:截至本文撰写日(2026 年 7 月 22 日),官方文档写的是“完整权重将在 7 月 27 日前发布”。因此,当前更准确的说法是 K3 已公布开放权重计划,而不是权重已经完全落地。
02编码测试:不是每项第一,但长程任务很突出
图1|Kimi官方Coding基准截图。测试均使用max或xhigh思考强度;属于厂商自报结果,应结合独立测试理解。
先看最硬核的编码组。DeepSWE 中,K3 得分 67.5,落后于 GPT-5.6 Sol 的 73.0 和 Fable 5 的 70.0,但略高于 GPT-5.5;Terminal Bench 2.1 得分 88.3,与第一名 88.8 几乎贴身;Program Bench 得分 77.8,反而以极小优势领先。
更有意思的是 SWE Marathon。这个项目更强调长时间、多步骤的软件工程执行,K3 得分 42,排在该图所有模型首位。FrontierSWE 上,它以 81.2 排名第二,明显高于 GPT-5.6 Sol 的 71.3。由此可以判断:K3 的优势并不只是写一个函数或修一处错误,而是维持较长任务链、理解大型代码库并持续推进。
当然,官方图也明确写着部分竞品结果可能包含 fallback 或安全防护影响,Kimi 自家的内部 Kimi Code Bench 也无法由外部完全复现。所以,这张图适合证明“具备前沿竞争力”,却不足以证明“全面碾压”。
03智能体测试:搜索、自动化和表格是亮点
图2|Kimi官方General Agents与Visual Agents基准截图,展示通用智能体、知识工作、搜索和视觉任务表现。
如果说编码只是开发者关心,那么通用智能体更接近企业用户的真实需求。K3 在 BrowseComp 中取得 91.2,Automation Bench 得分 30.8,SpreadsheetBench 2 得分 34.8,三项都位于图中第一。AA-Briefcase Elo 为 1548,仅次于 Fable 5;GDPval-AA v2 Elo 为 1668,排在 Fable 5 与 GPT-5.6 Sol 之后。
这组结果透露出一个重要变化:K3 更像“完成工作的人”,而不是“陪你讨论的人”。它适合把分散网页整理成研究结论、把原始数据做成表格、把需求拆成自动化步骤,或者在多个工具之间来回执行。官方案例中甚至展示了持续 48 小时进行芯片设计、并行调用子智能体完成科学研究等长程任务。
不过,长程能力也意味着等待时间和资源消耗可能增加。复杂任务的价值不能只用回答速度衡量,但如果你的需求只是改一句文案、写一封邮件,始终开启推理的 K3 未必是成本最低的选择。
04独立榜单复核:实力很强,但排名会变化
图3|Artificial Analysis Intelligence Index截图,来源于其独立评测数据;图中Kimi K3得分57。
第三方 Artificial Analysis 给 Kimi K3 的 Intelligence Index 评分为 57。7 月 17 日发布的分析中,它一度位列第三,仅落后于 Claude Fable 5 与 GPT-5.6 Sol,并在 GDPval-AA v2、AutomationBench-AA、AA-Briefcase 等智能体任务上表现突出。到 7 月 22 日,实时模型页已显示为第 4/187——这并不代表模型突然退步,而是榜单会随着新模型和数据更新而变化。
独立评测同时给出了冷静的一面:K3 的能力处于领先区间,但输出速度偏慢、内容偏长,价格在同能力区间里也不算便宜。其 API 公示价格为每百万输入 token 3 美元、输出 token 15 美元,缓存命中输入价格为 0.30 美元。对于高价值研究和工程任务,这个成本可能合理;对于高频轻量调用,则需要认真测算。
实际选型时,建议不要只盯着综合分数。第一步,挑选三到五个来自自己业务的真实任务,例如读取一份百页报告、修改一个跨文件代码模块、生成可复核的数据表;第二步,固定提示词、资料和验收标准,对比完成率、人工返工时间与总 token 成本;第三步,再观察连续多轮执行是否稳定。模型榜单回答的是“平均能力有多强”,企业真正需要回答的却是“它能否在我的流程里反复交付”。如果一次任务虽然慢几分钟,却能少掉数小时人工整理,它依然可能更划算;如果答案看起来漂亮但无法追溯来源,分数再高也不宜直接进入生产环节。
05谁适合现在就用Kimi K3?
第一类是开发者和技术团队。特别是需要跨文件理解、终端操作、前端视觉迭代和长时间修复的工程任务,K3 的能力结构很对路。第二类是咨询、投研、战略和内容研究人员。100 万 token 上下文、搜索、表格与可视化组合,适合处理报告、财报、论文和复杂资料库。第三类是正在搭建 Agent 的企业,因为工具调用、结构化输出和动态工具加载,能降低从模型到业务流程的连接成本。
相反,如果你只需要即时问答、简单润色或追求极低延迟,K3 的深度思考可能显得“用力过猛”。如果你高度在意开源部署,也建议等完整权重、技术报告和社区推理方案真正落地后再做判断。
最终评价:K3的意义,不只是“又一个大模型”
因此,这不是一次看参数下结论的测评,而是一份面向真实工作的能力核对单。
综合官方基准与独立榜单,我更愿意把 Kimi K3 定义为一款“任务完成型前沿模型”。它的价值不在某一道题赢了谁,而在于把推理、视觉、代码、搜索和工具组织成更长的执行链。对国内大模型而言,这意味着竞争焦点正从聊天体验,转向真正能完成软件工程和知识工作的智能体能力。
一句话总结:Kimi K3不是所有场景里的第一名,却已经是复杂工作场景中最值得认真测试的国产模型之一。 |
接下来真正决定它能走多远的,不是 2.8 万亿这个数字,而是三件事:完整权重能否如期开放,推理生态能否快速跟上,以及真实用户能否用它稳定完成高价值任务。榜单只是起点,持续交付才是终局。
资料来源与测试说明
Kimi K3官方技术博客(www.kimi.com)
Kimi API官方文档(platform.kimi.com)
Artificial Analysis:Kimi K3模型页(artificialanalysis.ai)
Artificial Analysis:Kimi K3独立分析(artificialanalysis.ai)
Interconnects AI:Kimi K3: The open-weights escalation(www.interconnects.ai)
说明:本文截图均来自公开可核验页面;官方基准属于厂商自报数据,第三方指数也会持续更新。本文不构成采购、投资或技术选型保证。