我们追踪了200天、超过3500个PR的数据。除了准确率,还有误报疲劳度、审查一致性、多文件关联Bug的检测差异
网上的大模型评测大多基于刷题数据——和真实生产代码差距很大。我们团队在 CI 流水线中部署了 Claude Opus 和 GPT-5.4 的并行审查——每个 PR 同时发给两个模型,然后人工复核。跑了 200 多天,累积 3,500+ 个 PR 的数据。
所有调用通过 TokenStar(tokenstar.world)统一 API——同一个接口切换模型,环境变量一致。
整体数据
指标 | Claude Opus 4.6 | GPT-5.4 | 差异 |
累积审查PR数 | 3,567 | — | |
有效问题检出率 | 91.3% | 85.7% | Claude +5.6% |
误报率 | 8.9% | 21.4% | GPT误报是Claude的2.4倍 |
安全漏洞检出率 | 93.8% | 81.2% | Claude +12.6% |
多文件Bug检出率 | 87.5% | 72.3% | Claude +15.2% |
单文件Bug检出率 | 94.2% | 91.8% | 差距仅2.4% |
平均审查耗时 | 9.8s | 4.3s | GPT快2.3倍 |
最重要的发现——不是检出率,是误报疲劳度
很多人只看检出率——谁找的 Bug 多就选谁。但生产环境中,误报率可能比检出率更重要。因为每一个误报都要人工过一遍——如果误报太多,审查人员会产生"狼来了"效应——开始跳过 AI 的建议,最终连真实问题也漏掉了。
我们的数据显示:GPT 的误报率是 Claude 的 2.4 倍。意味着每天每 100 个 PR 中,GPT 多产生约 12 个无效告警。按每个无效告警平均花费 2 分钟来算——每天浪费 24 分钟,一个月就是 8 小时。
多文件关联 Bug——差距最大的场景
Claude 在多文件关联变更的 Bug 检测上比 GPT 高了 15 个百分点——这是所有指标中差距最大的。一个典型的例子:PR 改了函数签名但调用方没跟着改——Claude 能关联到"虽然这段代码本身没问题,但上游调用会出错",GPT 通常只检查到"这段代码本身没问题"。
这种"跨越代码文件边界"的推理——是目前 Claude 在代码审查上超越 GPT 的最核心差异。
审查一致性——200天的稳定性数据
我们逐月追踪了两个模型的检出率。Claude 的一致性更好——月间波动在 2% 以内。GPT 有两次明显的"波动"——一次是模型更新后检出率突然下降(可能是新版本的行为变化),另一次是恢复后检出率又回来了。对生产环境来说,一致性意味着可预测——你不会某天突然发现"今天怎么漏了这么多Bug"。
两个模型在 TokenStar(tokenstar.world)上一个 API 切换——安全审查走 Claude,常规检查走 GPT。分级之后年化费用大约 5 万元——如果全部走 Claude 大约 8 万,全部走 GPT 大约 3.5 万但误报率太高不划算。