4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
本周 357 篇翻译任务,由 4 个模型完成。抽样 3 篇进行多模型盲评对比,综合最佳:gpt-o3(均分 8.3/10)。
本周翻译统计
| 模型 | 语言 | 翻译量 | 平均耗时 | 平均质量评分 |
|---|---|---|---|---|
| deepseek-v4-flash | en | 71 | 44s | 未评 |
| claude-sonnet-4.6 | ja | 178 | 49.3s | 未评 |
| passthrough | en | 105 | 0s | 未评 |
| native-english | en | 1 | - | 未评 |
| deepseek-v4-flash | zh | 1 | 68.2s | 未评 |
| deepseek-v4-flash:backtranslate | en | 1 | 13.1s | 未评 |
抽样对比评测
评测 1:原文标题
| 模型 | 准确性 | 流畅性 | 术语 | 可读性 | 总分 |
|---|---|---|---|---|---|
| claude-sonnet-4.6 | 9 | 8 | 8 | 9 | 8 |
| deepseek-v4-pro | 8 | 7 | 8 | 7 | 7 |
| gpt-o3 | 9 | 9 | 9 | 9 | 9 |
结论:三个版本整体质量接近,gpt-o3版本在流畅性、术语一致性和可读性上略胜,claude版本结构清晰但存在截断缺陷,deepseek版本因JSON格式影响阅读体验。建议优先选用gpt-o3版本。
评测 2:阿里3亿美元领投UniPat AI估值25亿 AI评测赛道首现巨头资本押注
| 模型 | 准确性 | 流畅性 | 术语 | 可读性 | 总分 |
|---|---|---|---|---|---|
| deepseek-v4-flash | 7 | 8 | 6 | 7 | 7 |
| deepseek-v4-pro | 8 | 8 | 8 | 7 | 8 |
| gpt-o3 | 8 | 7 | 8 | 8 | 8 |
结论:三个版本整体质量接近,B和C在术语一致性上优于A,C的可读性略胜,但B存在明显截断,建议优先考虑C或修复后的B。
评测 3:Cognition发布SWE-2 以Kimi K3基座实现代码模型性价比新平衡
| 模型 | 准确性 | 流畅性 | 术语 | 可读性 | 总分 |
|---|---|---|---|---|---|
| claude-sonnet-4.6 | 9 | 8 | 9 | 8 | 8 |
| deepseek-v4-pro | 9 | 9 | 9 | 9 | 9 |
| gpt-o3 | 8 | 8 | 8 | 8 | 8 |
结论:版本B整体最优,准确性、流畅性与可读性均衡最佳;版本A与C次之,C因截断问题扣分较多。
本文首发于赢政天下 (https://www.winzheng.com/lab/reports/translation-quality-week-38-2026),获取更多深度技术内容与资源,欢迎访问官网。