news 2026/8/27 15:00:45

从 Qwen 3.8 到 DeepSeek V4,中国开源模型凭什么把推理价格打到“白菜价“?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从 Qwen 3.8 到 DeepSeek V4,中国开源模型凭什么把推理价格打到“白菜价“?

上周末我翻了翻 OpenRouter 的实时调用排行榜,说实话愣了一下。

排在前四的模型——Qwen3.8-Flash-Next、DeepSeek-V4-Pro、Qwen3.8-Max、DeepSeek-V4-Flash——全是国产开源模型。曾经长期霸榜的 GPT-4o 系列和 Claude 系列,被挤到了第二屏。这个变化不是一天发生的,但 2026 年 8 月的数据把这个趋势推到了临界点:中国开源模型在全球最大模型调用平台上的用量占比,首次超过 60%。

我自己的感受是,半年前大家还在讨论"国产模型能不能用",现在讨论的已经是"用哪个更划算"。这种转变背后,不只是模型变强了,更关键的是成本结构被彻底掀翻了。

一、一张定价表,把硅谷的牌桌掀了

先看一组数字。阿里昨天发布的 Qwen3.8-Flash-Next,千亿总参数、激活仅 60 亿参数,每百万 token 输入 1 元、输出 3 元。作为对比,Claude Opus 5 是 $5/$25,折合人民币约 36/180 元。差距接近 40 倍。

但 Qwen 还不是最便宜的。DeepSeek V4-Flash 的 API 价格更低,输入 0.5 元、输出 2 元。两家中国厂商在价格上互相"卷",把全球推理成本拉到了前所未有的低位。

有人可能会说,便宜没好货。但 Benchmark 数据不支持这个结论。Qwen3.8-Flash-Next 在多个编码和多模态评测上跑赢了同参数量级的闭源模型,DeepSeek V4 Pro 在数学推理和长上下文任务上也和 GPT-5.6 Sol 互有胜负。换句话说,不是性能降级换低价,而是用更高效的架构实现了同等性能的极低成本

这背后是 MoE(混合专家)架构的成熟。中国厂商在 MoE 上的投入比硅谷同行激进得多——Qwen 3.8 系列的总参数/激活参数比高达 20:1,DeepSeek 的 V4 系列也维持在 15:1 以上。这种"参数量管够,但每次只唤醒一小部分"的思路,让训练和推理的边际成本大幅下降。

二、开源不只是"免费",而是生态定价权

一个经常被忽略的点是:开源模型的影响不只在下载量,更在 API 定价权

道理很简单。当一个开发者可以在 Hugging Face 上免费下载 Qwen3.8 的权重,自己部署到 4 张 RTX 4090 上跑推理时,闭源 API 供应商就不能随意涨价。因为用户的替代方案摆在桌面上:要么你把价格降到接近自部署的成本,要么我走。

这种"开源锚定效应"在过去一年表现得非常明显。2025 年初,主流闭源 API 的每百万 token 价格还在 10-20 美元区间。到 2026 年 8 月,GPT-5.6 Sol 已经把价格打到了 $4/$20(促销价),Claude Sonnet 5 的 $2/$10 也被认为是"必须跟否则流失用户"的价格。硅谷模型公司不是突然想降价,是被开源模型逼着降价

国际数据也印证了这一点。中国开源模型在海外的下载量累计突破 100 亿次,在美国开发者平台上的使用占比达到 62%,首次超过闭源模型。这些数字说明,中国开源模型已经不只是"国内开发者用用",而是真正进入了全球开发者的日常工具链。

三、效率竞赛:从"堆参数"到"压成本"

今年八月的一个有趣现象是,新模型发布节奏达到了历史最快——22 天里发布了至少 11 个新模型。但更值得关注的是,这些新模型的参数规模并没有显著增长,反而在"效率"上做文章。

Qwen3.8-Flash-Next 的架构设计很能说明问题。它采用了阿里自研的 Next 混合架构,Transformer 部分 125B 参数但只激活 6B,加上视觉专家的 2B 激活,总共只需 8B 激活参数就完成了千亿级模型的推理能力。训练成本比上一代 Qwen3.7-Plus 降低了近 90%。

这个 90% 的数字很有意思。它不是靠单一技术实现的,而是架构设计、数据配比、训练策略三个层面的协同优化。MoE 的专家路由更精准了,长序列训练的并行效率更高了,合成数据的质量也更接近人工标注。

效率竞争取代参数竞赛,是 2026 年大模型行业最重要的转折之一。当模型能力普遍跨过"可用"门槛后,谁能以更低成本提供同等质量的服务,谁就能赢下开发者生态。

四、这套打法能持续吗?

也有质疑的声音。一个核心问题是:中国开源模型当前的低价,是技术进步带来的结构性优势,还是烧钱补贴换市场份额?

我自己的判断偏向前者。理由有三:

第一,MoE 架构的优化空间还远没到天花板。当前主流模型的激活参数比在 10:1 到 20:1 之间,理论上可以做到 50:1 甚至更高,这意味着推理成本还有进一步下降的空间。

第二,中国在芯片受限的条件下,被迫在算法优化上走得更深。买不到最先进的 H100,就在算子融合、量化压缩、投机解码上做文章。这些技术积累不是短期补贴能取代的。

第三,生态规模效应正在显现。当越来越多开发者基于开源模型做二次开发、写工具链、建社区时,模型的边际成本会进一步摊薄。这不是烧钱,这是典型的互联网规模效应在 AI 层的复制。

当然,风险也存在。中美科技脱钩可能进一步加剧,影响开源模型的国际分发。国内算力基础设施的瓶颈也可能限制更大规模模型的训练。但至少从当前的市场数据看,中国开源模型已经站稳了脚跟。

五、结尾

回到文章开头那个 OpenRouter 排行榜。排名前四的模型都是中国开源模型,这个事实本身已经回答了"能不能用"的问题。现在真正需要关注的是:当推理成本降到接近于零时,应用的形态会发生什么变化?

我个人觉得,答案可能不在模型本身,而在那些被低成本模型催生出来的新场景上——比如实时多轮 agent 对话、端侧智能体、全量代码库的持续分析。这些场景以前因为推理成本太高而被搁置,现在成本闸门一开,想象力空间反而成了最大的变量。

你最近在用什么模型跑生产?是坚持闭源 API 还是迁移到了开源方案?欢迎评论区聊聊。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/27 14:49:19

RAG,在企业AI中释放LLM大模型的潜力

前言 从自然语言处理到计算机视觉等,生成式AI(GenAI)超越了传统的单一数据源模型,以整合各种模式的多种数据源,使自然语言大模型(LLM)更接近于模仿人类的能力。随着企业从谨慎探索转向快速整合&…

作者头像 李华
网站建设 2026/8/27 14:46:35

【Win上开源且免费的网络速度监控悬浮窗口工具TrafficMonitor(Win)】

Windows 上开源且免费的网络速度监控悬浮窗口工具 TrafficMonitor 该软件可以实时监控上传和下载速度,同时也能显示 CPU 和内存使用情况。此外,右键点击软件,勾选显示任务栏窗口,然后它就可以嵌入任务栏了,以便我们实时…

作者头像 李华
网站建设 2026/8/27 14:44:39

基于Jupyter的糖尿病视网膜病变分级:ResNet50迁移学习实战

简介:卷积神经网络(CNN)是医学图像分析的核心技术之一,其通过多层特征提取实现病变的自动识别。在医学影像样本有限的情况下,迁移学习成为提升模型性能的关键策略——利用ImageNet预训练权重初始化网络,再以…

作者头像 李华