一、同一天的两件事:开源视觉与法律 AI 换基座
我把这两件事放在一起,因为它们在 2026-09-01 同一天发生并互为镜像——一边是中国厂商把多模态大模型"以最宽松的协议开源给全世界",另一边是美国头部垂直 AI 公司反过来选用中国开源模型作为底座。
事件 A:DeepSeek 在 Hugging Face 释出 V4-Flash-Vision-Exp。这是 V4 家族首款多模态模型,也是 DeepSeek 历史上第一次把"视觉能力"加到现有架构上。
事件 B:Harvey 发布 Tenet。这是这家估值 110 亿美元、OpenAI 与红杉和 a16z 共同投资的法律 AI 公司,在自家产品里彻底替换闭源基座后的第一个对外亮相——它选的是 Moonshot AI 的开源模型 Kimi K3(2.8T 总参 / 50B 激活)。
这两件事的共同信号不在 OpenAI/Anthropic 也不在 DeepSeek/Moonshot,而在全球 AI 价值链正在被重排。
二、DeepSeek V4-Flash-Vision-Exp:305B / 13B 激活 / 4.6%
2.1 关键参数与协议
| 项目 | 数值 |
|---|---|
| 总参数 | 305B |
| 每 token 激活 | 13B |
| 激活率 | 4.6%(业内已知最低之一) |
| 许可证 | MIT License(零成本商用,无需标注) |
| 多模态支持 | 图像输入,兼容 JPEG / PNG / GIF / WebP |
| 开源内容 | 模型权重、Tokenizer、Prompt Encoding 参考实现、最小化 PyTorch 推理实现 |
| 涵盖模块 | 视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark |
| 权重格式 | safetensors,可直接下载 |
社区反应极快——发布当天 Hugging Face 页面已经出现7 个量化变体,覆盖 llama.cpp、LM Studio、Ollama 等不同框架。
2.2 与 V4-Flash 的关系
V4-Flash-Vision-Exp 建立在 V4-Flash(DeepSeek 主力轻量模型)之上,"Exp"后缀明确标识为实验性。做法不是从零训练多模态模型,而是在原文本架构上增加视觉模块并继续训练:
- 接入视觉编码器(图像 → token 序列)
- 接入 Aligner(视觉 token 与文本 token 嵌入对齐)
- 推理主干网络继续训练,让模型学会"看图"
这条路径的工程优势是:继承 V4-Flash 已有的全部文本推理与 Agent 能力,新增视觉而不破坏文本。
时间线(DeepSeek 官方):
- 2026-08-21:模型在 DeepSeek API 文档上线,仅 API 可访问,图片按 token 计费
- 2026-09-01:模型权重正式开源,可下载自部署
这段"先上线 API、再开源权重"的发布节奏,是 DeepSeek 在 V4 系列产品上反复使用的商业模型:先让 API 调用验证产品需求,再用开源收割开发者生态。
2.3 跑分:多模态 Agent 接近 Opus 4.8
| 基准 | V4-Flash-Vision-Exp | Claude Opus 4.8 | 说明 |
|---|---|---|---|
| ApexBench Pass@1 | 36.5 | 39.4 | 多模态 Agent 主基准 |
| Chartography(图表理解) | 64.3 | 65.0 | 差距很小 |
| Agents’ Last Exam | 27.3 | 25.7 | V4 反超 |
| ZeroBench Pass@5 | 35.0 | 34.0 | V4 反超 |
| NL2Repo | 57.7 | 69.7 | Opus 仍领先 |
文本侧能力继承自 V4-Flash:
| 文本/Agent 基准 | V4-Flash-Vision-Exp | V4-Flash | Claude Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | — |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| ApexBench(纯文本部分) | 显著提升(Vision 后仍 ≥ V4-Flash) | 26.5 (Flash 0731) | 39.4 |
DeepSeek 没有声明"全面超越",而是承认"多模态 Agent 能力接近 Claude Opus 4.8"。这一表述更可信也更工程。
2.4 这次"眼睛"不是给人看的,是给 Agent 用的
DeepSeek 官方强调了一个关键的设计取向——
“This ‘eye’ is not for human use but for the agent.”
区别于传统多模态模型聚焦"看图说话",V4-Flash-Vision-Exp 主攻多模态 Agent 能力:
- 读取网页截图 → 决定下一步操作
- 查看软件界面 → 识别可点击区域
- 解析图表 → 输出数据 + 调用工具
- 制作 PPT → 先看到模板图再生成内容
- 读取并修改前端页面 → 截图反馈
这些任务的共同点不是"识别图中有什么",而是"模型先理解视觉内容,再结合代码、推理、工具调用完成后续操作"。
2.5 4.6% 激活率意味着什么
V4-Flash-Vision-Exp 的激活率是 4.6%(284B 里每 token 激活 13B)。横向比较:
| 模型 | 激活率 |
|---|---|
| Claude Opus 5 | 不公开 / ~25% |
| GPT-5.6 Sol | 不公开 / ~30% |
| Grok 4.6 | 1.5T / 不公开激活 |
| DeepSeek V4-Flash | 4.6% |
| Hy4 preview(上一篇文章) | 6.4% |
| GLM 5.3 | 8% 区间 |
| Kimi K3 | 2.8T / 50B 激活(1.8%) |
更低激活率 = 推理时算力需求更低 + 配合 mxFP4 4-bit 训练精度硬件成本双降。4.6% 让"消费级显卡跑或微调该模型"成为可能——但请注意这是消费级显卡跑推理,自训练或微调仍需数据中心级硬件。
2.6 与 DeepSeek 既有产品栈的关系
把最近几次 DeepSeek 发版放一起看,可以看到一条清晰的产品线收敛:
| 层 | 产品 |
|---|---|
| 推理与工具调用 | V4-Flash / V4-Flash-Vision(本次) |
| Agent 编排 | DeepSeek Harness / miMoLA |
| 视觉感知 | V4-Flash-Vision-Exp(本次) |
这套组合让 DeepSeek 从"模型公司"演化成"Agent 全栈供应商"。
三、Harvey 选 Kimi K3:法律 AI 的范式翻转
3.1 Harvey 是什么
Harvey 由 OpenAI 校友 Winston Weinberg 和 Gabriel Pereyra 创立,OpenAI / Sequoia / a16z 三家共同投资:
- 估值 110 亿美元
- 服务 1,300+ 家机构与 10 万律师
- 此前深度绑定 OpenAI、Anthropic API
- 客户包括 AmLaw 100 中的多数律所
3.2 Tenet 选 Kimi K3 作为基座
Harvey 在 2026-09-01 发布法律专用模型Tenet。它的训练方式不是"用法律材料做简单微调",而是:
- 构建约1,750 个法律任务环境(并购尽调、合同审查、诉讼分析等)
- 每个任务由执业律师制定几十到几百条评分标准(事实识别 / 判断 / 法条引用 / 输出格式)
- 模型在沙盒里自己查文件、起草意见
- 裁判模型按律师标准逐条打分
- 通过异步强化学习让模型学会"什么是好的法律工作"
训练硬件仅为约 150 张 NVIDIA B300 GPU,耗时 2 个月。
3.3 跑分:把 Fable 5 打了 1.7 倍
| 基准 | Tenet(Harvey) | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Harvey LAB(full task pass rate) | 19.7% | 11.5% | 2.5% |
| APEX Agents(企业法律任务) | 74.0% | 67.4% | 60.3% |
| Kimi K3 在 Harvey LAB-AA Pass rate | 94.6% | 第二名 | — |
| Kimi K3 全任务 pass rate | 26.7% | 第二名 ~14% | — |
Tenet 比作为底座的 Kimi K3 还强——因为后训练针对法律任务做了优化。
3.4 为什么 Harvey 选 Kimi K3 而不是 OpenAI/Anthropic?
Harvey 公开的技术博客列了三层原因,核心逻辑沿着"成本 + 能力 + 自主权"三条线交织:
3.4.1 成本:法律任务的 token 消耗是普通聊天的几百倍
“The more complex the task, the longer the call chain; the more widespread agents become, the faster token consumption grows.”
法律场景动辄读取几十万字文档(并购尽调、合同审查、判例检索),多轮推理、工具调用。Harvey 客户的 Token 消耗规模超出普通聊天几十到几百倍。业务规模越大,向模型厂商支付的 API 费用越高——这直接把 35% 的毛利压成了成本中心。
3.4.2 能力:Kimi K3 在长链路任务上的边际优势
Artificial Analysis 在 Harvey LAB-AA 基准上跑 Kimi K3:
- Pass rate(产出物质量合格率):94.6%,第一,超过 Claude Fable 5
- Full task pass rate(完整任务通过率):26.7%,第一,几乎是第二名 Claude Fable 5 的 2 倍
- 在 Coding Agent Index:80 分,超过 Claude Fable 5
硅谷天使投资人 Jason Calacanis 公开说:“一些 Anthropic 与 OpenAI 的大客户在部署 Kimi 后把成本降低了 90%。”
3.4.3 自主权:数据合规与"模型主权"
“Tenet 的训练绝对没有用客户的任何数据,全是在自有环境里完成的。而且,保护数据并没有牺牲能力,Tenet 的表现反而比底座更强!”
法律行业充斥合同底稿、并购材料、诉讼策略、商业机密——这些如果传到闭源厂商服务器,哪怕对方保证安全,企业方也未必能承担监管压力。开源基座意味着 Harvey 可以把模型权重下载到自有服务器、本地化部署,所有推理与训练不出自己的域。
3.4.4 修改权:后训练的边际收益
闭源 API 只能改 prompt,开源权重能改网络结构、路由策略、推理路径、训练算法。Harvey 把"什么是好的法律工作"这个定义权掌握在自己手里,而不是被 OpenAI/Anthropic 的"安全策略对齐"流程绑死。
3.5 不只是 Harvey:Kimi 已经成为美国 AI 公司的"事实基座"
Semalt Iurii Iakovenko 在 2026-08-29 公开撰文指出 K3 在美国 AI 行业的事实地位:
| 公司 | 产品 | 使用 Kimi 的版本 |
|---|---|---|
| Harvey | Tenet | K3 |
| Cursor | Composer 2 / Composer 2.5 | K2.5 / K 变体 |
| Devin(Cognition) | SWE-1.7 | K2.7 |
| Cosine(UK) | Lumen Outpost | K2.6 |
| Thinking Machines(Mira Murati) | 自研模型 | K2.5 生成合成数据 + DeepSeek V3 架构 |
| Thomson Reuters | Thomson-1 | 中国开源基座 |
6 个月内不同版本 Kimi 被海外公司依次选中。这一信号比任何单一发布都更有说服力——中国开源大模型已经成为美国 AI 应用层的"事实工业原料"。
3.6 这是否意味着"美国法律 AI 倒戈"?
是的——但要拆成两个层面理解:
- 商业层面:Harvey 等公司选中国基座主要因为成本 + 能力——同样的输出 Chinese base 便宜 5 倍、长链任务能力持平甚至略强。
- 战略层面:把核心业务押在"可能下场做同类产品的竞争对手"接口上,存在限流、涨价、合规三重隐患。Harvey 现在能下牌桌,是有得选。
但也必须看到反向风险:
- Kimi K3 用的是"自定义许可证"——商业用途需要月活合规、训练数据合规、特定监管下需重新谈判。Hy4 preview 的 Apache 2.0 则明确无任何限制,Harvey 在技术博客中没有讨论这一点。
- 美国监管层面(如对中国大模型的限制)的不确定性,长期可能逼迫企业双基座备份——所以 OpenRouter 这种"中立调度层"反而是受益者。
四、合起来看:开源中文基座 + 海外垂直后训练的范式
把 DeepSeek-V4-Flash-Vision-Exp 开源 + Harvey 选 Kimi K3 这两件事拼起来,可以看到 2026 年 Q3 的一条清晰趋势:
全球 AI 价值链正在被重排为"中国厂商负责通用基座、海外厂商负责垂直应用"的分工格局。
| 层级 | 代表玩家 | 价值定位 |
|---|---|---|
| 算力 | NVIDIA / 国产替代(华为、海光、寒武纪) | 模型训练的物理基础 |
| 基座 | DeepSeek / Kimi / Qwen / GLM / Hy / InternLM | 通用能力的"原料" |
| 工具与生态 | Hugging Face / ModelScope / GitCode / prima.cpp | 开源分发与推理基础设施 |
| 垂直应用 | Harvey / Devin / Cursor / Thomson Reuters | 基于通用基座的行业专精 |
| 终端用户 | 1,300+ 机构、10 万律师、800 万开发者 | 通过垂直 AI 拿到生产力 |
这条分工让**基座 + 垂直后训练"两层叠加"**产生复利效应:
- Harvey 的 1750 个法律任务环境 + 异步强化学习流程让 Kimi K3 在法律领域超出原始能力
- DeepSeek-V4-Flash-Vision-Exp 的开源让全球开发者能基于它训练自己的多模态垂直模型
- Hugging Face / ModelScope 等中立平台让"全球分发"无需经过任何中国厂商许可——绕过了"中国大模型出海"的地缘政治压力
这与 Anthropic Fable 5.1 的EFS 数据主权方案形成有趣的对照——Anthropic 想让企业"用闭源最强模型 + 数据留在自己的云里",Harvey 的选择是"用开源基座 + 数据留在自己的云里 + 模型也留在自己的云里"。两条路都是为了解决数据主权,但实施路径截然相反。
五、对开发者和创业者的实操建议
5.1 我在做法律 / 金融 / 医疗 / 政务等垂直 AI
认真评估 Kimi K3 + 自己的行业后训练这条路。Tenet 的 1750 任务环境模板 + 异步强化学习流程,是一份可复制的"垂直 AI 创业剧本":
□ 选型:开源 MoE 基座(Kimi K3、Hy4 preview、DeepSeek V4)跑一遍你的行业基准 □ 任务环境建设:10³-10⁴ 个真实业务场景,让领域专家(律师、医生、分析师)制定评分标准 □ 后训练基础设施:≥100 张 B300,2 个月完成 RLHF / 异步 RL □ 部署:自有数据中心 / 私有云,权重完全自控 □ 商业模式:从"按 Token 计费"转为"按结果计费"或"按席位订阅"5.2 我在做多模态 Agent / 工具调用 Agent
立刻试 DeepSeek-V4-Flash-Vision-Exp。本地部署门槛低(4.6% 激活率)、MIT 协议商用零成本、自带视觉编码器与 Aligner 实现。
注意几个落地关键点:
- V4-Flash-Vision 已经有 7 个社区量化版本,但对视觉模块的支持各有差异,建议先在原始 BF16 上跑一遍再决定量化
- MoE 路由 + 视觉模块的混合训练范式,对显存峰值和带宽都比纯文本模型更敏感
- 该模型的官方部署文档尚未完整发布,建议跟 DeepSeek-V4-Flash-Vision-Exp Hugging Face 保持同步
5.3 我在做国产开源大模型选型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 通用文本 + 长上下文 | Kimi K3、Hy4 preview | 1M 上下文、Apache 2.0 / 自定义许可 |
| 多模态 + Agent | DeepSeek V4-Flash-Vision | 4.6% 激活率、MIT 协议 |
| 代码 Agent | Qwen 3.8 Max、Coding Plan | 代码微调领先 |
| 端侧 | Hy3 / MiniMax H3 / Ling 3.0 tiny | 小模型路线 |
| 极本地化预算(消费级显卡) | Hy4 preview 极量化 214GB | 唯一 Apache 2.0 极量化大模型 |
5.4 我在做模型评测
注意几点关键变化:
- Anthropic、OpenAI 不再是唯一基准。Harvey LAB、APEX Agents 等垂直基准正成为新的真实战场
- 开源模型不再是"未达 GPT 级别"的代名词。Kimi K3 在 Harvey LAB-AA 第一就足以说明
- MIT 协议的分发效应。DeepSeek V4-Flash-Vision 在 Hugging Face 上线 24 小时内出现 7 个社区量化版——这在过去是不可想象的
六、今日其他相关资讯
- Claude Fable 5.1 发布(同日 9/1)——详见本专栏第一篇
- 腾讯混元 Hy4 preview 轻量版(同日 9/1)——详见本专栏第二篇
- OpenRouter 月处理 200 万亿 Token,800 万开发者——Stripe 100 亿美元洽购交易持续发酵,本专栏第三篇之外单独跟进
- 韩国 AI for All 全民免费 AI 计划——9 月 1 日详情见 9 月 1 日日报
- 中国 AI 标识办法 9 月 1 日正式施行——生成式 AI 内容必须打标识
常见问题(FAQ)
Q1:DeepSeek V4-Flash-Vision-Exp 真的 MIT 协议?商用零成本?
A:是。MIT 是最宽松的标准开源协议之一,分发、修改、商用均无需授权,唯一义务是在软件中保留版权声明。DeepSeek 自 V3 系列起在新模型上持续采用 MIT 协议。
Q2:V4-Flash-Vision 4.6% 激活率能跑在消费级显卡上吗?
A:能跑推理,不能跑训练。305B 总参意味着全部权重必须常驻——单张 4090 仍然跑不动全模型,需要 CPU offload 或量化。社区已有 7 个量化版本,建议根据你的硬件预算选 INT4 或更激进的量化。
Q3:Harvey 为什么不直接调 GPT-5.6 Sol 或 Claude Fable 5 的 API?
A:(1)成本:法律任务 token 消耗规模巨大,按 API 计费会快速吞掉毛利;(2)能力:在 Legal Agent Bench 这种长链任务基准上,Kimi K3 跑赢 GPT-5.6 Sol;(3)数据主权:合同底稿、并购材料不希望传出私有环境;(4)控制权:闭源 API 不能改网络结构、训练自己定义的"什么是好的法律工作"。
Q4:Harvey Tenet 的训练是"用客户的法律材料做微调"吗?
A:不是。Harvey 在公开技术博客里明确说明 Tenet 的训练使用了约 1,750 个完全自建的法律任务环境,没有使用任何客户数据。这一点对法律 AI 这种对数据隐私极度敏感的领域尤其重要。
Q5:Kimi K3 是开源的吗?许可证是什么?
A:Moonshot 在 2026-07 月份开放了 Kimi K3 的权重,但使用的是"自定义许可证",而不是 MIT 或 Apache 2.0。自定义许可证对月活用户(MAU)和训练数据有具体合规条款——商用前应仔细阅读。这一点在对比 Hy4 preview 的 Apache 2.0 时尤其重要。
Q6:美国监管会限制美国 AI 公司使用中国基座吗?
A:截至 2026-09-01 暂无明确禁令,但一直是市场关注点。Harvey 的应对方式是"双基座备份 + 数据主权方案"。长期看,OpenRouter 这种中立调度层可能受益——它可以让 Harvey 同时挂载 Kimi、Llama、Anthropic、OpenAI 等多家基座。
Q7:DeepSeek V4-Flash-Vision 的"眼睛不是给人看的"具体怎么理解?
A:意思是模型不是为了"看图说话"而生,而是为了"看图后调用工具"。比如看到网页截图后,告诉 Agent “这里有个按钮可以点击”;看到软件界面后,识别可交互区域;看到图表后,把数据提取出来再调用工具做后续处理。
参考资料
- IT 之家 / 新浪科技《DeepSeek V4 多模态模型正式开源:305B 参数、MIT 协议、零成本商用为何冲击多模态 Agent 格局?》,发布时间:2026-09-01。
- 观察者网《DeepSeek-V4 首款多模态模型权重开放,"睁眼"后追上 Opus-4.8》,发布时间:2026-09-01。
- DeepSeek-V4-Flash-Vision-Exp Hugging Face 模型卡,发布时间:2026-09-01。
- AIBase《DeepSeek’s First Open-Source Multimodal Model Has Arrived: These Eyes Are Not for Humans to View》,发布时间:2026-09-01。
- Race to AGI《DeepSeek V4 Flash Vision releases 305B open-weight model》,发布时间:2026-09-01。
- 21 世纪经济报道《全球垂直 AI 开始拥抱中国开源大模型》,发布时间:2026-09-02。
- AsiaICT《OpenAI’s ‘Prodigal Son’ Makes a Move: Why Did Harvey, Valued at 11 Billion, Switch to Kimi?》,发布时间:2026-08-30。
- Semalt《US Legal AI Relies on Chinese Kimi Models》,发布时间:2026-08-29。
- 网易《嫌 110 亿太少?OpenAI"亲儿子"反水了!》,发布时间:2026-09-01。
- AINewsCycle《Moonshot AI’s Kimi K3 Debuts, Challenging US Frontier Models in Open-Weight Space》,发布时间:2026-08-23。