news 2026/9/2 10:12:29

DeepSeek-V4-Flash-Vision-Exp 开源与 Harvey 选 Kimi K3:305B 多模态 + 法律 AI 范式翻转的同一天

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek-V4-Flash-Vision-Exp 开源与 Harvey 选 Kimi K3:305B 多模态 + 法律 AI 范式翻转的同一天

一、同一天的两件事:开源视觉与法律 AI 换基座

我把这两件事放在一起,因为它们在 2026-09-01 同一天发生并互为镜像——一边是中国厂商把多模态大模型"以最宽松的协议开源给全世界",另一边是美国头部垂直 AI 公司反过来选用中国开源模型作为底座。

事件 A:DeepSeek 在 Hugging Face 释出 V4-Flash-Vision-Exp。这是 V4 家族首款多模态模型,也是 DeepSeek 历史上第一次把"视觉能力"加到现有架构上。

事件 B:Harvey 发布 Tenet。这是这家估值 110 亿美元、OpenAI 与红杉和 a16z 共同投资的法律 AI 公司,在自家产品里彻底替换闭源基座后的第一个对外亮相——它选的是 Moonshot AI 的开源模型 Kimi K3(2.8T 总参 / 50B 激活)。

这两件事的共同信号不在 OpenAI/Anthropic 也不在 DeepSeek/Moonshot,而在全球 AI 价值链正在被重排


二、DeepSeek V4-Flash-Vision-Exp:305B / 13B 激活 / 4.6%

2.1 关键参数与协议

项目数值
总参数305B
每 token 激活13B
激活率4.6%(业内已知最低之一)
许可证MIT License(零成本商用,无需标注)
多模态支持图像输入,兼容 JPEG / PNG / GIF / WebP
开源内容模型权重、Tokenizer、Prompt Encoding 参考实现、最小化 PyTorch 推理实现
涵盖模块视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections、DSpark
权重格式safetensors,可直接下载

社区反应极快——发布当天 Hugging Face 页面已经出现7 个量化变体,覆盖 llama.cpp、LM Studio、Ollama 等不同框架。

2.2 与 V4-Flash 的关系

V4-Flash-Vision-Exp 建立在 V4-Flash(DeepSeek 主力轻量模型)之上,"Exp"后缀明确标识为实验性。做法不是从零训练多模态模型,而是在原文本架构上增加视觉模块并继续训练:

  1. 接入视觉编码器(图像 → token 序列)
  2. 接入 Aligner(视觉 token 与文本 token 嵌入对齐)
  3. 推理主干网络继续训练,让模型学会"看图"

这条路径的工程优势是:继承 V4-Flash 已有的全部文本推理与 Agent 能力,新增视觉而不破坏文本

时间线(DeepSeek 官方):

  • 2026-08-21:模型在 DeepSeek API 文档上线,仅 API 可访问,图片按 token 计费
  • 2026-09-01:模型权重正式开源,可下载自部署

这段"先上线 API、再开源权重"的发布节奏,是 DeepSeek 在 V4 系列产品上反复使用的商业模型:先让 API 调用验证产品需求,再用开源收割开发者生态。

2.3 跑分:多模态 Agent 接近 Opus 4.8

基准V4-Flash-Vision-ExpClaude Opus 4.8说明
ApexBench Pass@136.539.4多模态 Agent 主基准
Chartography(图表理解)64.365.0差距很小
Agents’ Last Exam27.325.7V4 反超
ZeroBench Pass@535.034.0V4 反超
NL2Repo57.769.7Opus 仍领先

文本侧能力继承自 V4-Flash:

文本/Agent 基准V4-Flash-Vision-ExpV4-FlashClaude Opus 4.8
Terminal Bench 2.183.982.7
DeepSWE59.354.458.0
ApexBench(纯文本部分)显著提升(Vision 后仍 ≥ V4-Flash)26.5 (Flash 0731)39.4

DeepSeek 没有声明"全面超越",而是承认"多模态 Agent 能力接近 Claude Opus 4.8"。这一表述更可信也更工程。

2.4 这次"眼睛"不是给人看的,是给 Agent 用的

DeepSeek 官方强调了一个关键的设计取向——

“This ‘eye’ is not for human use but for the agent.”

区别于传统多模态模型聚焦"看图说话",V4-Flash-Vision-Exp 主攻多模态 Agent 能力

  • 读取网页截图 → 决定下一步操作
  • 查看软件界面 → 识别可点击区域
  • 解析图表 → 输出数据 + 调用工具
  • 制作 PPT → 先看到模板图再生成内容
  • 读取并修改前端页面 → 截图反馈

这些任务的共同点不是"识别图中有什么",而是"模型先理解视觉内容,再结合代码、推理、工具调用完成后续操作"。

2.5 4.6% 激活率意味着什么

V4-Flash-Vision-Exp 的激活率是 4.6%(284B 里每 token 激活 13B)。横向比较:

模型激活率
Claude Opus 5不公开 / ~25%
GPT-5.6 Sol不公开 / ~30%
Grok 4.61.5T / 不公开激活
DeepSeek V4-Flash4.6%
Hy4 preview(上一篇文章)6.4%
GLM 5.38% 区间
Kimi K32.8T / 50B 激活(1.8%)

更低激活率 = 推理时算力需求更低 + 配合 mxFP4 4-bit 训练精度硬件成本双降。4.6% 让"消费级显卡跑或微调该模型"成为可能——但请注意这是消费级显卡跑推理,自训练或微调仍需数据中心级硬件。

2.6 与 DeepSeek 既有产品栈的关系

把最近几次 DeepSeek 发版放一起看,可以看到一条清晰的产品线收敛:

产品
推理与工具调用V4-Flash / V4-Flash-Vision(本次)
Agent 编排DeepSeek Harness / miMoLA
视觉感知V4-Flash-Vision-Exp(本次)

这套组合让 DeepSeek 从"模型公司"演化成"Agent 全栈供应商"。


三、Harvey 选 Kimi K3:法律 AI 的范式翻转

3.1 Harvey 是什么

Harvey 由 OpenAI 校友 Winston Weinberg 和 Gabriel Pereyra 创立,OpenAI / Sequoia / a16z 三家共同投资

  • 估值 110 亿美元
  • 服务 1,300+ 家机构与 10 万律师
  • 此前深度绑定 OpenAI、Anthropic API
  • 客户包括 AmLaw 100 中的多数律所

3.2 Tenet 选 Kimi K3 作为基座

Harvey 在 2026-09-01 发布法律专用模型Tenet。它的训练方式不是"用法律材料做简单微调",而是:

  1. 构建约1,750 个法律任务环境(并购尽调、合同审查、诉讼分析等)
  2. 每个任务由执业律师制定几十到几百条评分标准(事实识别 / 判断 / 法条引用 / 输出格式)
  3. 模型在沙盒里自己查文件、起草意见
  4. 裁判模型按律师标准逐条打分
  5. 通过异步强化学习让模型学会"什么是好的法律工作"

训练硬件仅为约 150 张 NVIDIA B300 GPU,耗时 2 个月。

3.3 跑分:把 Fable 5 打了 1.7 倍

基准Tenet(Harvey)Claude Fable 5GPT-5.6 Sol
Harvey LAB(full task pass rate)19.7%11.5%2.5%
APEX Agents(企业法律任务)74.0%67.4%60.3%
Kimi K3 在 Harvey LAB-AA Pass rate94.6%第二名
Kimi K3 全任务 pass rate26.7%第二名 ~14%

Tenet 比作为底座的 Kimi K3 还强——因为后训练针对法律任务做了优化。

3.4 为什么 Harvey 选 Kimi K3 而不是 OpenAI/Anthropic?

Harvey 公开的技术博客列了三层原因,核心逻辑沿着"成本 + 能力 + 自主权"三条线交织:

3.4.1 成本:法律任务的 token 消耗是普通聊天的几百倍

“The more complex the task, the longer the call chain; the more widespread agents become, the faster token consumption grows.”

法律场景动辄读取几十万字文档(并购尽调、合同审查、判例检索),多轮推理、工具调用。Harvey 客户的 Token 消耗规模超出普通聊天几十到几百倍。业务规模越大,向模型厂商支付的 API 费用越高——这直接把 35% 的毛利压成了成本中心。

3.4.2 能力:Kimi K3 在长链路任务上的边际优势

Artificial Analysis 在 Harvey LAB-AA 基准上跑 Kimi K3:

  • Pass rate(产出物质量合格率):94.6%,第一,超过 Claude Fable 5
  • Full task pass rate(完整任务通过率):26.7%,第一,几乎是第二名 Claude Fable 5 的 2 倍
  • 在 Coding Agent Index:80 分,超过 Claude Fable 5

硅谷天使投资人 Jason Calacanis 公开说:“一些 Anthropic 与 OpenAI 的大客户在部署 Kimi 后把成本降低了 90%。”

3.4.3 自主权:数据合规与"模型主权"

“Tenet 的训练绝对没有用客户的任何数据,全是在自有环境里完成的。而且,保护数据并没有牺牲能力,Tenet 的表现反而比底座更强!”

法律行业充斥合同底稿、并购材料、诉讼策略、商业机密——这些如果传到闭源厂商服务器,哪怕对方保证安全,企业方也未必能承担监管压力。开源基座意味着 Harvey 可以把模型权重下载到自有服务器、本地化部署,所有推理与训练不出自己的域。

3.4.4 修改权:后训练的边际收益

闭源 API 只能改 prompt,开源权重能改网络结构、路由策略、推理路径、训练算法。Harvey 把"什么是好的法律工作"这个定义权掌握在自己手里,而不是被 OpenAI/Anthropic 的"安全策略对齐"流程绑死。

3.5 不只是 Harvey:Kimi 已经成为美国 AI 公司的"事实基座"

Semalt Iurii Iakovenko 在 2026-08-29 公开撰文指出 K3 在美国 AI 行业的事实地位:

公司产品使用 Kimi 的版本
HarveyTenetK3
CursorComposer 2 / Composer 2.5K2.5 / K 变体
Devin(Cognition)SWE-1.7K2.7
Cosine(UK)Lumen OutpostK2.6
Thinking Machines(Mira Murati)自研模型K2.5 生成合成数据 + DeepSeek V3 架构
Thomson ReutersThomson-1中国开源基座

6 个月内不同版本 Kimi 被海外公司依次选中。这一信号比任何单一发布都更有说服力——中国开源大模型已经成为美国 AI 应用层的"事实工业原料"。

3.6 这是否意味着"美国法律 AI 倒戈"?

是的——但要拆成两个层面理解:

  1. 商业层面:Harvey 等公司选中国基座主要因为成本 + 能力——同样的输出 Chinese base 便宜 5 倍、长链任务能力持平甚至略强。
  2. 战略层面:把核心业务押在"可能下场做同类产品的竞争对手"接口上,存在限流、涨价、合规三重隐患。Harvey 现在能下牌桌,是有得选。

但也必须看到反向风险

  • Kimi K3 用的是"自定义许可证"——商业用途需要月活合规、训练数据合规、特定监管下需重新谈判。Hy4 preview 的 Apache 2.0 则明确无任何限制,Harvey 在技术博客中没有讨论这一点。
  • 美国监管层面(如对中国大模型的限制)的不确定性,长期可能逼迫企业双基座备份——所以 OpenRouter 这种"中立调度层"反而是受益者。

四、合起来看:开源中文基座 + 海外垂直后训练的范式

把 DeepSeek-V4-Flash-Vision-Exp 开源 + Harvey 选 Kimi K3 这两件事拼起来,可以看到 2026 年 Q3 的一条清晰趋势:

全球 AI 价值链正在被重排为"中国厂商负责通用基座、海外厂商负责垂直应用"的分工格局。

层级代表玩家价值定位
算力NVIDIA / 国产替代(华为、海光、寒武纪)模型训练的物理基础
基座DeepSeek / Kimi / Qwen / GLM / Hy / InternLM通用能力的"原料"
工具与生态Hugging Face / ModelScope / GitCode / prima.cpp开源分发与推理基础设施
垂直应用Harvey / Devin / Cursor / Thomson Reuters基于通用基座的行业专精
终端用户1,300+ 机构、10 万律师、800 万开发者通过垂直 AI 拿到生产力

这条分工让**基座 + 垂直后训练"两层叠加"**产生复利效应:

  1. Harvey 的 1750 个法律任务环境 + 异步强化学习流程让 Kimi K3 在法律领域超出原始能力
  2. DeepSeek-V4-Flash-Vision-Exp 的开源让全球开发者能基于它训练自己的多模态垂直模型
  3. Hugging Face / ModelScope 等中立平台让"全球分发"无需经过任何中国厂商许可——绕过了"中国大模型出海"的地缘政治压力

这与 Anthropic Fable 5.1 的EFS 数据主权方案形成有趣的对照——Anthropic 想让企业"用闭源最强模型 + 数据留在自己的云里",Harvey 的选择是"用开源基座 + 数据留在自己的云里 + 模型也留在自己的云里"。两条路都是为了解决数据主权,但实施路径截然相反。


五、对开发者和创业者的实操建议

5.1 我在做法律 / 金融 / 医疗 / 政务等垂直 AI

认真评估 Kimi K3 + 自己的行业后训练这条路。Tenet 的 1750 任务环境模板 + 异步强化学习流程,是一份可复制的"垂直 AI 创业剧本":

□ 选型:开源 MoE 基座(Kimi K3、Hy4 preview、DeepSeek V4)跑一遍你的行业基准 □ 任务环境建设:10³-10⁴ 个真实业务场景,让领域专家(律师、医生、分析师)制定评分标准 □ 后训练基础设施:≥100 张 B300,2 个月完成 RLHF / 异步 RL □ 部署:自有数据中心 / 私有云,权重完全自控 □ 商业模式:从"按 Token 计费"转为"按结果计费"或"按席位订阅"

5.2 我在做多模态 Agent / 工具调用 Agent

立刻试 DeepSeek-V4-Flash-Vision-Exp。本地部署门槛低(4.6% 激活率)、MIT 协议商用零成本、自带视觉编码器与 Aligner 实现。

注意几个落地关键点:

  • V4-Flash-Vision 已经有 7 个社区量化版本,但对视觉模块的支持各有差异,建议先在原始 BF16 上跑一遍再决定量化
  • MoE 路由 + 视觉模块的混合训练范式,对显存峰值和带宽都比纯文本模型更敏感
  • 该模型的官方部署文档尚未完整发布,建议跟 DeepSeek-V4-Flash-Vision-Exp Hugging Face 保持同步

5.3 我在做国产开源大模型选型

场景推荐理由
通用文本 + 长上下文Kimi K3、Hy4 preview1M 上下文、Apache 2.0 / 自定义许可
多模态 + AgentDeepSeek V4-Flash-Vision4.6% 激活率、MIT 协议
代码 AgentQwen 3.8 Max、Coding Plan代码微调领先
端侧Hy3 / MiniMax H3 / Ling 3.0 tiny小模型路线
极本地化预算(消费级显卡)Hy4 preview 极量化 214GB唯一 Apache 2.0 极量化大模型

5.4 我在做模型评测

注意几点关键变化:

  • Anthropic、OpenAI 不再是唯一基准。Harvey LAB、APEX Agents 等垂直基准正成为新的真实战场
  • 开源模型不再是"未达 GPT 级别"的代名词。Kimi K3 在 Harvey LAB-AA 第一就足以说明
  • MIT 协议的分发效应。DeepSeek V4-Flash-Vision 在 Hugging Face 上线 24 小时内出现 7 个社区量化版——这在过去是不可想象的

六、今日其他相关资讯

  • Claude Fable 5.1 发布(同日 9/1)——详见本专栏第一篇
  • 腾讯混元 Hy4 preview 轻量版(同日 9/1)——详见本专栏第二篇
  • OpenRouter 月处理 200 万亿 Token,800 万开发者——Stripe 100 亿美元洽购交易持续发酵,本专栏第三篇之外单独跟进
  • 韩国 AI for All 全民免费 AI 计划——9 月 1 日详情见 9 月 1 日日报
  • 中国 AI 标识办法 9 月 1 日正式施行——生成式 AI 内容必须打标识

常见问题(FAQ)

Q1:DeepSeek V4-Flash-Vision-Exp 真的 MIT 协议?商用零成本?
A:是。MIT 是最宽松的标准开源协议之一,分发、修改、商用均无需授权,唯一义务是在软件中保留版权声明。DeepSeek 自 V3 系列起在新模型上持续采用 MIT 协议。

Q2:V4-Flash-Vision 4.6% 激活率能跑在消费级显卡上吗?
A:能跑推理,不能跑训练。305B 总参意味着全部权重必须常驻——单张 4090 仍然跑不动全模型,需要 CPU offload 或量化。社区已有 7 个量化版本,建议根据你的硬件预算选 INT4 或更激进的量化。

Q3:Harvey 为什么不直接调 GPT-5.6 Sol 或 Claude Fable 5 的 API?
A:(1)成本:法律任务 token 消耗规模巨大,按 API 计费会快速吞掉毛利;(2)能力:在 Legal Agent Bench 这种长链任务基准上,Kimi K3 跑赢 GPT-5.6 Sol;(3)数据主权:合同底稿、并购材料不希望传出私有环境;(4)控制权:闭源 API 不能改网络结构、训练自己定义的"什么是好的法律工作"。

Q4:Harvey Tenet 的训练是"用客户的法律材料做微调"吗?
A:不是。Harvey 在公开技术博客里明确说明 Tenet 的训练使用了约 1,750 个完全自建的法律任务环境,没有使用任何客户数据。这一点对法律 AI 这种对数据隐私极度敏感的领域尤其重要。

Q5:Kimi K3 是开源的吗?许可证是什么?
A:Moonshot 在 2026-07 月份开放了 Kimi K3 的权重,但使用的是"自定义许可证",而不是 MIT 或 Apache 2.0。自定义许可证对月活用户(MAU)和训练数据有具体合规条款——商用前应仔细阅读。这一点在对比 Hy4 preview 的 Apache 2.0 时尤其重要。

Q6:美国监管会限制美国 AI 公司使用中国基座吗?
A:截至 2026-09-01 暂无明确禁令,但一直是市场关注点。Harvey 的应对方式是"双基座备份 + 数据主权方案"。长期看,OpenRouter 这种中立调度层可能受益——它可以让 Harvey 同时挂载 Kimi、Llama、Anthropic、OpenAI 等多家基座。

Q7:DeepSeek V4-Flash-Vision 的"眼睛不是给人看的"具体怎么理解?
A:意思是模型不是为了"看图说话"而生,而是为了"看图后调用工具"。比如看到网页截图后,告诉 Agent “这里有个按钮可以点击”;看到软件界面后,识别可交互区域;看到图表后,把数据提取出来再调用工具做后续处理。


参考资料

  1. IT 之家 / 新浪科技《DeepSeek V4 多模态模型正式开源:305B 参数、MIT 协议、零成本商用为何冲击多模态 Agent 格局?》,发布时间:2026-09-01。
  2. 观察者网《DeepSeek-V4 首款多模态模型权重开放,"睁眼"后追上 Opus-4.8》,发布时间:2026-09-01。
  3. DeepSeek-V4-Flash-Vision-Exp Hugging Face 模型卡,发布时间:2026-09-01。
  4. AIBase《DeepSeek’s First Open-Source Multimodal Model Has Arrived: These Eyes Are Not for Humans to View》,发布时间:2026-09-01。
  5. Race to AGI《DeepSeek V4 Flash Vision releases 305B open-weight model》,发布时间:2026-09-01。
  6. 21 世纪经济报道《全球垂直 AI 开始拥抱中国开源大模型》,发布时间:2026-09-02。
  7. AsiaICT《OpenAI’s ‘Prodigal Son’ Makes a Move: Why Did Harvey, Valued at 11 Billion, Switch to Kimi?》,发布时间:2026-08-30。
  8. Semalt《US Legal AI Relies on Chinese Kimi Models》,发布时间:2026-08-29。
  9. 网易《嫌 110 亿太少?OpenAI"亲儿子"反水了!》,发布时间:2026-09-01。
  10. AINewsCycle《Moonshot AI’s Kimi K3 Debuts, Challenging US Frontier Models in Open-Weight Space》,发布时间:2026-08-23。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 10:10:50

基于51单片机与HX711的智能电子秤设计:从传感器采集到Proteus仿真全解析

简介:本资源是一套完整的基于51单片机的智能电子秤设计实现方案,面向嵌入式初学者、课程设计学生及电子类竞赛备赛者,解决称重系统开发中传感器驱动、数值校准、人机交互与功能扩展等典型工程问题。压缩包共40个文件,涵盖Proteus仿…

作者头像 李华
网站建设 2026/9/2 10:10:15

Ryujinx Switch模拟器:从搭环境到调顺流畅的完整路线

Ryujinx Switch模拟器:从搭环境到调顺流畅的完整路线 【免费下载链接】Ryujinx 用 C# 编写的实验性 Nintendo Switch 模拟器 项目地址: https://gitcode.com/GitHub_Trending/ry/Ryujinx Ryujinx 是用 C# 编写的开源 Nintendo Switch 模拟器,能把…

作者头像 李华
网站建设 2026/9/2 10:08:21

Czkawka 使用指南:三步装起来,快速清理重复文件与相似图片

Czkawka 使用指南:三步装起来,快速清理重复文件与相似图片 【免费下载链接】czkawka Multi functional app to find duplicates, empty folders, similar images etc. 项目地址: https://gitcode.com/GitHub_Trending/cz/czkawka Czkawka 是一款用…

作者头像 李华
网站建设 2026/9/2 10:07:35

基于Neo4j构建《红楼梦》知识图谱:从数据建模到可视化应用

简介:本资源是一套面向Python开发者与知识图谱初学者的《红楼梦》结构化知识建模实践包,聚焦于中文文本知识抽取、Neo4j图数据库构建与可视化展示全流程。资源共7个文件,包含核心知识图谱数据库(.zbak备份)、实体关系三…

作者头像 李华
网站建设 2026/9/2 10:07:30

C#上位机Modbus通信实战:NModbus库从RTU到TCP的完整指南

简介:这是一份面向C#开发者的NModbus工业通信示例工程,涵盖Modbus RTU、ASCII与TCP等多种协议操作,适合需要通过C#与PLC、仪表等工业设备进行数据交互的工程师学习参考。附带对Modbus功能码(如读线圈、读保持寄存器等)…

作者头像 李华
网站建设 2026/9/2 10:07:23

继电器自激振荡电路设计:从RC定时到警灯闪烁的硬件实现

你有没有遇到过这样的场景:一个简单的报警指示灯,需要它按照特定节奏闪烁,比如“亮一秒、灭一秒”或者“快闪三下、停顿两秒”?这种需求在工业控制、安防设备、甚至一些DIY项目中都很常见。很多人第一反应可能是用单片机写个程序&…

作者头像 李华