news 2026/9/24 15:47:14

从【DeepSeek】到百度文心:魏浩然的“非典型”技术突围与穿透周期的底层心法

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
从【DeepSeek】到百度文心:魏浩然的“非典型”技术突围与穿透周期的底层心法

从GOT-OCR到百度文心:魏浩然的“非典型”技术突围与穿透周期的底层心法

副标题:“真正的强者,不是天赋最耀眼的人,而是那个在每一次技术转向中都能重新扎下根去的人”
标签:#人生成长 #魏浩然 #百度文心 #DeepSeek #OCR #多模态大模型

技术的浪潮从不等待任何人,但它永远奖赏那些在浪潮之下默默打磨底层能力的人。

今天要聊的这个人,在DeepSeek V4技术报告的离职名单中,他可能是最低调、最沉默的那一位——他叫魏浩然

没有公开演讲,没有商业PR,没有高调的跳槽官宣。在喧嚣的AI名利场中,他像一个“隐形人”,留下的只有几篇惊艳行业的OCR论文,和一个没有被任何镜头捕捉到的沉默背影。

但在2026年9月,这个沉默的背影终于有了新的坐标:原DeepSeek核心研究员魏浩然,已带队转入百度基础模型研发部(BMU),出任文心大模型多模态算法负责人

这条路径背后,是一个1996年出生的青年研究者,用不到五年时间,从阶跃星辰到DeepSeek再到百度,三次跳上技术前沿的跃迁故事。剥开他的履历,藏着普通人穿越技术周期最具参照意义的底层逻辑

一、起点不是名校,但选择足够“硬核”:中科院直博的底层修炼

1996年,魏浩然出生于山东济南济阳县,一个在AI人才地图上几乎不会被标注的地方。

但他在学业上走出了一条极其清晰的路线:2023年直博毕业于中国科学院大学,研究方向为大语言模型与多模态大模型

“直博”意味着他在本科阶段就展现出了足够的科研潜力,被导师直接纳入博士培养轨道。而中科院大学的博士训练,给予他的不是“名校光环”,而是一套硬核的科研方法论:如何定义问题、如何设计实验、如何在失败中迭代假设。

深度成长思考(一):真正决定你天花板的,不是你从哪里出发,而是你用什么样的底层能力出发。

魏浩然没有清北本科的标签,也没有海外顶尖名校的镀金。但他用中科院直博的五年,完成了对大模型和多模态最底层原理的系统性掌握。这种“底层能力”,才是他后来能在OCR这个看似传统的领域做出范式级创新的真正根基。

二、阶跃星辰:用两个“第一”定义自己的技术坐标

博士毕业后,魏浩然加入阶跃星辰(StepFun),在VLM组参与Step系列多模态大模型的研发,主要负责模型架构设计、预训练以及Step-encoder的设计与训练。

在阶跃星辰期间,他做出了两个后来被行业反复提及的工作:

Vary双塔多模态模型。他主导开发了Vary模型,这一架构后来被DeepSeek-VL模型借鉴。一个在创业公司做出的架构设计,能被行业头部玩家的基础模型所采纳——这本身就说明了它的技术分量。

GOT-OCR2.0。这是让他真正“破圈”的工作。GOT-OCR2.0成为第一个登上Huggingface Trending #1的OCR模型,也是端到端OCR模型的经典之作,“是OCR技术在大语言模型时代重回公众视野的开端”。

深度成长思考(二):在一个“冷门”领域做到极致,比在热门领域做一个平庸的追随者,价值高一个数量级。

当大模型圈都在卷千亿参数、卷对话能力的时候,魏浩然选择了OCR——一个被很多人认为“太传统”的方向。但GOT-OCR2.0的成功证明了一个反直觉的规律:在一个高门槛的垂直领域把自己做成绝对壁垒,远比在拥挤的主战场上做一个可替代的参与者更有战略价值。

三、DeepSeek岁月:用“光学压缩”重新定义OCR的边界

2024年,魏浩然加入DeepSeek LLM组,作为大语言模型研究员进行数据scaling研究,并参与了DeepSeek V3.2和V4的开发。但真正让他成为行业T1级别人物的,是他主导的DeepSeek-OCR系列模型

DeepSeek-OCR(2025年10月):上下文光学压缩

这篇论文的核心思想极其原创:用光学2D映射的方式,将长上下文进行高倍压缩。魏浩然作为第一作者,提出了通过自主研发的DeepEncoder,将传统方法中成千上万个文本Token压缩为数量大幅减少的紧凑视觉Token。在压缩率低于10倍的条件下,OCR解码准确率仍可保持在约97%

这一工作的意义远不止于“OCR识别更准了”。它从根本上探索了一条解决大模型长上下文输入时显存暴涨与计算开销过大问题的全新路径——用视觉表征来极限压缩长文本信息

DeepSeek-OCR一经开源便登顶Huggingface Trending,GitHub Stars一月超过20K,到2026年初在Huggingface上总下载量达数千万

DeepSeek-OCR 2(2026年1月):视觉因果流

如果说第一代是“压缩”的革命,第二代则是对“理解”的颠覆。在DeepSeek-OCR 2:Visual Causal Flow中,魏浩然再次作为第一作者,提出了一个极具洞察力的问题:传统视觉语言模型总是按死板的光栅扫描顺序(左上到右下)处理图像Token,但这完全违背了人类的视觉感知方式。人类阅读复杂文档时,遵循的是灵活、语义驱动的因果扫描模式

为此,他设计了DeepEncoder V2,首次用轻量级语言模型(Qwen2-0.5B)取代传统的CLIP ViT作为视觉编码器,赋予编码器因果推理能力,使其能够根据图像语义动态重排视觉Token的顺序——这是一个从“机械扫描”到“智能理解”的范式跃迁。

论文三位作者为魏浩然、孙耀峰和李宇琨,魏浩然位列第一作者。

深度成长思考(三):真正的创新,往往发生在你“重新定义问题”的那一刻,而不是“优化已有答案”的时刻。

魏浩然的突破不在于把OCR的准确率从95%提到97%,而在于他重新定义了OCR在大模型时代的角色:它不再只是一个“把图片变成文字”的工具,而是一种用视觉表征压缩长文本信息、降低大模型计算开销的全新范式。这种“重新定义问题”的能力,来自于他在中科院时期打下的底层科研训练,以及在阶跃星辰期间积累的多模态架构设计经验。

四、离职与沉默:春节前后的转身,数月后的答案

2026年4月,DeepSeek V4技术报告正式公开。在这份长达58页、近300人署名的报告中,10人标注“已离职”,魏浩然赫然在列。他的离职时间被明确描述为“今年春节前后”。

与同期离职的王炳宣(腾讯)、罗福莉(小米)、郭达雅(字节Seed)、阮翀(元戎启行)不同,魏浩然的去向在当时没有任何公开披露

这种沉默持续了数月。直到2026年9月3日,多家媒体同时确认:魏浩然已于2026年初加入百度,并带领团队转入百度基础模型研发部(BMU),出任文心大模型多模态算法负责人

而他在百度的工作,早已悄然开花结果。

Unlimited OCR(2026年6月22日开源):魏浩然加入百度后带领团队在端到端文档感知领域取得重大突破,开源的Unlimited OCR模型在业内权威的文档理解评测基准OmniDocBench测试中取得全球第一,刷新了端到端OCR性能的SOTA纪录,登上GitHub和Hugging Face多个趋势榜单。

深度成长思考(四):沉默不是缺席,而是用结果说话。真正的强者,不需要在聚光灯下宣告下一步,只需要在沉默中完成下一步。

魏浩然从春节前后离开DeepSeek,到6月开源Unlimited OCR模型,中间只有三四个月的时间。他没有花时间在媒体上解释“我为什么离开”“我去了哪里”,而是直接把一个全球SOTA的模型放在所有人面前。在AI这个以月为单位迭代的行业里,沉默本身就是一种战略。

五、百度BMU:青年技术骨干接管研发中枢

魏浩然的加入,发生在百度大模型组织持续重构的关键节点。

2025年11月,百度新设基础模型研发部(BMU)应用模型研发部(AMU),将底座模型与应用模型研发拆分。2026年7月1日,出生于1997年、曾主导国内首个开源对话模型复旦MOSS的青年学者孙天祥正式加入百度,出任BMU负责人,并进入百度模型委员会(BMC)。

魏浩然此次带队进入BMU,被业内视为“孙天祥全面接手基础模型部门后,文心作为研发阵地重新集结的关键拼图”。从孙天祥统管通用基座,到魏浩然挂帅多模态算法,百度的模型研发中枢正加速向青年技术骨干倾斜

六、写在最后:穿透周期的三层成长启示

回顾魏浩然从济南到北京、从阶跃星辰到DeepSeek再到百度的完整轨迹,这条路径给了普通人最具操作性的三点启示:

1. 底层能力比名校标签更持久(扎根)
他没有清北光环,没有海外名校PhD。但他用中科院直博的五年,建立了对大模型和多模态最底层原理的系统性理解。这种底层能力,让他在每一次技术转向中都能快速重新扎根,而不是被浪潮甩下。

2. 在垂直领域做深,比在热门领域做广更有壁垒(深耕)
OCR在大模型时代看似“不性感”,但魏浩然用GOT-OCR2.0和DeepSeek-OCR系列证明:在一个高门槛领域做到T1级别,其稀缺性和不可替代性,远超在热门方向上做一个“还不错”的参与者。

3. 用结果代替解释,用沉默代替喧嚣(定力)
从DeepSeek离职后的数月沉默,到百度Unlimited OCR的全球SOTA,魏浩然展示了一种稀缺的职业品格:不急于向外界证明什么,只急于把下一件事做成。在AI这个充满噪音的行业里,“做完”永远比“说了什么”更有说服力。

4. 在不确定性中保持自己的节奏(闭环)
从GOT-OCR2.0到DeepSeek-OCR v1到v2,再到百度Unlimited OCR,魏浩然的每一步都形成了完整的闭环——从一个想法到一篇论文,从一个开源模型到一个SOTA结果。这种“闭环能力”,才是穿越技术周期最可靠的护城河。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 15:40:57

简述 Word Embedding 可以怎样运用于文本分类任务?

👨‍⚕️ 主页: gis分享者 👨‍⚕️ 感谢各位大佬 点赞👍 收藏⭐ 留言📝 加关注✅! 👨‍⚕️ 收录于专栏:AI大模型原理和应用面试题 文章目录 一、🍀回答重点 二、🍀扩展知识 一、🍀回答重点 Word Embedding 可以通过将词汇表示为稠密的向量,从而使文本…

作者头像 李华
网站建设 2026/9/24 15:40:05

AI Agent 面试题 244:Prompt模板的参数化设计和动态渲染机制

🔥 AI Agent 面试题 244:Prompt模板的参数化设计和动态渲染机制摘要:本文深入解析了「Prompt模板的参数化设计和动态渲染机制」这一 AI Agent 领域的核心面试题。文章从 Prompt 模板管理 的基本概念出发,系统性地剖析了 参数化、动…

作者头像 李华
网站建设 2026/9/24 15:35:38

all-in-rag 实战:向量数据库选型与 FAISS 本地向量存储实现指南

all-in-rag 实战:向量数据库选型与 FAISS 本地向量存储实现指南 【免费下载链接】all-in-rag 🔍大模型应用开发实战一:RAG 技术全栈指南,在线阅读地址:https://datawhalechina.github.io/all-in-rag/ 项目地址: http…

作者头像 李华