文章目录
- 前言
- 1. Transformer的天花板,好像真摸到了
- 1.1 大佬唱衰不是随口吐槽
- 2. Transformer的三个老毛病,一直没根治
- 2.1 脑子里有货,掏出来特别慢
- 2.2 想学新知识,成本高得离谱
- 2.3 没见过的题,很难举一反三
- 3. 病根出在架构本身的设计上
- 4. Mobius:换个思路破局
- 4.1 核心逻辑:知识和推理拆开
- 4.2 刚好戳中前面三个痛点
- 4.3 实测数据确实能打
- 5. 想象空间很大,但短板也明摆着
- 5.1 很多前沿方向都对口
- 5.2 短板也一点不含糊
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。
前言
最近AI圈有个吵得很热的话题:Transformer是不是快走到头了?
这话真不是营销号危言耸听,是行业里实打实的大佬公开表态了。
1. Transformer的天花板,好像真摸到了
1.1 大佬唱衰不是随口吐槽
前OpenAI推理负责人,加上前Google Gemini预训练负责人,两位都公开说过,Transformer已经成了通往AGI的最大瓶颈。
说白了就是,堆参数堆数据这套玩法,再往下走的收益已经低得可怜了。
国内不少头部厂商也在改Transformer架构,不过很多时候是算力不够逼的——搞点稀疏、线性注意力省成本,不全是为了突破架构本身的能力上限。
这就像你玩3A大作显卡带不动,先调低画质凑帧率,不是真的想把游戏本身做得更好。
2. Transformer的三个老毛病,一直没根治
2.1 脑子里有货,掏出来特别慢
现在大模型做复杂数学题、写难一点的代码,都得碎碎念半天才能出正确结果。
也就是所谓的长思维链,一边输出一边试错纠错,绕半天才能摸到正确答案。
不是模型不会做,是它得慢慢翻脑子里的存货,翻好半天才能找准对应的知识。
这就像你考试答题,明明知识点背过,非得先写一堆无关的话铺垫,绕半天才想起正解,既费时间又费答题卡。
更麻烦的是,这种效率问题靠优化注意力、优化硬件都很难质变——输出长度摆在那,再快也有极限。
2.2 想学新知识,成本高得离谱
想让大模型掌握新领域内容,现在最常用的是RAG,说白了就是开卷考试。
但开卷也有开卷的麻烦:甩给你几百页全新的资料,不画重点直接找答案,换谁都得翻半天。
信息密度太低,知识越多反而越容易找不着北。
要是想让它把知识真正记牢?那就得新旧数据混在一起,把模型重训甚至续训一遍。
这就像你想往衣柜里添几件新衣服,结果得把整个衣柜拆了重新组装,费时又费钱,完全不划算。
2.3 没见过的题,很难举一反三
组合泛化这个难题,困扰AI圈不是一天两天了。
简单说就是,模型分别学过A和B,但很难自己把俩东西凑到一起,生出新东西C。
当年爱因斯坦能搞出广义相对论,不光是他懂狭义相对论和黎曼几何,更关键是这俩知识点在他脑子里撞上了,迸发出了灵感。
现在的大模型倒好,俩知识点都存着,但同一次推理里很难同时被激活,根本碰不出火花。
就像你微信里躺着两个行业大牛,他俩联手能搞个大项目,但你从来没想过把他俩拉进同一个群。
3. 病根出在架构本身的设计上
这三个问题追根溯源,都和Transformer分层的记忆与推理机制脱不开关系。
简单讲,全连接层负责存知识,注意力层负责做推理,一层一层叠上去,各管各的。
不同层存的知识不一样,推理逻辑也不一样,信息只能顺着层级慢慢往下传。
这就像传统公司的层级制度,部门墙厚,跨层沟通难,底层信息传到顶层早就变味了,不同部门的知识也很难凑到一块。
知识读取慢、更新成本高、跨领域难组合,本质上都是这套分层机制带来的副作用。
4. Mobius:换个思路破局
4.1 核心逻辑:知识和推理拆开
上海人工智能实验室的书生团队搞出了个Mobius架构,走的就是知识与推理分离的路子。
说穿了逻辑很直白:把所有层的知识都从各自的层里拎出来,放到一个共享的记忆池里。
每一层做推理的时候,都能直接访问整个记忆池的所有知识,不用再顺着层级挨个翻。
这就像把公司所有部门的资料都丢进公共共享盘,任何人任何时候都能查,不用一层层打报告走审批。
4.2 刚好戳中前面三个痛点
首先是推理效率上去了。不用一层层遍历找知识,一次就能拿到更多信息,自然不用再靠说废话凑时间。
其次是学新知识更省心。所有知识平铺在池子里,新知识该放哪一目了然,不用牵一发而动全身。
最后是组合泛化变强了。所有知识都在一个池子里,同时被激活的概率高多了,自然更容易碰撞出新东西。
4.3 实测数据确实能打
目前的实验结果已经很有说服力:端到端推理效率比Transformer提升近4倍,下游任务准确率还没掉。
相当于同样做对一道题,别人花十分钟,你两分半就搞定,效率直接拉满。
数据效率也更高,只用60%的数据就能达到和Transformer差不多的MMLU分数,相当于别人复习一整本教材,你看半本就考得不相上下。
在知识组合泛化任务上,提升更是直接翻了两倍。
5. 想象空间很大,但短板也明摆着
5.1 很多前沿方向都对口
比如现在很热的递归自进化,不管是迭代数据还是迭代架构,都需要灵活高效的记忆机制,Mobius的设计刚好对上。
再比如AI辅助科学发现,科研最需要不同领域知识的碰撞,这也刚好踩中了Mobius的优势。
甚至未来的世界模型,要处理连续的物理世界,Mobius的潜在推理机制也能帮上忙。
简单说,以前的架构更像应试高手,这个新架构更有潜力往科研选手的方向走。
5.2 短板也一点不含糊
当然也不是没有问题。单看单个token的推理速度,Mobius现在还比不过Transformer。
毕竟知识和推理分离,天然就带来存算分离的问题,访存和通信都会有开销,相当于共享盘虽然方便,但网速慢的时候也会卡。
想真正发挥出这个架构的全部潜力,不光算法要优化,配套的存取策略、并行方案,甚至专门的硬件设计都得跟上。
至于它能不能真的成为下一代主流架构,现在下结论还太早。
但至少在Transformer逐渐摸到天花板的今天,有人走出了一条不一样的路。
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。