做 Agent 应用的人最近应该都有同一个感受:模型不贵,上下文贵。
一个 Agent 跑复杂任务,每调一次工具,可能就带回来一整页网页、一份文件、一长串执行日志。这些新内容要重新做预填充,历史记录还越攒越长。跑一个像样的深度研究任务,上下文轻松冲到几十万 Token。钱不是花在模型"思考"上,是花在模型反复"读材料"上。
9 月 24 日,小米 MiMo 负责人罗福莉公布了 MiMo-V3 的核心架构 HySparse2,就是冲着这个痛点来的。官方数据很直接:在 100 万 Token 长度下,预填充计算量降低 5.02 倍,KV 缓存缩小 4.5 倍。换成具体数字,80B-A3B 的 MoE 模型跑百万上下文,KV Cache 从大约 12GB 压到 2.7GB。
为什么 Agent 的负载和普通聊天完全是两回事
普通对话场景里,上下文是线性增长的,你一句我一句,长度可控。Agent 不一样。它每往前走一步,都要处理一大段新输入,同时还要从不断变长的历史里捞出下一步真正需要的信息。
这就把三个问题同时顶到了关键路径上:预填充成本、KV 缓存容量、长上下文检索准确率。只优化其中一个没用,三个得一起解。罗福莉的判断是,智能体推理是一种截然不同的工作负载,值得为它单独设计架构,而不是在聊天架构上打补丁。
这个判断我是认同的。今年各家都在卷 Agent,但底层架构大多还是为对话优化的那套。小米这次算是把话挑明了。
HySparse2 做了什么
架构上把模型切成前后两半。前半部分叫 Self-Decoder,用全注意力加滑动窗口注意力的混合结构;后半部分叫 Cross-Decoder,用全注意力加稀疏注意力的混合结构。在这个骨架上做了三件事。
第一件,KV 桥接。借鉴 YOCO 的思路,Cross-Decoder 里的全注意力层不自己算 KV,直接用 Self-Decoder 的隐藏状态构建。所有 Cross-Decoder 的 KV 缓存都来自 Self-Decoder,意味着预填充在 Self-Decoder 跑完时就能收工,后面不用再算。
第二件,KV 重用。每个混合块内部,所有稀疏层直接复用前一层全注意力层的 KV 缓存和 Token 选择索引。一份缓存大家用,不重复开房间。
第三件,两个精度升级。用 Token 级选择替代块级选择,长文本里捞关键信息更灵活;用近期 Token 的强制窗口替代独立的滑动窗口分支,让局部和全局 Token 共享同一份 KV 缓存,缓存管理逻辑更简单。
效果方面,除了成本数字,长上下文评测 MRCRv2 和 RULER-v2 得分更高,衡量 Agent 推理流畅度的 AgentPPL 和长文本稳定性的 LongPPL 也更低。也就是说,省钱的同时没有牺牲准头,这一点比单纯的压缩技巧重要。
对做应用的人意味着什么
我的看法是,这类架构创新比榜单刷分实在得多。
Agent 应用能不能跑通商业模式,核心就是成本结构。一个任务烧掉几毛钱的上下文费,和烧掉几分钱,决定了这个产品是玩具还是生意。HySparse2 这类把预填充和缓存成本压一个数量级的方案,等于把 Agent 应用的毛利空间直接撑开了。
另外一个信号值得注意:国内大模型的竞争重心,正在从堆参数、刷榜单,转向抠效率、抠场景适配。小米从 V2 的混合滑动窗口架构,到 V2.6 用强化学习拉能力,再到 V3 直接为 Agent 负载重做架构,路线很清楚,就是奔着"让 Agent 跑得起"去的。罗福莉从 DeepSeek 带着光环加入小米之后,这是交出的第一份架构级答卷,成色不错。
当然,架构公布和模型落地是两回事。MiMo-V3 什么时候发、开不开源、实际推理价格能不能同步降下来,才是开发者最后真正关心的。在那之前,先记住这个方向:为 Agent 负载专门设计的稀疏架构,大概率是接下来一年各家基础模型团队的标配动作。
参考资料
- 罗福莉官宣 MiMo-V3 架构(凤凰网科技):https://tech.ifeng.com/c/8wfBW2vRWW1
- IT 之家附 HySparse2 官方详解:https://baijiahao.baidu.com/s?id=1877201109580693963
- Agent 开始啃长任务,小米把大模型架构改了(智源社区):https://baijiahao.baidu.com/s?id=1877231510076848722
- 我平时追踪这类 AI 模型和工具动态会用 ai345(https://www.ai345.info/?ref=csdn),AI 工具导航加中文 AI 资讯日报,找工具和追新动态都不用翻墙