2024 年,DeepSeek-V3 用 557 万美元的训练成本震撼了硅谷;2026 年,DeepSeek-V4 将原生百万 token 上下文变成了开源基础设施。与此同时,以 Mamba 为代表的状态空间模型(SSM)正在从学术概念走向生产部署。本文以 DeepSeek 的架构演进为线索,系统梳理 Transformer 与 SSM 两条路线的碰撞、分野与殊途同归。
一、Transformer 的"慢性病":二次方复杂度的诅咒
自 2017 年《Attention Is All You Need》发表以来,Transformer 凭借自注意力机制一统 NLP 江湖。然而,这一架构有一个与生俱来的"基因缺陷":自注意力的计算和内存复杂度均为O(N2)O(N^2)O(N2)。序列长度每翻一倍,计算量和显存消耗就增长四倍。
在实际部署中,这表现为三个致命瓶颈:
- KV Cache 爆炸:推理时需要缓存所有历史 token 的 Key 和 Value,内存随序列线性增长
- 首 token 时间(TTFT)急剧上升:预填充阶段需要计算完整的注意力矩阵
- 长文本天花板:消费级 GPU 上,纯 Transformer 通常难以处理超过 128K 的上下文
面对这一困境,业界分化出了两条截然不同的解决路线。
二、路线一:DeepSeek 的"保守治疗"——在 Transformer 框架内极致优化
DeepSeek 选择了一条稳健而激进的路线:不抛弃 Transformer 的基本框架,而是在其内部进行一系列"外科手术式"的优化,逐步将长文本推理的成本降到可接受的范围。
2.1 第一次手术:MLA(V2/V3,2024)
2024 年 5 月,DeepSeek-V2 引入了Multi-head Latent Attention(MLA),这是 DeepSeek 效率革命的起点。MLA 的核心思想是低秩联合压缩:将 Key 和 Value 通过一个下投影矩阵压缩到一个低维隐向量ctKVc_t^{KV}ctKV中,推理时只需缓存这个压缩向量,而非完整的 per-head KV。
在 DeepSeek-V3 中,MLA 与 DeepSeekMoE 架构结合,打造了一个 671B 参数、每 token 仅激活 37B 的巨型模型。该模型在 14.8T tokens 上完成预训练,全程仅需 2.788M H800 GPU 小时——这一训练成本在当时引发了全球震动。
2.2 第二次手术:DSA(V3.2,2025)
MLA 解决了 KV Cache 的"每个 token 存多少"问题,但没有解决"要看多少历史 token"的问题。2025 年 12 月,DeepSeek-V3.2 引入了DeepSeek Sparse Attention(DSA),通过"闪电索引器"(Lightning Indexer)在注意力计算前快速筛选出最相关的 top-k token,将核心注意力的复杂度从O(L2)O(L^2)O(L2)降到O(L⋅k)O(L \cdot k)O(L⋅k)。
DSA 的"检索-然后-注意力"(retrieve-then-attend)机制,本质上是在 Transformer 内部嵌入了一个轻量级的信息检索系统。
2.3 第三次手术:CSA + HCA 混合注意力(V4,2026)
2026 年 4 月,DeepSeek-V4 的发布标志着这条路线的成熟。V4 不再使用单一的注意力机制,而是设计了两种互补的注意力分支并交替使用:
| 机制 | 压缩率 | 作用 | 类比 |
|---|---|---|---|
| CSA | 4:1 | 通过 softmax 门控池化压缩 KV,再用 FP4 闪电索引器选择 top-512 相关块 | 精读:在书中找到最相关的章节细读 |
| HCA | 128:1 | 将每 128 个 token 的 KV 合并为一个条目,然后在其上运行密集注意力 | 泛读:快速浏览全书概要 |
| SWA | 无 | 保留最近 128 个 token 的原始 KV | 当前页:确保对最新内容的精确感知 |
这种"精读 + 泛读 + 当前页"的三层设计,使得 DeepSeek-V4 在 1M token 上下文下实现了惊人的效率:V4-Pro 仅需 V3.2 的27% 推理 FLOPs 和 10% KV Cache,V4-Flash 更是降至10% FLOPs 和 7% KV Cache。
2.4 隐形的基石:mHC 与 Muon
除了注意力机制,DeepSeek-V4 还引入了两项关键创新:
Manifold-Constrained Hyper-Connections(mHC)替代了传统的残差连接。mHC 将残差流扩展为 4 条并行通道,并通过 Sinkhorn-Knopp 算法将混合矩阵约束在 Birkhoff 多面体(双随机矩阵流形)上,确保信号范数在深层网络中不会爆炸或消失。这使得 61 层的 V4-Pro 能够稳定训练。
Muon 优化器则通过 Newton-Schulz 正交化步骤,让梯度更新保持良好条件数,在 32T+ token 的预训练规模上实现了更快的收敛。
三、路线二:SSM 的"器官移植"——另起炉灶的线性革命
与 DeepSeek 的"保守治疗"不同,另一条路线选择彻底抛弃自注意力机制,回归控制论中的状态空间模型(State Space Model, SSM)。
3.1 从 S4 到 Mamba:选择性记忆的诞生
SSM 的核心思想极其优雅:用一个固定大小的隐状态(Hidden State)来压缩历史信息,每步更新状态的计算量为O(1)O(1)O(1),总复杂度O(N)O(N)O(N)。这与 Transformer 的"全员握手"形成鲜明对比——SSM 更像一个流水线工人,只保留当前的工作状态。
早期的 S4 模型通过数学化的AAA矩阵设计(HiPPO 理论)保证了长程依赖的建模能力,但缺乏灵活性。2023 年,Mamba 引入了选择性机制(Selective SSM),让BBB、CCC矩阵依赖于输入数据,实现了"根据内容选择性记忆"——这是 SSM 从"死板过滤器"进化为"智能处理器"的关键一跃。
3.2 Mamba-2 的 SSD:Transformer 与 SSM 的统一视角
2024 年,Mamba-2 提出了SSD(State Space Duality)框架,从理论上证明了一个惊人的结论:Transformer 的注意力机制和 SSM 的状态转移,本质上是同一枚硬币的两面。两者都可以看作是用一个矩阵MMM去混合序列中的 token,只是MMM的结构不同:
- Attention 的MMM是稠密、内容相关、带 softmax 归一化的N×NN \times NN×N矩阵
- SSM 的MMM是下三角、由递归参数决定、带衰减的结构化半可分矩阵
SSD 模型恰好位于两者的交集:既可以写成递归形式(SSM 视角,O(1)O(1)O(1)单步推理),又可以写成矩阵乘法形式(注意力视角,可利用 Tensor Core 加速)。
3.3 Mamba-3:向 Transformer 靠拢(2026)
2026 年 3 月发布的 Mamba-3 进一步模糊了与 Transformer 的边界:
- 引入QKNorm / BCNorm稳定训练
- 采用复数值状态更新,实现更丰富的状态跟踪
- 引入MIMO(多输入多输出)架构,在不增加推理延迟的前提下提升表现
- 去除短卷积层,通过新的离散化递归机制在 SSM 内部隐式实现卷积效果
在 1.5B 参数规模下,Mamba-3 相比 Gated DeltaNet 平均准确率提升 1.8 个百分点,同时将状态大小减半。
四、正面交锋:效率与能力的权衡
4.1 效率维度:两种"降本"哲学
| 维度 | DeepSeek 路线(V4) | SSM 路线(Mamba) |
|---|---|---|
| 核心策略 | 保留注意力,但通过压缩/稀疏化降低代价 | 完全消除注意力,用固定状态替代 |
| KV Cache | 极大压缩(V4 为 V3.2 的 7-10%) | 完全消除(O(1)O(1)O(1)固定状态) |
| 序列长度上限 | 1M tokens(已验证) | >220K tokens(消费级 GPU) |
| 推理速度(长文本) | 相比基线提升 3-10 倍 | 10.67× 更快(>370 tokens 后) |
| 内存效率 | 相比 GQA 基线降至 ~2% | 12.46× 更省 |
DeepSeek 的路线是"把 KV Cache 做到极致的小",而 SSM 的路线是"让 KV Cache 彻底消失"。前者在短文本上几乎没有性能损失,后者在任何长度上都保持恒定内存。
4.2 能力维度:精确检索 vs 长程建模
然而,效率的提升并非没有代价:
DeepSeek / Transformer 的优势:
- 精确关联回忆:在"大海捞针"(Needle-in-a-Haystack)任务中,显式注意力机制提供了更精确的 token 级归因。DeepSeek-V4-Pro 在 1M 上下文的 MRCR 任务上达到 83.5% 的准确率。
- 可解释性:注意力权重直观展示了模型"在看哪里"
SSM 的优势:
- 长程依赖建模:隐状态持续演化,有效上下文利用率高达 90.2%(Transformer 仅 12.7%)
- 动态变化检测:对序列中的关键转折点更敏感
- 状态跟踪:在需要维护搜索前沿、约束传播等任务中,固定状态提供了天然的"工作记忆"
两者的短板也恰好互补:纯 Transformer 在长文本上 KV Cache 爆炸;纯 SSM 在关联回忆任务上受限于固定隐状态容量,在复制任务上需要比 Transformer多 100 倍的训练数据。
五、殊途同归:混合架构的崛起
2026 年的技术图景已经清晰:纯 Transformer 在长文本场景下难以为继,纯 SSM 在精确回忆任务上仍有短板,而混合架构正在成为主流。
5.1 DeepSeek-V4 本身就是一种"混合"
有趣的是,DeepSeek-V4 的 CSA + HCA 交替设计,与 SSM 领域的混合架构(如 Jamba、Zamba、Mamba-2-Hybrid)在哲学上高度相似:
- Jamba / Zamba:将 Transformer 层与 Mamba 层按一定比例(如 1:7 到 1:10)交错
- DeepSeek-V4:将 CSA(精细稀疏注意力)与 HCA(粗粒度压缩注意力)交错
两者都遵循同一个设计哲学:用低成本机制处理全局/长程信息,用高精度机制处理局部/关键信息。DeepSeek 没有使用 SSM 层,但其"分层压缩 + 稀疏选择"的注意力设计,与 SSM 的"状态演化 + 选择性更新"在抽象层面形成了呼应。
5.2 SSD 理论架起的桥梁
Mamba-2 的 SSD 框架从数学上证明,Transformer 和 SSM 并非水火不容,而是结构化矩阵混合的不同实例。这意味着:
- 针对 Transformer 的优化(如 FlashAttention、稀疏注意力)可以被移植到 SSM
- SSM 的线性复杂度优势可以被引入到混合模型中
- 未来的架构设计可以在"稠密注意力—结构化注意力—SSM"的光谱上自由滑动
5.3 未来的融合方向
DeepSeek 在其技术报告中明确提到:“我们将持续研究和完善模型架构,努力突破 Transformer 的架构限制”。
与此同时,Mamba-3 通过引入 RoPE、QKNorm 和 MIMO,正在主动向 Transformer 的设计范式靠拢。两条路线正在从"对抗"走向"融合"。
六、选型指南:何时用谁?
| 场景 | 推荐路线 | 理由 |
|---|---|---|
| 短文本(<4K) | 标准 Transformer / DeepSeek-V3 | 生态成熟,关联回忆强 |
| 长文档/代码库(128K-1M) | DeepSeek-V4 | 原生 1M 上下文,检索精度高,开源可部署 |
| 超长序列(>1M)/ 实时流式 | SSM / 混合架构 | 线性复杂度,无 KV Cache,延迟可控 |
| 边缘设备/嵌入式 | SSM | 固定内存,硬件要求极低 |
| 需要精确检索/代码生成 | DeepSeek-V4 / 混合模型 | 注意力机制提供精确的 token 级归因 |
| 状态跟踪/多步推理 | SSM / 混合模型 | 固定状态天然适合维护搜索前沿 |
结语:不是取代,而是共生
Transformer 与 SSM 的竞争,本质上是表达能力与计算效率之间的永恒张力。DeepSeek 用四年时间证明:在 Transformer 框架内,通过 MLA → DSA → CSA/HCA 的渐进式优化,可以将百万 token 上下文从"研究 demo"变成"生产基础设施"。SSM 则用数学优雅性证明:完全抛弃二次方注意力,线性复杂度同样可以建模复杂序列。
2026 年的答案已经清晰:未来的大模型架构,既不会是"Attention Is All You Need",也不会是"State Space Is All You Need",而是在两者之间的光谱上,根据任务需求灵活调配计算资源。DeepSeek-V4 的混合注意力、Mamba-3 的 Transformer 化设计、以及 SSD 理论的统一框架,都指向同一个方向——选择性注意力 + 高效状态空间的融合。
在这场架构革命中,DeepSeek 和 Mamba 团队分别从两端向中间掘进。当他们在某个未来版本的模型中相遇时,那或许就是下一代通用人工智能架构诞生的时刻。