news 2026/7/23 11:40:43

盘古大模型团队开源推理组件,Omni Cache以内存为中心的KV管理与推理加速实践

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
盘古大模型团队开源推理组件,Omni Cache以内存为中心的KV管理与推理加速实践

本文整理自 AICon 上海 2026 Ken Zhang 分享《Omni Cache:以内存为中心的KV管理与推理加速》,通过音视频转录总结工具Ai好记进行视频转文字整理,以下为精炼整理后的内容。

推理时代的显存瓶颈

大模型推理的性能瓶颈,除了算力之外,最核心的限制就是显存(HBM)。当前推理引擎普遍采用静态预分配方式——引擎启动后就把 KV Block Pool 预分配好,每一层需要的显存空间提前固定。

这种方案的第一个问题是:HBM 真的用到了极致吗?

从 PagedAttention 起源的内存分块机制,把显存分配成一个个 block,虽然带来了灵活性,但 block 之间跳跃寻址的额外开销不可忽视。

第二个问题是非连续块寻址导致算子开发复杂度高

Ken Zhang 的团队在盘古大模型的实际运维中发现,算子开发中最常遇到的问题不是算法逻辑本身,而是 HBM 的管理问题——地址越界、tensor stride 不匹配、内存碎片。PagedAttention 的 block 机制使这些问题更加突出。

架构翻转:DRAM 为骨干,HBM 为缓存

传统的推理引擎以 HBM 为中心调度:请求进入后先分配 HBM block,资源在生命周期内持续占用,即使实际并不需要一直占着这块空间。

Ken Zhang 团队的方案做了一个架构翻转——把 Block Pool 移到 DRAM 上分配,HBM 只作为缓存来用,仅缓存当前层计算所需的 KV。

在某型号 H20 或 B200 上,单卡 HBM 约 100GB,8 张卡约 1TB。但 HBM 的成本是 DRAM 的 5 倍以上。

把 Block Pool 全部移到 DRAM 分配后,HBM 上只需要保留连续的 KV 缓冲区,多层复用同一个 buffer。利用层间计算的时间(每层约 30ms,60 层每层约 500μs)做 H2D/D2H 搬运,时间是够用的。

如果单层 buffer 不够,还可以用多 buffer 策略——单数层用一个 buffer,双数层用另一个,甚至可以扩展更多 buffer。

性能收益:Prefill 和 Decode 双端提升

架构翻转带来的核心改变是:Block Pool 移至 DRAM,HBM 留出连续缓冲区,算子从 PagedAttention 替换为 ReshapedAttention。

连续寻址带来的优势很明显:HBM 寻址效率大幅提高,L2/L3 cache 命中率提升,整体性能收益显著。

FlashAttention 与 PagedAttention 相比,15%-20% 的性能差异大部分来自 Block 与 Slot Mapping 的额外开销。用 ReshapedAttention 替代后,这部分开销就省掉了。

**Prefill 阶段吞吐大幅提升。**在 decode 侧,引入稀疏 attention 策略——把 KV 分成四个区管理,实现平稳的 HBM 消耗曲线。DeepSeek V4 等新模型面临 top-k attention 问题,有多种窗口与选择机制(TBO、SWA 滑动窗口、SFA 选择区、Recurrent),虽然每次计算不需要全量 KV,但全量 KV 仍需保存。

分区控制后,Decode 阶段的 batch size 提升了 4-8 倍。

对于 DataInfer 等时延不敏感场景(不关心单次时延,关心系统吞吐),架构翻转带来的收益更突出:端到端性能提升 3 到 5 倍。

P 侧与 D 侧的 KV 搬运策略

在处理 Prefill 到 Decode 的 KV 转移时,传统方案采用「先 P 后 D」策略——Prefill 完成后才决定 KV 分配给哪个 Decode 节点。这在以对话为主的时代是合理的,因为无法提前预估 D 侧负载。

但进入 AI 时代后,Ken Zhang 的团队逐步转向「先 D 后 P」策略:先确定 Decode 节点,再做 Prefill 和新 KV 搬运。这样做的好处是实现轴层级的 KV 拉取,调度更精准。

同时在 Prefill 内部,同一个 step 内可以预取下一层 KV。

当前这个推理组件已经在管理数万张生成卡,被 GM、千问、盘古等多个模型使用,最近即将开源。

总结

Omni Cache 的核心思路并不复杂:把昂贵的 HBM 从「主力存储」变成「智能缓存」,让 DRAM 承担存储主力角色。通过架构翻转减轻 HBM 压力、连续寻址提升计算效率、分区管理优化 Decode 吞吐——这一套组合拳为大规模推理服务提供了实际的性能提升路径。


以上内容由Ai好记转录整理。
Ai好记是一款音视频转图文笔记的AI音视频总结工具,支持解析B站、抖音、小红书小宇宙等平台链接及本地/网盘音视频文件,转录后自动生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/23 11:39:52

B站弹幕情感分析系统设计与实现

1. 项目概述与背景B站弹幕作为视频内容的重要互动形式,每天产生数以亿计的实时评论数据。这些短文本蕴含着用户对视频内容的即时情绪反馈,但传统的情感分析方法难以有效处理弹幕特有的网络用语、缩写和表情符号。我们设计的这套系统,正是要解…

作者头像 李华
网站建设 2026/7/23 11:39:06

OpenAI Assistant API架构解析与开发实战

1. OpenAI Assistant API 架构解析OpenAI Assistant API 作为构建智能体的核心工具,其架构设计体现了现代大模型应用的典型范式。这套API本质上是一个多模态任务协调系统,通过模块化设计将语言模型的推理能力与实际工具操作相结合。1.1 核心组件与工作流…

作者头像 李华
网站建设 2026/7/23 11:38:45

Unity WebView中LaTeX数学公式渲染问题深度解析与实战解决方案

1. 项目概述:当数学公式遇上Unity WebView 在Unity中集成一个WebView组件来展示网页内容,是很多项目里实现内嵌浏览器、加载H5页面或者展示富文本的常见做法。然而,当这个网页内容里包含了LaTeX数学公式时,问题就来了。你可能会发…

作者头像 李华
网站建设 2026/7/23 11:38:03

留学申诉怕缺乏专属服务?多博学团队服务模式解析

留学是一场充满挑战与机遇的旅程,但在这个过程中,留学生们难免会遇到各种学术难题,如挂科、学术不端指控、拒信等。面对这些问题,许多留学生和家长往往感到焦虑和无助,不知道该如何解决。多博学DR.UNI作为一家专业的留…

作者头像 李华
网站建设 2026/7/23 11:37:07

AI应用开发核心技能与实战指南

1. 项目概述:AI应用开发入门指南作为一名在AI领域摸爬滚打多年的开发者,我经常收到这样的咨询:"看到AI开发岗位要求那么多技术栈就发怵,我这样的新手/转行者真的有机会吗?"今天我就用最直白的语言&#xff0…

作者头像 李华
网站建设 2026/7/23 11:35:15

AI命令行排障工具catpaw:自然语言交互系统诊断

1. 项目概述:当命令行排障遇上AI对话 在运维和开发工作中,排查系统问题往往需要记忆大量命令和参数组合。从查看CPU负载的 top -n 1 -b | grep "Cpu(s)" 到分析网络连接的 ss -tulnp ,再到检查磁盘IO的 iostat -x 1 3 &#…

作者头像 李华