news 2026/10/7 15:09:11

Strata 的工作原理

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Strata 的工作原理

Strata 是一个高性能推理引擎,目标是在单张消费级显卡(≥12GB VRAM)+ ≥32GB 系统内存 + SSD 的家用 PC 上运行 1250 亿参数的 MoE 模型(Qwen3.8-Flash-Next),达到 60–95 tokens/s 的生成速度

一句话总结

GPU 做每个 token 都要做的密集部分 + 热门专家,CPU 与 GPU 并行算冷门专家(专家全驻留 RAM),SSD 只放 n-gram 表,再用 MTP + prompt lookup 投机解码一次产出多个 token——通过把整个 PC 变成推理流水线,把 125B 模型塞进了 12GB 显卡。

核心思想:三级分层卸载

模型是 MoE 架构:48 层、共 24,576 个专家,但每个 token 只激活约 10 个专家——所以不需要把所有专家都放进显存

Strata 把工作分摊到三个硬件层级:

  • GPU(VRAM):存放每个 token 都需要的部分——attention 与 DeltaNet mixer、门控残差权重、路由器(router)、共享专家、输出头、MTP 草稿层、KV cache(长上下文时部分从 RAM 流式读取),以及一个自适应专家缓存,剩余显存全部用来装最常用专家(每多 1GB 显存约多放 ~700 个专家) 3
  • 系统 RAM:pin 住全部 24,576 个专家。当路由选中了不在 GPU 缓存中的专家时,CPU 用 AVX-512/AVX2 内核就地计算,与 GPU 并行,互不等待。低内存模式下可只保留 GPU 放不下的那部分专家
  • SSD:存放 28.8GB 的 n-gram 查找表,每 token 只读几行,走 OS 页缓存

同一套引擎既编译为 NVIDIA CUDA 也可编译为 AMD HIP

专家放置与取回路径

  • ExpertCache维护(layer, expert)→ VRAM 槽位的驻留表,并按每层配额分配槽位,防止靠前的层垄断显存
  • 缓存未命中时走ExpertSource/FileExpertSource:RAM 驻留专家由PinnedArena管理(可用大页、可部分注册给 CUDA 做 DMA),非驻留的从 SSD 按区间加载
  • resident_stage_swaps负责 GPU 缓存与 RAM 之间的专家换入换出

执行流程:

重叠执行与 CUDA Graph

  • session_token()串行调度 48 层的前向传播;由于残差链严格串行,CPU 专家计算通过解耦的 host 线程与 GPU 的非 MoE 块(attention 等)重叠,用 doorbell 异步协议隐藏 CPU 延迟
  • SessionState预先分配 KV cache、GDN 循环状态、激活缓冲和 PLE 状态(session_bytes/session_init),token 路径上零分配
  • SessionGraphs为每层捕获 CUDA graph,消除 kernel launch 开销(每层 kernel 很小,launch 开销是主要瓶颈)

投机解码("先猜后验")

  • 模型自带的MTP 层每次最多起草 3 个 token,一次 48 层前向即可验证全部草稿,平均每次接受 2.4–3.2 个 token,加速 1.6–1.8×
  • Prompt lookup:当回复与上下文重复(代码编辑、引用文本)时,SuffixDrafter从前文中起草最多 5 个 token;DraftPolicy只在实测接受率和成本划算时启用(代码编辑快 6–11%,其他场景不变)
  • 关键性质:草稿只是猜测,大模型验证决定每个词,输出质量完全不变。

长上下文预填充

  • 以最多 8,192 token 的大块做 prefill,吞吐超 1,000 tok/s;下一层专家在 attention 运行的同时经 PCIe 流式传输到 GPU
  • 会话有缓存(conversation cache),后续消息只读新增部分,秒级开始
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 15:08:51

营销技能包实战:用Claude Code构建SEO诊断与CRO优化流水线

1. 项目缘起:为什么我要把营销方法论拆成可复用的技能包做增长和营销这些年,我最头疼的一件事不是没想法,而是想法没法稳定复现。一个落地页文案写得好,下次换个产品又得从头憋;一次SEO关键词布局踩对了点,…

作者头像 李华
网站建设 2026/10/7 15:07:36

Pandas实战指南:环境搭建、数据清洗与网约车分析案例

做数据分析这几年,Pandas几乎是我每天都会打开的工具。很多人把它当成一个“处理表格的库”,但真正跑过几个项目之后你会发现,它更像是数据清洗、聚合、可视化的“瑞士军刀”。不管是给业务部门做报表,还是临时跑一份运营数据&…

作者头像 李华
网站建设 2026/10/7 15:07:24

【ptrade】沪深300ETF海龟突破 · 回测实录

03_海龟突破 回测实录 价格突破20日最高价买入,跌破10日最低价卖出。经典海龟法则的单标的版本。 策略类型:趋势跟踪 / 突破 回测批次:2026-10-04(本地 QuantStudio 回测引擎) 数据来源:QuantStudio 本地行情库(etf_daily / stock_daily) 一、策略思路 海龟法则的核心…

作者头像 李华
网站建设 2026/10/7 15:06:33

Spring Boot+Vue人事档案管理系统实战指南

简介:这是一套面向计算机专业本科生的毕业设计级人事档案管理系统实战项目,聚焦Spring Boot后端与Vue前端协同开发,解决中小型企业员工信息数字化管理痛点,适用于课程设计、期末大作业及Java全栈入门实践。资源包共242个文件&…

作者头像 李华
网站建设 2026/10/7 15:06:24

论文数据分析的“第二十二条军规”:为什么工具越智能,你越需要知道它在做什么 | aigcbiye官网www.aigcbiye.com 微信公众号搜一搜 aigcbiye

aigcbiye官网 微信公众号搜一搜 aigcbiye 一个奇怪的悖论 我教论文写作这些年,发现了一个特别拧巴的现象。 数据分析这一环,学生怕它,但真正让他们焦虑的,不是“不会跑SPSS”。SPSS有教程,B站上有的是。真正让人后背…

作者头像 李华