news 2026/8/25 10:44:17

256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型

【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B

Ornith-1.5-35B-A3B 是 Ornith-1.5 家族中基于 MoE(Mixture of Experts,混合专家)架构的多模态推理模型:总参数约 35B,但每个 token 只激活约 3B 参数,推理成本接近小模型,却在 SWE-bench Verified、Terminal-Bench 等编码与 Agent 基准上全面超过 Gemma-4-31B 等稠密模型。

一、什么是 MoE:把"全员加班"改成"按需点将"

传统稠密模型处理每个 token 时,所有参数都要参与计算,模型越大、每次推理越贵。

MoE 的思路是:把每一层里最重的"专家网络"(FFN 模块)拆成很多个小组,再配一个路由器(Router),每个 token 只选少数几个专家来处理。这样:

  • 总参数大→ 知识容量大(能"记住"更多模式)
  • 激活参数小→ 单次推理计算量小、速度快

Ornith-1.5-35B-A3B 的名字就概括了它的身份:35B是总参数,A3B(Activated 3B)是每 token 实际激活的参数。

二、256个专家、每层选8个:它是怎么分配的

打开 config.json,能看到核心 MoE 参数:

关键配置数值含义
num_experts256每层配备 256 个专家 FFN
num_experts_per_tok8每个 token 只激活 8 个专家
num_hidden_layers40语言主干共 40 层
hidden_size2048隐藏层维度
moe_intermediate_size512单个专家内部宽度
vocab_size248320词表规模

也就是说,每层有 256 个专家,路由器为每个 token 挑选 8 个(约 3%)。256 个专家 × 40 层,就是它 35B 总参数的大头所在;而每次前向传播真正"干活"的只有 3B 左右,这就是 A3B 的由来。

从权重清单 model.safetensors.index.json 还能看到一个重要细节:每层除了 256 个可选专家外,还额外配了 1 个shared_expert(共享专家)。

🧠 为什么需要共享专家?被选中的 8 个专家只负责"个性化"能力,而所有 token 都会经过的共享专家则承载通用语言能力,两者相加,保证任何 token 都有稳定的基础能力托底。这是当前 MoE 模型的常见稳健设计。

三、不只是 MoE:线性注意力让长上下文更便宜

config.json里的layer_types字段揭示了另一个隐藏亮点——注意力混合结构

  • 每 4 层中有3 层是linear_attention(线性注意力),只有第 4 层是full_attention
  • 完整注意力层还采用 GQA(num_key_value_heads=2,仅 2 个 KV 头)

这意味着 262,144(256K)token 的上下文窗口下,历史信息的记忆与计算开销大幅降低,长文档、大代码库场景不再被 KV Cache 拖垮。这也是为什么官方推荐在 2×80GB GPU 上以 256K 上下文部署,并用--enable-prefix-caching复用前缀。

四、3B激活参数凭什么"碾压"稠密巨兽?

MoE 的优势不是玄学,而是三个因素的叠加:

  1. 容量与成本的解耦稠密模型想要更强能力,只能把每个 token 的计算量一起做大;Ornith-1.5-35B-A3B 用 256 个专家堆出 35B 容量,推理却只花 3B 的算力——"装得下大知识,跑得快"

  2. 稀疏激活 = 专家分工路由器让不同专家逐渐擅长不同类型的任务(语法、数学、代码、工具调用……),token 按需点将。对比同规模的 Qwen3.6-35B-A3B 和稠密的 Gemma-4-31B,Ornith-1.5-35B-A3B 在 Agent 编码类基准上领先幅度最大,正说明这种分工在"多步骤工具使用"上收益最高。

  3. 自改进训练放大了架构红利根据 README,Ornith-1.5 的突破在于端到端自改进循环:模型持续自己生成训练任务、构造求解脚手架、用强化学习打磨策略。好的架构(MoE + 线性注意力)提供了能力上限,自改进训练把上限兑现了出来。

五、官方基准成绩一览

以下为 README 公布的五次独立运行均值(节选):

基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B(稠密)Qwen3.5-397B
SWE-bench Verified79.073.452.076.4
SWE-bench Pro59.649.535.751.6
Terminal-Bench 2.1 (Terminus-2)67.852.542.153.5
NL2Repo46.229.415.536.8
GPQA Diamond89.286.084.388.4

可以看到:一个"只跑 3B 参数"的 MoE 模型,在多数编码/Agent 项上追平甚至超过了 397B 的 Qwen3.5——这就是稀疏激活对稠密大模型的降维打击。

六、新手部署速查:2×80GB 显卡跑满 256K 上下文

完整参数(bf16)约70GB,官方推荐 2×80GB GPU 部署,并保留 256K 上下文的显存余量:

  • 运行时要求:Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9
  • 关键启动参数:--tensor-parallel-size 2--max-model-len 262144、开启前缀缓存,并启用推理解析器(--reasoning-parser qwen3)与工具调用解析器
  • 建议采样参数:通用任务temperature=0.6, top_p=0.95, top_k=20(与 generation_config.json 一致)
  • 上下文不够用时:官方验证过 YaRN 缩放(factor=4.0 可扩到约 1M token)

⚠️ 注意:Ornith-1.5-35B-A3B 是推理模型,助手回复会先输出<think>…</think>思考块再给答案,服务端需开启 reasoning parser,否则思维链会混进正文。

七、写在最后:为什么值得你关注这个模型

对新手而言,Ornith-1.5-35B-A3B 的价值可以浓缩成三句话:

  1. MoE 让"大模型"变得可部署——35B 容量 + 3B 激活成本,双 80G 卡即可本地跑 Agent 编码;
  2. 256 专家 + 1 共享专家的组合,兼顾了专业分工与基础稳定;
  3. 线性注意力 + 256K 上下文,让它能吞下整个代码库,成为真正可用的终端编码 Agent。

想深入了解架构与自改进训练细节,可直接阅读仓库内的 README.md(含全部评测口径说明)与 config.json(全部结构参数)。

【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/25 10:38:25

腾讯云Lighthouse+WooCommerce:零基础2小时搭建跨境电商独立站

1. 项目概述&#xff1a;为什么选择这个技术栈&#xff1f;最近几年&#xff0c;身边做跨境电商的朋友越来越多&#xff0c;但很多人卡在了第一步&#xff1a;建站。平台抽成高、规则多变、客户数据不在自己手里&#xff0c;这些问题逼着大家开始琢磨独立站。我帮几个朋友从零开…

作者头像 李华
网站建设 2026/8/25 10:35:50

OpenClaw Discord服务器管理模块:权限、安全与性能优化实战

1. 项目概述&#xff1a;从“小龙虾”到Discord服务器管家最近在折腾一个叫OpenClaw的开源项目&#xff0c;圈内人戏称它为“小龙虾”。这玩意儿本质上是一个AI智能体&#xff08;Agent&#xff09;框架&#xff0c;能帮你把大语言模型&#xff08;比如Llama、GPT&#xff09;的…

作者头像 李华
网站建设 2026/8/25 10:35:44

深入理解AHB总线:SoC内部高性能数据传输的核心机制与实战应用

1. 从零开始理解AHB&#xff1a;为什么它是SoC的“主动脉”&#xff1f;如果你刚开始接触芯片设计&#xff0c;尤其是基于ARM架构的SoC&#xff0c;那么“AHB”这个词一定会高频出现。它听起来像是一个神秘的缩写&#xff0c;一堆文档里反复提及&#xff0c;但初看之下&#xf…

作者头像 李华
网站建设 2026/8/25 10:34:01

腾讯云轻量服务器采购攻略:2核4G配置与安全部署实践

1. 项目概述&#xff1a;一次精打细算的上云采购行动又到了一年一度的云服务采购旺季&#xff0c;对于很多中小团队、个人开发者或者刚起步的创业者来说&#xff0c;这无疑是一个优化成本、储备算力的黄金窗口期。今年腾讯云“上云采购季”的促销活动&#xff0c;特别是“轻量应…

作者头像 李华
网站建设 2026/8/25 10:33:06

电感充放电、LR和LC充放电电路Multisim电路仿真

目录 1 电感充放电基础知识及Multisim电路仿真 1.1 电感充放电基础知识 一、电感的核心特性 二、充电(通电)过程(S1开关置于1) 三、放电(断电)过程(S1开关置于1) 四、充放电最关键对比 五、和电容对比 六、最实用结论 1.2 电感充放电Multisim电路仿真 一、 波形核…

作者头像 李华
网站建设 2026/8/25 10:26:35

为什么 Next.js 打包比 Vue/React 大?

文章目录原因 1&#xff1a;Next.js 默认包含 SSR / RSC / Edge Runtime 等功能原因 2&#xff1a;Next.js 每个路由都有 Server & Client bundling原因 3&#xff1a;Next.js 默认使用 React&#xff0c;体积比 Vue 大原因 4&#xff1a;Next.js 的构建产物包含大量元数据…

作者头像 李华