news 2026/9/29 15:09:26

三个本地26B/35B大模型实际运行状况对比报告

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
三个本地26B/35B大模型实际运行状况对比报告

三个本地模型实际运行状况对比报告

数据来源:三份 llama-server 运行日志(真实会话记录,非理论值)

模型日志文件运行时段日志时长
gemma-4-26bgoogle-gemma-4/llama_server_20260927_203847-045.log2026-09-27 20:38~53 分钟
Ornith-1.5-35BOrnith-1.5-35B/llama_server_20260914_170912-045.log2026-09-14 17:09~6.1 小时(366 分钟)
Qwen3.6-35B-Claude4.7OpusQwen3.6-Claude4.7Opus-35B/llama_server_20260926_211005-045.log2026-09-26 21:10~65 分钟

一、测试环境(三者一致)

  • 构建:llama-b9297-bin-win-cuda-12.4-x64
  • 硬件:CUDA0 = RTX 4060 8G(主)、CUDA1 = Quadro RTX 3000 12G(副);CPU i9-12950(24 线程 / 32G 内存)
  • 共性启动参数:--split-mode layer+-ts、--cpu-moe(expert 权重放内存)、--no-mmap、--mlock、KV cacheq8_0、-fa on、--ctx-checkpoints 0、--reasoning off
  • 接口:llama-server 监听0.0.0.0:8080,由 8001 token 代理转发




二、三个模型的实际运行状况

1. gemma-4-26b(gemma-4-26B_q4_0-it.gguf)

项目实测值
模型体积 / 量化13.77 GB / q4_0(26B MoE A4B,约 3.8B 激活;hybrid 注意力,40 层中仅 10 层全注意力)
多模态✅ mmproj 1139.46 MiB(gemma4v 投影器)加载成功
本次运行上下文n_ctx = 262144(= n_ctx_train,无需 YaRN)
prefill 速度643~661 t/s(全场最快、最稳;44K prompt = 69.1 s,54K prompt = 82.3 s)
生成速度12.9~17.6 t/s,典型 ≈13 t/s
投机解码❌ 无(no implementations specified for speculative decoding)
单轮最长输出2460 tokens 生成耗时213.6 s(≈11.5 t/s)
本次会话最大上下文67,342 tokens(truncated = 0,无截断)
本次会话规模13,429 次 graph 复用
日志中的异常⚠️VirtualLock 12846383104-byte buffer failed(Windows 无 SeLockMemoryPrivilege,--mlock实际未生效);⚠️pooling_type [-1] but [1] specified(--embeddings --pooling mean对纯聊天无用)

实际观察:超长 prompt 的预处理极快(54K 仅 82 秒),但生成偏慢。日志中大量"长 prompt 输入 + 短回答"模式(每轮 4.8 万~5.4 万 token 输入、几百 token 输出),是典型的"整仓/长文档阅读"用法。

2. Ornith-1.5-35B-A3B(APEX-MTP-I-Mini)

项目实测值
模型体积 / 量化13.70 GB(35B MoE A3B,约 3B 激活;含 nextn/MTP 层)
多模态✅ mmproj 857.60 MiB 加载成功
本次运行上下文n_ctx = 131072(日志当时的配置;当前 bat 已提升到 262144)
prefill 速度356~452 t/s(三个模型中最慢;随上下文增长从 452 降到 356)
生成速度13.5~21.3 t/s(三个模型中最快,MTP 生效时可达 20+ t/s)
投机解码✅MTPdraft-mtp实际生效,--spec-draft-n-max 1;累计接受 17,842 / 生成 19,523 ≈ 91.4%(单轮区间 77%~100%)
超长 prompt 实测114,567 tokens 的 prefill 耗时 321 s(5.4 分钟),生成 204 tokens
本次会话最大上下文114,771 tokens(接近 131072 上限,truncated = 0)
本次会话规模19,288 次 graph 复用,连续运行 6 小时无重启
日志中的异常无(全程 0 错误、0 截断、0 取消)

实际观察:本质是"长会话 / 长输出"型模型。MTP 让解码速度成为三者最快,但--cpu-moe让 expert 走内存带宽,导致 prefill 成为三者最慢——超长 prompt 的等待成本很高(114K ≈ 5.4 分钟)。日志中 prompt cache 本次为关闭状态(--cache-ram N未开)。

3. Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled

项目实测值
模型体积 / 量化16.49 GB(35B MoE A3B,约 3B 激活;Claude 4.7 Opus 推理蒸馏版)
多模态✅ mmproj 857.60 MiB 加载成功
本次运行上下文n_ctx = 262144
prefill 速度484~527 t/s(首轮 527,随长度衰减到 ~484;99K prompt = 205 s)
生成速度11.2~15.8 t/s,典型 ≈14 t/s(长推理输出时降到 ~11 t/s)
投机解码⚠️ 配置了 checkpoint 式投机(speculative decoding will use checkpoints)但未真正生效(no implementations specified)
跨轮缓存❌ 每轮都forcing full prompt re-processing(SWA/hybrid 架构 + 关闭 checkpoint,无法复用前缀)
本次会话最大上下文99,244 tokens(truncated = 0)
本次会话规模3,022 次 graph 复用,运行 ~65 分钟
日志中的异常⚠️embeddings enabled with n_batch (3072) > n_ubatch (2048),被强制降为 2048(--embeddings无用开销)

实际观察:prefill / 生成都居中,最突出的问题是"每轮全量重算前缀"——99K 的长会话每轮都要 200 秒左右重跑 prefill,这是它最大的实用瓶颈。


三、核心指标横向对比

指标gemma-4-26bOrnith-1.5-35BQwen3.6-35B-Claude4.7Opus
模型体积13.77 GB13.70 GB(最小)16.49 GB(最大)
架构26B MoE A4B35B MoE A3B35B MoE A3B
本次运行上下文262,144131,072262,144
prefill(t/s)~650(最快)~400(最慢)~500
生成(t/s)~13~18(最快)~14
MTP 投机解码无有(接受率 91%)无
多模态✅(1139MB mmproj)✅(858MB mmproj)✅(858MB mmproj)
超长 prompt 等待54K / 82 s114K / 321 s99K / 205 s
跨轮 prefix 复用❌❌❌
日志内错误2 条警告01 条警告
连续运行53 分钟6.1 小时65 分钟

四、优劣对比

gemma-4-26b

  • 优势:prefill 吞吐最高且稳定(650 t/s),喂长 prompt 最省时间;体积小、加载快;多模态已实测可用。
  • 劣势:无 MTP,生成最慢(~13 t/s);长输出(2400+ token)单轮要 3.5 分钟;--mlock在 Windows 上失效,模型页可能被换出;--embeddings --pooling mean属于无用开销并产生警告。
  • 定位:“读得快、写得慢”—— 长输入、短输出。

Ornith-1.5-35B-A3B

  • 优势:唯一真正跑起 MTP 的模型,生成最快(~18 t/s,峰值 21+);13.70GB 体积最小;日志全程零错误、连续 6 小时稳定;上下文曾吃满 114K。
  • 劣势:prefill 三者最慢(~400 t/s,114K 要 5.4 分钟),超长 prompt 的体验最差;--cpu-moe使 prefill 受内存带宽限制,加大 batch 收益有限。
  • 定位:“写得快、读得慢”—— 中短输入、长输出。

Qwen3.6-35B-A3B-Claude-4.7-Opus

  • 优势:指标均衡(prefill ~500、生成 ~14);Claude 4.7 Opus 推理蒸馏,指令遵循 / 推理风格更贴近高质量 agent 场景;26 万上下文。
  • 劣势:投机解码配置了却没生效;每轮强制全量重 prefill,长会话(99K)每轮约 200 s,累积等待最痛;体积最大(16.49GB),显存最紧;--embeddings导致 batch 被降级。
  • 定位:“均衡型 agent 推理模型”,但长会话成本高。

五、适用的任务建议

任务类型首选理由(基于实测)
长文档 / 整仓阅读理解、代码审阅、摘要问答(输入极大、输出较短)gemma-4-26bprefill 650 t/s,54K 输入仅 82 s,等待最短
长文写作、报告生成、长链推理(输出 token 多)Ornith-1.5-35B生成 ~18 t/s + MTP 接受率 91%,长输出总耗时最低
多轮 agent / 工具调用 / 指令遵循密集任务(prompt 中等)Qwen3.6-35B-Claude4.7Opus推理蒸馏、指令遵循好;但需把 prompt 压在 ~50K 以内,否则每轮重算代价大
图片理解 / 多模态问答三者均可三个 mmproj 都已加载成功;gemma4v 对图片尺寸上限更敏感(勿加--image-min-tokens)
超长上下文(>100K token 一次性灌入)gemma-4-26b(若 128K 够用)或 Ornith(需吃满)gemma prefill 最快;Ornith 实测能吃 114K 但等待 5 分钟级
需要长时间连续服务、稳定性优先Ornith-1.5-35B日志连续 6.1 小时零错误
显存/内存最紧张时Ornith-1.5-35B体积 13.70GB,三者最小


六、实测暴露的共性问题与优化建议

  1. 三者都无法复用跨轮前缀(SWA/hybrid 架构 +--ctx-checkpoints 0),长会话每轮都要全量重 prefill:

    • Qwen 99K ≈ 205 s / 轮、Ornith 114K ≈ 321 s / 轮、gemma 54K ≈ 82 s / 轮。
    • 这是当前长会话最大的时间成本,应在选型时优先考虑"prompt 长度 vs 模型"的匹配。
  2. --cpu-moe是双刃剑:换来 131K~262K 长上下文,但 prefill 变成内存带宽瓶颈(Ornith 最明显),生成也变慢。若某模型不需要超长上下文,去掉--cpu-moe可显著提速。

  3. --mlock在 Windows 上无效(gemma 日志明确报VirtualLock ... failed),需要真正锁内存时应改用其他方式或接受换页风险。

  4. --embeddings --pooling mean对纯 chat 场景无收益:gemma 产生 pooling 警告,Qwen 因n_batch(3072) > n_ubatch(2048)被强制降 batch。建议移除。

  5. Ornith 的--image-min-tokens 1024需谨慎:若配套 mmproj 缺少image_max_pixels/image_min_pixels键,mtmd 会把 token 下限换算成像素下限从而触发clip_init中止(gemma 已踩过此坑并移除该参数);建议换 mmproj 时复查这一项。

  6. 长 prompt 超时防护依赖 8001 代理的 SSE 心跳:服务端--timeout需设为-1(Ornith bat 已设),且不要让"超时重试型"客户端直连 8080,否则 prefill 会被反复取消、永远跑不完。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 15:09:24

OpenCode CLI 无法复制问题解决办法 会提示 “Copied to clipboard“,

OpenCode CLI 无法复制后会提示 “Copied to clipboard”,但实际按 CtrlV / CtrlShiftV 粘贴出来的还是旧内容,或者根本粘贴不出任何东西 问题现象 OpenCode CLI 在终端里选中文本后会提示 “Copied to clipboard”,但实际按 CtrlV / CtrlS…

作者头像 李华
网站建设 2026/9/29 15:09:05

百创短视频创新模式如何值得信赖吗

重庆百创星图互联网科技有限公司作为重庆AIGEO头部服务商,主打(短视频AIGEO)双全案一站式企业线上推广获客服务,定位服务长线布局线上的突破型企业,助力企业低成本完成全域流量布局,高效获取精准客资。技术与研发实力作为重庆地区…

作者头像 李华
网站建设 2026/9/29 15:09:05

昌平区近视防控眼镜靠谱服务商有哪些:楠瓜视光综合实力推荐

说起青少年近视防控,很多家长都在昌平区找靠谱的近视防控服务商,也听过不少家长踩坑:有的选了普通商业眼镜店,只配了镜却控制不住度数,半年涨了近百度;有的挤去大医院排队大半天,医生几句话就打发&#xff…

作者头像 李华
网站建设 2026/9/29 15:08:43

Windows多线程编程:从线程创建到UI卡死解决

01 线程创建:先搞清楚你为什么要"多线程" 写 Windows 程序遇到"卡死"几乎是每个初学者都会撞上的墙。我最早用 Win32 API 写一个小工具,主窗口里放一个"开始处理"按钮,点击后要批量读取文件做格式转换。文件一…

作者头像 李华
网站建设 2026/9/29 15:08:03

内容被写进了哪个文件:重定向这一层的三条规则

授权与合规声明 本文全部操作对象均为自建隔离靶场(本机容器或隔离虚拟机),涉及安全测试的环节必须以取得合法授权为前提。未经授权的渗透测试违反《中华人民共和国网络安全法》与《刑法》相关条款,须承担相应法律责任。本文只讲环…

作者头像 李华
网站建设 2026/9/29 15:07:51

光盾苍穹:国防、航天与安全的光电融合革命

国防、航天与安全是光电融合技术中“要求最极端、对抗最激烈、战略价值最高”的领域。在这里,光电融合的核心逻辑是:光承担高速保密通信、高精度侦察感知、定向能毁伤和量子安全密钥分发,电承担实时决策、火控解算、多源融合和平台控制&#…

作者头像 李华