一句话总结
想提高 LLM 的推理效果,常见套路是砸算力:多采样几份答案、想得更久、请个验证器当裁判。这三条路在固定预算下互相抢钱,CoBa 把他们组织成一个算力分配问题:每一步在 “采样候选 / 轻验证 / 强验证 / 停” 四个动作里选择,在多个数学与符号推理基准上与多数投票打平,但算力节省了一半多
- 论文标题:CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing
- 论文地址:https://arxiv.org/abs/2608.07424
- 作者背景:长沙理工大学、上海交通大学
一、动机
推理时扩展(test-time scaling)用更多算力换取更高的推理精度。主流做法有三种:
- 多采样:同一道题答 N 遍,投票选多数
- 想更久:把思维链拉长,让模型多盘算几步
- 请裁判:用一个验证器给每份候选答案打分,挑分高的交卷
这三招在学界和实践中都被反复验证有效,但作者指出了两个结构性问题:
不灵活:如果额外算力固定,那么这三种操作便互斥,具体选用哪种方案的决策往往是一次性的
均匀开销:传统方案不看问题难度,对每个问题都使用同样的算力开销,处理简单题时存在浪费
容易想到的解法是在处理问题之前,先评估问题难度来做算力分配。对此作者更进一步:训练一个控制器,根据实际情况对不同环节单独分配算力
二、解决方案
2.1 状态-动作空间设计
CoBa(Compute-Balanced test-time scaling,算力平衡的测试时扩展)把推理过程建模成序贯决策。每个决策步 t 中,系统状态包括:当前候选集、验证器分数、剩余预算,以及答案多样性、候选长度token 开销等历史特征。动作空间包括:
- SAMPLE:采一个候选
- VERIFY_1 … VERIFY_L:由轻到重地调用验证器
- STOP:停止并交出当前答案
成本方面主要使用参数加权 token(param-weighted tokens)来度量,即每个模型消耗的 token 数乘以它的参数量(单位 B)。14B 模型处理一个 token 记 14 份钱,8B 模型只记 8 份,相当于工时乘以时薪
2.2 路由机制
验证器分四层:
- (V0)纯规则的答案频率统计(规则驱动,几乎免费)
- (V1)Qwen3-8B 轻量判官
- (V2)Phi-4-reasoning 过程验证器,给中间推理步骤打分
- (V3)Qwen3-14B 深度结果验证器
采样流程:
- 预热:采 2 份候选,拿到最基本的多样性
- 基础验证:V0 统计答案一致性,V1 给每份候选快速打分
- 收敛:若最高票答案占比 ≥ 0.6 且 V1 信心分 ≥ 0.7,则立刻交卷
- 加码:若未收敛就增加采候选
- 强验证:按 V1 分数与答案频率排序,把排名最靠前的 K 份送 V3 深度复核,而非全体送审
最终答案分数使用四路加权融合:
R = 0.20·答案频率 + 0.30·V1 分 + 0.15·V2 分 + 0.45·V3 分
三、实验结果
3.1 实验设置
不同方法各跑各的采样,运气好坏就能差出几个点。作者用离线回放协议把这个变量锁死:对每个 “数据集 × 生成器” 组合,先统一生成并存下每题 16 份候选,之后所有方法都在同一个候选池上回放,谁也不能另摸新牌
使用 3 个开源模型(Qwen3-14B、Phi-4-reasoning、Qwen3-8B)在 5 个基准上测试(MATH-500、AIME 2024、AIME 2025、AMC 2023、Reasoning Gym 困难子集)
3.2 主结果
宏平均口径下(15 个组合各算各的再取平均):CoBa-Routed-Strong(候选上限 8,4 份送强验证)基本打平自评加权投票,并且算力节省了 49%;略超 best-of-16 多数投票,并且算力节省了 59%
3.3 行为分布
为了进一步证实 CoBa 是通过按需分配来节省算力而非全局抠门,作者分析了系统的动作分布
简单基准上,系统一般轻量验证后就早停;越难的基准,加采样与强验证的动作占比越高,花钱模式随难度自适应