会算账的推理:CoBa 如何用一半不到的算力,站进 best-of-16 的精度区间

发布时间:2026/9/13 21:28:16
会算账的推理:CoBa 如何用一半不到的算力,站进 best-of-16 的精度区间 一句话总结想提高 LLM 的推理效果常见套路是砸算力多采样几份答案、想得更久、请个验证器当裁判。这三条路在固定预算下互相抢钱CoBa 把他们组织成一个算力分配问题每一步在 “采样候选 / 轻验证 / 强验证 / 停” 四个动作里选择在多个数学与符号推理基准上与多数投票打平但算力节省了一半多论文标题CoBa: Cost-Effective Test-Time Scaling via Compute-Balanced Routing论文地址https://arxiv.org/abs/2608.07424作者背景长沙理工大学、上海交通大学一、动机推理时扩展test-time scaling用更多算力换取更高的推理精度。主流做法有三种多采样同一道题答 N 遍投票选多数想更久把思维链拉长让模型多盘算几步请裁判用一个验证器给每份候选答案打分挑分高的交卷这三招在学界和实践中都被反复验证有效但作者指出了两个结构性问题不灵活如果额外算力固定那么这三种操作便互斥具体选用哪种方案的决策往往是一次性的均匀开销传统方案不看问题难度对每个问题都使用同样的算力开销处理简单题时存在浪费容易想到的解法是在处理问题之前先评估问题难度来做算力分配。对此作者更进一步训练一个控制器根据实际情况对不同环节单独分配算力二、解决方案2.1 状态-动作空间设计CoBaCompute-Balanced test-time scaling算力平衡的测试时扩展把推理过程建模成序贯决策。每个决策步 t 中系统状态包括当前候选集、验证器分数、剩余预算以及答案多样性、候选长度token 开销等历史特征。动作空间包括SAMPLE采一个候选VERIFY_1 … VERIFY_L由轻到重地调用验证器STOP停止并交出当前答案成本方面主要使用参数加权 tokenparam-weighted tokens来度量即每个模型消耗的 token 数乘以它的参数量单位 B。14B 模型处理一个 token 记 14 份钱8B 模型只记 8 份相当于工时乘以时薪2.2 路由机制验证器分四层V0纯规则的答案频率统计规则驱动几乎免费V1Qwen3-8B 轻量判官V2Phi-4-reasoning 过程验证器给中间推理步骤打分V3Qwen3-14B 深度结果验证器采样流程预热采 2 份候选拿到最基本的多样性基础验证V0 统计答案一致性V1 给每份候选快速打分收敛若最高票答案占比 ≥ 0.6 且 V1 信心分 ≥ 0.7则立刻交卷加码若未收敛就增加采候选强验证按 V1 分数与答案频率排序把排名最靠前的 K 份送 V3 深度复核而非全体送审最终答案分数使用四路加权融合R 0.20·答案频率 0.30·V1 分 0.15·V2 分 0.45·V3 分三、实验结果3.1 实验设置不同方法各跑各的采样运气好坏就能差出几个点。作者用离线回放协议把这个变量锁死对每个 “数据集 × 生成器” 组合先统一生成并存下每题 16 份候选之后所有方法都在同一个候选池上回放谁也不能另摸新牌使用 3 个开源模型Qwen3-14B、Phi-4-reasoning、Qwen3-8B在 5 个基准上测试MATH-500、AIME 2024、AIME 2025、AMC 2023、Reasoning Gym 困难子集3.2 主结果宏平均口径下15 个组合各算各的再取平均CoBa-Routed-Strong候选上限 84 份送强验证基本打平自评加权投票并且算力节省了 49%略超 best-of-16 多数投票并且算力节省了 59%3.3 行为分布为了进一步证实 CoBa 是通过按需分配来节省算力而非全局抠门作者分析了系统的动作分布简单基准上系统一般轻量验证后就早停越难的基准加采样与强验证的动作占比越高花钱模式随难度自适应