Thomson Reuters 的论文《Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck》是首个在不可精确验证的开放生成任务上对五类测试时扩展(TTS)方法做算力归一化对比的工作,结论是:瓶颈不在「生成更多候选」(探索有效),而在「从候选池里选出最终答案」(利用失效)。这与本站此前介绍的《LLM-as-a-Verifier》把验证当作缩放轴的系列不同——在开放生成任务上,验证器恰恰是失效环节。
算力归一化的方法族对比
实验覆盖五个没有精确验证器的开放生成基准:HealthBench(5000 题医学)、LEXam(516 题法律)、PRBench(1650 题金融/法律)、WildBench(1024 题通用对话)、WritingBench(555 题创意写作)。六种方法在四档算力下对比,算力档对应 Best-of-N(BoN)N=2/4/8/16 的输出 token 量:BoN、Beam Search、Particle Filter(PF)、Sequential Refinement(SR)、Fusion,另加 Budget Forcing 对照。生成器覆盖 OLMo3-7B-Think、OLMo3.1-32B-Think、Qwen3.5-9B 与 Qwen3.5-35B-A3B 四个模型,四档算力在 25% 容差内对齐。探索侧全部有效:oracle 质量随算力单调上升,说明「多采候选」本身是有效的;论文同时给出偏差校正的 oracle 估计器,因为 naive oracle 会系统性高估可用质量。论文的理论部分推导出 BoN 的头空捕获约等于验证器相关性 rho_v,实测回归为 y=1.198*rho_v-0.011(R²=0.66,p<10^-36)。
利用侧全面失效
用统一裁判 Qwen3.5-397B-A17B 与各基准原生裁判对齐后,在 152 个样本上测得:Skywork-Reward-V2-Llama-3.1-8B 的 Spearman 相关 rho_v 仅 0.120,Llama-3.1-70B-Instruct-RM-RB2 为 0.107——当前一代开源奖励模型在开放生成上几乎无法区分好坏,基于它的 BoN 选择近乎随机。头空捕获(方法实际回收的、多候选可带来质量增益的比例)定义为 h=(BoN@16-单样本均值)/(Oracle@16-单样本均值),跨基准平均下来,Fusion 约 40%,BoN 只有约 15%;算力、奖励模型规模、生成器规模三条缩放轴都补不上这个差距。论文的概括是:候选池不是瓶颈,从里面选才是。
树搜索与自我修正的失败模式
两种经典方法的失败方式各不相同。树搜索在多样性上坍缩:Particle Filter 最终输出的平均成对余弦距离只有 0.036-0.069,BoN 为 0.123-0.124;WritingBench 上 16 个粒子相似度 >=0.997,等效于单条轨迹;正文记录树搜索的多样性只剩独立采样的 40-60%,它在探索与利用两侧同时失败。Sequential Refinement 只在五个基准中的一个(PRBench)真实提升:HealthBench 与 LEXam 上逐轮变差;WildBench 的增益全部来自 Coding & Debugging 单一子任务,剔除后净回退;WritingBench 的表观增益被冗长度混淆(SR 长度-分数相关 rho=+0.33,BoN 为 +0.20,裁判的内容/长度判别力只有 0.7 倍)。
可复现的最小验证
统一裁判本身经过信效度校验:HealthBench 上对医生标注的 Macro F1 为 0.679(高于标注者间一致均值),PRBench 的 kappa 为 0.679。主结果表(Qwen3.5-35B-A3B 单模型)里,HealthBench 的 BoN 从 Low 到 XHigh 算力档停在 0.536→0.539,Fusion 为 0.574→0.588;PRBench 是 0.292→0.292 对 0.315→0.331;LEXam 是 0.525→0.530 对 0.546→0.547。Beam Search 与 Particle Filter 全面低于单样本基线。论文把 Fusion 定位为目前唯一一致有效的方法,而非解决方案——剩余约六成头空仍是开放问题。对个人开发者,核心洞察数小时内可复现:在小规模开放任务上采样 N 个候选,用 LLM 裁判打分,对比 BoN 选择与合成式 Fusion,单卡或 API 调用即可,无需论文级的算力规模。