PTTS,用规划-执行分离让测试时算力省一半

UCLA最新提出的PTTS(Planned Test-Time Scaling)方法,通过在测试时对多个推理分支进行显式规划与执行分离,有效解决了传统重复采样策略导致的算力浪费和模式塌缩问题。实验表明...

人工智能

在人工智能模型的测试阶段,如何高效利用计算资源一直是研究热点。传统的测试时扩展(Test-Time Scaling)方法,如best-of-N和self-consistency,虽然能提升模型表现,但其核心依赖于多次独立采样并从中选择最优解。然而,UCLA团队在9月23日发布的论文中指出,这种重复采样的方式存在根本性缺陷:k个分支往往高度相似,最终收敛到单一主导模式,导致大量算力被浪费在重复尝试上。

为解决这一问题,研究团队提出了PTTS(Planned Test-Time Scaling)方法。该方法的核心思想是将测试时的采样过程转化为一个协调的联合策略:首先由规划器(Planner)为每个推理分支生成一份差异化的解题大纲,然后由执行器(Executor)基于各自的大纲产出完整解答。通过这种方式,PTTS实现了从"重复抽奖"到"分工勘探"的转变,显著提升了算力使用效率。

文章配图

具体而言,PTTS包含两种实现方式:PTTS-ZS(零样本)和PTTS-RL(强化学习)。PTTS-ZS利用基础大语言模型生成多样化的大纲,并冻结一个强推理模型作为执行器;而PTTS-RL则通过强化学习优化规划器,使其能够根据任务需求动态调整推理预算。

实验结果显示,PTTS在多个数理推理基准测试中表现出色。以Qwen3-1.7B和4B模型为执行器,在pass@64指标上,PTTS-ZS相比传统重复采样方法提升了6.7个百分点,而PTTS-RL更是达到了13.4个百分点的提升。更重要的是,PTTS能够在约等于基线的算力开销下实现这些性能提升,相当于将所需算力降低了50%以上。

这项研究的意义不仅在于提升模型的推理效率,更在于揭示了测试时扩展方法的本质问题。通过显式地规划推理路径,PTTS为AI模型的测试阶段提供了一个全新的思路,有望推动相关技术在实际应用中的进一步发展。