Inference Notes · 论文精读

English

← 全部笔记

Hill Sampling for Test-Time Scaling: A Simple and Better Alternative to Repeated Sampling, Evolution, and Training

Jacob Beck, Philip V. Ogren, Ari Kobren · Oracle

在解决该任务旨在为大型语言模型(LLM)分配测试时算力,以有效发现可验证的算法和数学解,并探究复杂的进化机制是否真的必要。

结论它表明使用简单贪心更新的 Token 采样比扰动权重或维护复杂种群提供更强、更廉价的探索,尽管其主打的 SOTA 结果依赖于浮点敏感环境下的单一最佳随机种子,并且在缺乏特定领域提示的情况下表现不佳。

AgentInference
发表 · arXiv 2609.25510
精读于2026-09-23
可信度机制: 高 (算法简单). 涨点: 中 (3个随机种子,存在浮点敏感性). 泛化性: 中 (仅针对标量数学任务).
阅读范围Full LaTeX source, all 2 files incl. appendix given in full; 4 of 15 figures viewed by the reader
精读Gemini 3.1 Pro · 经独立审校

1. 任务

这篇论文致力于解决可验证数学与算法发现(verifiable algorithmic discovery)中的测试时扩展(test-time scaling)问题。给定一个形式化问题(如将圆打包进正方形)和一个能返回标量奖励的可执行评估器,目标是利用 LLM 的推理算力生成并不断改进候选程序,从而发现更优的数学对象。

这个问题的难点在于程序搜索空间巨大,模型很容易陷入局部最优,或者发生模式崩溃(mode-collapse)导致只生成安全但低奖励的代码。此前的方案(如 FunSearch, AlphaEvolve, ShinkaEvolve)通常使用复杂的进化算法——维护种群归档、强制多样性、交叉重组,甚至在测试时更新模型权重(EvoTune, TTT-Discover)。

本文针对一个核心空白:这些复杂的进化和 RL 机制到底有多少是必需的?作者假设,一个极其简单的方案或许就能达到相当甚至更好的发现效果。

2. 核心思路

Hill Sampling(爬山采样): 抛弃种群、归档和权重更新,直接从冻结的 LLM 中不断采样候选代码,评估后只保留迄今为止找到的唯一最佳程序。所有后续的代码编辑都以此最佳程序为上下文。如果新生成的代码更好,就替换它;否则丢弃。

3. 机制 + 心智模型

机制:

  1. 初始化起始程序 $x_0$ 并评估其奖励 $r^*_0$。
  2. 在第 $t = 0 \dots M-1$ 轮:
  3. 从冻结的 LLM 中,以固定的解码温度(如 $T=1.0$),在当前最佳程序 $x_t$ 的上下文中独立采样 $N$ 个候选编辑($y_{t,1} \dots y_{t,N}$)。(实验中 $N=64$ 或 $512$)。
  4. 执行所有候选程序,得到奖励 $r_{t,i}$。
  5. 找出本轮最高奖励 $r_{t,i^}$ 及对应程序 $y_{t,i^}$。
  6. 如果 $r_{t,i^} \ge r^t$,则更新当前最佳程序 $x{t+1} = y_{t,i^*}$ 并更新最高奖励。否则保持 $x_{t+1} = x_t$不变。
  7. 重复直至算力预算耗尽。

心智模型: 在高温度下对冻结模型进行 Token 级别的采样,相比于扰动模型连续参数或进行进化交叉,能提供更丰富、更强力的程序空间探索。将这种强大的探索与贪心的“保留最佳”策略结合,足以驱动优化过程。

4. 指标 / 数据集

5. 对比 baseline

6. 开源

论文中未提及。(作者称基于开源的 OpenEvolve 框架构建,并记录了超参数,但并未提供自己代码的 URL)。

7. 关键数字核实

说法 出处 实际条件 成立? 备注
在已发表方法中创下 circle packing 新 SOTA Tab 1, §1 14 轮, gpt-oss-20b, zero-slack 评估器 ⚠️ 击败已发表的 ThetaEvolve,但这是 3 个随机种子中的最大值,而非期望回报,并且依赖于对浮点运算顺序极度敏感的无容差 (zero-slack) 评估。
在 Erdos 问题上超越 AlphaEvolve Tab 1, §1 70 轮, Mistral-24B 仍低于使用了 120B 模型的 TTT-Discover。
在 Sets 上取得 strong results Tab 1, Fig 1 2 轮, OLMo-32B ⚠️ 仅达到 AlphaEvolve 的 95%。所有 baseline 打平,暗示受限于领域知识。
仅需数小时的 wall-clock time Tab 1, Abstract 8x H100s Circles: 4:33, Sets: 1:13, Erdos: 12:00。
零学习率 (Model Noise) 的最大奖励超越学习后的 ES Fig 2, §5.1 Circles, $\sigma=10^{-3}$, $T=0$ ES 更新提高了平均奖励,但主动破坏了最大奖励。
Token 采样优于 Model Noise Fig 3, §5.1 Erdos 及其 Circles Temp=1 的 Repeated Sampling 击败了固定权重扰动。
复杂的多样性/RL 机制没有帮助 Fig 5, §5.3 Erdos Top-K、执行反馈和 In-context RL 表现均不如基础的 Hill Sampling。

8. 摘要没说的

9. 可达性与启发

10. 置信度与下一步

11. 审校记录