論文の概要: Hill Sampling for Test-Time Scaling: A Simple and Better Alternative to Repeated Sampling, Evolution, and Training
- arxiv url: http://arxiv.org/abs/2609.25510v1
- Date: Tue, 22 Sep 2026 00:08:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.158358
- Title: Hill Sampling for Test-Time Scaling: A Simple and Better Alternative to Repeated Sampling, Evolution, and Training
- Title(参考訳): テスト時間スケーリングのためのヒルサンプリング: 繰り返しサンプリング、進化、トレーニングのためのシンプルで優れた代替手段
- Abstract要約: 大規模言語モデル(LLM)は、テスト時間にさらなる計算を費やすことで、検証可能な科学的およびアルゴリズム的な問題の解を改善することができる。
近年のシステムは、より精巧な進化的探索ハーネスや、テスト時間トレーニング中にモデルパラメータを更新することによって、強力な結果が得られる。
凍結したLLMから候補プログラムの編集を繰り返す簡単な手順であるHill Samplingを紹介する。
- 参考スコア(独自算出の注目度): 4.135051601703708
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) can improve solutions to verifiable scientific and algorithmic problems by spending additional computation at test time. Recent systems achieve strong results with increasingly elaborate evolutionary search harnesses or by updating model parameters during test-time training. We ask how much of this machinery is necessary. We introduce Hill Sampling, a simple procedure that repeatedly samples candidate program edits from a frozen LLM, retains the best program found so far, and conditions all subsequent samples on that program. We evaluate the method on circle packing, sums/differences of sets, and Erdos' minimum-overlap problem using three open-weight models. Hill Sampling sets a new state of the art on circle packing among published methods, improves over the AlphaEvolve reference on Erdos' minimum-overlap problem, and achieves strong results on sums and differences of finite sets. The circle-packing and Erdos results require only hours of wall-clock time on eight NVIDIA H100 GPUs. To our knowledge, we also conduct, the largest study, by parameter count, of evolution strategies (ES) applied directly to LLM weights at test time. Surprisingly, learning the weights is worse than setting the ES learning rate to zero: at zero learning rate, the method is still searching in weight space through fixed random perturbations. Those perturbations can help exploration, but randomness from token sampling is stronger still, and repeated sampling remains substantially weaker than Hill Sampling. These results suggest a simple test-time compute allocation strategy: repeatedly sample edits to the best verified solution found so far, before introducing additional complexity such as adding archives, diversity mechanisms, evolutionary scaffolds, or test-time parameter learning.
- Abstract(参考訳): 大規模言語モデル(LLM)は、テスト時間にさらなる計算を費やすことで、検証可能な科学的およびアルゴリズム的な問題の解を改善することができる。
近年のシステムは、より精巧な進化的探索ハーネスや、テスト時間トレーニング中にモデルパラメータを更新することによって、強力な結果が得られる。
私たちはこの機械のどれ程が必要か尋ねる。
凍結したLCMから候補プログラムの編集を繰り返す単純な手順であるHill Samplingを導入し、これまで見つかった最良のプログラムと、その後のプログラムの全てのサンプルを条件に保持する。
3つのオープンウェイトモデルを用いて、円のパッキング、集合の和/差、エルドスの最小オーバーラップ問題を評価した。
Hill Sampling は、公表された方法間の円のパッキングに関する新しい最先端の状態を設定し、エルドスの最小オーバーラップ問題に関するAlphaEvolve参照を改善し、有限集合の和と差に関する強い結果を得る。
circle-packingとErdosの結果は8つのNVIDIA H100 GPU上で数時間のウォールタイムしか必要としない。
また,本研究では,LLM重みに直接適用した進化戦略(ES)について,パラメータ数による最大の研究を行う。
驚くべきことに、重量の学習はES学習率を0に設定するよりも悪い: 学習速度ゼロでは、固定されたランダムな摂動を通してまだウェイト空間を探索している。
これらの摂動は探索に役立つが、トークンサンプリングからのランダム性は依然として強く、繰り返しサンプリングはヒルサンプリングよりもかなり弱いままである。
これらの結果は、単純なテストタイムの計算割り当て戦略を示唆している。アーカイブ、多様性メカニズム、進化的な足場、テストタイムパラメータ学習などの複雑さを導入する前に、これまで見つかった最も検証されたソリューションを何度もサンプルで編集する。
関連論文リスト
- $S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models [10.157422365382933]
テスト時間スケーリングは、より多くの推論計算が与えられたとき、固定拡散言語モデル(DLM)がより良い出力を生成できるかどうかを調べる。
S3$ (Stratified Scaling Search) は,デノナイズ処理中に計算を再配置することで生成を改善するバリデーション誘導探索法である。
LLaDA-8B-Instruct on MATH-500, GSM8K, ARC-Challenge, TruthfulQA による実験では、S3$ はベンチマーク全体のパフォーマンスを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-07T00:51:06Z) - Learning to Reason Across Parallel Samples for LLM Reasoning [48.41933431325965]
大規模言語モデル(LLM)において、テスト時間計算のスケーリングは大幅なパフォーマンス向上をもたらす
本稿では,このような複数のサンプル集合を利用する新しい手法を提案する。
5つの推論データセットの実験は、SSAの有効性と効率を実証している。
論文 参考訳(メタデータ) (2025-06-10T17:42:35Z) - Satori-SWE: Evolutionary Test-Time Scaling for Sample-Efficient Software Engineering [51.7496756448709]
言語モデル(LM)は、コーディングベンチマークではうまく機能するが、現実のソフトウェア工学のタスクでは苦労する。
既存のアプローチは、高品質なデータによる教師付き微調整に依存している。
本研究では, 生成を進化過程として扱うサンプル効率の高い手法であるテスト時間スケーリング(EvoScale)を提案する。
論文 参考訳(メタデータ) (2025-05-29T16:15:36Z) - Nearly Optimal Sample Complexity for Learning with Label Proportions [54.67830198790247]
トレーニングセットの例をバッグにグループ化する部分情報設定であるLLP(Learning from Label Proportions)について検討する。
部分的な可観測性にもかかわらず、ゴールは個々の例のレベルで小さな後悔を達成することである。
我々は, LLPの2乗損失下でのサンプル複雑性について, 標本複雑性が本質的に最適であることを示す。
論文 参考訳(メタデータ) (2025-05-08T15:45:23Z) - Sample, Don't Search: Rethinking Test-Time Alignment for Language Models [55.2480439325792]
新しいテストタイムアライメントアプローチであるQAlignを紹介します。
テスト時間計算をスケールする際、QAlignは各プロンプトの最適配向分布からのサンプリングに収束する。
マルコフ連鎖モンテカルロのテキスト生成における最近の進歩を取り入れることで、基礎となるモデルを変更したり、ロジットアクセスを必要とせずに、より良い整合出力を可能にする。
論文 参考訳(メタデータ) (2025-04-04T00:41:40Z) - Towards Automated Imbalanced Learning with Deep Hierarchical
Reinforcement Learning [57.163525407022966]
不均衡学習はデータマイニングにおいて基本的な課題であり、各クラスにトレーニングサンプルの不均等な比率が存在する。
オーバーサンプリングは、少数民族のための合成サンプルを生成することによって、不均衡な学習に取り組む効果的な手法である。
我々は,異なるレベルの意思決定を共同で最適化できる自動オーバーサンプリングアルゴリズムであるAutoSMOTEを提案する。
論文 参考訳(メタデータ) (2022-08-26T04:28:01Z) - Sampling Through the Lens of Sequential Decision Making [9.101505546901999]
我々はアダプティブ・サンプル・ウィズ・リワード(ASR)と呼ばれる報酬誘導型サンプリング戦略を提案する。
提案手法は,サンプリング過程を最適に調整し,最適性能を実現する。
情報検索とクラスタリングの実証的な結果は、異なるデータセット間でのASRのスーパーブパフォーマンスを示している。
論文 参考訳(メタデータ) (2022-08-17T04:01:29Z) - Local policy search with Bayesian optimization [73.0364959221845]
強化学習は、環境との相互作用によって最適な政策を見つけることを目的としている。
局所探索のための政策勾配は、しばしばランダムな摂動から得られる。
目的関数の確率モデルとその勾配を用いたアルゴリズムを開発する。
論文 参考訳(メタデータ) (2021-06-22T16:07:02Z) - Robust Sampling in Deep Learning [62.997667081978825]
ディープラーニングは、オーバーフィッティングを減らし、一般化を改善するために正規化メカニズムを必要とする。
分散ロバスト最適化に基づく新しい正規化手法によりこの問題に対処する。
トレーニング中は、最悪のサンプルが最適化に最も貢献するものであるように、その正確性に応じてサンプルの選択が行われる。
論文 参考訳(メタデータ) (2020-06-04T09:46:52Z) - Minority Class Oversampling for Tabular Data with Deep Generative Models [4.976007156860967]
オーバーサンプリングによる非バランスな分類タスクの性能向上を図るために, 深層生成モデルを用いて現実的なサンプルを提供する能力について検討した。
実験の結果,サンプリング手法は品質に影響を与えないが,実行環境は様々であることがわかった。
また、性能指標の点でも改善が重要であるが、絶対的な点では小さな点がしばしば見られる。
論文 参考訳(メタデータ) (2020-05-07T21:35:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。