論文の概要: Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
- arxiv url: http://arxiv.org/abs/2608.05643v1
- Date: Thu, 06 Aug 2026 06:38:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.702852
- Title: Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning
- Title(参考訳): 再サンプリングの精錬: LLM推論のためのテスト時間自己補正
- Authors: Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Lena Trigg, Ali Subhan, Muhammad Ali, Dean F. Hougen,
- Abstract要約: 本稿では,テスト時間計算を用いて候補解の探索と改良を行う検証自由幅改良フレームワークを提案する。
提案手法は, 難解な復号化, 多数決投票, 検証器ベースのベスト・オブ・N$, ビームサーチ, および複数のオープンウェイトモデル間でのルック・復号化を一貫して改善する。
- 参考スコア(独自算出の注目度): 3.8191765711200065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling improves LLM reasoning by using additional inference compute, but wider sampling alone can suffer from diminishing returns: new rollouts often repeat existing answer patterns instead of adding useful reasoning diversity. Verifier-based selection offers an alternative, but its performance depends on the calibration of an external reward model. We propose a verifier-free breadth--depth refinement framework that uses test-time compute to both explore and improve candidate solutions. The method samples multiple independent reasoning rollouts, refines each rollout through iterative self-critique and self-correction, and aggregates the refined answers by majority voting. Breadth preserves diverse initial attempts, while depth repairs local reasoning errors before aggregation. Across AIME24, AIME25, AMC, OlympiadBench, and MATH500, our method consistently improves over greedy decoding, majority voting, verifier-based best-of-$N$, beam search, and lookahead decoding across multiple open-weight models. For instance, with Qwen2.5-1.5B, accuracy increases from the strongest verifier-based baseline to $58.0\%$ on MATH500, and from $25.0\%$ to $32.5\%$ on AMC. These results show that test-time compute can be more effective when used to refine sampled trajectories rather than only to sample more candidates or rely on verifier-guided selection.
- Abstract(参考訳): テストタイムスケーリングは、追加の推論計算を使用することでLCM推論を改善するが、より広範なサンプリングだけではリターンの低下に悩まされる可能性がある。
検証者ベースの選択は代替手段を提供するが、その性能は外部報酬モデルの校正に依存する。
本稿では,テスト時間計算を用いて候補解の探索と改良を行う検証自由幅改良フレームワークを提案する。
この方法は、複数の独立した推論ロールアウトをサンプリングし、反復的な自己批判と自己補正を通じて各ロールアウトを精査し、多数決によって精査された回答を集計する。
ブレッドスは様々な初期試行を保存し、深度は集約の前に局所的な推論エラーを修復する。
AIME24, AIME25, AMC, OlympiadBench, MATH500 にまたがって, 本手法は複数のオープンウェイトモデルにまたがるグレディデコーディング, 多数決投票, 検証子ベースのベスト・オブ・N$, ビームサーチ, ルックアヘッドデコーディングよりも一貫して改善されている。
例えば、Qwen2.5-1.5Bでは、最強の検証基準ベースラインからMATH500では58.0\%、AMCでは25.0\%から32.5\%に精度が上がる。
これらの結果から, 試験時間計算は, より多くの候補をサンプリングしたり, 検証対象の選択に依存するのではなく, サンプリングされた軌道を洗練させるのに有効であることが示唆された。
関連論文リスト
- $S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models [10.157422365382933]
テスト時間スケーリングは、より多くの推論計算が与えられたとき、固定拡散言語モデル(DLM)がより良い出力を生成できるかどうかを調べる。
S3$ (Stratified Scaling Search) は,デノナイズ処理中に計算を再配置することで生成を改善するバリデーション誘導探索法である。
LLaDA-8B-Instruct on MATH-500, GSM8K, ARC-Challenge, TruthfulQA による実験では、S3$ はベンチマーク全体のパフォーマンスを一貫して改善している。
論文 参考訳(メタデータ) (2026-04-07T00:51:06Z) - Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences [7.715856473694668]
このアルゴリズムは、外部スカラー報酬を、候補を生成するのに使用するLLMと同じLLMから得られるペアの選好に置き換えるものである。
Duel-Evolveはベイジアン・ブラッドリー・テリーモデルを通じてノイズの多い候補比較を集計し、候補品質の不確実性を考慮した推定結果を得る。
既存のメソッドやベースラインよりも20パーセント高い精度でDuel-Evolveを、LiveCodeBenchでは12パーセント以上改善した。
論文 参考訳(メタデータ) (2026-02-25T05:16:11Z) - Efficient Evaluation of LLM Performance with Statistical Guarantees [11.703733256169214]
大規模言語モデルのベンチマークのためのFAQ(Factized Active Querying)を提案する。
FAQは、ハイブリッド分散推論/アクティブラーニングサンプリングポリシーを用いて、質問を適応的に選択する。
FAQは、2つのベンチマークスイートの強いベースラインよりも、有効サンプルサイズが5倍に向上する。
論文 参考訳(メタデータ) (2026-01-28T04:59:20Z) - CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning [62.56541355300587]
本稿では,高逆推論経路に向けてモデルを適応的に修正する一般的なテスト時間校正フレームワークを提案する。
本フレームワークでは,まず解空間を探索し,次にロジットの校正を学習する二相法であるCarBoNを提案する。
MATH-500とAIME-2024の実験では、CarBoNは効率を向上し、同じ精度に達するために最大4倍のロールアウトが可能である。
論文 参考訳(メタデータ) (2025-10-17T14:04:37Z) - Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers [63.99316853136304]
ミラー・クリティク(Mirror-Critique)は、情報的批評で検証者を訓練する枠組みである。
我々は、高品質な批判データを合成するために、小さな命令調整モデルを展開する。
結果として得られるミラー検証は、ソリューション毎に複数の批判を生成することで、候補ソリューションを評価するためにデプロイされる。
論文 参考訳(メタデータ) (2025-09-27T06:50:24Z) - Sample, Don't Search: Rethinking Test-Time Alignment for Language Models [55.2480439325792]
新しいテストタイムアライメントアプローチであるQAlignを紹介します。
テスト時間計算をスケールする際、QAlignは各プロンプトの最適配向分布からのサンプリングに収束する。
マルコフ連鎖モンテカルロのテキスト生成における最近の進歩を取り入れることで、基礎となるモデルを変更したり、ロジットアクセスを必要とせずに、より良い整合出力を可能にする。
論文 参考訳(メタデータ) (2025-04-04T00:41:40Z) - Scalable Best-of-N Selection for Large Language Models via Self-Certainty [75.1351701045874]
Best-of-N selectionは、Large Language Models(LLMs)の推論性能を改善するための重要なテクニックである。
本稿では, LLM出力の固有確率分布を利用して, 外部報酬モデルを必要としない応答品質を推定する, 新規で効率的な指標である自己確実性を提案する。
本研究は, LLM推論能力を向上させるための実用的で効率的な方法として, 自己確実性を確立した。
論文 参考訳(メタデータ) (2025-02-25T19:08:07Z) - Large Language Monkeys: Scaling Inference Compute with Repeated Sampling [81.34900892130929]
モデルから候補解を繰り返しサンプリングする簡単な手法を用いて、推論計算をスケーリングのための別の軸として検討する。
複数のタスクやモデルにまたがって、カバレッジは4桁以上のサンプル数でスケールする。
コードや形式的証明のようなドメインでは、回答が自動的に検証されるので、カバレッジの増加は直接的にパフォーマンスの向上につながります。
論文 参考訳(メタデータ) (2024-07-31T17:57:25Z) - Let's Sample Step by Step: Adaptive-Consistency for Efficient Reasoning
and Coding with LLMs [60.58434523646137]
大規模言語モデル(LLM)からの出力の正確性を改善するための一般的なアプローチは、自己整合性である。
コスト効率のよいモデルに依存しない手法であるAdaptive-Consistencyを導入し,各質問のサンプル数を動的に調整する。
実験の結果,Adaptive-Consistencyはサンプル予算を最大7.9倍に削減し,平均精度は0.1%以下であった。
論文 参考訳(メタデータ) (2023-05-19T17:49:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。