論文の概要: Test-Time Scaling via Error Localization
- arxiv url: http://arxiv.org/abs/2607.21453v2
- Date: Fri, 24 Jul 2026 02:14:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 14:08:31.024774
- Title: Test-Time Scaling via Error Localization
- Title(参考訳): エラーローカライゼーションによるテスト時間スケーリング
- Abstract要約: 大規模言語モデルの性能向上のための信頼性の高い手法として,推論時間計算のスケーリングが登場している。
固定あるいは環境フィードバックを利用してトークンレベルのエラーローカライゼーションを行う推論時アルゴリズムであるTTEL(Test-Time Scaling via Error Localization)を導入する。
- 参考スコア(独自算出の注目度): 15.13459650752427
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Scaling inference-time computation has emerged as a reliable method to improve the performance of large language models on complex reasoning and programming tasks. However, standard approaches such as independent sampling and sequential multi-turn refinement operate without token-level credit assignment, resulting in computational inefficiency, since valid reasoning prefixes are frequently discarded. In this work, we introduce Test-Time Scaling via Error Localization (TTEL), an inference-time algorithm that utilizes fixed or environment feedback to perform token-level error localization. By comparing conditional probabilities under informed feedback against a null-context baseline, TTEL isolates the step at which an error occurred. The algorithm then truncates the trajectory and branches a new generation, maximally reusing the valid prefix. Extensive evaluations demonstrate that TTEL establishes strictly dominating Pareto frontiers across sequential reasoning domains, measured by pass-at-k vs. generated-token cost. With Qwen3-8B on LiveCodeBench, TTEL attains a pass@64 of 71.0% while generating approximately half as many tokens as independent sampling (360.4k vs. 735.0k). Generalizing to math benchmarks AIME-2025 and HMMT-2025, TTEL cleanly outperforms competing test-time baselines across both Qwen3-8B and Qwen3-4B-Thinking-2507.
- Abstract(参考訳): 推論時間計算のスケーリングは、複雑な推論やプログラミングタスクにおいて、大規模言語モデルの性能を向上させるための信頼性の高い方法として登場した。
しかし、独立サンプリングやシーケンシャル・マルチターン・リファインメントのような標準的な手法はトークン単位のクレジット代入を使わずに動作し、有効な推論プレフィックスは頻繁に破棄されるため、計算の非効率性をもたらす。
本研究では,固定あるいは環境フィードバックを利用してトークンレベルのエラーローカライゼーションを行う推論時間アルゴリズムであるTTEL(Test-Time Scaling via Error Localization)を導入する。
情報フィードバック下での条件付き確率をヌルコンテキストベースラインと比較することにより、TTELはエラーが発生したステップを分離する。
その後、アルゴリズムは軌道を切断し、新しい世代を分岐し、有効なプレフィックスを最大限に再利用する。
大規模な評価の結果,TTEL はパス・アット・k 対生成トーケンコストで測定された逐次的推論領域をまたいだパレート・フロンティアを厳格に支配していることが明らかとなった。
LiveCodeBench上のQwen3-8Bでは、TTELはパス@64の71.0%を獲得し、独立したサンプリング(360.4k vs. 735.0k)として約半分のトークンを生成する。
数学ベンチマークの AIME-2025 と HMMT-2025 に一般化されたTTEL は、Qwen3-8B と Qwen3-4B-Thinking-2507 の双方で競合するテストタイムベースラインをきれいに上回っている。
関連論文リスト
- Thought-Level Beam Search for Reasoning [39.76902449987798]
テストタイムの計算スケーリングは、大きな推論モデルにおけるパフォーマンスの主要な要因である。
部分軌道上の制約付き計算割当問題としてテスト時間推論を定式化する。
Emph Thoughtレベルビームサーチを実行する推論アルゴリズムであるGambitを導入する。
論文 参考訳(メタデータ) (2026-08-08T09:00:01Z) - Constrained Decoding for Diffusion Language Models via Efficient Inference over Finite Automata [57.27430779838529]
有限オートマトンとして表現可能な任意の制約の下で,制約付き平均場後部からサンプリングする,正確かつトラクタブルなアルゴリズムを提案する。
このアプローチは、構築による制約満足度を保証し、欲求とサンプリングベースのデコーディングの両方をサポートし、並列およびブロックワイドデコーディングと互換性がある。
Dream-7B と LLaDA-8 の実証的な評価は、様々なタスクにおいてかなりの精度の向上を示した。
論文 参考訳(メタデータ) (2026-07-08T05:48:57Z) - Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing [65.59464371673623]
Local Branch Routing (LBR)はトークンレベルのテストタイムスケーリングフレームワークである。
小さなローカルなルックアヘッドツリーを拡張し、言語モデルを通じてすべてのサンプルブランチを転送し、軽量ルータを使用してコミットするdeep-1サブツリーを選択する。
LBRにより、各トークン決定は、完全なソリューションレベルの検索を避けながら、ルート次トーケン分布を超えるエビデンスを使用することができる。
論文 参考訳(メタデータ) (2026-06-24T03:42:44Z) - Closing the Loop on Latent Reasoning via Test-Time Reconstruction [45.08180971427891]
最近の研究は、中間推論を自然言語のトレースから潜時あるいはキャッシュレベルの表現に移行している。
本稿では,クエリ自体を参照としてループをクローズする自己教師型テストタイムトレーニング手法であるRELATを提案する。
ReLATは、単一モデル推論、テキストベースのコラボレーション、オープンループラテントコラボレーション、代替テストタイムトレーニング目標よりも一貫して改善されていることを示す。
論文 参考訳(メタデータ) (2026-06-04T14:54:40Z) - LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification [35.08680804423239]
CoT(Chain-of- Thought)推論は、難しいタスクにおいて大きな言語モデル(LLM)を改善するが、推論コストも高くつく。
本稿では,連続潜伏空間における有界探索を最初に行う2段階のパラダイムであるLaTERを提案する。
LaTERは入力の埋め込み空間に隠された最後の層を投影し、潜伏KVキャッシュを保持し、エントロピーとモデルネイティブのストップトーケンプローブを使用していつ切り替えるかを決定する。
論文 参考訳(メタデータ) (2026-05-08T06:23:58Z) - Algorithm-Based Pipeline for Reliable and Intent-Preserving Code Translation with LLMs [3.4257278503723576]
直接一発翻訳は、しばしばプログラム意図を保存するのに失敗し、制御フローのエラー、型ハンドリング、I/O動作を引き起こす。
本稿では,言語ニュートラルな中間仕様を導入し,これらの詳細をコード生成前にキャプチャするアルゴリズムベースのパイプラインを提案する。
論文 参考訳(メタデータ) (2026-02-18T00:34:29Z) - Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations [83.93566096400723]
ランダムにサンプリングされたトークン化が与えられた場合、命令調整されたモデルは元の性能の最大93.4%を維持している。
文字レベルのセグメンテーションは文字列操作とコード理解タスクを最大+14%改善する。
右列桁のグルーピングは、大数の算術を+33%向上させる。
論文 参考訳(メタデータ) (2025-06-23T18:02:26Z) - Accelerated Test-Time Scaling with Model-Free Speculative Sampling [58.69141724095398]
STAND(Stochastic Adaptive N-gram Drafting)は,新しいモデルフリーな投機的デコード手法である。
従来の自己回帰復号法と比較して,STANDは推論遅延を60~65%削減することを示した。
モデルフリーのアプローチとして、STANDは追加のトレーニングなしで既存の言語モデルに適用できる。
論文 参考訳(メタデータ) (2025-06-05T07:31:18Z) - Learning Adaptive Parallel Reasoning with Language Models [70.1745752819628]
本稿では,適応並列推論(Adaptive Parallel Reasoning, APR)を提案する。
APRは、spawn()とjoin()操作を使用して適応的なマルチスレッド推論を可能にすることで、既存の推論メソッドを一般化する。
鍵となる革新は、親と子の両方の推論スレッドを最適化して、事前に定義された推論構造を必要とせずにタスクの成功率を高める、エンドツーエンドの強化学習戦略である。
論文 参考訳(メタデータ) (2025-04-21T22:29:02Z) - Fast Controlled Generation from Language Models with Adaptive Weighted Rejection Sampling [90.86991492288487]
トークンの制約を評価するのは 違法にコストがかかる
LCDは文字列上のグローバル分布を歪め、ローカル情報のみに基づいてトークンをサンプリングすることができる。
我々のアプローチは最先端のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-04-07T18:30:18Z) - LTM: Scalable and Black-box Similarity-based Test Suite Minimization based on Language Models [0.6562256987706128]
テストスイートはソフトウェアが進化するにつれて成長する傾向にあり、割り当てられたテスト予算ですべてのテストケースを実行することができないことが多い。
テストスイートの最小化(TSM)は、冗長なテストケースを削除することで、ソフトウェアテストの効率を改善するために使用される。
LTM(Language model-based Test suite Minimization)を提案する。
論文 参考訳(メタデータ) (2023-04-03T22:16:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。