論文の概要: Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing
- arxiv url: http://arxiv.org/abs/2606.25354v2
- Date: Mon, 29 Jun 2026 23:57:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 13:50:27.689551
- Title: Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing
- Title(参考訳): 局所分岐ルーティングによる効率よく訓練可能な言語モデルテストタイムスケーリング
- Abstract要約: Local Branch Routing (LBR)はトークンレベルのテストタイムスケーリングフレームワークである。
小さなローカルなルックアヘッドツリーを拡張し、言語モデルを通じてすべてのサンプルブランチを転送し、軽量ルータを使用してコミットするdeep-1サブツリーを選択する。
LBRにより、各トークン決定は、完全なソリューションレベルの検索を避けながら、ルート次トーケン分布を超えるエビデンスを使用することができる。
- 参考スコア(独自算出の注目度): 65.59464371673623
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Test-time scaling improves language-model reasoning, but existing approaches often face a difficult trade-off: long chain-of-thought sampling remains single-threaded, while sentence- or solution-level search can be computationally expensive and hard to train end-to-end. We introduce Local Branch Routing (LBR), a token-level test-time scaling framework that expands a small local lookahead tree, forwards all sampled branches through the language model, and uses a lightweight router to select the depth-1 subtree to commit. By routing over the hidden states of candidate local futures, LBR allows each token decision to use evidence beyond the root next-token distribution while avoiding full solution-level search. The resulting prune-shift-grow decoding process preserves discrete branch identities and defines a tractable tree-trajectory likelihood: newly grown nodes are counted when first sampled, and router decisions are assigned explicit probabilities. This enables end-to-end reinforcement learning with verifiable rewards, jointly optimizing the base model and router under the same likelihood-ratio principle as discrete-token RLVR. On synthetic hierarchical-planning tasks, LBR shows that post-candidate hidden states provide useful routing evidence. On mathematical reasoning benchmarks, LBR improves both Pass@1 and Pass@32 over discrete chain-of-thought, vanilla discrete-token RLVR, and RL-compatible soft-token branching baselines. These results suggest that lightweight local branching offers an efficient, trainable, and discrete form of language-model test-time scaling.
- Abstract(参考訳): テストタイムのスケーリングは言語モデル推論を改善するが、既存のアプローチは多くの場合、難しいトレードオフに直面している。
トークンレベルのテスト時間スケーリングフレームワークであるLocal Branch Routing (LBR)を導入し、小さなローカルなルックアヘッドツリーを拡張し、言語モデルを通じてすべてのサンプルブランチを転送し、軽量ルータを使用してコミットするdeep-1サブツリーを選択する。
候補となるローカルな先物の隠れ状態にルーティングすることで、LBRは各トークンがルートの次点分布を超えるエビデンスを使用することを許し、完全なソリューションレベルの探索を回避できる。
結果として生じるプルー・シフト・グロー復号プロセスは、個々の分岐のアイデンティティを保存し、トラクタブルなツリー・トラジェクトリの確率を定義する: 新しく成長したノードは、最初にサンプリングされたときにカウントされ、ルータの決定は明示的な確率に割り当てられる。
これにより、検証可能な報酬でエンドツーエンドの強化学習が可能になり、ベースモデルとルータを離散的なRLVRと同じ確率比原理で共同最適化する。
合成階層計画タスクにおいて、LBRは候補後の隠れ状態が有用な経路証拠を提供することを示す。
数学的推論ベンチマークでは、Pass@1とPass@32は、離散チェーン、バニラ離散トケンRLVR、RL互換のソフトトケン分岐ベースラインよりも改善されている。
これらの結果は、軽量な局所分岐が、言語モデルテストタイムスケーリングの効率的で訓練可能で離散的な形式を提供することを示唆している。
関連論文リスト
- Trajectory-Level Speculative Decoding for Diffusion Language Models [16.97093186372498]
拡散ベースの言語モデル (dLLM) は反復的復号化による並列トークン生成を可能にするが、既存の復号化戦略は信頼性の低い単一トークン生成に崩壊する。
そこで我々は,信頼層木探索による起草軌道構築のためのトラジェクトリレベルの投機フレームワークを開発した。
我々のフレームワークはデノーミングを30~40%削減し、トークン単位のステップを2.6から4.3に増やし、バニラdLLMを7~14倍、Fast-dLLMを1.3倍、推論とコードベンチマークを1%未満で高速化する。
論文 参考訳(メタデータ) (2026-08-27T09:42:20Z) - TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - TARPO: Token-Wise Latent-Explicit Reasoning via Action-Routing Policy Optimization [18.977861031175756]
TARPOは純粋なRLフレームワークであり、各ステップで離散トークン生成と連続潜在推論を切り替える。
TARPOは、様々なベンチマークで、既存の明示的で潜在的なRLベースラインよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-06-04T08:30:53Z) - Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection [57.3886742625188]
Pre-Routeは、応答前に構造化推論を実行するプロアクティブなルーティングフレームワークである。
本研究は, (i) LLMは, ガイドラインを確実に適用可能な遅延ルーティング能力を有すること, (ii) 線形プローブにより, 表現空間における最適ルーティングの分離性を高めること, (iii) 蒸留により, この推論構造を, 軽量展開のためのより小さなモデルに伝達すること,の3つの重要な知見を示す。
論文 参考訳(メタデータ) (2026-05-11T09:10:55Z) - Latent Abstraction for Retrieval-Augmented Generation [4.6096940605642915]
既存のシステムは各ホップで自然言語クエリを生成することに依存している。
我々は,単一のLLMが符号化,検索,生成を同時に行う統一的なフレームワークである textbfLAnR (Latent Abstraction for RAG) を提案する。
論文 参考訳(メタデータ) (2026-04-20T06:26:13Z) - TARo: Token-level Adaptive Routing for LLM Test-time Alignment [15.824259013420807]
TARoステアは、推論時に完全に構造化された推論に向けて、大きな言語モデルを凍結した。
大規模な実験により、TARoはベースモデルで最大+22.4%の推論性能を著しく改善することが示された。
TARoはまた、小から大のバックボーンから再訓練せずに一般化する。
論文 参考訳(メタデータ) (2026-03-19T02:18:40Z) - $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models [96.0074341403456]
LLM推論を改善するための実用的な方法として、推論時計算が再導入されている。
テスト時間スケーリング(TTS)アルゴリズムの多くは、自動回帰デコーディングに依存している。
そこで我々は,dLLM のための効率的な TTS フレームワーク Prism を提案する。
論文 参考訳(メタデータ) (2026-02-02T09:14:51Z) - Chain-in-Tree: Back to Sequential Reasoning in LLM Tree Search [4.12237459236889]
Chain-in-Tree (CiT)は、すべてのステップで拡張するのではなく、検索中にいつ分岐するかを決定するフレームワークである。
GSM8KとMath500のトークン生成、モデル呼び出し、ランタイムの75~85%の削減を実現している。
論文 参考訳(メタデータ) (2025-09-30T06:18:44Z) - Beyond Next Token Probabilities: Learnable, Fast Detection of Hallucinations and Data Contamination on LLM Output Distributions [60.43398881149664]
LLM出力シグナチャの効率的な符号化を訓練した軽量アテンションベースアーキテクチャであるLOS-Netを紹介する。
非常に低い検出レイテンシを維持しながら、さまざまなベンチマークやLLMで優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-18T09:04:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。