論文の概要: Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning
- arxiv url: http://arxiv.org/abs/2608.02291v1
- Date: Mon, 03 Aug 2026 14:22:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.595563
- Title: Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning
- Title(参考訳): 共有プレフィックス - マルチエージェント推論のためのアダプティブルーティング
- Authors: Yiqing Liu, Zihao Wang, Hantao Yao, Wu Liu, Yongdong Zhang,
- Abstract要約: MAR(Multi-agent reasoning)は、反復的な解交換と改良を通じて推論の信頼性を向上させる。
既存の適応MARメソッドは通常、クエリレベルのラベルやトラジェクトリレベルのリターンからルーティング決定を学習する。
効率的な適応MARのための共有操作型クレジット割り当てフレームワークであるTreeCreditを提案する。
- 参考スコア(独自算出の注目度): 72.49938949082117
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-agent reasoning (MAR) improves reasoning reliability through iterative solution exchange and refinement. Existing adaptive MAR methods typically learn routing decisions from query-level labels or trajectory-level returns, but such coarse supervision cannot accurately estimate the state-conditioned utility of individual operators in multi-step collaboration. We propose TreeCredit, a shared-prefix credit assignment framework for efficient adaptive MAR. Its core insight is to estimate operator utility through state-matched downstream comparisons, rather than directly attributing trajectory-level outcomes to preceding decisions. TreeCredit constructs shared-prefix collaboration trees by expanding candidate operators from the same intermediate state and assigns each state--operator pair a correctness-prioritized suffix credit based on the terminal correctness and cumulative additional cost of its complete continuation. These structured credits are converted into state-local operator preferences to train a lightweight pairwise state router, which dynamically selects the next admissible operator during inference. Experiments on six reasoning benchmarks show that TreeCredit modestly improves accuracy while substantially reducing inference cost, achieving a better accuracy--cost trade-off than representative MAR methods.
- Abstract(参考訳): MAR(Multi-agent reasoning)は、反復的な解交換と改良を通じて推論の信頼性を向上させる。
既存の適応MAR手法は、一般にクエリレベルラベルやトラジェクトリレベルのリターンからルーティング決定を学習するが、そのような粗い監督は、複数ステップの協調作業において個々のオペレータの状態条件の効用を正確に見積もることはできない。
効率的な適応MARのための共有プリフィックス・クレジット・アサイン・フレームワークであるTreeCreditを提案する。
その中核的な洞察は、前回の判断に軌道レベルの結果を直接帰結させるのではなく、状態マッチングされた下流の比較を通じてオペレーターユーティリティを見積もることである。
TreeCreditは、同じ中間状態から候補演算子を拡張して共有プレフィックスの協調木を構築し、各状態演算子ペアに、その完全な継続の終端正しさと累積的な追加コストに基づいて、正当性優先の接尾辞クレジットを割り当てる。
これらの構造化されたクレジットは、推論中に次の許容可能な演算子を動的に選択する軽量なペアワイズステートルータをトレーニングするために、状態ローカルな演算子に変換される。
6つの推論ベンチマークの実験により、TreeCreditは推定コストを大幅に削減し、代表的MAR法よりも精度の高いトレードオフを実現する。
関連論文リスト
- TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents [6.89645931986174]
本稿では,ルーリック誘導型行動選択フレームワークCo-ReActを紹介する。
各決定ステップにおいて、Co-ReActはエージェントのコンテキストにルーブリックを注入し、次のReason-or-Act決定を導く。
我々は、GRPOで専用のルーリック発電機を訓練し、このガイダンスを信頼性の高いものにする。
論文 参考訳(メタデータ) (2026-05-22T12:59:16Z) - Contextual Counterfactual Credit Assignment for Multi-Agent Reinforcement Learning in LLM Collaboration [22.269718913202595]
コンテキスト非現実的クレジット割り当て(textbftextttC3)を導入する。
textbftextttC3は、エピソード全体で報酬を分配する代わりに、個々のメッセージの因果的影響を分離する。
textbftextttC3は、確立されたベースラインよりもターミナルパフォーマンスを改善する。
論文 参考訳(メタデータ) (2026-03-06T20:25:11Z) - ORCH: many analyses, one merge-a deterministic multi-agent orchestrator for discrete-choice reasoning with EMA-guided routing [0.6445605125467574]
ORCHは異種言語モデルを編成する離散選択推論のためのフレームワークである。
タスクの分解と回答の集約に固定されたルールを使用し、パイプラインを予測可能、再現可能、トレーニング不要にする。
MMLU、MMLU-Pro、GSM8Kの実験では、ORCHは単一モデルベースラインと多数投票アンサンブルを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-02T08:27:58Z) - TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG [71.06073770344732]
エージェント検索強化生成(RAG)は、推論と情報検索の多段階的な相互作用として質問応答を定式化する。
エージェントRAGのためのオンラインツリーベースRLフレームワークであるTreePS-RAGについて述べる。
論文 参考訳(メタデータ) (2026-01-11T14:07:30Z) - ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - Arbitrage: Efficient Reasoning via Advantage-Aware Speculation [71.45710345765528]
投機的復号化は、高速だが不正確なドラフトモデルを用いて推論を加速し、自動回帰的にトークンを提案する。
しかし、意味論的に等価なステップにおけるトークンミスマッチによる不要な拒絶のため、従来のトークンレベルの投機的デコーディングは、タスクの推論に苦労する。
提案するArbitrageは,ドラフトモデルとターゲットモデルとの相対的優位性に基づいて動的に生成をルーティングする,新しいステップレベルの投機生成フレームワークである。
論文 参考訳(メタデータ) (2025-12-04T17:50:53Z) - In-Token Rationality Optimization: Towards Accurate and Concise LLM Reasoning via Self-Feedback [38.915062716409686]
InTROはトークンレベルの探索と,正確かつ簡潔な推論のための自己フィードバックを可能にする,新たなフレームワークである。
InTROは他のベースラインを一貫して上回り、ベースモデルと比較して解の精度を最大20%向上させる。
その思考の連鎖は明らかに簡潔であり、冗長性が低下している。
論文 参考訳(メタデータ) (2025-11-13T01:47:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。