論文の概要: VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents
- arxiv url: http://arxiv.org/abs/2610.08402v1
- Date: Tue, 06 Oct 2026 14:15:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.024681
- Title: VETTA: Coordinating Turn- and Token-Level Credit Assignment for Multi-Turn LLM Agents
- Title(参考訳): VETTA:マルチターンLDMエージェントのターンレベルおよびトークンレベルクレジットアサインメントの調整
- Abstract要約: マルチターンLDMエージェントは、トークンごとに応答トークンを生成しながら、複数のインタラクション間でスパースなタスクフィードバックを受け取ることが多い。
VETTAは,共有批評家の異なる頭上で,ターンレベルの値とトークンレベルの値を共同で学習する信用割当手法である。
VETTAは両方の時間的シーケンスに沿って利点を計算し、各ターンの利点とPPO更新のための応答内中心のトークン残差を結合する。
- 参考スコア(独自算出の注目度): 30.005457080904478
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-turn LLM agents often receive sparse task feedback across several interactions, while generating each response token by token. This creates two related credit-assignment questions: which responses helped achieve the outcome, and which generation decisions mattered within each response? Existing methods typically focus on only one level: turn-level methods evaluate complete responses but do not distinguish the decisions within them; token-level methods can propagate feedback across turns but do not explicitly model credit for each response. These complementary limitations motivate learning credit at both levels and coordinating it in a single policy update. We introduce VETTA, a credit assignment method that jointly learns turn- and token-level values through separate heads on a shared lightweight critic. VETTA computes advantages along both temporal sequences and combines each turn advantage with a within-response-centered token residual for PPO updates. Furthermore, to reduce value-learning cost, the critic retains only early Transformer blocks from the pretrained checkpoint used to initialize the actor. On two challenging agent benchmarks, ALFWorld and WebShop, VETTA improves success rates over PPO by 37.5% and 22.3%, respectively, with Qwen2.5-1.5B-Instruct and achieves success rates of 95.5% and 76.0%, respectively, with Qwen2.5-7B-Instruct. Critic-depth comparisons further show strong task performance with substantially lower critic-side computation. These results suggest that a compact shared critic can coordinate turn- and token-level credit to improve agent performance while keeping value estimation efficient. Code is available at https://github.com/Jiaju-Chen/VETTA-official.
- Abstract(参考訳): マルチターンLDMエージェントは、トークンごとに応答トークンを生成しながら、複数のインタラクション間でスパースなタスクフィードバックを受け取ることが多い。
これは2つの関連するクレジット割り当て質問を生み出します。どのレスポンスが結果の達成に役立ち、どの生成決定が各レスポンス内で重要か?
ターンレベルのメソッドは完全なレスポンスを評価するが、その中の決定を区別しない。トークンレベルのメソッドはターンをまたいでフィードバックを伝播するが、各レスポンスに対するクレジットを明示的にモデル化しない。
これらの補完的な制限は、両方のレベルで学習クレジットを動機付け、単一のポリシー更新でそれを調整します。
VETTAは,共有された軽量批評家に対して,個別の頭を用いてターンレベルとトークンレベルの値を共同で学習する信用割当手法である。
VETTAは両方の時間的シーケンスに沿って利点を計算し、各ターンの利点とPPO更新のための応答内中心のトークン残差を結合する。
さらに、価値学習コストを低減するために、アクターの初期化に使用する事前訓練されたチェックポイントから、初期のTransformerブロックのみを保持する。
ALFWorldとWebShopの2つの挑戦的ベンチマークでは、VETTAがそれぞれ37.5%、22.3%、Qwen2.5-1.5B-Instructが95.5%、76.0%、Qwen2.5-7B-Instructがそれぞれ成功した。
批判深度比較は、批判面の計算がかなり少ないほど、強いタスク性能を示す。
これらの結果から,コンパクトな共有批評家はターンレベルとトークンレベルのクレジットをコーディネートし,評価効率を保ちながらエージェント性能を向上させることが示唆された。
コードはhttps://github.com/Jiaju-Chen/VETTA-officialで入手できる。
関連論文リスト
- SIPO: Unifying Reinforcement Learning with On-Policy Self-Distillation [24.836022752759035]
検証可能な報酬付き強化学習(RLVR)は,様々なタスクにおいて大規模言語モデル(LLM)を改善するための標準パラダイムとなっている。
我々は,自己指導型政策最適化(SIPO)と対照的な自己指導型政策最適化(SIPO)を提案する。
論文 参考訳(メタデータ) (2026-09-29T05:15:41Z) - PACT: From Credit Assignment to Critic Alignment [35.4873739114819]
強化学習は、大規模言語モデル(LLM)の訓練後の中心的な構成要素となっているが、トークンレベルの信用は一般的に受け入れられた数学的定義を欠いている。
完全性、固定整合性、中立性の3つの規則性条件を定式化し、トークンレベルの信用を独自に決定することを証明する。
この特徴付けは、既存のアルゴリズムにまたがる現象を説明する統一的な基盤を提供し、改良されたアクター・クリティカル・トレーニング手順の開発を導く。
論文 参考訳(メタデータ) (2026-09-22T12:58:28Z) - Contrastive Branch Policy Optimization [16.16893757028268]
検証可能な報酬(RLVR)による強化学習は、言語モデルが外部ツールとのマルチターンインタラクションを学習することを可能にする。
既存の方法は、固定されたロールアウト予算を割り当て、分岐結果をトークンレベルのクレジットに変換する、という2つの異なる問題を分割する傾向があります。
本稿では,この2つの問題を解消し,それぞれに専用のメカニズムを割り当てる,コントラスト分岐政策最適化(CBPO)を紹介する。
論文 参考訳(メタデータ) (2026-08-25T09:25:55Z) - AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning [58.76655851910778]
AgentOPSDは、エージェント強化学習におけるターンレベルのクレジット割り当てのための、批判のない再帰的手法である。
ALFWorld, WebShop, Search-QA上のAgentOPSDを2つのスケールでQwen2.5モデルを用いて評価する(3B, 7B)。
論文 参考訳(メタデータ) (2026-08-06T13:00:59Z) - Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes [40.20394793623452]
事前トレーニングされたVLAポリシーがオンラインRLを介して微調整されると、各ロールアウトエピソードは単一のバイナリ結果のみを生成する。
階層的アドバンテージ・重み付き行動クローン (HABC) を提案する。
HABCは教師付き微調整(SFT)ベースラインを36%、44%、12%から92%、88%、38%で成功している。
論文 参考訳(メタデータ) (2026-06-15T17:57:14Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Q-VGM: Q-Guided Value-Gradient Matching for Flow-Matching VLA Policies [14.519898493996891]
本稿では,Q-Guided Value-Gradient Matching (Q-VGM) を法外強化学習(RL)法として提案する。
Q-VGMは、生成モデルにおけるフローアライメントの値勾配ビューであるVGG-Flowを活用することで問題を回避している。
LIBEROでは、Q-VGMが75.0%から92.5%に、RoboTwin 2.0では76.4%から87.2%に、実際の2つのテーブルトップタスクでは40.0%から67.5%に上昇している。
論文 参考訳(メタデータ) (2026-06-06T07:10:25Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - Reinforcing Video Reasoning with Focused Thinking [65.85683941058916]
本稿では,集中的思考と深い報酬の粒度で視覚的推論を強化する新しいフレームワークであるTW-GRPOを提案する。
具体的には,高情報密度のトークンを優先するトークン重み付け機構を用いる。
また,シングルチョイスからマルチチョイスQAタスクにシフトすることで,RLトレーニングを再構築する。
論文 参考訳(メタデータ) (2025-05-30T15:42:19Z) - SureMap: Simultaneous Mean Estimation for Single-Task and Multi-Task Disaggregated Evaluation [75.56845750400116]
分散評価(disaggregated evaluation) -- 異なるサブポピュレーション上での機械学習モデルのパフォーマンスの推定 - は、AIシステムのパフォーマンスとグループフェアネスを評価する上で、中核的なタスクである。
ブラックボックスモデルの評価において,マルチタスクとシングルタスクの双方に対して高い推定精度を持つSureMapを開発した。
提案手法は, ウェル・チョーゼンを用いた最大後部推定と, スタインの非バイアスリスク推定(SURE)によるクロスバリデーションフリーチューニングを併用する。
論文 参考訳(メタデータ) (2024-11-14T17:53:35Z) - Simultaneous Double Q-learning with Conservative Advantage Learning for
Actor-Critic Methods [133.85604983925282]
保守的アドバンテージ学習(SDQ-CAL)を用いた同時二重Q-ラーニングを提案する。
提案アルゴリズムはバイアスの少ない値推定を実現し,一連の連続制御ベンチマークタスクにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2022-05-08T09:17:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。