論文の概要: IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents
- arxiv url: http://arxiv.org/abs/2608.24588v2
- Date: Wed, 26 Aug 2026 16:29:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.2048
- Title: IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents
- Title(参考訳): IAPO:マルチターンサービスエージェントのクレジットアサインメントに対する影響認識ポリシー最適化
- Abstract要約: この研究は、マルチターンユーザインタラクションにおけるクレジット代入の理解を深める。
粗末な結果フィードバックからサービスエージェントをトレーニングするための、原則化されたアプローチを提供する。
- 参考スコア(独自算出の注目度): 10.577620258047665
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large Language Model (LLM) agents increasingly solve long-horizon tasks through multi-turn interactions with users and external tools. In these settings, relevant task information often unfolds over time rather than being fully specified at the initial prompt. Service agents make this challenge especially concrete: users may clarify or revise their goals, while tool responses provide information needed for subsequent decisions. Thus, a final reward alone cannot indicate which actions contributed to resolving the task. Recent methods rely on comparative evidence from other trajectories or resampled continuations, or on separately constructed step-level learning signals, to refine credit. However, a completed rollout already records how information and errors flow between agent actions. We introduce Influence-Aware Policy Optimization (IAPO), which represents each rollout as a typed influence-dependency graph over trainable agent actions, with user and tool observations serving as evidence. IAPO converts support-use and failed-use structure into routing weights that redistribute the same trajectory-level advantage. Experiments with Qwen3-4B and Qwen3-8B demonstrate superior performance over multi-turn reinforcement learning (RL) baselines across three service-agent benchmarks: ${τ^2}$-Bench, UserBench, and AgentChangeBench. BFCL-v4 Multi-Turn further shows that these gains do not compromise multi-turn function-calling performance. This work advances the understanding of credit assignment in multi-turn user interactions and provides a principled approach to training service agents from sparse outcome feedback.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、ユーザと外部ツールとのマルチターンインタラクションを通じて、長い水平タスクをますます解決します。
これらの設定では、関連するタスク情報は初期プロンプトで完全に指定されるのではなく、時間とともに展開されることが多い。
ユーザは目標を明確にしたり修正したりし、ツールのレスポンスはその後の決定に必要な情報を提供する。
したがって、最終的な報酬だけでは、タスクの解決に寄与するアクションを示すことはできない。
近年の手法は、他の軌跡や再サンプリングされた継続、あるいは個別に構築されたステップレベルの学習信号を比較証拠に頼り、信用を洗練させる。
しかしながら、完了したロールアウトでは、エージェントアクション間の情報とエラーのフローがすでに記録されている。
本稿では、各ロールアウトをトレーニング可能なエージェントアクションに対する型付きインフルエンス依存グラフとして表現し、ユーザおよびツールの観察を証拠として提供する、インフルエンス・アウェア・ポリシー・オプティマイズ(IAPO)を紹介する。
IAPOは、サポートユースとフェールユース構造を、同じ軌道レベルの利点を再分配するルーティングウェイトに変換する。
Qwen3-4BとQwen3-8Bの実験は、3つのサービスエージェントベンチマーク({τ^2}$-Bench, UserBench, AgentChangeBench)でマルチターン強化学習(RL)ベースラインよりも優れた性能を示した。
BFCL-v4 Multi-Turnは、これらのゲインがマルチターン関数呼び出し性能を損なわないことを示す。
この研究は、マルチターンユーザインタラクションにおけるクレジット割り当ての理解を深め、スパースな結果フィードバックからサービスエージェントを訓練するための原則的なアプローチを提供する。
関連論文リスト
- APPO: Agentic Procedural Policy Optimization [28.730334202611257]
エージェントRLを2つの視点から研究する:textitwhere to branchと、ブランチ後のクレジットの割り当て方法
本稿では、分岐とクレジットの割り当てを粗い相互作用単位から細かな決定点にシフトするAPPOを提案する。
APPOは、強力なエージェントRLベースラインを4ポイント近く改善し、効率的なツールコールを維持し、振る舞いの解釈可能性を維持する。
論文 参考訳(メタデータ) (2026-06-10T17:47:07Z) - TAPO: Tool-Aware Policy Optimization via Credit Transfer for Multimodal Search Agents [54.08846865906602]
ツール強化マルチモーダルサーチエージェントにおいて,クレジットミス割り当てをGRPOの系統的障害モードとして特徴付ける。
本稿では,情報取得ツールのパラメータ決定性を利用したツール・アウェア・ポリシー・オプティマイズ(TAPO)を提案する。
論文 参考訳(メタデータ) (2026-06-04T07:15:43Z) - InfoPO: Information-Driven Policy Optimization for User-Centric Agents [39.407032905771885]
アクティブな不確実性低減のプロセスとしてマルチターンインタラクションをフレーム化するInfoPOを紹介する。
情報ゲイン報酬を計算し、そのフィードバックがエージェントのその後の行動分布を変化させるクレジットを回す。
そして、この信号とタスク結果とを適応分散ゲート融合により結合する。
論文 参考訳(メタデータ) (2026-02-28T13:58:14Z) - Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization [61.641777037967366]
プロアクティブな大規模言語モデル(LLM)エージェントは、複数のターンで積極的に計画し、クエリし、相互作用することを目的としている。
エージェント強化学習(RL)は、マルチターン環境でエージェントを訓練するための有望なソリューションとして登場した。
本稿では,行動強化と情報収集能力の強化を両立させたエージェントRLフレームワークであるBAOを提案する。
論文 参考訳(メタデータ) (2026-02-11T20:40:43Z) - DLLM Agent: See Farther, Run Faster [94.74432470237817]
拡散大言語モデル(DLLM)は、自己回帰(AR)デコーディングの代替として、魅力的な効率とモデリング特性を持つ。
我々は、DLLMとARのバックボーンを同一のエージェントワークフロー内でインスタンス化することで、制御された環境でこれを研究する。
DLLMエージェントはARエージェントよりも平均30%以上速く、場合によっては8倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2026-02-07T09:01:18Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering [51.07491603393163]
tAgentは知識グラフ誘導ルーティング問題としてマルチエージェントQAを定式化するフレームワークである。
エージェントアウトプットのソフトな監督と重み付けされた集約を活用することで、エージェントは多様なエージェントの相補的な強みを捉える、原則化された協調スキームを学ぶ。
論文 参考訳(メタデータ) (2025-10-06T23:20:49Z) - Multi-Agent Tool-Integrated Policy Optimization [67.12841355267678]
大規模言語モデル(LLM)は、知識集約的かつ複雑な推論タスクに対して、多ターンツール統合計画にますます依存している。
既存の実装は通常、単一のエージェントに依存するが、コンテキスト長とノイズの多いツールレスポンスに悩まされる。
ツール統合マルチエージェントフレームワークの効果的な強化学習をサポートする方法はない。
論文 参考訳(メタデータ) (2025-10-06T10:44:04Z) - $C^3$-Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking [12.218102495632937]
エージェントの堅牢性を評価するためのオープンソースベンチマークをC3$-Benchで提示する。
具体的には,複雑なツール関係をナビゲートし,重要な隠蔽情報を処理し,動的決定経路を管理する,という3つの課題を設計する。
本質的に$C3$-Benchは、これらの課題を通じてモデル脆弱性を公開し、エージェントパフォーマンスの解釈可能性の研究を促進することを目的としている。
論文 参考訳(メタデータ) (2025-05-24T15:25:44Z) - Reinforcing Multi-Turn Reasoning in LLM Agents via Turn-Level Reward Design [35.544075583073685]
マルチターンRLアルゴリズムとエージェント応用のためのテキストターンレベルの報酬設計に関する最初の体系的研究について述べる。
我々は、多ターン推論強化検索エージェントのケーススタディを行い、検証可能とLCM-as-judgeの2種類のターンレベルの報酬を慎重に設計する。
マルチターン探索タスクの実験により、適切に設計されたターンレベルの報酬を組み込むことで、RLアルゴリズムは軌道レベルの報酬でベースライン法を大幅に上回ることを示す。
論文 参考訳(メタデータ) (2025-05-17T04:09:46Z) - Learning From Good Trajectories in Offline Multi-Agent Reinforcement
Learning [98.07495732562654]
オフラインマルチエージェント強化学習(MARL)は、事前コンパイルされたデータセットから効果的なマルチエージェントポリシーを学ぶことを目的としている。
オフラインのMARLが学んだエージェントは、しばしばこのランダムなポリシーを継承し、チーム全体のパフォーマンスを脅かす。
この問題に対処するために,共有個人軌道(SIT)と呼ばれる新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-28T18:11:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。