論文の概要: Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
- arxiv url: http://arxiv.org/abs/2603.23550v1
- Date: Sat, 21 Mar 2026 18:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-26 21:06:10.930399
- Title: Implicit Turn-Wise Policy Optimization for Proactive User-LLM Interaction
- Title(参考訳): アクティブユーザ-LLMインタラクションのための暗黙のターンワイズポリシー最適化
- Authors: Haoyu Wang, Yuxin Chen, Liang Luo, Buyun Zhang, Ellie Dingqiao Wen, Pan Li,
- Abstract要約: インプシットプロセス報酬モデルでは、スパース結果信号から細粒度でターンワイズなプロセス報酬を生成する。
我々はITPOを,算数指導,文書作成,医用レコメンデーションの3つの代表的なマルチターン協調タスクで評価した。
- 参考スコア(独自算出の注目度): 22.34445328484827
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-turn human-AI collaboration is fundamental to deploying interactive services such as adaptive tutoring, conversational recommendation, and professional consultation. However, optimizing these interactions via reinforcement learning is hindered by the sparsity of verifiable intermediate rewards and the high stochasticity of user responses. To address these challenges, we introduce Implicit Turn-wise Policy Optimization (ITPO). ITPO leverages an implicit process reward model to derive fine-grained, turn-wise process rewards from sparse outcome signals. Unlike volatile token-level rewards, these turn-level signals exhibit superior robustness and may utilize a normalization mechanism to further enhance training stability. We evaluate ITPO across three representative multi-turn collaborative tasks: math tutoring, document writing, and medical recommendation. Empirical results demonstrate that ITPO, when combined with PPO, GRPO, or RLOO, consistently achieves improved convergence than existing baselines. Elaborate trajectory analysis confirms that ITPO infers turn-wise preferences that are semantically aligned with human judgment. Code is publicly available at https://github.com/Graph-COM/ITPO.
- Abstract(参考訳): マルチターンヒューマン-AIコラボレーションは、適応型チュータリング、会話レコメンデーション、プロフェッショナルコンサルテーションなどの対話型サービスを展開するための基本となる。
しかし、これらの相互作用を強化学習によって最適化することは、検証可能な中間報酬の空間性とユーザ応答の確率性によって妨げられる。
これらの課題に対処するため,Implicit Turn-wise Policy Optimization (ITPO)を導入する。
ITPOは暗黙のプロセス報酬モデルを利用して、粗い結果信号から細粒度でターンワイズなプロセス報酬を導き出す。
揮発性トークンレベルの報酬とは異なり、これらのターンレベルの信号は優れた堅牢性を示し、トレーニング安定性をさらに高めるために正規化機構を利用する。
我々はITPOを,算数指導,文書作成,医用レコメンデーションの3つの代表的なマルチターン協調タスクで評価した。
実証実験の結果,ITPOとPPO,GRPO,RLOOを組み合わせた場合,既存のベースラインよりも優れた収束性が得られることがわかった。
実験軌道解析により、ITPOは人間の判断にセマンティックに一致したターンワイドな嗜好を推測することを確認した。
コードはhttps://github.com/Graph-COM/ITPOで公開されている。
関連論文リスト
- Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn LLM Agents [28.145430029174577]
大規模言語モデル(LLM)ベースのエージェントは、外部環境と対話する能力を高めるために強化学習(RL)でますます訓練されている。
既存のアプローチは通常、最終回答でのみ提供される結果に基づく報酬に依存します。
本稿では,情報ゲインに基づくポリシー最適化(IGPO)を提案する。
論文 参考訳(メタデータ) (2025-10-16T17:59:32Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - ARPO:End-to-End Policy Optimization for GUI Agents with Experience Replay [88.74638385288773]
Agentic Replay Policy Optimizationは、複雑で長期のコンピュータタスクのパフォーマンスを改善する。
本稿では,ベースラインエージェントの性能に基づいてタスクをフィルタリングするタスク選択戦略を提案する。
OSWorldベンチマークの実験では、ARPOが競争結果を達成することを示した。
論文 参考訳(メタデータ) (2025-05-22T06:24:32Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。