論文の概要: Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context
- arxiv url: http://arxiv.org/abs/2608.17499v1
- Date: Tue, 18 Aug 2026 08:25:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 21:40:53.264358
- Title: Towards Better Agents for Multi-Turn User Interaction: The Next User Turn Is More Than Context
- Title(参考訳): マルチスレッドユーザーインタラクションのためのエージェントの改善に向けて: 次のユーザターンはコンテキスト以上のもの
- Abstract要約: 次世代のユーザ反応は、マルチターンユーザインタラクションエージェントを改善するために実行可能なローカルクレジットを提供する。
textscFACAは、独立してトレーニングされた3回の実行で9ドメイン$$$- Family平均を改善する。
- 参考スコア(独自算出の注目度): 12.546026856710148
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: User-facing tool agents must coordinate dialogue and tool use as user goals unfold over multiple turns. Yet interactive reinforcement learning typically reduces each rollout to a terminal reward, assigning the same credit to effective elicitation, errors, and later repair. The next user turn is more than context: it also provides noisy, temporally local evidence about the preceding user-to-user segment. We introduce \textbf{F}eedback-\textbf{A}ware \textbf{C}redit \textbf{A}ssignment (\textsc{FACA}), which aligns each reaction with that segment, derives a locally normalized reaction advantage, and adds it to verified terminal outcome advantage without an extra critic or rollout. Against an outcome-only Interactive GRPO control matched in simulator, visible dialogue, initialization, rollout, and optimization, \textsc{FACA} improves the nine-domain $τ$-family average across three independently trained runs by 5.91 and 10.22 percentage points at 8B and 14B, respectively. Gains concentrate in Telecom; at 8B, randomizing reaction polarity removes the Telecom gain. The same ordering holds zero-shot on Pare-Bench and Co-Gym. These results demonstrate that next-turn user reactions provide actionable local credit for improving multi-turn user-interacting agents.
- Abstract(参考訳): ユーザ対応のツールエージェントは、対話とツールの使用を調整する必要がある。
しかし、インタラクティブな強化学習は、通常、各ロールアウトを終末報酬に還元し、有効活用、エラー、後の修復に同じクレジットを割り当てる。
次のユーザー・ターンはコンテキスト以上のもので、前回のユーザー・ツー・ユーザー・セグメントに関するノイズがあり、時間的に局所的な証拠を提供する。
本稿では、各反応をそのセグメントと整列させ、局所的に正規化された反応の利点を導出し、余分な批判やロールアウトを伴わずに端末結果の利点を検証できるような、 \textbf{F}eedback-\textbf{A}ware \textbf{C}redit \textbf{A}ssignment (\textsc{FACA})を紹介する。
シミュレータ、可視対話、初期化、ロールアウト、最適化で一致した結果のみの対話型GRPOコントロールに対して、 \textsc{FACA} は、それぞれ8Bで5.91と10.22のパーセンテージでトレーニングされた3つの実行に対して、9ドメインの$τ$ファミリー平均を改善した。
利益はテレコムに集中し、8Bではランダム化反応の極性がテレコムの利益を減少させる。
同じ順序付けは、Pare-Bench と Co-Gym でゼロショットを保持する。
これらの結果は、マルチターンユーザインタラクションエージェントを改善するために、次のターンユーザ反応が実用的なローカルクレジットを提供することを示す。
関連論文リスト
- IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents [10.577620258047665]
この研究は、マルチターンユーザインタラクションにおけるクレジット代入の理解を深める。
粗末な結果フィードバックからサービスエージェントをトレーニングするための、原則化されたアプローチを提供する。
論文 参考訳(メタデータ) (2026-08-25T14:14:36Z) - ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction [4.6344273009233214]
ARCはレスポンシブでステアブルで実行対応のユーザエージェントインタラクションのための新しいパラダイムである。
ARCは、コアである$/2$ツール使用ベンチマークを大幅に強化する。
Interはシンクスタイルのベースラインに対して4.91sから1.27sに短縮する。
論文 参考訳(メタデータ) (2026-08-13T01:51:53Z) - Intent Speaks Louder: Controllable User Simulation Beyond Response Imitation [25.422690765682788]
制御可能なユーザシミュレーションでは、どのローカルインタラクションインテントを次のユーザターンにするかを、そのインテントが言語でどのように表現されているかから区別する必要があります。
我々は、対話意図をターン毎の明示的な指示として公開するUserIDAを紹介する。
LMSYS-USPでは、UserIDAは86.6%の意図精度を達成し、最強のユーザーシミュレーションベースラインを24.3%上回っている。
論文 参考訳(メタデータ) (2026-08-10T10:48:40Z) - SWE-Together: Evaluating Coding Agents in Interactive User Sessions [19.069719245971786]
実際のユーザエージェントコーディングセッションから再構成したマルチターンベンチマークであるSWE-Togetherを紹介する。
11,260のセッションから109のリポジトリレベルのタスクをキュレートし、リカバリ可能なレポジトリステートでセッションを選択します。
我々は、元のユーザの意図を保存し、コーディングエージェントの進捗が必要な時にフィードバックを提供する、リアクティブLLMベースのユーザシミュレータを構築します。
論文 参考訳(メタデータ) (2026-06-29T08:35:15Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments [72.02445514666428]
静的な嗜好リコールを超えてペルマの一貫性を評価するためのベンチマークであるPERMAを紹介する。
PerMAは、複数のセッションとドメインにまたがる時間的に順序付けられたインタラクションイベントと、時間とともに好みに関連するクエリで構成されている。
実験により、関連するインタラクションをリンクすることで、高度なメモリシステムはより正確な好みを抽出し、トークン消費を減らすことができることが示された。
論文 参考訳(メタデータ) (2026-03-24T14:04:11Z) - Listening to the Echo: User-Reaction Aware Policy Optimization via Scalar-Verbal Hybrid Reinforcement Learning [42.070531160001785]
感情支援システムのための反応認識ポリシー最適化(RAPO)を提案する。
RAPOは、対話を反応駆動プロセスとして扱い、シミュレーションされたユーザ応答を利用して、高密度な自然言語フィードバックを生成する。
RAPOは、肯定的な相互作用の結果の駆動において、強い強化学習ベースラインを著しく上回る。
論文 参考訳(メタデータ) (2026-03-16T15:39:54Z) - OpenClaw-RL: Train Any Agent Simply by Talking [54.06773485601523]
次状態信号は普遍的であり、ポリシーはそれらすべてから同時に学習することができる。
個人的な会話、端末の実行、GUIインタラクション、SWEタスク、ツールコールトレースは、別個のトレーニング問題ではない。
OpenClaw-RLは、エージェントを単に使用することで改善し、ユーザのリクエリ、修正、明示的なフィードバックから会話信号を復元する。
論文 参考訳(メタデータ) (2026-03-10T18:59:01Z) - On the Mechanisms of Collaborative Learning in VAE Recommenders [12.77626224639472]
変分オートエンコーダ(VAE)は行列分解の強力な代替手段である。
VAE-based collaborative filtering (CF) において, 協調がいかに生じるかを分析し, 潜時近接によって制御されることを示す。
分析はNetflix, MovieLens-20M, Million Songのデータセットで検証されている。
論文 参考訳(メタデータ) (2025-11-10T07:13:58Z) - UserBench: An Interactive Gym Environment for User-Centric Agents [110.77212949007958]
LLM(Large Language Models)ベースのエージェントは、推論とツールの使用において、目覚ましい進歩を遂げてきたが、ユーザと積極的にコラボレーションする能力はまだ未熟である。
マルチターン、選好駆動インタラクションにおいてエージェントを評価するために設計されたユーザ中心のベンチマークであるUserBenchを紹介する。
論文 参考訳(メタデータ) (2025-07-29T17:34:12Z) - Search-Based Interaction For Conversation Recommendation via Generative Reward Model Based Simulated User [117.82681846559909]
会話レコメンデーションシステム(CRS)は、マルチターンインタラクションを使用してユーザの好みを捉え、パーソナライズされたレコメンデーションを提供する。
本稿では,CRSと自動インタラクションを行うための生成報酬モデルに基づくシミュレーションユーザGRSUを提案する。
論文 参考訳(メタデータ) (2025-04-29T06:37:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。