論文の概要: Unlocking Proactivity in Task-Oriented Dialogue
- arxiv url: http://arxiv.org/abs/2605.22240v1
- Date: Thu, 21 May 2026 09:46:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 16:35:42.193535
- Title: Unlocking Proactivity in Task-Oriented Dialogue
- Title(参考訳): タスク指向対話におけるアンロック確率
- Authors: Hongbin Zhang, Ning Gao, Yuqin Dai, Ruiyuan Wu, Jinpeng Wang, Rena Wei Gao, Bingdong Tan, Shuzheng Gao, Zongjie Li, Chaozheng Wang,
- Abstract要約: アクティブなタスク指向対話(TOD)は、ユーザの懸念を積極的に調査し、受け入れに向けて会話を操縦する説得エージェントを要求する。
ユーザの潜在的関心事に対する条件付けは、サンプリングの量が損なわれることのない、プロアクティブな能力を解放することを示します。
- 参考スコア(独自算出の注目度): 21.99795860301162
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Proactive task-oriented dialogue (TOD), such as outbound sales, demands a persuasive agent that actively probes the user's concerns and steers the conversation toward acceptance within a bounded number of turns. Yet post-trained LLMs are inherently conservative, and reward-shaping RL (e.g., GRPO) struggles since it only re-weights what an already passive policy samples. We show that conditioning on the user's latent concerns unlocks proactive capability that no amount of sampling can undermine, establishing these concerns as a pivotal training-time signal. To operationalize this finding, we build the \textbf{Cognitive User Simulator}, which models each user as a stratified persona comprising observable external traits and hidden internal concerns. The simulator produces faithful and diverse interactions, while emitting per-turn state dynamics that track persuasion progress. We then introduce \textbf{Simulator-Induced Asymmetric-View Policy Optimization}, which converts the modeled concerns and the simulation state transition into complementary training objectives: (1) \emph{Asymmetric On-Policy Self-Distillation} that transfers concern-aware behavior from a privileged view of the same policy into its deployable, conversation-only view; and (2) \emph{State-Transition Policy Refinement} ...
- Abstract(参考訳): アウトバウンド販売のような積極的タスク指向対話(TOD)は、ユーザの懸念を積極的に調査し、境界数の範囲内で会話を受理する説得エージェントを要求する。
しかし、ポストトレーニング後のLLMは本質的に保守的であり、報酬形成のRL(例えばGRPO)は、すでに受動的政策のサンプルを再重み付けしているだけであるため、困難である。
ユーザの潜在的関心事に対する条件付けは、サンプリングの量を損なうことのない積極的な能力を解放し、これらの懸念を重要な訓練時間信号として確立することを示す。
この発見を運用するために,各ユーザを,観測可能な外部特性と隠された内部懸念を含む階層化されたペルソナとしてモデル化する,‘textbf{Cognitive User Simulator’を構築した。
シミュレータは忠実で多様な相互作用を発生させ、一方、説得の進捗を追跡するターン毎の状態ダイナミクスを出力する。
次に、モデル化された関心事とシミュレーション状態の遷移を相補的な訓練目標に変換する「textbf{Simulator-induced Asymmetric-View Policy Optimization」を紹介します。(1)「emph{Asymmetric On-Policy Self-Distillation」は、同一方針の特権的な視点から、その展開可能な会話のみの視点へ、および(2)「emph{State-Transition Policy Refinement」...
関連論文リスト
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment [59.536125286960186]
セルフリフレクションと相互監査を可能にするために、専門的な役割を割り当てるマルチエージェントフレームワークがますます採用されている。
アクター・オブザーバ非対称性(Actor-Observer Asymmetric)と呼ばれる認知バイアスを同時に誘発する。
ReTASは、対立する視点を客観的なコンセンサスに合成するためにエージェントを誘導する。
論文 参考訳(メタデータ) (2026-04-21T15:05:58Z) - From Control to Foresight: Simulation as a New Paradigm for Human-Agent Collaboration [14.322953078328693]
効果的なコラボレーションには、コントロールだけでなく、前もって注意が必要だ、と私たちは主張します。
シミュレーション・イン・ザ・ループは,ユーザとエージェントがシミュレーションされた将来の軌道を探索することを可能にする対話パラダイムである。
論文 参考訳(メタデータ) (2026-03-12T08:42:33Z) - Sleeper Cell: Injecting Latent Malice Temporal Backdoors into Tool-Using LLMs [0.0]
オープンウェイト大規模言語モデル(LLM)はエージェントAIを民主化しているが、微調整されたウェイトは頻繁に共有され、リーダーボードのパフォーマンスを超えた限られた精査で採用されている。
これにより、サードパーティモデルが強力な行動保証なしで組み込まれるリスクが生じる。
有毒なモデルでは、良質なタスクに対して最先端のパフォーマンスを維持し、採用にインセンティブを与えていることを示す。
論文 参考訳(メタデータ) (2026-03-02T22:01:08Z) - SPACeR: Self-Play Anchoring with Centralized Reference Models [50.55045557371374]
Simエージェントポリシーは、現実的で、人間らしく、高速で、マルチエージェント設定でスケーラブルである。
大規模な拡散モデルやトークン化モデルを用いた模倣学習の最近の進歩は、人間の運転データから直接行動を把握することができることを示している。
本研究では,事前訓練されたトークン化自己回帰運動モデルを利用したSPACeRを提案する。
論文 参考訳(メタデータ) (2025-10-20T19:53:02Z) - Compromising Embodied Agents with Contextual Backdoor Attacks [69.71630408822767]
大型言語モデル(LLM)は、エンボディドインテリジェンスの発展に変化をもたらした。
本稿では,このプロセスにおけるバックドアセキュリティの重大な脅威を明らかにする。
ほんの少しの文脈的デモンストレーションを毒殺しただけで、攻撃者はブラックボックスLDMの文脈的環境を隠蔽することができる。
論文 参考訳(メタデータ) (2024-08-06T01:20:12Z) - CtRL-Sim: Reactive and Controllable Driving Agents with Offline Reinforcement Learning [38.63187494867502]
CtRL-Simは、リターン条件付きオフライン強化学習(RL)を利用して、リアクティブで制御可能なトラフィックエージェントを効率的に生成する手法である。
CtRL-Simは,エージェントの挙動を詳細に制御しながら,現実的な安全クリティカルシナリオを生成可能であることを示す。
論文 参考訳(メタデータ) (2024-03-29T02:10:19Z) - SAFE-SIM: Safety-Critical Closed-Loop Traffic Simulation with Diffusion-Controllable Adversaries [94.84458417662407]
制御可能なクローズドループ安全クリティカルシミュレーションフレームワークであるSAFE-SIMを紹介する。
提案手法は,1)現実の環境を深く反映した現実的な長距離安全クリティカルシナリオの生成,2)より包括的でインタラクティブな評価のための制御可能な敵行動の提供,の2つの利点をもたらす。
複数のプランナにまたがるnuScenesとnuPlanデータセットを使用して、我々のフレームワークを実証的に検証し、リアリズムと制御性の両方の改善を実証した。
論文 参考訳(メタデータ) (2023-12-31T04:14:43Z) - User Behavior Simulation with Large Language Model based Agents [116.74368915420065]
LLMベースのエージェントフレームワークを提案し,実際のユーザ動作をシミュレートするサンドボックス環境を設計する。
実験結果から,本手法のシミュレーション行動は実人の行動に非常に近いことが判明した。
論文 参考訳(メタデータ) (2023-06-05T02:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。