論文の概要: You Changed Your Mind, The Model Didn't: Demystifying Intent in Multi-Turn Dialogue
- arxiv url: http://arxiv.org/abs/2610.06496v1
- Date: Mon, 05 Oct 2026 15:16:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 08:03:44.511302
- Title: You Changed Your Mind, The Model Didn't: Demystifying Intent in Multi-Turn Dialogue
- Title(参考訳): マルチトゥルン・ダイアログで暗黙のインテントを暗示するモデル(動画あり)
- Abstract要約: 大きな言語モデルはマルチターンタスクを処理し、ユーザは変更を提案するが、最終的に拒否する。
拒否された変更に言及するだけで、ユーザの最終的な意図が変更されていなくても、タスクの実行が損なわれる可能性があるのです。
さまざまなタスクにまたがって、モデルは拒否された提案と代替された要件の両方に対して脆弱であり、上述した結果の混乱と一致している。
- 参考スコア(独自算出の注目度): 16.254806701752344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a large language model handles a multi-turn task and a user proposes a change but ultimately rejects it, the model should continue as if nothing changed. We find a surprising failure: merely mentioning a rejected change can derail task execution, even when the user's final intent remains unchanged. To systematically study language model behavior under evolving user intent, we introduce Intent-Eval, a controlled benchmark spanning tool actions, code, databases, and mathematics. Across diverse tasks, models are vulnerable to both rejected proposals and superseded requirements, consistent with mentioned-as-in-effect confusion: conversational content is treated as active requirements even after it has been rejected or replaced. Accuracy degradation can deepen or persist as interaction continues, highlighting the need to distinguish what has been mentioned from what remains in effect. Building on this insight, we propose Intent-OPSD, a decision-conditioned on-policy self-distillation framework with Teacher and Student initialized from the same model. The frozen Teacher provides active-intent supervision from the complete task matching the user's decision, training the Student on the full dialogue to follow active requirements reflecting user intent.
- Abstract(参考訳): 大規模な言語モデルがマルチターンタスクを処理し、ユーザが変更を提案するが最終的に拒否した場合、モデルは変更されていないかのように継続するべきである。
拒否された変更に言及するだけで、ユーザの最終的な意図が変更されていなくても、タスクの実行が損なわれる可能性があるのです。
進化するユーザ意図の下で言語モデルの振る舞いを体系的に研究するために、ツールアクション、コード、データベース、数学にまたがる制御されたベンチマークであるIntent-Evalを導入する。
さまざまなタスクにおいて、モデルは、拒否された提案と置き換えられた要求の両方に対して脆弱であり、前述の「効果」の混乱と一致する:会話の内容は、拒否されたり、置き換えられた後でも、アクティブな要件として扱われる。
相互作用が継続するにつれて、正確さの低下は深まり、継続する可能性がある。
この知見に基づいて,教師と学生が同一モデルから初期化した意思決定型自己蒸留フレームワークであるIntent-OPSDを提案する。
凍結した教師は、ユーザの決定に合致する完全なタスクからアクティブなインテリジェンスを提供し、学生をフル対話でトレーニングし、ユーザの意図を反映したアクティブな要求に従う。
関連論文リスト
- Intent-Driven Situation Tracking for User-Centric Multi-Turn Agents [4.138547191663224]
Intent-Driven situation states (IDSS) は、対話と並行して明示的な状況を維持する訓練不要のフレームワークである。
IDSSパースツールは、証明可能なエンティティと属性に返却され、ユーザの意図、必要な変数、制約、実行状態を追跡し、アクション実行可能性の更新のためにタスク制約に新しい事実を伝達する。
論文 参考訳(メタデータ) (2026-08-16T14:14:07Z) - LLMs Get Lost in Evolving User Intent [31.460856308052872]
静的なシングルターンタスクを動的マルチターン会話に変換するフレームワークを導入する。
強い静的設定性能は進化するインテント・セッティングに移行しないことを示す。
今日のLLMは、ユーザの進化する意図を忠実に追跡し、実行していません。
論文 参考訳(メタデータ) (2026-07-22T21:14:44Z) - Interactive Task Alignment as a POMDP [17.743513722485876]
本稿では,特定のタスクを不特定なインタラクションに変換するための一般的なフレームワークを紹介する。
ユーザシミュレータを人的ユーザスタディで検証した。
教師付き微調整と強化学習によるポストトレーニングではタスクアライメントが改善されるが,インタラクションによる不確実性の解消には,モデルが人間に遅れている。
論文 参考訳(メタデータ) (2026-07-17T18:04:38Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - Interactive Reasoning: Visualizing and Controlling Chain-of-Thought Reasoning in Large Language Models [54.85405423240165]
トピックの階層構造としてチェーンオブ思考出力を可視化するインタラクション設計であるInteractive Reasoningを導入する。
私たちは、不確実なトレードオフに直面したAIによる意思決定のプロトタイプであるHippoで、インタラクティブな推論を実装しています。
論文 参考訳(メタデータ) (2025-06-30T10:00:43Z) - JoTR: A Joint Transformer and Reinforcement Learning Framework for
Dialog Policy Learning [53.83063435640911]
対話政策学習(DPL)は対話モデリングの重要な構成要素である。
フレキシブルな対話行動を生成するための新しいフレームワークであるJoTRを導入する。
従来の方法とは異なり、JoTRはよりダイナミックで適応可能な対話アクション生成を可能にするワードレベルのポリシーを定式化している。
論文 参考訳(メタデータ) (2023-09-01T03:19:53Z) - DiactTOD: Learning Generalizable Latent Dialogue Acts for Controllable
Task-Oriented Dialogue Systems [15.087619144902776]
本稿では,潜在空間における対話行動を表現する対話行動モデル(DiactTOD)を提案する。
大規模なコーパスで事前トレーニングを行うと、DiactTODは対話を予測し制御し、制御可能な応答を生成する。
論文 参考訳(メタデータ) (2023-08-01T23:29:16Z) - Controllable Mixed-Initiative Dialogue Generation through Prompting [50.03458333265885]
混合開始対話タスクには、情報の繰り返し交換と会話制御が含まれる。
エージェントは、ポリシープランナーが定める特定の対話意図や戦略に従う応答を生成することにより、コントロールを得る。
標準的なアプローチは、これらの意図に基づいて生成条件を実行するために、訓練済みの言語モデルを微調整している。
代わりに、条件生成の微調整に代えて、大きな言語モデルをドロップインで置き換えるように促します。
論文 参考訳(メタデータ) (2023-05-06T23:11:25Z) - Interacting with Non-Cooperative User: A New Paradigm for Proactive
Dialogue Policy [83.61404191470126]
インタラクティブな環境下でプロアクティブなポリシーを学習できるI-Proという新しいソリューションを提案する。
具体的には,4つの要因からなる学習目標重みを通じてトレードオフを学習する。
実験の結果,I-Proは,有効性と解釈性において,ベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2022-04-07T14:11:31Z) - Refine and Imitate: Reducing Repetition and Inconsistency in Persuasion
Dialogues via Reinforcement Learning and Human Demonstration [45.14559188965439]
ユーザシミュレータを使わずにmleベースの言語モデルの洗練に強化学習を適用することを提案する。
我々は報酬を通じて繰り返し、矛盾、タスク関連に関する文レベル情報を蒸留する。
実験により,我々のモデルは,自動測定結果と人的評価結果の両方において,従来の最先端対話モデルよりも優れていたことがわかった。
論文 参考訳(メタデータ) (2020-12-31T00:02:51Z) - TOD-BERT: Pre-trained Natural Language Understanding for Task-Oriented
Dialogue [113.45485470103762]
本研究では,言語モデリングのためのタスク指向対話データセットを,人間とマルチターンの9つに統合する。
事前学習時の対話動作をモデル化するために,ユーザトークンとシステムトークンをマスク付き言語モデルに組み込む。
論文 参考訳(メタデータ) (2020-04-15T04:09:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。