論文の概要: Beyond Oracle Communication: Benchmarking Interactive Intent Alignment Under Miscommunication and Evolving User Intent
- arxiv url: http://arxiv.org/abs/2609.38604v1
- Date: Tue, 29 Sep 2026 22:10:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.794236
- Title: Beyond Oracle Communication: Benchmarking Interactive Intent Alignment Under Miscommunication and Evolving User Intent
- Title(参考訳): Oracle Communicationを超えて: ミスコミュニケーションとユーザインテントの進化の下でインタラクティブなインテントアライメントのベンチマーク
- Abstract要約: 我々はDrift-Bench++を紹介した。Drift-Bench++は、制御ミスアライメントとインテントシフトを伴う検証可能なタスクのベンチマークである。
また,タスクグラウンディング,ユーザリアリズム,質問の有効性,進化意図への適応を網羅した総合評価プロトコルGRIPを開発した。
インタラクティブなインテントアライメントのための統一された実行可能なベンチマークを提供することで、Drift-Bench++はエージェントの評価と前進のための基盤を提供する。
- 参考スコア(独自算出の注目度): 29.694220187115558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern LLM agents increasingly tackle complex tasks through interactive, long-horizon exchanges with users, while existing benchmarks generally assume that users always accurately and sufficiently communicate a fixed intent. However, this oracle communication assumption rarely holds in practice: users may miscommunicate, change their goals, and run out of patience. We define this task setting as Interactive Intent Alignment, where agents must recover and continuously track the user's current intent despite imperfect communication and evolving goals. To study this setting, we introduce Drift-Bench++, a principled benchmark construction pipeline for verified executable tasks with controlled misalignment and intent shifts, along with an interaction protocol featuring finite patience, diverse simulated users, and silent interaction-conditioned shifts. We further develop GRIP, a comprehensive evaluation protocol covering task grounding, user realism, inquiry effectiveness, and adaptation to evolving intent. Across diverse environments, models, and interaction conditions, stronger interaction consistently helps but remains far from oracle performance; Validation on deployed ProdAgent sessions further shows that the modeled failures are prevalent and consequential in deployment. By providing a unified, executable benchmark for interactive intent alignment, Drift-Bench++ offers a foundation for evaluating and advancing agents under realistic communication and evolving intent.
- Abstract(参考訳): 現代のLLMエージェントは、ユーザとの対話的で長期にわたる交流を通じて、複雑なタスクに対処する傾向にある。
しかし、このオラクルコミュニケーションの前提は、ユーザーがコミュニケーションを間違えたり、目標を変更したり、忍耐が尽きたりするなど、現実的にはほとんど成り立たない。
このタスク設定をインタラクティブ・インテント・アライメント(Interactive Intent Alignment)と定義する。
この設定を検討するために、Drift-Bench++は、制御ミスアライメントとインテントシフトを伴う検証可能なタスクのための、原則化されたベンチマーク構築パイプラインであり、有限忍耐、多様なシミュレートされたユーザ、サイレントなインタラクション条件のシフトを特徴とするインタラクションプロトコルである。
さらに,タスクグラウンディング,ユーザリアリズム,質問の有効性,進化意図への適応を網羅した総合評価プロトコルGRIPを開発した。
さまざまな環境、モデル、インタラクション条件にわたって、強い相互作用は一貫して役立ちますが、オラクルのパフォーマンスからは程遠いままです。
インタラクティブなインテントアライメントのための統一された実行可能なベンチマークを提供することで、Drift-Bench++は、現実的なコミュニケーションと進化するインテントの下でエージェントを評価し、前進するための基盤を提供する。
関連論文リスト
- From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents [56.187590188698955]
大規模言語モデルは、ますます有能な自律エージェントを可能にしてきたが、そのようなエージェントを実用的に有効にするためには、パーソナライズが不可欠である。
最近のベンチマークではエージェントのパーソナライゼーションの評価が始まっているが、それらは主に静的な選好スナップショット、固定されたインタラクションログ、あるいは事前に定義されたユーザプロファイルに対する質問応答に依存している。
縦断的相互作用履歴から構築した暗黙的行動アライメントのベンチマークであるIBA-Benchを紹介する。
IBA-Agentは、広範囲な検索と軌道レベルのアライメントを通じて競合する優先順位を調整するエージェントフレームワークである。
論文 参考訳(メタデータ) (2026-08-03T12:52:04Z) - LLMs Get Lost in Evolving User Intent [31.460856308052872]
静的なシングルターンタスクを動的マルチターン会話に変換するフレームワークを導入する。
強い静的設定性能は進化するインテント・セッティングに移行しないことを示す。
今日のLLMは、ユーザの進化する意図を忠実に追跡し、実行していません。
論文 参考訳(メタデータ) (2026-07-22T21:14:44Z) - Communication Policy Evolution for Proactive LLM Agents [58.4960889232199]
本稿では,コミュニケーションポリシを形式化し,テキストおよびUIベースのポリシを確立し,さまざまな環境におけるコミュニケーションポリシを評価する。
本稿では,コミュニケーションポリシーをロールアウトとプロンプトレベルの進化を通じて改善するための自己進化フレームワークであるコミュニケーションポリシー進化(CPE)を提案する。
論文 参考訳(メタデータ) (2026-06-12T09:54:01Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments [8.937298475124484]
現在の大規模言語モデルエージェントはリアクティブパラダイムの下で動作し、短期セッション内の即時ユーザクエリにのみ応答する。
本稿では,比較的静的なユーザニーズと動的環境とのギャップを埋めることのできる,アクティブなタスク指向エージェントのための新しいインタラクションパラダイムを提案する。
動的環境下で複雑なマルチターンダイアログデータを構築するための高品質なデータ合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-01-14T11:15:40Z) - UserBench: An Interactive Gym Environment for User-Centric Agents [110.77212949007958]
LLM(Large Language Models)ベースのエージェントは、推論とツールの使用において、目覚ましい進歩を遂げてきたが、ユーザと積極的にコラボレーションする能力はまだ未熟である。
マルチターン、選好駆動インタラクションにおいてエージェントを評価するために設計されたユーザ中心のベンチマークであるUserBenchを紹介する。
論文 参考訳(メタデータ) (2025-07-29T17:34:12Z) - Benchmark Real-time Adaptation and Communication Capabilities of Embodied Agent in Collaborative Scenarios [2.930915232771767]
リアルタイムな人間とAIのコラボレーションは、エージェントが効果的なコミュニケーションを動的に維持しながら、目に見えない人間の行動に適応する必要がある。
我々は,強力な適応性とリアルタイム実行によるコミュニケーションを組み合わせたMonTA(Monitor-then-Adapt framework)を提案する。
提案したベンチマークでは,MonTAが他のベースラインエージェントより優れていることを示す。
論文 参考訳(メタデータ) (2024-11-30T11:17:17Z) - Tell Me More! Towards Implicit User Intention Understanding of Language
Model Driven Agents [110.25679611755962]
現在の言語モデル駆動エージェントは、しばしば効果的なユーザ参加のメカニズムを欠いている。
Intention-in-Interaction (IN3) は明示的なクエリを通してユーザの暗黙の意図を検査するための新しいベンチマークである。
私たちは、タスクの曖昧さを積極的に評価し、ユーザの意図を問う強力なモデルであるMistral-Interactを経験的に訓練し、それらを実行可能な目標へと洗練させます。
論文 参考訳(メタデータ) (2024-02-14T14:36:30Z) - AntEval: Evaluation of Social Interaction Competencies in LLM-Driven
Agents [65.16893197330589]
大規模言語モデル(LLM)は、幅広いシナリオで人間の振る舞いを再現する能力を示した。
しかし、複雑なマルチ文字のソーシャルインタラクションを扱う能力については、まだ完全には研究されていない。
本稿では,新しいインタラクションフレームワークと評価手法を含むマルチエージェントインタラクション評価フレームワーク(AntEval)を紹介する。
論文 参考訳(メタデータ) (2024-01-12T11:18:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。