論文の概要: ProEvent: An Event-centric Benchmark for Proactive Agents
- arxiv url: http://arxiv.org/abs/2607.17701v1
- Date: Mon, 20 Jul 2026 08:48:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.555577
- Title: ProEvent: An Event-centric Benchmark for Proactive Agents
- Title(参考訳): ProEvent: プロアクティブエージェントのためのイベント中心ベンチマーク
- Authors: Guanzhen Li, Liangming Pan, Leye Wang,
- Abstract要約: ProEventは、エージェントがユーザのタイムテーブルを積極的にメンテナンスする能力を評価するために設計された、最初のイベント中心のベンチマークである。
ProEventは、ユーザ間の動的インタラクション、同時チャットスレッド、実世界のノイズを考慮した、合成されながら現実的なチャットを提供する。
- 参考スコア(独自算出の注目度): 41.03981463319731
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Proactive agents are expected to anticipate user needs and provide autonomous assistance by perceiving environmental context without explicit instructions. A fundamental capability of such agents is to identify and track users' upcoming events, enabling continuous and event-specific assistance. For example, by recording the time and location of a planned hike, an agent can deliver weather reminders in advance or provide navigation support before departure. However, existing works on proactive agents largely overlook event-centric assistance, and the open-ended nature of proactive assistance poses challenges for reliable evaluation. To bridge these gaps, we introduce ProEvent, the first event-centric benchmark designed to assess an agent's ability to proactively maintain a user's timetable based on ongoing instant messaging chats. ProEvent provides synthesized yet realistic chats that consider the dynamic interaction among users, concurrent chat threads, and noise in the real world, and evaluates proactive agents on response timing, single-step response correctness, and multi-step response correctness. Experiments on eight LLMs and pipelines reveal that current agents frequently overact and struggle with event cancellation. Notably, even GPT-5.1 only reacts correctly in 26.7% of scenarios. Further qualitative analysis reveals fundamental limitations of current LLMs as proactive agents, particularly in detecting implicit events and reasoning from the user's first-person perspective.
- Abstract(参考訳): 積極的エージェントはユーザニーズを予測し、明示的な指示なしに環境コンテキストを知覚することで自律的な支援を提供する。
このようなエージェントの基本的な機能は、ユーザの今後のイベントを特定し、追跡することであり、継続的およびイベント固有のアシストを可能にする。
例えば、予定されるハイキングの時間と場所を記録することで、エージェントは事前に天気予報を配信したり、出発前にナビゲーション支援を行うことができる。
しかし、既存のプロアクティブエージェントの研究は、主にイベント中心のアシストを見落としており、プロアクティブエージェントのオープンな性質は、信頼性の高い評価のための課題を提起している。
これらのギャップを埋めるため、ProEventは、エージェントが現在進行中のインスタントメッセージングチャットに基づいて、ユーザのタイムテーブルを積極的にメンテナンスする能力を評価するように設計された、最初のイベント中心のベンチマークである。
ProEventは、ユーザ間の動的インタラクション、同時チャットスレッド、および実世界のノイズを考慮した、合成されながら現実的なチャットを提供し、応答タイミング、シングルステップ応答の正しさ、マルチステップ応答の正しさについて、プロアクティブエージェントを評価する。
8つのLSMとパイプラインの実験では、現在のエージェントが頻繁にオーバーアクティベートし、イベントのキャンセルに苦労していることが判明した。
特に、GPT-5.1でさえ26.7%のシナリオでしか正しく反応しない。
さらに質的な分析は、特に暗黙の出来事を検出し、ユーザーの一人称視点から推論する際に、現在のLLMのプロアクティブエージェントとしての基本的な限界を明らかにする。
関連論文リスト
- Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents [17.725926482772227]
推論の前に知覚に基づく2段階のフレームワークであるtextbf Pre-Reasoning Perception Framework (PRPF) を提案する。
PRPFは、介入ゲーティングとコンテキスト圧縮のための軽量なMultimodal Proactive Perceptor (MPP)を導入し、介入が保証された場合にのみProactive Agent Reasoner (PAR)を起動する。
ProactiveMobileベンチマークの実験では、PRPFは成功率(SR)とProactiveMobileベースラインでの推論効率を改善しつつ、偽トリガレート(FTR)を大幅に低減することが示された。
論文 参考訳(メタデータ) (2026-06-02T06:54:02Z) - Anticipate and Learn: Unleashing Idle-Time Compute in Proactive Agents [51.46570338144688]
ProActは、アイドルタイム計算を利用して、今後のユーザニーズを予測し、満たすプロアクティブエージェントアーキテクチャである。
進化する対話履歴を永続記憶とともに解析することにより、ProActは今後のニーズを予測し、情報を反復的に取得する。
MemBenchの評価では、ProActが最先端の反射精度を達成し、持続的で堅牢な性能を裏付けている。
論文 参考訳(メタデータ) (2026-05-25T15:47:21Z) - Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization [61.641777037967366]
プロアクティブな大規模言語モデル(LLM)エージェントは、複数のターンで積極的に計画し、クエリし、相互作用することを目的としている。
エージェント強化学習(RL)は、マルチターン環境でエージェントを訓練するための有望なソリューションとして登場した。
本稿では,行動強化と情報収集能力の強化を両立させたエージェントRLフレームワークであるBAOを提案する。
論文 参考訳(メタデータ) (2026-02-11T20:40:43Z) - ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems [7.591337469415894]
ProAgentは、大量の感覚コンテキストとLCM推論を利用してプロアクティブアシストを提供するエンドツーエンドのプロアクティブエージェントシステムである。
ProAgent on Augmented Reality (AR) メガネをエッジサーバで実装し,実世界のテストベッド,パブリックデータセット,ユーザスタディを通じて広範囲に評価する。
その結果,ProAgentは最大33.4%,ツールコールF1スコア16.8%,ユーザの満足度が向上した。
論文 参考訳(メタデータ) (2025-12-07T08:21:07Z) - Foundation Models for Logistics: Toward Certifiable, Conversational Planning Interfaces [59.80143393787701]
大規模言語モデル(LLM)は不確実性に対処し、導入障壁を低くしながら再計画の加速を約束する。
本稿では,自然言語対話のアクセシビリティと目標解釈の検証可能な保証とを組み合わせたニューロシンボリック・フレームワークを提案する。
わずか100個の不確実性フィルタで微調整された軽量モデルは、GPT-4.1のゼロショット性能を上回り、推論遅延を50%近く削減する。
論文 参考訳(メタデータ) (2025-07-15T14:24:01Z) - ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory Perceptions [8.300084456561171]
最初のコンテキスト対応プロアクティブエージェントであるContextAgentを紹介する。
ContextAgentは、ユーザの意図を理解するために、ウェアラブル上の知覚的知覚から多次元コンテキストを抽出する。
アクティブなアシストが必要な場合、ContextAgentは自動的に必要なツールを呼び出す。
論文 参考訳(メタデータ) (2025-05-20T17:55:25Z) - Interacting with Non-Cooperative User: A New Paradigm for Proactive
Dialogue Policy [83.61404191470126]
インタラクティブな環境下でプロアクティブなポリシーを学習できるI-Proという新しいソリューションを提案する。
具体的には,4つの要因からなる学習目標重みを通じてトレードオフを学習する。
実験の結果,I-Proは,有効性と解釈性において,ベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2022-04-07T14:11:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。