論文の概要: Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
- arxiv url: http://arxiv.org/abs/2604.00842v1
- Date: Wed, 01 Apr 2026 12:53:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-02 16:44:31.991225
- Title: Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
- Title(参考訳): アクティブエージェント研究環境:アクティブユーザによるアクティブアシスタントの評価
- Abstract要約: Pareは、デジタル環境におけるプロアクティブエージェントの構築と評価のためのフレームワークである。
Pare-Benchは、コミュニケーション、生産性、スケジューリング、ライフスタイルアプリにまたがる143のタスクのベンチマークである。
- 参考スコア(独自算出の注目度): 85.1155076383488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Proactive agents that anticipate user needs and autonomously execute tasks hold great promise as digital assistants, yet the lack of realistic user simulation frameworks hinders their development. Existing approaches model apps as flat tool-calling APIs, failing to capture the stateful and sequential nature of user interaction in digital environments and making realistic user simulation infeasible. We introduce Proactive Agent Research Environment (Pare), a framework for building and evaluating proactive agents in digital environments. Pare models applications as finite state machines with stateful navigation and state-dependent action space for the user simulator, enabling active user simulation. Building on this foundation, we present Pare-Bench, a benchmark of 143 diverse tasks spanning communication, productivity, scheduling, and lifestyle apps, designed to test context observation, goal inference, intervention timing, and multi-app orchestration.
- Abstract(参考訳): ユーザニーズを予測し、自律的にタスクを実行するプロアクティブエージェントは、デジタルアシスタントとして大きな可能性を秘めている。
既存のアプローチは、フラットなツールコールAPIとしてアプリをモデル化し、デジタル環境におけるユーザインタラクションのステートフルでシーケンシャルな性質を捉えず、現実的なユーザシミュレーションを実現する。
本稿では,デジタル環境におけるプロアクティブエージェントの構築と評価を行うフレームワークであるProactive Agent Research Environment (Pare)を紹介する。
Pareは、ユーザシミュレータのためのステートフルナビゲーションと状態依存アクションスペースを備えた有限状態マシンとしてアプリケーションをモデル化し、アクティブなユーザシミュレーションを可能にする。
この基盤の上に構築されたPare-Benchは、コミュニケーション、生産性、スケジューリング、ライフスタイルアプリにまたがる143のタスクのベンチマークで、コンテキスト観察、ゴール推論、介入タイミング、マルチアプリオーケストレーションをテストするように設計されています。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation [16.74971373243012]
既存の評価手法はしばしば静的なベンチマークに依存しており、エージェントの振る舞いの動的で多段階の性質を捉えていない。
エージェント評価のための対話型ユーザシミュレーションツールキットVISTAを提案する。
我々のツールキットは、シミュレーションされた相互作用のリアリズム、能力カバレッジ、相互作用の有効性を測定するための6つのメトリクスからなる。
論文 参考訳(メタデータ) (2026-06-09T16:39:32Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - Computer-Using World Model [58.59112582915026]
我々は,次のユーザインタフェース(UI)状態を予測するデスクトップソフトウェアのための世界モデルであるComputer-Using World Model (CUWM)を紹介する。
CUWMはまずエージェント関連状態変化のテキスト記述を予測し、次に次のスクリーンショットを合成するために視覚的にこれらの変化を実現する。
テスト時間動作探索を用いてCUWMを評価し、凍結エージェントが世界モデルを用いて実行前の候補動作をシミュレートし比較する。
論文 参考訳(メタデータ) (2026-02-19T13:48:29Z) - Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments [8.937298475124484]
現在の大規模言語モデルエージェントはリアクティブパラダイムの下で動作し、短期セッション内の即時ユーザクエリにのみ応答する。
本稿では,比較的静的なユーザニーズと動的環境とのギャップを埋めることのできる,アクティブなタスク指向エージェントのための新しいインタラクションパラダイムを提案する。
動的環境下で複雑なマルチターンダイアログデータを構築するための高品質なデータ合成パイプラインを提案する。
論文 参考訳(メタデータ) (2026-01-14T11:15:40Z) - TongSIM: A General Platform for Simulating Intelligent Machines [59.27575233453533]
エボディード・インテリジェンス(Embodied Intelligence)は、現実的なシミュレートされた環境における訓練エージェントに焦点を当てる。
TongSIMは、エンボディエージェントのトレーニングと評価のための高忠実で汎用的なプラットフォームである。
論文 参考訳(メタデータ) (2025-12-23T10:00:43Z) - Non-Collaborative User Simulators for Tool Agents [12.294827535425414]
本研究では,非協調行動の4つのカテゴリをシミュレートする新しいユーザシミュレータアーキテクチャを提案する。
我々のMultiWOZと$tau$-benchの実験は、非コラボレーションユーザと出会う際に、最先端のツールエージェントの性能が著しく低下していることを明らかにした。
論文 参考訳(メタデータ) (2025-09-27T05:06:17Z) - Test Automation for Interactive Scenarios via Promptable Traffic Simulation [48.240394447516664]
本稿では,対話型シナリオにおけるAVプランナ評価のための,現実的かつ安全クリティカルな人間の行動を生成する自動化手法を提案する。
我々は低次元目標位置を用いて複雑な人間の行動のパラメータ化を行い、それをプロンプト可能な交通シミュレータProSimに入力する。
テスト生成を自動化するために,目標領域を探索し,ベイズ最適化を用いて安全クリティカルな動作を効率的に識別するプロンプト生成モジュールを導入する。
論文 参考訳(メタデータ) (2025-06-01T22:29:32Z) - Towards a Formal Characterization of User Simulation Objectives in Conversational Information Access [15.54070473873364]
ユーザシミュレーションは、会話情報アクセスエージェントを自動訓練し、評価するための有望なアプローチである。
トレーニングは実際のユーザとの行動類似性を最大化することを目的としており、評価は現実世界の会話エージェントのパフォーマンスの正確な予測に焦点を当てている。
論文 参考訳(メタデータ) (2024-06-27T08:46:41Z) - USimAgent: Large Language Models for Simulating Search Users [33.17004578463697]
本稿では,大規模言語モデルに基づくユーザ検索行動シミュレータUSimAgentを紹介する。
シミュレータは、検索中のユーザのクエリ、クリック、動作の停止をシミュレートすることができる。
実ユーザ行動データセットに関する実証調査では、シミュレータがクエリ生成において既存のメソッドよりも優れていることが示された。
論文 参考訳(メタデータ) (2024-03-14T07:40:54Z) - User Behavior Simulation with Large Language Model based Agents [116.74368915420065]
LLMベースのエージェントフレームワークを提案し,実際のユーザ動作をシミュレートするサンドボックス環境を設計する。
実験結果から,本手法のシミュレーション行動は実人の行動に非常に近いことが判明した。
論文 参考訳(メタデータ) (2023-06-05T02:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。