論文の概要: AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use
- arxiv url: http://arxiv.org/abs/2607.20536v1
- Date: Fri, 10 Jul 2026 16:55:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.222636
- Title: AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use
- Title(参考訳): AppWorld-UL: ツール使用のための異種エージェントユーザインタラクションのベンチマーク
- Abstract要約: AppWorld-ULは、多様なエージェント-ユーザインタラクションを必要とする516の課題のベンチマークである。
我々の評価によると、最先端のLLMであるClaude Opus 4.7は、AppWorld-ULでわずか48.6%の成功しか達成していない。
このことは、ベンチマークの難しさと、ユーザ・イン・ザ・ループ・ツール・エージェントの研究を前進させる可能性を示している。
- 参考スコア(独自算出の注目度): 38.67550182213879
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-use agents that address day-to-day digital tasks such as ordering groceries must not only operate applications, but also interact with the user, e.g., to ask clarification questions, prompt for confirmation, and inform the user when the instruction is infeasible. However, current benchmarks for evaluating agent-user interactions do not capture the diversity of such interactions. Further, they operate in small environments with few, often non-state-changing, APIs. To address this gap, we introduce AppWorld-UL, a ``user-in-the-loop'' benchmark of 516 challenging tasks requiring diverse agent-user interactions. Building upon the AppWorld framework with 9 popular simulated apps like Amazon and Spotify, we systematically modify original tasks to introduce ambiguities and constraints that necessitate various types of agent-user interaction. User behavior is simulated by an LLM prompted to respond with carefully designed knowledge boundaries, offering more reliable simulation than the unconstrained or overly rigid alternatives used in prior work. Our evaluation reveals that a state-of-the-art LLM, Claude Opus 4.7, achieves only 48.6% success on AppWorld-UL, and only 35.7% on the harder, compositional subset. On the stricter, scenario-level metric, compositional task performance drops to only 21.3%. Our analysis reveals that correct user-interaction is crucial for success. This demonstrates the benchmark's difficulty and its potential to advance research on user-in-the-loop tool-use agents.
- Abstract(参考訳): 食料品の注文などの日々のデジタルタスクに対処するツール利用エージェントは、アプリケーションを操作するだけでなく、例えば、ユーザと対話して、明確化の質問をしたり、確認のプロンプトをしたり、命令が有効でないときにユーザに通知したりしなければならない。
しかし、エージェント-ユーザインタラクションを評価するための現在のベンチマークは、そのようなインタラクションの多様性を捉えていない。
さらに、ほとんどの非状態変更のAPIで、小さな環境で運用する。
このギャップに対処するために,エージェント-ユーザインタラクションの多様性を必要とする516の課題に対して,‘user-in-the-loop’ベンチマークであるAppWorld-ULを紹介した。
AmazonやSpotifyのような9つの人気のあるシミュレートされたアプリを使ったAppWorldフレームワークをベースとして、さまざまなタイプのエージェント-ユーザインタラクションを必要とするあいまいさと制約を導入するために、オリジナルタスクを体系的に修正しました。
ユーザの振る舞いは、LLMによってシミュレートされ、慎重に設計された知識境界に応答し、事前の作業で使用される制約のない、あるいは過度に厳密な代替手段よりも信頼性の高いシミュレーションを提供する。
我々の評価によると、最先端のLLMであるClaude Opus 4.7は、AppWorld-ULで48.6%、より硬く構成的なサブセットで35.7%しか成功していない。
より厳密なシナリオレベルのメトリクスでは、構成的タスクのパフォーマンスは21.3%に低下する。
分析の結果,正しいユーザインタラクションが成功に不可欠であることが判明した。
このことは、ベンチマークの難しさと、ユーザ・イン・ザ・ループ・ツール・エージェントの研究を前進させる可能性を示している。
関連論文リスト
- xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems [57.62172039072062]
xDailyBenchは、個人生活、ホワイトカラーワーク、学習と研究、ドメイン横断アクティビティなど、51のシナリオにまたがる248の慎重にキュレートされたタスクのベンチマークである。
これらのタスクは、ユーザがAIで実際に完了した、あるいは真に達成することを意図した要求に基づいており、明示的な要件と暗黙的な要件の両方をカバーする、きめ細かいバイナリルーブリックで評価される。
最高のモデルではタスクレベルのスコアが75.6%に達し、すべてのモデルは明示的な要件よりも暗黙的にパフォーマンスが悪く、ギャップは9ポイント以下である。
論文 参考訳(メタデータ) (2026-09-07T17:30:58Z) - Efficient Test-Time Adaptation through Human-AI Interaction [112.5131603022122]
我々は,ヒト-エージェント間相互作用(TAHI)によるテスト時間適応を提案する。
エージェントを2つの高ユーティリティドメイン(書き込みと視覚的創造)の30人に適応させ、合計600のタスクをこなします。
エージェントは10タスク以内の単独作業の成功率を4.5-20.9%向上させる。
論文 参考訳(メタデータ) (2026-09-03T17:33:18Z) - DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions [63.13827503828231]
我々は、長期ユーザーインタラクションにおけるパーソナライズされたプロアクティブなエージェント動作を評価するためのベンチマークであるVitaBench 2.0を紹介する。
結果は、最先端のモデルでさえ、現実世界のパーソナライゼーションは非常に困難であることを示している。
論文 参考訳(メタデータ) (2026-05-26T15:07:38Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications [20.065087936770215]
実世界の環境に根ざした多目的対話型タスクのエージェントを評価するベンチマークであるVitaBenchを紹介する。
VitaBenchは、66のツールを含む、これまでで最も複雑な生命維持シミュレーション環境を持つエージェントを提示する。
総合評価の結果,最も先進的なモデルでさえ,クロスシナリオタスクにおいて30%の成功率しか達成できないことがわかった。
論文 参考訳(メタデータ) (2025-09-30T16:33:49Z) - Fairy: Interactive Mobile Assistant to Real-world Tasks via LMM-based Multi-agent [7.715715198300168]
Fairyはインタラクティブなマルチエージェントモバイルアシスタントで、アプリ知識を継続的に蓄積し、使用中に自己進化する。
i) ユーザタスクをクロスアプリビューからサブタスクに分解するGlobal Task Planner,(ii) サブタスクを長期メモリと短期メモリに基づいてステップとアクションに洗練するApp-Level Executor,(iii) 実行エクスペリエンスをApp MapとTricksに統合するSelf-Learnerの3つのコアモジュール。
論文 参考訳(メタデータ) (2025-09-25T04:21:31Z) - MVISU-Bench: Benchmarking Mobile Agents for Real-World Tasks by Multi-App, Vague, Interactive, Single-App and Unethical Instructions [11.021990614727702]
textbfMVISU-Benchは137のモバイルアプリケーションに404のタスクを含むベンチマークである。
また,リスクを軽減し,モバイルエージェントのユーザ意図を明らかにするために,動的プロンプトプロンプトプロンプトとして機能するプラグイン・アンド・プレイモジュールであるAiderを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:18:30Z) - Breaking Single-Tester Limits: Multi-Agent LLMs for Multi-User Feature Testing [15.383375235673954]
アプリケーション機能テストのためのマルチユーザ対話タスクを自動化するために,LLM(Large Language Models)を利用した新しいマルチエージェントアプローチであるMAdroidを提案する。
具体的には、MAdroidは、ユーザエージェント(オペレータ)とスーパーバイザーエージェント(コーディネータとオブザーバ)の2つの機能タイプを採用している。
マルチユーザ対話型タスク41件を含む評価は,96.8%の動作類似性を有するタスクの82.9%を達成し,提案手法の有効性を示した。
論文 参考訳(メタデータ) (2025-06-21T01:38:53Z) - SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation [89.24729958546168]
スマートフォンエージェントは、ユーザーがデバイスを効率的に制御するのを助けるためにますます重要になっている。
We present SPA-Bench, a comprehensive SmartPhone Agent Benchmark designed to evaluate (M)LLM-based agent。
論文 参考訳(メタデータ) (2024-10-19T17:28:48Z) - MUG: Interactive Multimodal Grounding on User Interfaces [12.035123646959669]
本稿では,ユーザとエージェントがインタフェース画面上で協調作業を行うマルチモーダルグラウンドのための対話型タスクMUGを提案する。
ユーザがコマンドを与え、エージェントがコマンドに応答する。MUGはエージェントの応答を見る際に、エージェントがそのアクションを洗練または修正するための追加コマンドを与えるように、複数のラウンドのインタラクションを可能にする。
論文 参考訳(メタデータ) (2022-09-29T21:08:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。