論文の概要: "Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents
- arxiv url: http://arxiv.org/abs/2608.04755v1
- Date: Wed, 05 Aug 2026 12:23:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.917059
- Title: "Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents
- Title(参考訳): 過度に選択された「常に」:モバイルGUIエージェントにおけるタスク補完駆動型ポップアップ決定の意図しないコスト
- Authors: Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei,
- Abstract要約: タスク関連性とプライバシリスクに基づく4段階のパーミッション・フレームワークを構築した。
我々は、同期アノテーション付きスクリーンショットとUIツリー階層を用いて、4つのフロンティアマルチモーダル大言語モデルを評価する。
要求者のみをカレンダーからPiMusicに変更することで、権限が26/32から0/32に削減され、強いがタスク条件のApp-Trust Biasが明らかになった。
- 参考スコア(独自算出の注目度): 38.29267974352746
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mobile GUI agents routinely encounter system permission dialogs during task execution, yet their ability to grant only permissions that are necessary for the delegated task remains largely unexamined. We present a systematic study of this capability, which we term Permission Literacy. We construct a four-level permission framework based on task relevance and privacy risk and validate the evaluated scenarios with three independent experts in GUI-agent safety. We inject Android-style permission popups into real GUI tasks and evaluate four frontier multimodal large language models using synchronized annotated screenshots and UI-tree hierarchies, making the requester, permission, justification, and available actions accessible to the agent. Beyond the main study, we conduct controlled interventions that separately vary task context and agent-visible requester identity. Under the same Calendar task, changing only the requester from Calendar to PiMusic reduces grants from 26/32 to 0/32, revealing a strong but task-conditioned App-Trust Bias. Holding a popup fixed while changing task context also substantially changes authorization decisions, revealing a systematic Task-Prior Override. Prompt interventions can reduce unnecessary grants, but their effectiveness is inconsistent across models and may come at the cost of suppressing legitimate grants. These results suggest that separating task execution from permission authorization is a promising design direction for future work.
- Abstract(参考訳): モバイルGUIエージェントは、タスク実行中にシステムパーミッションダイアログに定期的に遭遇するが、委譲されたタスクに必要なパーミッションのみを許可する機能はほとんど検討されていない。
我々は,この能力の体系的研究を行い,その能力について,パーミッション・リテラシーと呼ぶ。
タスク関連性とプライバシリスクに基づく4段階のパーミッションフレームワークを構築し,GUIエージェントの安全性に関する3つの独立した専門家による評価シナリオを検証した。
我々は、Androidスタイルのパーミッションポップアップを実際のGUIタスクに注入し、同期化されたアノテーション付きスクリーンショットとUIツリー階層を使用して4つのフロンティアマルチモーダルな大規模言語モデルを評価し、要求者、パーミッション、正当化、利用可能なアクションをエージェントにアクセスできるようにする。
本研究の他に,タスクコンテキストとエージェント可視性要求者同一性が異なる制御された介入を行う。
同じカレンダータスクでは、要求者のみをカレンダーからPiMusicに変更することで、権限を26/32から0/32に減らし、強いタスク条件のApp-Trust Biasが明らかになる。
タスクコンテキストを変更しながらポップアップを固定すると、承認決定が大幅に変更され、システマティックなタスク-プライアオーバーライドが明らかになる。
迅速な介入は不要な助成金を減らすことができるが、それらの効果はモデル間で矛盾しておらず、正当な助成金を抑制するコストがかかる可能性がある。
これらの結果は,タスク実行と許可の分離が今後の作業にとって有望な設計方針であることを示唆している。
関連論文リスト
- How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement [55.966820779528376]
AIエージェントが普及するにつれて、ユーザーはそのようなシステムが抱えるリスクにますますさらされている。
プロンプト・インジェクション・アタックや幻覚は、エージェントに個人情報を第三者にリークさせる可能性がある。
自律システムとして、エージェントは、ユーザの意図や承認なしに、銀行取引のような機密性の高いタスクを実行することの、より積極的な危険性を示す。
論文 参考訳(メタデータ) (2026-07-15T11:36:22Z) - DocOS: Towards Proactive Document-Guided Actions in GUI Agents [54.27655693145045]
textbfDocOSは、完全にインタラクティブな環境で文書誘導問題解決を評価するために設計されたベンチマークである。
実験の結果、エージェントはプロアクティブ検索中に関連情報を確実に見つけるのに苦労し、検索した指示を忠実に正確な行動に移すのに失敗することが判明した。
論文 参考訳(メタデータ) (2026-05-18T08:36:04Z) - Do Coding Agents Understand Least-Privilege Authorization? [14.240332406666779]
我々は、現在のモデルが認証境界自体を推測できるかどうか検討する。
We show that frontier model often off permissions by the execution chain while giving unuseed or sensitive accesss。
そこで我々は,まずカバレッジ指向のポリシを生成し,各エントリをグラウンドと感度で監査する,十分性-高度分解法を提案する。
論文 参考訳(メタデータ) (2026-05-14T14:05:58Z) - Authorization Propagation in Multi-Agent AI Systems: Identity Governance as Infrastructure [0.0]
我々はこの問題を認可伝搬と呼ぶ。
RBAC、ABAC、ReBACのような古典的なアクセス制御モデルでは、完全には対処できない。
この論文は、認可伝達をワークフローレベルのプロパティとして形式化し、3つのサブプロブレムを特定し、マルチエージェントAIシステムにおける認可アーキテクチャの7つの構造的要件を導出する。
論文 参考訳(メタデータ) (2026-05-06T20:56:17Z) - KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation [72.01173512175531]
KnowU-Benchはパーソナライズされたモバイルエージェントのためのオンラインベンチマークである。
42のGUIタスク、86のパーソナライズされたタスク、64のプロアクティブタスクをカバーしている。
明示的なタスク実行に優れるエージェントは、あいまいな指示の下で50%以下に低下する。
論文 参考訳(メタデータ) (2026-04-09T16:50:50Z) - Who Grants the Agent Power? Defending Against Instruction Injection via Task-Centric Access Control [25.109590157742712]
我々は、動的にタスクスコープ化されたパーミッションを強制する軽量ランタイムアクセス制御フレームワークであるAgentSentryを紹介する。
広範囲で永続的な許可を与える代わりに、AgentSentryは、最小限の一時的なポリシーを動的に生成し、強制する。
我々は,エージェントがプライベートメールの転送に騙されるようなインジェクション攻撃を,エージェントSentryがうまく防ぐことを実証する。
論文 参考訳(メタデータ) (2025-10-30T07:36:59Z) - TaskAudit: Detecting Functiona11ity Errors in Mobile Apps via Agentic Task Execution [17.208420259998178]
TaskAuditは、シミュレーションインタラクションによる関数a11ityエラーの検出に焦点を当てたアクセシビリティ評価システムである。
実世界のアプリ評価では,54のアプリ画面から48のファンクタ11ityエラーを検出する方法が,既存のチェッカーでは4~20であるのに対し,我々の戦略は48のファンクタ11ityエラーを検出する。
論文 参考訳(メタデータ) (2025-10-14T20:28:49Z) - Tell Me More! Towards Implicit User Intention Understanding of Language
Model Driven Agents [110.25679611755962]
現在の言語モデル駆動エージェントは、しばしば効果的なユーザ参加のメカニズムを欠いている。
Intention-in-Interaction (IN3) は明示的なクエリを通してユーザの暗黙の意図を検査するための新しいベンチマークである。
私たちは、タスクの曖昧さを積極的に評価し、ユーザの意図を問う強力なモデルであるMistral-Interactを経験的に訓練し、それらを実行可能な目標へと洗練させます。
論文 参考訳(メタデータ) (2024-02-14T14:36:30Z) - Diagnosis, Feedback, Adaptation: A Human-in-the-Loop Framework for
Test-Time Policy Adaptation [20.266695694005943]
ポリシーは新しい環境にポリシーがデプロイされたときに発生する状態と報酬の変化によって、しばしば失敗する。
データ拡張は、エージェントの観察におけるタスク非関連の変化にモデルを不変にすることで、ロバスト性を高めることができる。
本稿では,ユーザからのフィードバックを直接活用して,タスク関連概念をパーソナライズする対話型フレームワークを提案する。
論文 参考訳(メタデータ) (2023-07-12T17:55:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。