論文の概要: SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- arxiv url: http://arxiv.org/abs/2607.15550v1
- Date: Fri, 17 Jul 2026 01:45:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.730881
- Title: SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- Title(参考訳): SeerGuard: 世界モデル予測によるモバイルGUIエージェントの安全性フレームワーク
- Abstract要約: SeerGuardは、事前実行命令レベルのスクリーニングとアクションレベルのリスクアセスメントを通じてリスクを軽減するために設計された、結果認識の安全性フレームワークである。
我々は,マルチタスク学習による統合型安全拡張世界モデル(SAWM)を構築し,セマンティック次世代予測と安全リスク評価を統合する。
- 参考スコア(独自算出の注目度): 26.773000505309437
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Mobile graphical user interface (GUI) agents have demonstrated remarkable capabilities in automating complex tasks, yet they introduce critical safety risks where a single erroneous action can lead to irreversible consequences. Existing safety mechanisms are primarily reactive, lacking the ability to assess risks before execution. In this paper, we introduce SeerGuard, a consequence-aware safety framework designed to mitigate these risks through pre-execution instruction-level screening and action-level risk assessment. Specifically, the action-level assessment analyzes agent-proposed actions within current GUI states, anticipating likely outcomes to identify risks before they are executed. To enable these capabilities, we construct a unified safety-augmented world model (SAWM) via multi-task learning, integrating semantic next-state prediction with safety risk assessment. Extensive experiments demonstrate that SeerGuard generalizes effectively across diverse mobile GUI agents. On Qwen3-VL-8B-Instruct, it increases the safety-utility score from $0.191$ to $0.596$ at $ω=0.8$ and reduces the risk-cost score from $0.347$ to $0.130$ at $α=0.8$. Further analyses on our SAWM validate the effectiveness of the instruction-level screening, alongside the capability of action risk assessment and next-state prediction.
- Abstract(参考訳): モバイル・グラフィカル・ユーザー・インタフェース(GUI)エージェントは複雑なタスクの自動化において顕著な能力を示してきたが、単一の誤動作が不可逆的な結果をもたらす重大な安全リスクが生じる。
既存の安全メカニズムは主に反応性があり、実行前にリスクを評価する能力がない。
本稿では,これらのリスクを軽減するために,事前の指導レベルのスクリーニングと行動レベルのリスクアセスメントを通じて,結果認識型安全性フレームワークであるSeerGuardを紹介する。
特に、アクションレベルアセスメントは、現在のGUI状態内のエージェントが提案するアクションを分析し、実行前にリスクを特定する可能性のある結果を予測する。
これらの機能を実現するため,マルチタスク学習による統合安全拡張世界モデル(SAWM)を構築し,セマンティック次世代予測と安全リスク評価を統合する。
大規模な実験により、SierGuardは多様なモバイルGUIエージェントで効果的に一般化されている。
Qwen3-VL-8B-Instructでは、安全ユーティリティスコアを0.191$から0.596$に、リスクコストスコアを0.347$から0.130$に下げる。
我々のSAWMに関するさらなる分析は、行動リスク評価と次の状態予測の能力とともに、命令レベルのスクリーニングの有効性を検証する。
関連論文リスト
- AURA-Eval: Evaluation Framework for Acting Under Risk Awareness in LLM Agent Trajectories [12.694014584212695]
ツール・ユース・トラジェクトリにおける制御強化と行動のきめ細かい診断を組み合わせたフレームワークであるAURA-Evalを紹介する。
157個のトラジェクトリを用いて1,249個の評価項目を生成し,20個のフロンティアモデルとオープンウェイトモデルを評価する。
以上の結果から, LLM エージェントは安全経路が存在しない場合, より安全でない行動に陥ることが示唆された。
論文 参考訳(メタデータ) (2026-09-06T18:58:56Z) - MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps [26.50307679295416]
実際のAndroidアプリケーション上に構築されたリスクタスクのベンチマークであるMobileWorldSafetyを紹介します。
各タスクに対して、最終システム状態に対する検証可能なリスク指標を定義する。
これは、安全性障害と能力障害を区別し、客観的かつ再現可能な評価を可能にする。
論文 参考訳(メタデータ) (2026-08-18T11:33:22Z) - VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring [60.53395558502203]
Vision-Language Embodied Safety Agent (VLESA)は、自我中心のビデオから人間の活動を監視する。
VLESAは、コンテキストに応じて同一のアクションが安全または危険である意図に依存した安全性に対処する。
目標を共同で推測し,映像から将来の行動を予測するための意図-行動予測エージェントを提案する。
論文 参考訳(メタデータ) (2026-06-02T17:42:17Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models [62.16655896700062]
活性化ステアリングは大規模言語モデル(LLM)の有用性を高める技術である
重要かつ過度に調査された安全リスクを無意識に導入することを示します。
実験によると、これらの介入は強制乗算器として機能し、ジェイルブレイクに新たな脆弱性を発生させ、標準ベンチマークで攻撃成功率を80%以上向上させる。
論文 参考訳(メタデータ) (2026-02-03T12:32:35Z) - SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models [60.8821834954637]
LRMの安全性をエンドツーエンドに評価する最初のベンチマークであるSafeRBenchを紹介する。
私たちは、リスクカテゴリとレベルを入力設計に組み込んだ先駆者です。
我々は,長い推論トレースを意味的に一貫性のある単位にセグメント化するためのマイクロシンクのチャンキング機構を導入する。
論文 参考訳(メタデータ) (2025-11-19T06:46:33Z) - DeepKnown-Guard: A Proprietary Model-Based Safety Response Framework for AI Agents [12.054307827384415]
大きな言語モデル(LLM)はますます顕著になり、重要なドメインへの信頼性の高いデプロイメントを厳しく制限しています。
本稿では,LLMを入力レベルと出力レベルの両方で保護する新しい安全応答フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T03:04:35Z) - LM Agents May Fail to Act on Their Own Risk Knowledge [15.60032437959883]
言語モデル(LM)エージェントは、安全クリティカルなシナリオにおいて、様々な潜在的な、深刻なリスクをもたらす。
Sudo rm -rf /*' が危険なのか?」といった質問に対して "Yes" と答えることが多いが、インスタンス化された軌跡におけるそのようなリスクを特定できない可能性が高い。
論文 参考訳(メタデータ) (2025-08-19T02:46:08Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z) - Safety Margins for Reinforcement Learning [53.10194953873209]
安全マージンを生成するためにプロキシ臨界度メトリクスをどのように活用するかを示す。
Atari 環境での APE-X と A3C からの学習方針に対するアプローチを評価する。
論文 参考訳(メタデータ) (2023-07-25T16:49:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。