論文の概要: Alignment Is Local: A Paired Diagnostic for GUI Agents under User-Side Persuasion
- arxiv url: http://arxiv.org/abs/2607.29199v1
- Date: Fri, 31 Jul 2026 09:18:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.673137
- Title: Alignment Is Local: A Paired Diagnostic for GUI Agents under User-Side Persuasion
- Title(参考訳): アライメントは局所的:ユーザ側説得下でのGUIエージェントのペア診断
- Abstract要約: 現在のモバイルエージェントで支配的な軽量防衛である、即時レベルのアライメントは、局所的な現象である、と我々は主張する。
単線ガードレールは, 最大40ポイントの単発ASR削減をほぼゼロのオーバーリフレクションコストで達成できることを示す。
- 参考スコア(独自算出の注目度): 41.163763265336456
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Trustworthy deployment of GUI agents in ubiquitous computing settings requires alignment that survives dynamic interaction and precise threat conditions, not just single-turn refusal of explicit harmful requests. We argue that prompt-level alignment, the dominant lightweight defense in current mobile agents, is a local phenomenon: it works reliably only in the narrow evaluation slice where it is typically measured, namely single-turn, explicitly-verbalized intent, and degrades systematically along two axes that any real user can traverse. Using a paired diagnostic on three frontier GUI agents, screen-grounded, user-side persuasion, with no environment injection, we show that a one-line guardrail achieves large single-shot ASR reductions, up to roughly 40 points, at near-zero over-refusal cost. Nevertheless, moving from independent probes to four-turn escalation chains raises guarded ASR by approximately 20 points on every model. Relative to the neutral baselines, this increase reflects substantial guardrail erosion for Qwen but a largely defense-orthogonal dynamic risk for Claude and GPT. The sign of the salience gap flips under the guardrail: concealed requests are not systematically more successful than explicit ones without a guardrail, but are more successful with one, indicating that the defense engages primarily when intent is named. Static single-turn ASR therefore overstates deployed robustness by a systematic and predictable margin.
- Abstract(参考訳): ユビキタスコンピューティング環境におけるGUIエージェントの信頼性の高いデプロイには、明示的な有害な要求を単一ターンで拒否するのではなく、動的インタラクションと正確な脅威条件を継続するアライメントが必要である。
現在のモバイルエージェントで支配的な軽量防衛であるプロンプトレベルのアライメントは、局所的な現象である、と我々は主張する。これは、通常は測定される狭い評価スライス、すなわちシングルターン、明示的にバーバル化されたインテントでのみ確実に機能し、実際のユーザが横断できる2つの軸に沿って体系的に劣化する。
スクリーングラウンド, ユーザ側の説得, 環境注入のない3つのフロンティアGUIエージェントのペア診断を用いて, ワンラインガードレールは, ほぼゼロのオーバーリフレクションコストで, 最大40ポイントの単発ASR削減を実現していることを示す。
それでも、独立したプローブから4ターンのエスカレーションチェーンに移行することで、ASRは各モデルで約20ポイント上昇する。
中立のベースラインとは対照的に、この増加はQwenのガードレールの侵食を反映しているが、ClaudeとGPTの防衛的・直交的なリスクは大きい。
隠蔽された要求は、ガードレールのない明示的な要求よりも体系的に成功しないが、それよりも成功しており、主に意図が命名されたときに防衛が関与することを示している。
静的な単ターンASRは、体系的で予測可能なマージンによって頑丈さを誇張している。
関連論文リスト
- Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal [3.441021278275805]
大きな言語モデルにおける行動アライメントは、しばしば脆弱な内部安全表現を隠蔽する。
本研究では, 対向接尾辞攻撃を表現的アライメントのプローブとして検討した。
その結果,全層にまたがる拒絶の抑制は,単一層配置対よりも効果的であることが判明した。
論文 参考訳(メタデータ) (2026-07-09T19:21:29Z) - TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning [60.68349524623048]
分解されたジェイルブレイクは、大きな言語モデルにとって重大な脅威となる。
我々はステートフルなデュアルエンコーダ防御フレームワークであるTwinGateを紹介する。
我々は、8600の異なる悪意のある意図にまたがる360万以上の命令の包括的なデータセットを構築した。
論文 参考訳(メタデータ) (2026-04-30T13:44:01Z) - Defusing the Trigger: Plug-and-Play Defense for Backdoored LLMs via Tail-Risk Intrinsic Geometric Smoothing [16.949753329459796]
Tail-risk Intrinsic Geometric Smoothing (TIGS)は、大規模な言語モデルにおけるバックドア攻撃に対するプラグアンドプレイの推論時防御である。
TIGSはコンテンツ認識型テールリスクスクリーニングを使用して、不審な注意頭と行を識別する。
その後、本質的な幾何学的滑らか化を施す一方で、より強いフルロー収縮はトリガー支配的なルーティングを妨害する。
論文 参考訳(メタデータ) (2026-04-27T08:18:30Z) - Adaptive Defense Orchestration for RAG: A Sentinel-Strategist Architecture against Multi-Vector Attacks [0.0]
検索強化世代システムは、医療や法律などの機密性の高い領域にますます展開されている。
この機能は、メンバシップ推論、データ中毒、意図しないコンテンツのリークなど、重大なセキュリティリスクをもたらす。
本稿では,リスク分析と防衛選択のためのコンテキスト認識フレームワークであるSentinel-Strategistアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-22T11:17:10Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models [10.286339414754499]
Bad RSSDは自己教師付き拡散モデルの表現層をターゲットにした最初のバックドア攻撃である。
標的画像に対するPCA空間のトリガーで有毒なサンプルのセマンティック表現をハイジャックする。
悪い RSSD は FID と MSE の両方で既存の攻撃を著しく上回っている。
論文 参考訳(メタデータ) (2026-03-01T09:56:26Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification [52.63017280231648]
人物再識別(ReID)は、歩行者軌道追跡などの現実の多くの応用において、基本的な課題である。
Person ReIDモデルは、歩行者画像に対する知覚不能な摂動が完全に誤った予測を引き起こすような、敵の攻撃に非常に敏感である。
本稿では,2つの相からなる二重不変防衛フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-13T03:56:40Z) - A Self-supervised Approach for Adversarial Robustness [105.88250594033053]
敵対的な例は、ディープニューラルネットワーク(DNN)ベースの視覚システムにおいて破滅的な誤りを引き起こす可能性がある。
本稿では,入力空間における自己教師型対向学習機構を提案する。
これは、反逆攻撃に対する強力な堅牢性を提供する。
論文 参考訳(メタデータ) (2020-06-08T20:42:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。