論文の概要: Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure
- arxiv url: http://arxiv.org/abs/2607.04334v1
- Date: Sun, 05 Jul 2026 14:33:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.903664
- Title: Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure
- Title(参考訳): GUIエージェントは視線を信じているか? : レンズと構造に対する状態信頼を診断する
- Abstract要約: 我々は、視覚的状態依存、状態信念の画素、構造または先行への帰属を定式化する。
310の実際のWeb、モバイル、デスクトッププローブ上でのシングルチャネルの介入と組み合わせて測定する。
我々の中心となる計量は知覚融合ギャップ(Perception-Fusion Gap)である。
- 参考スコア(独自算出の注目度): 5.717981279944186
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal GUI agents read an interface through two redundant channels: the rendered pixels of a screenshot and a serialized structure such as a DOM or accessibility tree. Before acting, an agent forms a belief about the current interface state, but existing benchmarks score task success, element grounding, or attack resistance and do not ask whether that belief is drawn from the pixels. We formalize visual state reliance, the attribution of a state belief to pixels, structure, or priors, and measure it with paired single-channel interventions over 310 real web, mobile, and desktop probes. Every probe is scored by deterministic forced choice, with no model-generated item and no model judge. Our central metric is the Perception-Fusion Gap, the fraction of probes a model perceives correctly yet resolves toward structure under conflict. Across five models from three vendors, textual state beliefs defer to structure while image-only accuracy stays near ceiling, and Perception-Fusion Gap is positive for every model; non-text identity, by contrast, stays largely pixel-bound. The substitution is specific to the serialized-text and indexed-action channel, and coordinate-action agents are largely immune. For textual conflicts, a white-box ablation traces the effect to a single copied structural value, and in two live environments the conflict drives wrong actions and real task failure. Visual state reliance therefore gives a measurable diagnostic of whether agent state beliefs are visually grounded, and the errors it exposes propagate to actions.
- Abstract(参考訳): マルチモーダルGUIエージェントは、スクリーンショットのレンダリングピクセルとDOMやアクセシビリティツリーのようなシリアライズされた構造という、2つの冗長なチャネルを通してインターフェイスを読み取る。
作用する前に、エージェントは現在のインターフェイス状態についての信念を形成するが、既存のベンチマークはタスクの成功、要素の接地、攻撃抵抗を記録し、その信念がピクセルから引き出されるかどうかを問わない。
我々は,310個の実Web,モバイル,デスクトッププローブ上での単一チャネル介入を用いて,視覚的状態依存,状態信念の画素,構造,先行への寄与を定式化する。
それぞれのプローブは決定論的に強制された選択によってスコアされ、モデル生成項目は存在せず、モデル判断器も存在しない。
我々の中心となる計量は知覚融合ギャップ(Perception-Fusion Gap)である。
3つのベンダーの5つのモデルにおいて、画像のみの精度が天井付近に留まっている間、テキスト状態の信念は構造を反映し、知覚融合ギャップはすべてのモデルに対して正である。
置換はシリアライズド・テキストとインデックス化・アクション・チャネルに特異的であり、コーディネート・アクション・エージェントは大部分が免疫性である。
テキストの衝突に対して、ホワイトボックスのアブレーションは、その効果を1つのコピーされた構造値にトレースし、2つのライブ環境では、コンフリクトが間違ったアクションと実際のタスク失敗を駆動する。
したがって、視覚状態依存は、エージェント状態の信念が視覚的に根拠づけられているかどうかを計測可能な診断を与え、それが公開するエラーは行動に伝播する。
関連論文リスト
- MNIST-PRO: MNIST is Back as a Partially Observable World for AI Agents [74.83535434786145]
MNIST-PRO (MNIST-PRO) は、MNISTの桁認識を、ルックバック制約付きシーケンシャルな視線に基づく検索タスクに変換することで、エージェント認識を分離するベンチマークである。
生の視覚履歴、テキスト状態、構造化されたメートル法グリッドマップ、統合された視覚キャンバスを含む4つの記憶表現の10つのマルチモーダルモデルを評価する。
論文 参考訳(メタデータ) (2026-08-31T16:05:39Z) - Lift, Associate, and Fuse: A Decision-Centric Framework for 2D-to-3D Foundation Model Transfer [18.616107275409764]
2次元基礎モデルから3次元セグメンテーションへの予測を伝達する手法は、一般にタスクまたは表現によってグループ化される。
我々は5つの演算子として転送システムを表す決定中心のフレームワークである textbfLift, Associate, and Fuse (LAF) を紹介する。
LAFは、永続キャリアの明示的な契約を定義し、破棄された証拠が回収不能になる第1段階を特定する。
論文 参考訳(メタデータ) (2026-08-21T01:33:23Z) - Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning [75.00741348880044]
ツール強化された視覚言語モデル、ますます「イメージで考える」
近年、ブラインドテスト、ゲイン分解、アテンション分析による研究により、返却画像はほとんど寄与していないことが示された。
我々は、返却されたピクセルが到着する前に出力される構造化されたテキストである、と仮定する。
論文 参考訳(メタデータ) (2026-08-10T14:52:10Z) - When Does Consensus Mean Correctness? Measuring the Agreement-Accuracy Coupling with Semantics-Preserving Re-Rendering [0.8594140167290097]
ラベルのない信頼性信号として、摂動入力間のモデルの合意が使用される。
レンダリングは正確さと信頼性の両方で再サンプリングする。
モデル自身のクロスレンダーコンセンサスインバータを微調整する。
論文 参考訳(メタデータ) (2026-08-06T07:08:05Z) - Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources [3.168307501254055]
視覚言語モデル(VLM)は,ニュースやWebコンテンツを画像として読み取る傾向にあり,出版者のアイデンティティが視覚的に存在していることを示す。
記事の内容証拠をどの表面ソースキューがオーバーライドするかを計測するクロスモデル診断であるCueを紹介する。
論文 参考訳(メタデータ) (2026-07-03T14:22:05Z) - Can Machines Really See Objects in Images? A Study Based on Syntactic Distance and Visual Self-Referential Instances [53.65561607407989]
そのような局所的な手がかりが区別の安定な基盤を提供しない場合、モデルが依然として正しく分類できるかどうかを問う。
ResNetとVision Transformersの実験では、一貫した位相遷移現象が明らかになった。
結果は、汎用インテリジェンスは、既存の言語を再利用するのではなく、新しい言語を作成する必要があることを示唆している。
論文 参考訳(メタデータ) (2026-06-28T14:27:40Z) - Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models [29.66841995436342]
現代の視覚言語モデル(VLM)は、計量距離クエリでは信頼できないままである。
我々は,Hypersim,ScanNet,KITTI360から構築したマルチビュー評価プロトコルであるtextbfViewDiagを紹介する。
安定な予測は、証拠に敏感な推論よりも先駆的な崩壊を反映している可能性が示唆された。
論文 参考訳(メタデータ) (2026-06-01T18:06:08Z) - A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration [0.0]
生産言語モデルシステムは、労働者エージェントの目に見えないオーケストレーションにまたがってそれを拡大する要求に答える。
これは、単一のワーカーが見ることができない欠陥のクラスに何をもたらすか尋ねる。
1人の開発者から5世代にわたる10のシステムと、異なるアライメントパラダイムからの5つのプロバイダのみです。
論文 参考訳(メタデータ) (2026-05-25T05:09:48Z) - Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions [2.9521041993295607]
視覚言語モデル(VLM)は、古典的な光学錯視に直面した場合、体系的なバイアスを示す。
モデルトレーニングなしでこの障害モードに対処するツール誘導推論フレームワークを提案する。
我々は3つの経験的観察を報告し、さらなる調査を保証していると信じている。
論文 参考訳(メタデータ) (2026-03-31T08:35:10Z) - Contextual inference from single objects in Vision-Language models [10.367669666212473]
一つのオブジェクトがどれくらいのシーンコンテキストを持つかは、人間のシーン知覚においてよく研究されている問題である。
この能力が視覚言語モデル(VLM)でどのように構成されるかはいまだに理解されていない。
本研究では,単一対象からの文脈推論の系統的・機械的解析を通じて,この問題を考察する。
論文 参考訳(メタデータ) (2026-03-20T13:24:15Z) - Dissecting Adversarial Robustness of Multimodal LM Agents [70.2077308846307]
我々は、VisualWebArena上に現実的な脅威モデルを用いて、200の敵タスクと評価スクリプトを手動で作成する。
我々は,クロボックスフロンティアLMを用いた最新のエージェントを,リフレクションやツリーサーチを行うエージェントを含む,壊すことに成功している。
AREを使用して、新しいコンポーネントの追加に伴うロバスト性の変化を厳格に評価しています。
論文 参考訳(メタデータ) (2024-06-18T17:32:48Z) - Counterfactual Image Editing [54.21104691749547]
対物画像編集は、生成AIにおいて重要なタスクであり、ある機能が異なる場合、画像がどのように見えるかを尋ねる。
本稿では,形式言語を用いた対物画像編集タスクを形式化し,潜在生成因子と画像の因果関係をモデル化する。
ニューラル因果モデルを利用して、対物画像を生成する効率的なアルゴリズムを開発した。
論文 参考訳(メタデータ) (2024-02-07T20:55:39Z) - ZoomNeXt: A Unified Collaborative Pyramid Network for Camouflaged Object Detection [70.11264880907652]
最近のオブジェクト(COD)は、現実のシナリオでは極めて複雑で難しい、視覚的にブレンドされたオブジェクトを周囲に分割しようと試みている。
本研究では,不明瞭な画像を観察したり,ズームインしたりアウトしたりする際の人間の行動を模倣する,効果的な統合協調ピラミッドネットワークを提案する。
我々のフレームワークは、画像とビデオのCODベンチマークにおいて、既存の最先端の手法を一貫して上回っている。
論文 参考訳(メタデータ) (2023-10-31T06:11:23Z) - Unsupervised Foggy Scene Understanding via Self Spatial-Temporal Label
Diffusion [51.11295961195151]
運転シーンの霧画像列の特徴を利用して、自信ある擬似ラベルを密度化する。
局所的な空間的類似性と逐次画像データの隣接時間対応の2つの発見に基づいて,新たなターゲット・ドメイン駆動擬似ラベル拡散方式を提案する。
本手法は,2つの天然霧のデータセット上で51.92%,53.84%の平均交叉結合(mIoU)を達成するのに有効である。
論文 参考訳(メタデータ) (2022-06-10T05:16:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。