論文の概要: GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
- arxiv url: http://arxiv.org/abs/2608.21832v2
- Date: Thu, 27 Aug 2026 07:03:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.563378
- Title: GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
- Title(参考訳): GUI-プリミティブ:視覚言語GUIグラウンディングにおける空間推論障害の診断
- Abstract要約: コンピュータ利用エージェントは、インターフェイス要素を見つけるために、スクリーンショットに自然言語命令を接地する。
既存のベンチマークでは、モデルが言語を正しい要素にバインドするかどうかを区別していない。
そこで我々はGUI-Primitives(GUI-Primitives, 994-itemベンチマーク)を紹介した。
- 参考スコア(独自算出の注目度): 8.113418747367573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents ground natural-language instructions in screenshots to locate interface elements, yet existing benchmarks do not isolate whether models bind relational language to the correct element. We introduce GUI-Primitives, a 994-item benchmark of contrastive instruction pairs over seven spatial relations in graphical user interfaces (left/right, above/below, containment, alignment, proximity, list ordinal, occlusion). Each pair holds the screenshot and anchor fixed while changing the relation expression, so the correct target moves between two designated candidates. Five annotators validate a 196-item subset ($κ= 0.94$ well-formedness; $κ= 0.79$ target selection). Nineteen vision-language models reach at most $32\%$ strict point-in-box accuracy. Because models emit unconstrained coordinates, we classify each prediction by the candidate region it falls within. Predictions fall outside both candidates on $60-92\%$ of items. Conditional on falling within a candidate region, target selection reaches 0.82-0.90 for horizontal position, vertical position, proximity, and list ordinal, but does not differ significantly from 0.50 for containment and occlusion: most failures reflect candidate localization rather than relation understanding. Across ten models, benchmark accuracy correlates with ScreenSpot-Pro accuracy (Spearman $ρ= +0.74$), an exploratory association at this sample size. Marking the two designated candidates raises selection accuracy by 35--57 percentage points, an oracle diagnostic that supplies the candidate set rather than a deployable method. We release the benchmark, predictions, and code.
- Abstract(参考訳): コンピュータ利用エージェントは、インターフェース要素を特定するために、スクリーンショットに自然言語命令を接地するが、既存のベンチマークでは、モデルがリレーショナル言語を正しい要素に結合するかどうかを区別しない。
GUI-Primitives(GUI-Primitives)は、GUIインタフェースの7つの空間的関係(左/右、上/下、囲い込み、アライメント、近接、リストオーディショナル、オクルージョン)に比較して比較可能な命令ペアのベンチマークである。
各ペアは、関係式を変更しながらスクリーンショットとアンカーを固定しているため、正しいターゲットは2つの指定された候補の間を移動する。
5つのアノテーションは196-item部分集合(κ= 0.94$ well-formedness; $κ= 0.79$ target selection)を検証する。
9つの視覚言語モデルは、少なくとも32\%$厳格なポイントインボックス精度に達する。
モデルは制約のない座標を出力するため、各予測を、それが属する候補領域によって分類する。
予測は両候補の60-92\%の項目に該当する。
候補領域内での落下条件では、目標選択は水平位置、垂直位置、近接位置、リスト順序で0.82-0.90に達するが、封じ込めや隠蔽では0.50と大きく異なるわけではない。
10モデルにわたってベンチマーク精度はScreenSpot-Proの精度(Spearman $ρ= +0.74$)と相関する。
指定された2つの候補をマークすることは、デプロイ可能な方法ではなく、候補セットを提供するオラクル診断である35--57パーセントの選択精度を高める。
ベンチマーク、予測、コードをリリースします。
関連論文リスト
- Confidence-Aware Ensemble and Long-Word Refinement for Artistic Text Recognition [0.6303112417588329]
アートテキスト認識(ATR)は、装飾的なフォント、湾曲したレイアウト、オブジェクトのような文字、散らかし、激しい歪みを言葉画像で組み合わせることがしばしばあるため、依然として困難である。
本稿では,この設定の標準化ベンチマークとしてWordArt-V1.5について検討し,最近のシーンおよび芸術的テキスト認識器を共通プロトコルで評価する。
本稿では, SVTRv2, PARSeq, MAERecを公式トレーニングスプリットの微調整後に組み合わせた自信認識アンサンブルを提案する。
論文 参考訳(メタデータ) (2026-08-30T18:56:04Z) - G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification [14.607727417863273]
G2Dは、生成的なVLMを使用して、CLIP検索候補を画像に対して検証する、トレーニング不要のフレームワークである。
平均精度は68.85%、CLIPは59.35%、スタンドアロンのVLMは63.11%である。
また、DCLIP、WaffleCLIP、CuPLに移行し、識別的提案と生成的視覚的推論の実践的なインターフェースをサポートする。
論文 参考訳(メタデータ) (2026-08-27T07:34:07Z) - ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning [1.827510863075184]
ClosureBenchはグラフ関係推論のための構築的なベンチマークである。
証明済みの真実だ
1.5Bのオープンウェイトからフロンティアシステムへのモデルの評価を行った。
論文 参考訳(メタデータ) (2026-08-18T18:36:21Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - PACE: Polar Axis-Conditioned Estimation for PairUAV Relative Localization [0.0]
PairUAV 相対ローカライゼーションは2つのUAV画像を極航法コマンドにマップする。
ヘッダとレンジは同じペアのポーズコンテキストを共有し、それらを均質な座標として扱い、両方の出力に同じデコーダエビデンスと最適化状態を使用するように強制する。
本稿では,共有されたReloc3rスタイルのペア表現を保持しながら,軸特異的な読み出しインタフェースを割り当てる手法であるPolar Axis-Conditioned Estimationを導入する。
論文 参考訳(メタデータ) (2026-07-19T14:20:13Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets [6.896160570537455]
本稿では,単段階実行可能なGUIグラウンドにおけるポストホックUQのクロスレジームベンチマークであるArgusを紹介する。
我々は,ロジットに基づくスコア,サンプリングと整合性尺度,隠れ状態および密度推定器,P(True)および言語信頼促進手法の評価を行った。
UQランキングは、固定モデルのためにデータセット間で安定しているが、モデルクラスとオブザーバブルインターフェース間で分解される。
論文 参考訳(メタデータ) (2026-06-24T12:34:28Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Revisiting the Role of Language Priors in Vision-Language Models [90.0317841097143]
視覚言語モデル(VLM)は、微調整なしで、ゼロショット方式で様々な視覚的理解タスクに適用される。
我々は、画像から次の単語を生成するために訓練された$textitgenerative VLMs$について研究する。
画像テキスト検索の図解的タスクにおけるゼロショット性能を,8つの人気のある視覚言語ベンチマークで検証する。
論文 参考訳(メタデータ) (2023-06-02T19:19:43Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z) - Towards Instance-Level Parser Selection for Cross-Lingual Transfer of
Dependency Parsers [59.345145623931636]
我々は、インスタンスレベルの選択(ILPS)という、新しい言語間移動パラダイムを論じる。
本稿では,デレキシライズドトランスファーの枠組みにおけるインスタンスレベルの選択に着目した概念実証研究を提案する。
論文 参考訳(メタデータ) (2020-04-16T13:18:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。