論文の概要: Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines
- arxiv url: http://arxiv.org/abs/2604.15376v1
- Date: Wed, 15 Apr 2026 20:47:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-20 22:00:19.568573
- Title: Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines
- Title(参考訳): Zoom Consistency:マルチステップビジュアルグラウンドパイプラインにおける自由信頼信号
- Authors: Keon Kim, Krish Chelikavada,
- Abstract要約: マルチステップズームインパイプラインはGUIグラウンディングに広く利用されている。
中間出力は、無償で有用な信頼信号: ズーム一貫性を含む。
理想化条件下でのステップ1空間誤差の線形推定器であることを示す。
- 参考スコア(独自算出の注目度): 0.880899367147235
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-step zoom-in pipelines are widely used for GUI grounding, yet the intermediate predictions they produce are typically discarded after coordinate remapping. We observe that these intermediate outputs contain a useful confidence signal for free: zoom consistency, the distance between a model's step-2 prediction and the crop center. Unlike log-probabilities or token-level uncertainty, zoom consistency is a geometric quantity in a shared coordinate space, making it directly comparable across architecturally different VLMs without calibration. We prove this quantity is a linear estimator of step-1 spatial error under idealized conditions (perfect step-2, target within crop) and show it correlates with prediction correctness across two VLMs (AUC = 0.60; Spearman rho = -0.14, p < 10^{-6} for KV-Ground-8B; rho = -0.11, p = 0.0003 for Qwen3.5-27B). The correlation is small but consistent across models, application categories, and operating systems. As a proof-of-concept, we use zoom consistency to route between a specialist and generalist model, capturing 16.5% of the oracle headroom between them (+0.8%, McNemar p = 0.19). Code is available at https://github.com/omxyz/zoom-consistency-routing.
- Abstract(参考訳): マルチステップズームインパイプラインはGUIグラウンディングに広く使用されているが、中間予測は座標の再マッピング後に破棄されることが多い。
これらの中間出力は、ズーム一貫性、モデルのステップ2予測と作物中心の間の距離といった、自由な信頼性信号を含むことが観察された。
対数確率やトークンレベルの不確実性とは異なり、ズーム一貫性は共有座標空間における幾何量であり、キャリブレーションなしでアーキテクチャ的に異なるVLM間で直接比較することができる。
この量は、理想化された条件下でのステップ-1空間誤差の線形推定器(完全ステップ-2、作物中のターゲット)であることが証明され、2つのVLM(AUC = 0.60; Spearman rho = -0.14, p < 10^{-6} for KV-Ground-8B; rho = -0.11, p = 0.0003 for Qwen3.5-27B)の予測精度と相関している。
相関は小さいが、モデル、アプリケーションカテゴリ、オペレーティングシステム間で一貫性がある。
概念実証として、私たちは、スペシャリストとジェネラリストのモデルをルートするためにズーム一貫性を使用し、それらの間のオラクルヘッドルームの16.5%(+0.8%, McNemar p = 0.19)をキャプチャする。
コードはhttps://github.com/omxyz/zoom-consistency-routing.comで公開されている。
関連論文リスト
- UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding [55.22866422166757]
テストタイムズームイン法は、各ケースでモデルが実際に不確実かどうかを無視して、固定された作物サイズを持つすべてのインスタンスに対して一様に適用する。
トレーニング不要な適応型ズームインフレームワークである textbfUI-Zoomer を提案する。
論文 参考訳(メタデータ) (2026-04-15T17:32:28Z) - Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement [0.0]
視覚言語モデルは、それらのテキスト経路が表現できないような幾何学を符号化する。
ロラ微調整(r=16, 2,000枚)は、このギャップを6.5度に縮める。
これらの知見は、単一の凍結したバックボーンがマルチタスク幾何学的センサーとして機能することを可能にした。
論文 参考訳(メタデータ) (2026-03-06T16:48:27Z) - LINA: Linear Autoregressive Image Generative Models with Continuous Tokens [56.80443965097921]
連続トークンを持つ自己回帰モデルは、特にテキスト・トゥ・イメージ(T2I)合成において、視覚生成に有望なパラダイムを形成する。
このフレームワーク内での計算効率のよい線形アテンションの設計法について検討する。
LINAは、線形注意に基づくシンプルで計算効率の良いT2Iモデルであり、ユーザ命令から高忠実度1024x1024画像を生成することができる。
論文 参考訳(メタデータ) (2026-01-30T06:44:33Z) - On the Relationship Between Representation Geometry and Generalization in Deep Neural Networks [0.0]
教師なし幾何学的計量である有効次元が精度を強く予測することを示す。
ノイズによる幾何劣化は精度損失(r=-0.94, $p 10(9)$)を引き起こすが、PCAによる幾何改善はアーキテクチャ全体にわたる精度(95%のばらつきで-0.03pp)を維持する。
これらの結果は、有効次元が、ラベルなしで完全に計算されたニューラルネットワークの性能に関するドメインに依存しない予測および因果情報を提供することを証明している。
論文 参考訳(メタデータ) (2026-01-28T04:33:41Z) - iGaussian: Real-Time Camera Pose Estimation via Feed-Forward 3D Gaussian Splatting Inversion [62.09575122593993]
iGaussianは2段階のフィードフォワードフレームワークで、直接3Dガウス変換によるリアルタイムカメラポーズ推定を実現する。
NeRF Synthetic, Mip-NeRF 360, T&T+DB データセットの実験結果から, 従来の手法に比べて大幅な性能向上が得られた。
論文 参考訳(メタデータ) (2025-11-18T05:22:22Z) - Environment-Aware Indoor LoRaWAN Path Loss: Parametric Regression Comparisons, Shadow Fading, and Calibrated Fade Margins [3.776919981139063]
内部のLoRaWAN伝播は、構造的および時間的変化の文脈因子によって形成される。
リークセーフなクロスバリデーションを用いて評価した,環境に配慮した統計的に規律のある経路損失フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-05T20:14:48Z) - Thinking Forward: Memory-Efficient Federated Finetuning of Language Models [21.438831528354513]
連合学習環境における大規模言語モデル(LLM)の微調整には、リソース制約のあるデバイスに対して過剰なメモリを必要とする。
本稿では,LLMのトレーニング可能な重みをクライアント間で分割するFLアルゴリズムであるSpryを紹介する。
Spryはメモリフットプリントが低く、精度が高く、高速な収束を実現している。
論文 参考訳(メタデータ) (2024-05-24T13:37:48Z) - Vanishing Point Estimation in Uncalibrated Images with Prior Gravity
Direction [82.72686460985297]
我々はマンハッタンのフレームを推定する問題に取り組む。
2つの新しい2行解法が導出され、そのうちの1つは既存の解法に影響を与える特異点に悩まされない。
また、局所最適化の性能を高めるために、任意の行で実行される新しい最小でないメソッドを設計する。
論文 参考訳(メタデータ) (2023-08-21T13:03:25Z) - Adaptive Split-Fusion Transformer [90.04885335911729]
本稿では,適応重みによる畳み込みと注目の分岐を異なる方法で扱うための適応分割変換器(ASF-former)を提案する。
ImageNet-1Kのような標準ベンチマークの実験では、我々のASFフォーマーはCNN、トランスフォーマー、ハイブリッドパイロットを精度で上回っている。
論文 参考訳(メタデータ) (2022-04-26T10:00:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。