論文の概要: OpenVAM: Open-World Visual Attention Modeling with VLMs
- arxiv url: http://arxiv.org/abs/2609.31364v1
- Date: Fri, 25 Sep 2026 14:59:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.448385
- Title: OpenVAM: Open-World Visual Attention Modeling with VLMs
- Title(参考訳): OpenVAM: VLMを使ったオープンワールドビジュアルアテンションモデリング
- Abstract要約: 我々は、異種ドメイン間の普遍性と説明可能性に共同で対処する統一フレームワークOpenVAMを紹介する。
3段階のトレーニング戦略は、言語接地を導入し、説明アライメントを改善しながら、強いローカライゼーション前を保ちます。
実験の結果,OpenVAMは領域シフト下での堅牢性を向上し,画像に基づく説明を行うことで,サリエンシの予測をより解釈可能であることがわかった。
- 参考スコア(独自算出の注目度): 2.312921160243967
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Predicting human gaze is a core capability for applications ranging from web/UI design analysis to robotics and human-computer interaction. Yet, most visual attention modeling methods output only a dense saliency map, which is often insufficient for action: practitioners need to connect attention peaks to discrete elements in the scene (what) and understand the drivers of those peaks in context (why), while remaining robust to domain shift across natural images, commercial content, and UI/web layouts. We, therefore, introduce OpenVAM (Open-world Visual Attention Modeling with VLMs), a unified framework that jointly addresses universality and explainability across heterogeneous domains (natural scenes, commercial imagery, and UI/web layouts) and supervision modalities. OpenVAM adopts a decoupled-but-aligned design: a dedicated dense visual pathway provides stable, spatially precise localization, while an instruction-following vision--language semantic head generates grounded what/why explanations conditioned on the same image and data-type prompts. A three-stage training strategy preserves strong localization priors while progressively introducing language grounding and improving explanation alignment via parameter-efficient adaptation without perturbing the saliency branch. We further propose a scalable pipeline to generate multi-domain saliency-reason annotations for training and systematic evaluation. Experiments across diverse datasets show that OpenVAM improves robustness under domain shift while producing image-grounded explanations that make saliency predictions more interpretable.
- Abstract(参考訳): 人間の視線を予測することは、Web/UI設計分析からロボティクス、人間とコンピュータのインタラクションに至るまで、アプリケーションの中核機能である。
実践者は、注意のピークをシーン内の離散的な要素(何)に接続し、それらのピークのドライバをコンテキスト(なぜ)で理解する必要があります。
そこで我々は,OpenVAM(Open-world Visual Attention Modeling with VLMs)という,異種ドメイン(自然シーン,商用画像,UI/Webレイアウト)の普遍性と説明性を共同で扱う統一フレームワークを導入し,モダリティの監督を行う。
OpenVAMは疎結合な設計を採用しており、密集した視覚経路は安定的で空間的に精密な位置決めを提供し、一方命令追従型視覚-意味的ヘッドは、同じ画像とデータ型プロンプトに条件付けされた何/何の説明が根拠となるかを生成する。
3段階のトレーニング戦略は、言語基盤を段階的に導入し、サリエンシブランチを乱すことなくパラメータ効率の良い適応による説明アライメントを改善しながら、強いローカライゼーション前を保ちながら、強いローカライゼーションを保ちます。
さらに、トレーニングと体系的評価のためのマルチドメイン・サリエンシ・レアソンアノテーションを生成するスケーラブルなパイプラインを提案する。
さまざまなデータセットを対象とした実験では、OpenVAMはドメインシフト下で堅牢性を改善し、画像で座屈した説明を生成して、サリエンシの予測をより解釈可能であることが示されている。
関連論文リスト
- ViQ: Text-Aligned Visual Quantized Representations at Any Resolution [91.46185855575789]
本稿では,視覚的量子化表現フレームワークViQについて紹介する。
我々のアプローチは、量子化学習をテキスト整列事前学習と特徴分別という2つの段階に構成する。
マルチモーダル・タスクの実験では、ViQは最先端のマルチモーダル・ビジョン・エンコーダに比べて競争性能が高いことを示した。
論文 参考訳(メタデータ) (2026-06-25T17:29:27Z) - AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding [55.535374902204296]
AffordanceVLAは、タスク指向の中間表現として構造化された価格予測を導入する統一フレームワークである。
AffordanceVLAは様々な操作シナリオで高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-06-04T13:28:51Z) - OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - AutoFocus: Uncertainty-Aware Active Visual Search for GUI Grounding [8.941979904606308]
VLM(Vision-Language Models)は、自然言語命令を実行可能なスクリーン座標に変換する自動GUIエージェントである。
既存のズームイン戦略は固定アンカー、グリッド、強化学習に依存している。
GUIグラウンドティングのためのトレーニング不要で不確実性を考慮したアクティブなビジュアル検索フレームワークであるAutoFocusを提案する。
論文 参考訳(メタデータ) (2026-05-04T14:18:46Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization [75.88719716002014]
ドメイン一般化 (Domain Generalization, DG) は、目に見えないターゲットドメインに対して効果的に機能する汎用モデルの開発を目指している。
VFM(Pre-trained Visual Foundation Models)の最近の進歩は、ディープラーニングモデルの一般化能力を向上する大きな可能性を示している。
VFMの制御可能で柔軟な言語プロンプトを活用することで,この問題に対処することを提案する。
論文 参考訳(メタデータ) (2025-07-03T03:52:37Z) - Training-Free Open-Vocabulary Segmentation with Offline Diffusion-Augmented Prototype Generation [44.008094698200026]
FreeDAはオープン語彙セマンティックセグメンテーションのためのトレーニング不要な拡散拡張手法である。
FreeDAは5つのデータセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-04-09T18:00:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。