論文の概要: Look Where You Say You're Looking: Self-Grounded Attention for Visual Reasoning
- arxiv url: http://arxiv.org/abs/2610.05023v1
- Date: Sun, 04 Oct 2026 07:37:27 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:51:46.671665
- Title: Look Where You Say You're Looking: Self-Grounded Attention for Visual Reasoning
- Title(参考訳): 目で見る場所:視覚的推論のための自己中心的注意
- Abstract要約: 本稿では,視覚的注意力と画像領域との整合性を高めるために,視覚言語モデル(VLM)を訓練するセルフ・サリエンシを紹介する。
自己満足性(Self-Saliency)は、各推論ステップで言及されたオブジェクトのローカライズにグラウンドモデルを使用し、結果の領域をモデルの視覚的注意の監督として扱う。
- 参考スコア(独自算出の注目度): 39.60397013753974
- License:
- Abstract: We introduce Self-Saliency, a method for training Vision-Language Models (VLMs) to increase the alignment between their visual attention and the image regions mentioned in their reasoning. Self-Saliency uses a grounding model to localize the objects mentioned in each reasoning step and treats the resulting areas as supervision for the model's visual attention. Previous work on steering visual attention determines target image regions based solely on the image and question. In contrast, we show that conditioning the target regions on the model's generated reasoning improves downstream performance. For proper evaluation, we build a unified, broad suite of 25 visual reasoning benchmarks, where we reproduce the results of previous methods. We find that Self-Saliency significantly outperforms both prior attention-steering methods and baselines that ground image-level text, achieving both a better average rank and a better mean score. Post-training analysis shows that the model primarily adapts its reasoning text to existing attention patterns, producing shorter steps that refer to larger regions. Nevertheless, when controlling for generated text, attention to grounded regions increases significantly across the relevant layer. Finally, we identify a consistent geometric bias in VLM visual attention toward the image border. However, our ablations show that Self-Saliency's gains cannot be explained by simply aligning attention with the center of the image, highlighting the importance of aligning visual attention with the regions mentioned in the model's reasoning.
- Abstract(参考訳): 本稿では,視覚的注意力と画像領域との整合性を高めるために,視覚言語モデル(VLM)を訓練するセルフ・サリエンシを紹介する。
自己満足性(Self-Saliency)は、各推論ステップで言及されたオブジェクトのローカライズにグラウンドモデルを使用し、結果の領域をモデルの視覚的注意の監督として扱う。
視覚的注意を操縦する以前の研究は、画像と質問のみに基づいて対象画像領域を決定する。
対照的に、モデルが生成した推論に基づいて対象領域を条件付けすることで、下流の性能が向上することを示す。
適切な評価のために、25の視覚的推論ベンチマークからなる統一された広義のスイートを構築し、従来の手法の結果を再現する。
その結果, 自己満足度は, 画像レベルのテキストをベースとして, 従来のアテンションステアリング手法とベースラインの両方に優れており, 平均ランクと平均スコアの両方が向上していることがわかった。
トレーニング後の分析では、モデルは主に既存の注意パターンに推論テキストを適応させ、より大きな領域を参照するより短いステップを生成する。
しかし, 生成したテキストの制御において, 接地領域への注意は, 関連層間で著しく増大する。
最後に、画像境界に対するVLM視覚的注意における一貫した幾何学的バイアスを同定する。
しかし,本稿では,画像の中心に注意を合わせるだけで自己満足の利益を説明できないことを示し,モデルの推論に言及されている領域に視覚的注意を合わせることの重要性を強調した。
関連論文リスト
- Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs [4.507919939159203]
本稿では,変換器モデルを用いた画像上のテキスト生成に適した診断精度マップ手法を提案する。
我々のアプローチは、すべてのヘッドとレイヤにわたる視覚トークンに対する言語モデルの注意を集約し、この注意をビジョンエンコーダのパッチグリッドにマッピングして、イメージ上にローカライズします。
論文 参考訳(メタデータ) (2026-07-17T16:40:23Z) - Thinking with Visual Grounding [55.778136782175615]
本稿では,各ステップで使用される視覚的エビデンスを明示的ポイントやボックスグラウンドで,モデルが自然言語思考をインターリーブする推論プロセスである視覚的グラウンドド・シンキングを紹介する。
この動作をトレーニングするために,正確な視覚的推論トレースを抽出するスケーラブルな合成パイプラインを構築した。
本稿では,回答正当性報酬と,生成したオブジェクト参照が正しい画像証拠と一致するか否かをスコアする密接なグラウンド化報酬を組み合わせたグラウンド化対応強化学習を提案する。
論文 参考訳(メタデータ) (2026-06-15T02:28:34Z) - Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models [15.851502442699]
MLLM(Multimodal large language model)はしばしば、拡張推論モードの下で知覚障害に悩まされる。
多段階の推論において、モデルの視覚的注意が散らばり、疑問関連領域から遠ざかって、視覚的入力に効果的に焦点をあてる。
本研究では,エントロピー・フォーカス基準に基づいて視覚的頭部を選択する学習自由な視覚領域誘導注意(VRGA)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-15T02:21:05Z) - Improving Visual Reasoning with Iterative Evidence Refinement [41.18410988040976]
視覚言語モデル(VLM)は、画像の上に推論する能力がますます高まっている。
しかし、堅牢な視覚的推論は、基礎となる視覚的証拠において、しばしば中間的なステップを再定義する必要がある。
本稿では、内部表現による画像証拠の再挿入をモデルに訓練するエンド・ツー・エンドのセルフリビジョン・フレームワークであるSIEVEを提案する。
論文 参考訳(メタデータ) (2026-03-14T21:08:21Z) - Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas [69.56484419619919]
機械的解釈可能性のレンズによる空間的推論の課題について検討する。
空間的推論の成功は、実際の物体の位置と注意を一致させるモデルの能力と強く相関している。
本研究の目的は,ADAPTVISを用いて,信頼性の高い地域への注意を喚起することである。
論文 参考訳(メタデータ) (2025-03-03T17:57:03Z) - Top-Down Visual Attention from Analysis by Synthesis [87.47527557366593]
我々は、古典的分析・合成(AbS)の視覚的視点からトップダウンの注意を考察する。
本稿では,AbSを変動的に近似したトップダウン変調ViTモデルであるAbSViT(Analytic-by-Synthesis Vision Transformer)を提案する。
論文 参考訳(メタデータ) (2023-03-23T05:17:05Z) - Improving Visual Grounding by Encouraging Consistent Gradient-based
Explanations [58.442103936918805]
注意マスク整合性は,従来の方法よりも優れた視覚的グラウンドリング結果が得られることを示す。
AMCは効率的で実装が容易であり、どんな視覚言語モデルでも採用できるため一般的である。
論文 参考訳(メタデータ) (2022-06-30T17:55:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。