論文の概要: AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors
- arxiv url: http://arxiv.org/abs/2609.35247v1
- Date: Mon, 28 Sep 2026 14:17:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 07:15:17.897439
- Title: AnswerMap: Faithful Spatial Interpretability of VLMs from Answer Posteriors
- Title(参考訳): AnswerMap: Answer PosteriorからのVLMの忠実な空間的解釈可能性
- Abstract要約: 出力ヘッドから構築されたトレーニング不要、タスク非依存、ブラックボックスの視覚的理性であるAnswerMapを紹介する。
行と円柱の後方の積は、クエリ条件付き空間写像を与える。
2つのテストで4つのモデルと3つのクエリ分布でAnswerMapを検証する。
- 参考スコア(独自算出の注目度): 3.260444867039254
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When a VLM answers a visual query, current interpretability tools rely on text rationales, which use a mismatched modality, or on internal read-outs, which originate too early to reflect the final output and require white-box access to the model. We introduce AnswerMap, a training-free, task-agnostic, black-box visual rationale constructed from the output head. The image is cut into K row and K column bands, each shown alone to the frozen model along with the query in the format of a yes/no relevance question. The outer product of the row and column ``yes'' posteriors gives the query-conditioned spatial map. Crucially, by defining a fixed read-out R (e.g., expectation, maximum) on top of AnswerMap, we can derive continuous outputs like location natively. This bypasses the reliance on discrete text tokens for continuous-output tasks and guarantees an image-dependent answer by construction. However, a rationale can be confabulated, so we validate AnswerMap across four models and three query distributions with two tests: (a) agreement with the model's own generated point and (b) deletion of the map's region. The map lands where the model points (AUC 0.85 against 0.38 for attention), and deleting its region flips 53% of correct answers (against 19% for attention's). Beyond establishing faithfulness, we demonstrate the map's task-agnostic utility through three distinct read-outs: its maximum flags hallucinated objects without generation, its expectation localizes correctly when the model's own pointing fails, and its top-mass region, fed back as a crop, fixes half of the model's wrong answers. AnswerMap thus offers a new lens on VLM interpretability and, through its read-outs, a new output interface for visual tasks beyond text tokens.
- Abstract(参考訳): VLMが視覚的なクエリに答えると、現在の解釈可能性ツールは、ミスマッチしたモダリティを使用するテキスト論理や、最終的な出力を反映し、モデルへのホワイトボックスアクセスを要求するには早すぎる内部読み出しに依存します。
出力ヘッドから構築されたトレーニング不要、タスクに依存しない、ブラックボックスの視覚的理性であるAnswerMapを紹介する。
画像はK行とK列のバンドに切り分けられ、それぞれがイエス/ノー関連質問の形式でクエリとともに凍結モデルに単独で表示される。
行と列 `yes'' の後行の外側積は、クエリ条件付き空間写像を与える。
重要なことは、AnswerMapの上に固定された読み取り出力R(例えば、期待値、最大値)を定義することで、位置のような連続的な出力をネイティブに導き出すことができます。
これにより、連続的な出力タスクに対する個別のテキストトークンへの依存を回避し、構成によるイメージ依存の回答を保証する。
しかし、合理化は可能であるので、4つのモデルと3つのクエリ分布でAnswerMapを2つのテストで検証する。
(a)モデルが生成した点と一致し、
b) 地図の領域の削除
地図は、モデルが示す地点(AUC 0.85 対 0.38 対 注意点)に到達し、その領域を削除すると、正解の53%(注意点の19%)が反転する。
信頼の確立以外にも、マップのタスク非依存のユーティリティを、3つの異なる読み出しを通じて示す: 最大フラグは生成せずに幻覚オブジェクトを誘導し、予測はモデル自身のポインティングが失敗したときに正しくローカライズし、その上位マス領域は作物として送り返され、モデルの間違った回答の半分を修正する。
これによりAnswerMapは、VLMの解釈可能性に関する新たなレンズを提供し、読み出しを通じて、テキストトークン以外の視覚タスクのための新しい出力インターフェースを提供する。
関連論文リスト
- ActMap: Single-Pass Uncertainty Quantification from Generation-Time Activation Maps [1.7403133838762448]
ActMapは、生成時の隠れ状態軌跡を固定された12時間s32times128$の時間統計チャネルに圧縮する表現である。
小型ビジョン変換器としてインスタンス化された軽量分類器は、各マップから推定された正当性確率をミリ秒単位で読み取る。
論文 参考訳(メタデータ) (2026-09-10T13:04:24Z) - Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information [41.72898733384826]
視覚言語モデル(VLM)は、テキストプロンプトによって参照される画像領域を特定し、対応する視覚的証拠を出力にルーティングすることができる。
視覚検索ヘッド(VRHs)は,画像領域へのテキスト記述のグラウンディングに因果的に責任を負う,注目ヘッドの小さなサブセットである。
提案手法は, 提案手法を用いて, 提案手法を用いて, 出力予測トークンから注目点を抽出し, 因果頭部を確実に同定するものであることを示す。
論文 参考訳(メタデータ) (2026-08-27T17:43:58Z) - VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? [79.44137632338062]
マルチモーダルな大規模言語モデルが視覚的推論問題に正しく答える場合、その予測はタスククリティカルな視覚的証拠によって実際に支持されているか?
VisualFLIPは1,374枚の画像が基数,属性,空間,論理的タスクにまたがって同一の問合せペアとして配置されたベンチマークである。
ペアの両面を解く必要がある24個のMLLMと、少なくとも一方の面を解くモデルが両方の画像に対して同じ空でない答えを繰り返す頻度を測定するCR(Collapse Rate)を評価した。
論文 参考訳(メタデータ) (2026-06-05T22:06:07Z) - Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)? [72.2500547961037]
空間推論は視覚言語モデル(VLM)が現実世界の環境に展開する基本的な能力である。
対象情報を隠蔽するオクルージョン(Occlusion)と、誤解を招く視覚的手がかりを生成する視点曖昧性(spective ambiguity)の2つのタイプの観察課題を紹介した。
各構成について、クリーンな観察では答えられるが、導入した課題では無視する必要がある空間的質問を設計する。
論文 参考訳(メタデータ) (2026-05-28T20:44:47Z) - DIAGRAMS: A Review Framework for Reasoning-Level Attribution in Diagram QA [56.73431446011309]
ダイアグラム質問応答(ダイアグラムQA)は、各問合せ対を答えを導き出すために必要なすべての視覚領域にリンクする推論レベルの属性を必要とする。
私たちは、データセット固有の構造からインターフェースロジックを分離する軽量でスキーマ駆動のレビューフレームワークであるDIAGRAMSを紹介します。
論文 参考訳(メタデータ) (2026-04-29T02:34:51Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding [5.925837407110905]
カルトマップQA(CartoMapQA)は、視覚言語モデルによる地図の理解を評価するためのベンチマークである。
データセットには2000以上のサンプルが含まれており、それぞれが地図地図、質問(オープンエンドまたは複数選択の回答)、接地真実の回答で構成されている。
論文 参考訳(メタデータ) (2025-12-03T08:25:22Z) - When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought [118.71264263478083]
MIRAは,中間画像の生成が推論の成功に不可欠であるシナリオにおいて,モデルを評価するために設計された新しいベンチマークである。
546のマルチモーダル問題を含み、中間画像と最終回答が注釈付きである。
論文 参考訳(メタデータ) (2025-11-04T18:00:51Z) - Bayesian Fields: Task-driven Open-Set Semantic Gaussian Splatting [19.187033477078177]
オープンセットのセマンティックマッピングでは(i)シーンを表現するために正しい粒度を決定する必要がある。
(II)複数の2次元観察から総合的な3次元再構成へ意味知識を融合させる。
ベイジアン・フィールズ(英: Bayesian Fields)は、オープンセットのセマンティックマッピングのためのタスク駆動の確率論的アプローチである。
論文 参考訳(メタデータ) (2025-03-07T21:36:30Z) - Leveraging VLM-Based Pipelines to Annotate 3D Objects [68.51034848207355]
本稿では,VLMの応答に影響を与える視点などの要因を疎外する代替アルゴリズムを提案する。
テキストのみの応答をマージする代わりに、VLMの合同画像テキストの可能性を利用する。
VLMベースのパイプラインを使って764Kデータセットから764Kオブジェクトの信頼性の高いアノテーションを生成する方法を示す。
論文 参考訳(メタデータ) (2023-11-29T17:54:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。