論文の概要: CREG: Compass Relational Evidence for Interpreting Spatial Reasoning in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2603.20475v1
- Date: Fri, 20 Mar 2026 20:09:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:38.933326
- Title: CREG: Compass Relational Evidence for Interpreting Spatial Reasoning in Vision-Language Models
- Title(参考訳): CREG:視覚言語モデルにおける空間推論の解釈のためのコンパス関係証拠
- Abstract要約: 視覚言語モデル(VLM)は空間推論ベンチマークで強く機能するが、方向関係のエンコード方法はまだよく分かっていない。
我々は,マルチレイヤのコントラスト空間属性を基準中心の極性系に投影するフレームワークCREG(Grad-Act Graph)を紹介する。
以上の結果から, 対照的な多層アトリビューションは, 標準的なサリエンシに基づく説明よりも, より忠実に指向性のある証拠を提示できることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) perform strongly on spatial reasoning benchmarks, yet how they encode directional relations remains poorly understood. Existing attribution methods such as GradCAM and attention rollout reveal where a model attends, but not what direction it infers between objects. We introduce CREG (Compass Relational Evidence Graph), a training-free interpretability framework that projects multi-layer contrastive Grad-times-Act attributions into a reference-centered polar coordinate system, producing a directional evidence distribution over compass sectors. To evaluate directional explanations, we propose three metrics: Direction Alignment Error (DAE), Edge Accuracy (EA), and Causal Occlusion Score (COS). On Qwen2-VL-7B across VSR and COCO-Pairs, CREG consistently outperforms standard attribution baselines; on COCO-Pairs, prediction-targeted CREG achieves a DAE of 55.5 degrees and an EA of 0.553, improving over attention rollout by 16.1 degrees in angular error and 0.120 in EA. Causal occlusion experiments on 540 samples across both datasets further support the faithfulness of these directional explanations, with COS greater than or equal to +0.42. The gains are smaller on Qwen2-VL-2B, suggesting that CREG benefits from the more structured spatial representations that emerge at larger scales. Overall, our results show that contrastive, multi-layer attribution can expose directional evidence more faithfully than standard saliency-based explanations in VLM spatial reasoning.
- Abstract(参考訳): 視覚言語モデル(VLM)は空間推論ベンチマークで強く機能するが、方向関係のエンコード方法はまだよく分かっていない。
GradCAMやアテンションロールアウトといった既存の属性メソッドは、モデルがどこに出席するかを明らかにしているが、オブジェクト間でどの方向を推測するかは明らかにしていない。
本研究では,複数層にコントラストのあるGrad-times-Act属性を基準中心の極座標系に投影し,コンパスセクターの方向的エビデンス分布を生成する。
方向性説明を評価するために,方向調整誤差(DAE),エッジ精度(EA),因果オクルージョンスコア(COS)の3つの指標を提案する。
VSRとCOCO-Pair間のQwen2-VL-7Bでは、CREGは標準の属性ベースラインを一貫して上回り、COCO-Pairsでは予測対象のCREGのDAEは55.5度、EAは0.553度に達し、角度誤差は16.1度、EAは0.120度向上した。
両方のデータセットにまたがる540個のサンプルに対する因果閉塞実験は、COSが+0.42より大きいか等しいかという、これらの方向説明の忠実性をさらに支えている。
Qwen2-VL-2Bではゲインが小さくなり、CREGはより大規模に現れるより構造化された空間表現の恩恵を受けることが示唆された。
以上の結果から,VLMの空間的推論における標準値に基づく説明よりも,多層的帰属が指向性証拠を忠実に提示できることが示唆された。
関連論文リスト
- m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning [1.2162625261919089]
マップ・ツー・ストリート・ビュー空間推論のためのスケーラブルなベンチマークであるm2svを紹介する。
制御されたあいまいさを持つ地理的に多様なベンチマークであるm2sv-20kと、教師付き微調整のための構造化された推論トレースであるm2sv-sft-11kをリリースする。
既存のマルチモーダルベンチマークの性能は高いが、最も評価されたVLMはm2svで65.2%の精度しか達成していない。
論文 参考訳(メタデータ) (2026-01-27T02:01:56Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models [15.50826328938879]
視覚言語モデル(VLM)の空間的推論能力を評価するためのベンチマークであるSURDSを紹介する。
nuScenesデータセットに基づいて構築されたSURDSは、41,080の視覚要求回答トレーニングインスタンスと9,250の評価サンプルで構成されている。
本研究では,空間的に接地された報酬信号を利用した強化学習に基づくアライメント手法を提案する。
論文 参考訳(メタデータ) (2024-11-20T08:14:01Z) - Relation DETR: Exploring Explicit Position Relation Prior for Object Detection [26.03892270020559]
本稿では,DETR(Detection TRansformer)の収束性と性能を向上させる手法を提案する。
我々の手法であるRelation-DETRは、プログレッシブ・アテンション・リファインメントのための位置関係埋め込みを構築するエンコーダを導入している。
汎用データセットとタスク固有のデータセットの両方の実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2024-07-16T13:17:07Z) - Revisiting Link Prediction: A Data Perspective [59.296773787387224]
グラフの基本的なタスクであるリンク予測は、友人の推薦、タンパク質分析、薬物相互作用予測など、様々な応用において不可欠であることが証明されている。
既存の文献の証拠は、すべてのデータセットに適した普遍的に最良のアルゴリズムが存在しないことを裏付けている。
我々は,局所的な構造的近接,大域的な構造的近接,特徴的近接という,リンク予測に不可欠な3つの基本的要因を認識する。
論文 参考訳(メタデータ) (2023-10-01T21:09:59Z) - Quaternion-valued Correlation Learning for Few-Shot Semantic
Segmentation [33.88445464404075]
Few-shot segmentation (FSS)は、少数のサンプルしか与えられていないクラスをセグメントすることを目的としている。
相関学習に関する四元数視点を導入し、新しい四元数評価相関学習ネットワーク(QCLNet)を提案する。
我々のQCLNetは超複素値ネットワークとして定式化され、四元数値畳み込みを用いてクエリ部分空間の外部関係を探索する四元数領域の相関テンソルを表す。
論文 参考訳(メタデータ) (2023-05-12T06:56:22Z) - Robust Self-Supervised LiDAR Odometry via Representative Structure
Discovery and 3D Inherent Error Modeling [67.75095378830694]
そこで我々は,2段階のオドメトリ推定ネットワークを構築し,一連の部分領域変換を推定してエゴモーメントを求める。
本稿では,トレーニング,推論,マッピングフェーズにおける信頼できない構造の影響を軽減することを目的とする。
我々の2フレームのオードメトリーは、翻訳/回転誤差の点で、過去の芸術の状態を16%/12%上回っている。
論文 参考訳(メタデータ) (2022-02-27T12:52:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。