論文の概要: SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification
- arxiv url: http://arxiv.org/abs/2608.03631v1
- Date: Tue, 04 Aug 2026 13:16:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.203588
- Title: SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification
- Title(参考訳): SEER:制御空間関係分類のための自己集合的エビデンスインタフェース
- Authors: Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng,
- Abstract要約: SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
- 参考スコア(独自算出の注目度): 71.9783246097687
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Spatial relation questions require a model to identify the queried subject and object before comparing their layout. Yet a VLM can recognize both entities and still answer from the wrong instance or an ambiguous global view. We ask whether making query-specific evidence explicit can mitigate this failure and propose SEER (Self-grounded Evidence for Entity-Relation Reasoning), a training-free inference-time evidence interface for frozen VLMs. SEER hides candidate relations during pair localization, constructs a query-specific view with explicit subject/object roles, and retains the full image and sparse box geometry as complementary evidence. For relation-choice protocols with exact inverse support, an optional refinement swaps the entity roles and changes the forward decision only when exactly one visual state obeys the corresponding inverse relation. On an image-disjoint GQA-Train900 test frozen before model scoring, SEER pools to +3.94 [2.17,5.72] over Full; the gain remains positive under label-independent grounding-order counterbalancing and on the 535 rows whose entity names are unique. The unchanged protocol yields +4.35 to +11.79 on all 2,434 filtered EmbSpatial pair-relation questions across three models. Matched controls separate local refocus from role-explicit conditioning. These results establish query-specific evidence construction as the principal intervention, with reciprocal consistency as a smaller protocol-specific refinement.
- Abstract(参考訳): 空間的関係の質問は、それらのレイアウトを比較する前に、クエリ対象とオブジェクトを識別するモデルを必要とする。
しかし、VLMは両方のエンティティを認識でき、間違ったインスタンスやあいまいなグローバルビューから答えることができる。
我々は、クエリ固有のエビデンスを明示することは、この失敗を軽減し、凍結したVLMのためのトレーニング不要な推論時エビデンスインターフェースであるSEER(Self-grounded Evidence for Entity-Relation Reasoning)を提案する。
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
モデルスコアの前に凍結された画像分離GQA-Train900テストでは、SEERプールはフルで+3.94[2.17,5.72]まで上昇し、ラベル非依存の接地順序の逆バランシングと、エンティティ名がユニークな535行で上昇は肯定的である。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
Matchedコントロールは、ロール-明示的な条件付けからローカルリフォーカスを分離する。
これらの結果は、相互整合性をより小さなプロトコル固有の改善として、クエリ固有のエビデンス構築を主要な介入として確立する。
関連論文リスト
- MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG [50.46218163777298]
知識に基づくビジュアル質問回答 (KB-VQA) では、大規模百科事典の知識ベースからクエリ画像と一致する視覚エンティティを検索し、関連する質問に答える必要がある。
MMAgent-R$2$は、視覚的リランク化と能動的拒絶を内部検証機構として統合したエージェントmRAGフレームワークである。
論文 参考訳(メタデータ) (2026-07-08T13:15:39Z) - AbstRAG: Learning to Abstract for Retrieval Problems [23.379898867224355]
AbstRAGは、クエリ-エビデンスギャップを、式、概念、インテント-エビデンス、イベントタイプコンポーネントに分解する。
21対のブートストラップのコントラストのうち18のnDCG@10よりも優れており、生成精度は1.9%、5.2%、および4.0%向上している。
論文 参考訳(メタデータ) (2026-06-08T13:14:01Z) - Disagreement-Based Cross-Model Routing for Implicit Video Question Answering [0.0]
我々はImplicitQAベンチマークを用いて,複数選択のビデオ質問応答について検討した。
このベンチマークでは、単一のフロンティアビデオLLMが、その精度の天井付近ですでに動作している。
ラベルやトレーニングを必要とせず、純粋な推論時間である、不一致に基づくクロスモデルルーティングを提案する。
論文 参考訳(メタデータ) (2026-05-31T05:56:27Z) - Hydra-SGG: Hybrid Relation Assignment for One-stage Scene Graph Generation [57.69385990442078]
Hydra-SGGは、VG150 (16.0 mR@50)、Open Images V6 (50.1 weighted score)、GQA (12.7 mR@50)を含む複数のデータセットで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-09-16T13:13:06Z) - Reference Twice: A Simple and Unified Baseline for Few-Shot Instance Segmentation [103.90033029330527]
FSIS(Few-Shot Instance)は、サポート例が限定された新しいクラスの検出とセグメンテーションを必要とする。
我々は、FSISのサポートとクエリ機能の関係を利用するための統合フレームワーク、Reference Twice(RefT)を導入する。
論文 参考訳(メタデータ) (2023-01-03T15:33:48Z) - Robust Question Answering Through Sub-part Alignment [53.94003466761305]
我々はアライメント問題として質問応答をモデル化する。
私たちは、SQuAD v1.1でモデルをトレーニングし、いくつかの逆および外ドメインデータセットでそれをテストします。
論文 参考訳(メタデータ) (2020-04-30T09:10:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。