論文の概要: Question-Aware Evidence Ledgers for Video Relational Reasoning
- arxiv url: http://arxiv.org/abs/2606.02506v1
- Date: Mon, 01 Jun 2026 17:18:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:32.530402
- Title: Question-Aware Evidence Ledgers for Video Relational Reasoning
- Title(参考訳): ビデオ・リレーショナル・推論のための質問認識型エビデンス・レジャー
- Abstract要約: 我々は,強力なGPT-5.5ビデオQA解決器と疑似エビデンス台帳のセットを中心に構築されたテスト時間推論パイプラインを提案する。
パイプラインは92.95%の総合精度と93.79%のマクロ精度を達成した。
- 参考スコア(独自算出の注目度): 49.15616982043187
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The VRR-QA challenge evaluates visual relational reasoning in videos, where answers often depend on implicit spatial relations, event boundaries, target identity, and dialogue context rather than a single salient frame. We present a test-time reasoning pipeline built around a strong GPT-5.5 video QA solver and a set of question-aware evidence ledgers. The initial solver answers each question from a uniform video representation, while routed ledgers are prompted to make the required targets, count units, reference frames, and temporal or spatial scope explicit for counting, spatial, endpoint, viewpoint, and dialogue reasoning. External tools such as open-vocabulary detection, depth cues, pair crops, ASR, and scene-graph ledgers are used only as evidence sources. A conservative gate keeps the current answer unless independent evidence uniquely supports a different option. The final evidence-gated pipeline achieves 92.95% overall accuracy and 93.79% macro accuracy on the challenge test split.
- Abstract(参考訳): VRR-QAの課題は、ビデオにおける視覚的リレーショナル推論を評価し、答えは暗黙の空間的関係、イベント境界、ターゲットアイデンティティ、対話コンテキストにのみ依存する。
我々は,強力なGPT-5.5ビデオQA解決器と疑似エビデンス台帳のセットを中心に構築されたテスト時間推論パイプラインを提案する。
初期解法は、一様のビデオ表現から各質問に答える一方、ルーティングされた台帳は、必要なターゲット、カウント単位、参照フレーム、時間的または空間的スコープをカウント、空間的、エンドポイント、視点、対話的推論のために明示するように促される。
オープンボキャブラリ検出、ディープキュー、ペア作物、ASR、シーングラフ台帳といった外部ツールはエビデンスソースとしてのみ使用される。
独立した証拠が別の選択肢を独自にサポートしない限り、保守的なゲートは現在の回答を保持します。
最終的なエビデンス付きパイプラインは92.95%の全体的な精度と93.79%のマクロ精度を達成した。
関連論文リスト
- Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation [50.92223196290564]
明示的な証拠選択と統合のための統一エージェントループを提案する。
探索中、SCoREはクエリ関連観測とソースポインタのみを保守されたテキスト台帳に保持する。
終了時には、参照された元のイメージを再ロードし、答えの視覚的証拠を統合し、論理的なシーケンスにアレンジする。
論文 参考訳(メタデータ) (2026-09-14T16:11:35Z) - Beyond One-Shot Expansion: Contrastive Evidence Exploration for Multi-Hop Retrieval [19.37201042661162]
本研究では,エビデンス条件付き探索,パス特化コントラスト改善,カバレッジ対応ファイナルランキングを組み込んだ,トレーニング不要なマルチホップ検索フレームワークを提案する。
MuSiQue、HotpotQA、および2WikiMultihopQAの実験では、ベースラインよりも検索品質と下流QAパフォーマンスが一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-09-07T05:13:56Z) - Evidence-Backed Video Question Answering [90.93225758130426]
既存の説明可能性の取り組みは、テキストの合理性やまばらなバウンディングボックスに依存している。
E-VQA(Evidence-Backed Video Question Answering)を提案する。
これをサポートするために,識別的および生成的画素レベルのグラウンド化のための最初の人為的検証ベンチマークST-Evidenceを導入する。
論文 参考訳(メタデータ) (2026-07-13T17:49:10Z) - Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA [15.724849094439987]
TimeLogicQAは、ビデオ質問応答システムが時間的関係について推論できるかどうかを評価する。
我々はこの課題を視覚的エビデンスルーティングパイプラインで解決し、認識を象徴的な時間的推論から分離する。
論文 参考訳(メタデータ) (2026-05-31T08:49:04Z) - Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge [15.724849094439987]
本稿では,適応型テスト時間計算を中心に構築された推論のみのシステムを提案する。
システムはまず、各質問に直接ビデオ言語モデルパスで答え、続いて複数の軽量ビューを使用して不安定な質問を見つける。
テストスプリットでは、最終システムは90.07平均精度と87.81マクロ平均精度を得る。
論文 参考訳(メタデータ) (2026-05-31T08:45:06Z) - VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification [73.02304272829785]
VideoBenchは、証拠を厳格に検証する長ビデオ応答のための階層的なベンチマークだ。
これは、13のドメインに500の注釈付き質問を手動で記述し、時間間隔と空間境界ボックスを組み合わせて証拠とする。
GeminiPro-3-Proでさえ、標準のエンドツーエンドのQA設定で17%未満の質問に正しく答えている。
その結果,表面レベルでの回答の正しさと真正な証拠に基づく推論との間に大きなギャップが生じた。
論文 参考訳(メタデータ) (2026-04-02T03:29:43Z) - Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding [25.82963105515627]
VideoHV-Agentは、構造化仮説検証プロセスとしてビデオ質問応答を再構成するフレームワークである。
ビデオHV-Agentは,解釈性の向上,論理的音質の向上,計算コストの低減を実現し,最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-03-05T09:16:07Z) - ImplicitQA: Going beyond frames towards Implicit Video Reasoning [39.63171940350552]
ImplicitQAは、人間のような暗黙の推論でビデオQAモデルをテストするために設計された新しいベンチマークである。
ImplicitQAは、1Kの高品質なクリエイティビティビデオクリップから引き出された1Kの微妙な注釈付きQAペアからなる。
論文 参考訳(メタデータ) (2025-06-26T19:53:54Z) - V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning [40.18308199837137]
これらの問題点に対処するために,ビデオS-テンポラル推論(V-STa)ベンチマークを導入する。
我々は,ビデオLLMの時空間推論プロセスを実現するためのデータセットを構築した。
14のビデオ-LLMによる実験では、現在のビデオ-LLMと、堅牢で一貫性のある推論の必要性の間に大きなギャップが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:44Z) - Discovering Spatio-Temporal Rationales for Video Question Answering [68.33688981540998]
本稿では,複数のオブジェクトやイベントを異なる時間に含む長編映像を特徴とする,複雑なビデオ質問応答(VideoQA)の解法を提案する。
本稿では,モーダル間相互作用を用いて質問クリティカルなモーメントやオブジェクトを適応的に収集する時空間合理化法を提案する。
また、STRをコアとし、新たな応答相互作用機構を基盤とするトランスフォーマースタイルのニューラルネットワークアーキテクチャであるTranSTRを提案する。
論文 参考訳(メタデータ) (2023-07-22T12:00:26Z) - Locate before Answering: Answer Guided Question Localization for Video
Question Answering [70.38700123685143]
LocAnsは質問ロケータと回答予測器をエンドツーエンドモデルに統合する。
最新の2つのビデオQAデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-10-05T08:19:16Z) - Invariant Grounding for Video Question Answering [72.87173324555846]
Video Question Answering (ビデオQA)は、ビデオに関する質問に答えるタスクである。
先行するビデオQAモデルでは、典型的な学習目標である経験的リスク最小化(ERM)が、ビデオクエストペアと回答の間の表面的相関に基づく。
Invariant Grounding for VideoQA (IGV) という新たな学習フレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-06T04:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。