論文の概要: Question-Aware Evidence Ledgers for Video Relational Reasoning
- arxiv url: http://arxiv.org/abs/2606.02506v1
- Date: Mon, 01 Jun 2026 17:18:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:32.530402
- Title: Question-Aware Evidence Ledgers for Video Relational Reasoning
- Title(参考訳): ビデオ・リレーショナル・推論のための質問認識型エビデンス・レジャー
- Authors: Yilin Ou, Mengshi Qi, Huadong Ma,
- Abstract要約: 我々は,強力なGPT-5.5ビデオQA解決器と疑似エビデンス台帳のセットを中心に構築されたテスト時間推論パイプラインを提案する。
パイプラインは92.95%の総合精度と93.79%のマクロ精度を達成した。
- 参考スコア(独自算出の注目度): 49.15616982043187
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The VRR-QA challenge evaluates visual relational reasoning in videos, where answers often depend on implicit spatial relations, event boundaries, target identity, and dialogue context rather than a single salient frame. We present a test-time reasoning pipeline built around a strong GPT-5.5 video QA solver and a set of question-aware evidence ledgers. The initial solver answers each question from a uniform video representation, while routed ledgers are prompted to make the required targets, count units, reference frames, and temporal or spatial scope explicit for counting, spatial, endpoint, viewpoint, and dialogue reasoning. External tools such as open-vocabulary detection, depth cues, pair crops, ASR, and scene-graph ledgers are used only as evidence sources. A conservative gate keeps the current answer unless independent evidence uniquely supports a different option. The final evidence-gated pipeline achieves 92.95% overall accuracy and 93.79% macro accuracy on the challenge test split.
- Abstract(参考訳): VRR-QAの課題は、ビデオにおける視覚的リレーショナル推論を評価し、答えは暗黙の空間的関係、イベント境界、ターゲットアイデンティティ、対話コンテキストにのみ依存する。
我々は,強力なGPT-5.5ビデオQA解決器と疑似エビデンス台帳のセットを中心に構築されたテスト時間推論パイプラインを提案する。
初期解法は、一様のビデオ表現から各質問に答える一方、ルーティングされた台帳は、必要なターゲット、カウント単位、参照フレーム、時間的または空間的スコープをカウント、空間的、エンドポイント、視点、対話的推論のために明示するように促される。
オープンボキャブラリ検出、ディープキュー、ペア作物、ASR、シーングラフ台帳といった外部ツールはエビデンスソースとしてのみ使用される。
独立した証拠が別の選択肢を独自にサポートしない限り、保守的なゲートは現在の回答を保持します。
最終的なエビデンス付きパイプラインは92.95%の全体的な精度と93.79%のマクロ精度を達成した。
関連論文リスト
- Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA [15.724849094439987]
TimeLogicQAは、ビデオ質問応答システムが時間的関係について推論できるかどうかを評価する。
我々はこの課題を視覚的エビデンスルーティングパイプラインで解決し、認識を象徴的な時間的推論から分離する。
論文 参考訳(メタデータ) (2026-05-31T08:49:04Z) - Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge [15.724849094439987]
本稿では,適応型テスト時間計算を中心に構築された推論のみのシステムを提案する。
システムはまず、各質問に直接ビデオ言語モデルパスで答え、続いて複数の軽量ビューを使用して不安定な質問を見つける。
テストスプリットでは、最終システムは90.07平均精度と87.81マクロ平均精度を得る。
論文 参考訳(メタデータ) (2026-05-31T08:45:06Z) - VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification [73.02304272829785]
VideoBenchは、証拠を厳格に検証する長ビデオ応答のための階層的なベンチマークだ。
これは、13のドメインに500の注釈付き質問を手動で記述し、時間間隔と空間境界ボックスを組み合わせて証拠とする。
GeminiPro-3-Proでさえ、標準のエンドツーエンドのQA設定で17%未満の質問に正しく答えている。
その結果,表面レベルでの回答の正しさと真正な証拠に基づく推論との間に大きなギャップが生じた。
論文 参考訳(メタデータ) (2026-04-02T03:29:43Z) - Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding [25.82963105515627]
VideoHV-Agentは、構造化仮説検証プロセスとしてビデオ質問応答を再構成するフレームワークである。
ビデオHV-Agentは,解釈性の向上,論理的音質の向上,計算コストの低減を実現し,最先端の精度を実現する。
論文 参考訳(メタデータ) (2026-03-05T09:16:07Z) - ImplicitQA: Going beyond frames towards Implicit Video Reasoning [39.63171940350552]
ImplicitQAは、人間のような暗黙の推論でビデオQAモデルをテストするために設計された新しいベンチマークである。
ImplicitQAは、1Kの高品質なクリエイティビティビデオクリップから引き出された1Kの微妙な注釈付きQAペアからなる。
論文 参考訳(メタデータ) (2025-06-26T19:53:54Z) - V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning [40.18308199837137]
これらの問題点に対処するために,ビデオS-テンポラル推論(V-STa)ベンチマークを導入する。
我々は,ビデオLLMの時空間推論プロセスを実現するためのデータセットを構築した。
14のビデオ-LLMによる実験では、現在のビデオ-LLMと、堅牢で一貫性のある推論の必要性の間に大きなギャップが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:44Z) - Discovering Spatio-Temporal Rationales for Video Question Answering [68.33688981540998]
本稿では,複数のオブジェクトやイベントを異なる時間に含む長編映像を特徴とする,複雑なビデオ質問応答(VideoQA)の解法を提案する。
本稿では,モーダル間相互作用を用いて質問クリティカルなモーメントやオブジェクトを適応的に収集する時空間合理化法を提案する。
また、STRをコアとし、新たな応答相互作用機構を基盤とするトランスフォーマースタイルのニューラルネットワークアーキテクチャであるTranSTRを提案する。
論文 参考訳(メタデータ) (2023-07-22T12:00:26Z) - Locate before Answering: Answer Guided Question Localization for Video
Question Answering [70.38700123685143]
LocAnsは質問ロケータと回答予測器をエンドツーエンドモデルに統合する。
最新の2つのビデオQAデータセットで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-10-05T08:19:16Z) - Invariant Grounding for Video Question Answering [72.87173324555846]
Video Question Answering (ビデオQA)は、ビデオに関する質問に答えるタスクである。
先行するビデオQAモデルでは、典型的な学習目標である経験的リスク最小化(ERM)が、ビデオクエストペアと回答の間の表面的相関に基づく。
Invariant Grounding for VideoQA (IGV) という新たな学習フレームワークを提案する。
論文 参考訳(メタデータ) (2022-06-06T04:37:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。