論文の概要: VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
- arxiv url: http://arxiv.org/abs/2605.04870v1
- Date: Wed, 06 May 2026 13:01:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.823185
- Title: VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
- Title(参考訳): VTAgent:Evidence-Aware Video TextVQAのためのエージェントキーフレームアンカリング
- Abstract要約: ビデオテキストベースの視覚的質問応答 (Video TextVQA) は、ビデオに現れる視覚的テキストコンテンツについて推論することで質問に答えることを目的としている。
そこで本研究では,回答の前に関連事項を明示的にアンカーする質問誘導型エージェントフレームワークを提案する。
本研究は,ビデオテキストVQAの進行において,明示的なアンカーが重要な役割を担っていることを明らかにする。
- 参考スコア(独自算出の注目度): 42.454642585543446
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Video text-based visual question answering (Video TextVQA) aims to answer questions by reasoning over visual textual content appearing in videos. Despite the strong multimodal video understanding capabilities of recent Video-LLMs, their performance on existing Video TextVQA benchmarks remains limited. To better understand this gap, we conduct an upper-bound analysis through frame-wise question answering, counting a sample as correct if any frame yields the right answer, which significantly outperforms direct video-based inference and reveals a substantial performance gap. The results suggest that the primary bottleneck lies in the localization of key question-relevant evidence, rather than in reasoning capacity itself. Building on this insight, we propose a question-guided agent framework that explicitly anchors the relevant keyframes before answering. The approach operates effectively in a training-free setting and consistently surpasses direct video inference. With additional supervised fine-tuning (SFT) and reinforcement learning (RL), it achieves an average improvement of +12.12 in accuracy and +11.15 in ANLS across benchmarks, establishing new state-of-the-art results. Our study underscores the critical role of explicit keyframe anchoring for advancing Video TextVQA. The code will be publicly released.
- Abstract(参考訳): ビデオテキストベースの視覚的質問応答 (Video TextVQA) は、ビデオに現れる視覚的テキストコンテンツについて推論することで質問に答えることを目的としている。
最近のVideo-LLMの強力なマルチモーダルビデオ理解機能にもかかわらず、既存のVideo TextVQAベンチマークのパフォーマンスは制限されている。
このギャップをよりよく理解するために、フレームワイドな質問応答による上界解析を行い、任意のフレームが正しい回答を得た場合、サンプルを正解としてカウントする。
その結果、主要なボトルネックは、能力自体の推論ではなく、重要な疑問関連証拠の局所化にあることが示唆された。
この知見に基づいて,応答前に関連キーフレームを明示的にアンカーする質問誘導型エージェントフレームワークを提案する。
このアプローチは、トレーニング不要の設定で効果的に動作し、ダイレクトビデオ推論を一貫して上回る。
教師付き微調整(SFT)と強化学習(RL)が追加され、精度は+12.12、ANLSは+11.15に改善され、新しい最先端の結果が確立された。
本研究は,ビデオテキストVQAの進行において,キーフレームアンカーが重要な役割を担っていることを明らかにする。
コードは公開されます。
関連論文リスト
- From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA [44.46419663487345]
高いベンチマーク精度は、真の視覚的証拠の使用を保証するものではない。
交通事故のビデオ質問応答(VideoQA)におけるこの問題について検討する。
テキストのみの信頼度と視覚的必要信号を組み合わせたインスタンスレベルのショートカットスコアを提案する。
論文 参考訳(メタデータ) (2026-06-29T12:33:15Z) - Query-Conditioned Evidential Keyframe Sampling for MLLM-Based Long-Form Video Understanding [21.306038832082553]
MLLM(Multimodal Large Language Models)は,ビデオ質問応答において高い性能を示した。
ロングフォームビデオへのそれらの応用は、コンテキスト長と計算コストの制限によって制限される。
本稿では,情報理論に基づくエビデンス駆動サンプリングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-01T15:02:50Z) - Video-BrowseComp: Benchmarking Agentic Video Research on Open Web [64.53060049124961]
Video-BrowseCompは、オープンウェブのエージェントによるビデオ推論に適した210の質問からなるベンチマークである。
これは時間的視覚的証拠に必須に依存しており、回答はテキスト検索のみでは導き出せないことを保証している。
初のオープンWebビデオ調査ベンチマークとして、Video-BrowseCompは、受動的知覚を越えて、プロアクティブなビデオ推論へと分野を前進させた。
論文 参考訳(メタデータ) (2025-12-28T19:08:27Z) - SFA: Scan, Focus, and Amplify toward Guidance-aware Answering for Video TextVQA [44.90805518708208]
ビデオテキストベースの視覚的質問応答(Video TextVQA)タスクは、ビデオ内に現れる視覚的テキストを活用することで、ビデオに関する質問に答えることを目的としている。
このタスクは、フレーム毎にスケール、向き、明度が異なるシーンテキストを正確に知覚し、理解するモデルを必要とする、重大な課題を生じさせる。
本研究では,ビデオテキストVQAに適したトレーニングフリーのフレームワークであるSFAと,質問に答える人間のプロセスに動機づけられたビデオ-LLMベースの最初の手法を提案する。
論文 参考訳(メタデータ) (2025-11-25T11:14:39Z) - VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection [61.54044967253421]
空間的詳細と時間的コヒーレンスを保持するビデオQAペアを特徴とする,新しいデータセットであるVideoEspressoを紹介する。
GPT-4o を用いた QA ペア生成にあたり, 冗長性を抑えるためにセマンティック・アウェア法を用いて構成パイプラインを構築した。
フレームセレクタと2段階の命令微調整推論LVLMを備えたハイブリッドLVLM協調フレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-22T08:33:36Z) - Uncertainty-Guided Self-Questioning and Answering for Video-Language Alignment [19.345829429613037]
本稿では,自己問合せと回答を通じて,学習過程における質問サンプルを増強する自己学習フレームワークを提案する。
低品質の自己生成質問は、特に訓練の初期段階において、パフォーマンスを汚染する可能性がある。
我々は、不確実性を推定し、自己生成質問の品質を評価するために、エビデンシャル・ディープ・ラーニングを導入する。
論文 参考訳(メタデータ) (2024-09-17T05:17:37Z) - CLIPVQA:Video Quality Assessment via CLIP [56.94085651315878]
VQA問題(CLIPVQA)に対する効率的なCLIPベースのトランスフォーマー手法を提案する。
提案したCLIPVQAは、新しい最先端のVQAパフォーマンスを実現し、既存のベンチマークVQAメソッドよりも最大で37%の汎用性を実現している。
論文 参考訳(メタデータ) (2024-07-06T02:32:28Z) - VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。
データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。
機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文 参考訳(メタデータ) (2023-12-04T19:48:02Z) - Can I Trust Your Answer? Visually Grounded Video Question Answering [88.11169242115416]
本稿では,ビデオ言語理解のための事前学習技術を活用したビデオQAについて検討する。
NExT-GQA - NExT-QAの拡張で、10.5$K$の時間的グラウンドラベルを元のQAペアに結び付ける。
論文 参考訳(メタデータ) (2023-09-04T03:06:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。