論文の概要: Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection
- arxiv url: http://arxiv.org/abs/2607.18080v2
- Date: Sun, 26 Jul 2026 15:00:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 12:52:43.69503
- Title: Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection
- Title(参考訳): Sparse Evidence can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection
- Abstract要約: マルチモーダルビデオ誤情報検出は、一般的に、全体論的ビデオ理解タスクとして定式化される。
マルチモーダルビデオ誤情報検出における抽出によるスパース・インタラクティブ・エビデンス検証のためのフレームワークであるSIEVEを提案する。
- 参考スコア(独自算出の注目度): 15.95488291516215
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal video misinformation detection is commonly formulated as a holistic video-understanding task, where the entire video and its associated content are processed and judged in a single pass. However, real-world misinformation often exhibits a sparse and compositional evidence structure: a reliable decision may depend on only a few coupled clues, while most video content contributes limited additional information. Exhaustive multimodal reasoning may therefore introduce substantial redundancy and obscure decisive evidence. This motivates decoupling evidence acquisition from verification: first identifying sparse, decision-relevant clues and then judging veracity based on the acquired evidence. Accordingly, we propose SIEVE, a framework for Sparse Interactive Evidence Verification via Extraction in multimodal video misinformation detection. An evidence-seeking agent actively explores the available multimodal evidence and constructs a compact evidence package, which is then used by a verifier to determine veracity. The agent is trained with supervised evidence-seeking trajectories and an evidence-aware reinforcement learning objective that promotes informative evidence acquisition while discouraging unnecessary or invalid interactions. Experiments on multiple video misinformation benchmarks show that SIEVE consistently outperforms the evaluated baselines and supports reliable verification using compact evidence packages. Moreover, the resulting acquisition process provides an explicit and inspectable evidence trail, improving the transparency and groundedness of multimodal misinformation detection.
- Abstract(参考訳): マルチモーダルビデオ誤情報検出は、ビデオ全体とその関連コンテンツが単一のパスで処理され、判定される全体的ビデオ理解タスクとして、一般的に定式化される。
しかし、現実世界の誤報は、しばしばスパースで構成的な証拠構造を示す:信頼できる決定は、いくつかの結びついた手がかりにのみ依存するが、ほとんどのビデオコンテンツは、限られた追加情報に寄与する。
したがって、排他的マルチモーダル推論は実質的な冗長性と明確な証拠をもたらす可能性がある。
最初は、スパースで決定に関連のある手がかりを特定し、次に、取得した証拠に基づいて正確さを判断する。
そこで我々は,マルチモーダルビデオ誤情報検出における抽出によるスパース・インタラクティブ・エビデンス検証のためのフレームワークであるSIEVEを提案する。
エビデンス検索エージェントは、利用可能なマルチモーダルエビデンスを積極的に探索し、コンパクトエビデンスパッケージを構築し、検証者が検証に使用する。
本発明のエージェントは、監視された証拠探索軌跡と、不要または無効な相互作用を抑えつつ、情報的証拠獲得を促進する証拠認識強化学習目標とを訓練する。
複数のビデオ誤報ベンチマークの実験により、SIEVEは評価基準線を一貫して上回り、コンパクトなエビデンスパッケージを用いた信頼性検証をサポートすることが示された。
さらに、得られた取得プロセスは、明示的で検査可能なエビデンストレイルを提供し、マルチモーダル誤情報検出の透明性と基礎性を向上させる。
関連論文リスト
- Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation [50.92223196290564]
明示的な証拠選択と統合のための統一エージェントループを提案する。
探索中、SCoREはクエリ関連観測とソースポインタのみを保守されたテキスト台帳に保持する。
終了時には、参照された元のイメージを再ロードし、答えの視覚的証拠を統合し、論理的なシーケンスにアレンジする。
論文 参考訳(メタデータ) (2026-09-14T16:11:35Z) - Decoding Multimodal Cues: Unveiling the Implicit Meaning Behind Hateful Videos [47.13788871461312]
我々は、モデルが文脈的合理性を提供できるように、説明可能なヘイトフルなビデオ検出を実現することを目指している。
このアプローチは、ビデオ内容の理解と意思決定プロセスの説明可能性を包括的に強化することができる。
本稿では,情報拡張・推論拡張(IARE)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-10T11:28:23Z) - Revisiting Uncertainty: On Evidential Learning for Partially Relevant Video Retrieval [70.47320120707029]
部分的関連性のあるビデオ検索は、部分的コンテンツのみを記述するテキストクエリを使って、未編集の動画を検索することを目的としている。
この設定では、曖昧なクエリはしばしばビデオ間のセマンティックなあいまいさを引き起こす。
我々は,多粒質のクロスモーダルな証拠を集約し,不確実性を定量化し,モデル化する階層的顕在的学習フレームワークであるHolmesを提案する。
論文 参考訳(メタデータ) (2026-05-07T12:06:13Z) - VITED: Video Temporal Evidence Distillation [49.38292490256531]
そこで我々は,チェーン・オブ・エビデンス推論による複雑なビデオ質問応答について検討した。
モデルは、固定数のフレームを均一にサンプリングするため、多段階の推論に苦労する。
本稿では,既存のビデオQAデータセットをエビデンス・アソシエーション・チェーンで拡張するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-17T06:30:02Z) - Multimodal Misinformation Detection using Large Vision-Language Models [7.505532091249881]
大規模言語モデル(LLM)は、様々なタスクにおいて顕著なパフォーマンスを示している。
誤情報検出の一部として証拠検索を考えるアプローチはほとんどない。
マルチモーダルエビデンス検索のための新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-19T13:57:11Z) - RED-DOT: Multimodal Fact-checking via Relevant Evidence Detection [17.107961913114778]
本稿では,各証拠が関連しているかどうかを識別するために,関連証拠検出(RED)モジュールを提案する。
RED-DOTは、VERITEベンチマークの最先端(SotA)を最大33.7%改善した。
RED-DOT は NewsCLIPings+ で SotA を最大3% 上回った。
論文 参考訳(メタデータ) (2023-11-16T14:43:45Z) - Unleashing Potential of Evidence in Knowledge-Intensive Dialogue
Generation [37.29386687125705]
知識集約対話生成(u-EIDG)におけるエビデンスを効果的に統合する枠組みを提案する。
具体的には,Large Language Models (LLM) のパワーを活用し,ラベルのないデータから信頼性のあるエビデンスラベルを抽出する自動エビデンス生成フレームワークを提案する。
これらのエビデンスラベルを利用することで、検索されたパスから関連するエビデンスを効果的に識別する信頼性のあるエビデンス指標をトレーニングする。
論文 参考訳(メタデータ) (2023-09-15T13:13:30Z) - Give Me More Details: Improving Fact-Checking with Latent Retrieval [58.706972228039604]
証拠は、自動化された事実チェックにおいて重要な役割を果たす。
既存のファクトチェックシステムは、エビデンス文が与えられたと仮定するか、検索エンジンが返した検索スニペットを使用する。
資料から得られた全文を証拠として組み込んで,2つの豊富なデータセットを導入することを提案する。
論文 参考訳(メタデータ) (2023-05-25T15:01:19Z) - Topic-Aware Evidence Reasoning and Stance-Aware Aggregation for Fact
Verification [19.130541561303293]
本稿では,事実検証のための新たな話題認識型証拠推論とスタンス認識型アグリゲーションモデルを提案する。
2つのベンチマークデータセットで実施されたテストは、事実検証のためのいくつかの最先端アプローチよりも提案モデルの方が優れていることを示す。
論文 参考訳(メタデータ) (2021-06-02T14:33:12Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z) - Multi-Modal Video Forensic Platform for Investigating Post-Terrorist
Attack Scenarios [55.82693757287532]
大規模ビデオ分析プラットフォーム(VAP)は、容疑者を特定し証拠を確保するために法執行機関(LEA)を支援する。
本稿では,視覚・音声分析モジュールを統合し,監視カメラからの情報と目撃者からの映像アップロードを融合するビデオ分析プラットフォームを提案する。
論文 参考訳(メタデータ) (2020-04-02T14:29:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。