論文の概要: Evidence Triangulation for Multimodal Fact-Checking in the Wild
- arxiv url: http://arxiv.org/abs/2606.31367v1
- Date: Tue, 30 Jun 2026 08:59:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.14831
- Title: Evidence Triangulation for Multimodal Fact-Checking in the Wild
- Title(参考訳): 野生におけるマルチモーダル Fact-Checking のエビデンス・トライアングル化
- Abstract要約: X-POSE(X-POSE)は、X(旧Twitter)のコミュニティアノテーション付きマルチモーダル投稿のベンチマークである。
また,3つの並列なクロスアテンションストリームを用いた証拠三角測量を行う新しいMFCモデルTRENTを提案する。
- 参考スコア(独自算出の注目度): 14.259306741814372
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The proliferation of multimedia content on social platforms has fueled multimodal misinformation, where images are used to reinforce false claims. Consequently, Multimodal Fact-Checking (MFC) has emerged as an increasingly important research area. However, current progress is hindered by a reliance on synthetic training data and curated benchmarks that fail to capture the complexity of in-the-wild data. Furthermore, existing detection models rely on restricted intra-modality consistency or unconstrained all-to-all fusion, failing to capture nuanced relations between posts and external evidence. To address these limitations, we introduce X-POSE, a benchmark of real-world, community-annotated multimodal posts from X (formerly Twitter), augmented with full-length news articles retrieved via VLM-optimized search. Additionally, we propose TRENT, a novel MFC model that performs evidence triangulation using three parallel cross-attention streams alongside a relational fusion mechanism that explicitly models entailment and contradiction. Extensive evaluations demonstrate that TRENT consistently outperforms state-of-the-art specialized models and commercial VLMs. The code, prompt templates, and dataset are available at https://github.com/stevejpapad/evidence-triangulation
- Abstract(参考訳): ソーシャルプラットフォーム上でのマルチメディアコンテンツの拡散は、画像が虚偽の主張を補強するために使用されるマルチモーダル誤報を助長している。
その結果、MFC(Multimodal Fact-Checking)はますます重要な研究領域となっている。
しかし、現在の進歩は、合成トレーニングデータと、Wildデータの複雑さを捉えるのに失敗するベンチマークに依存しているため妨げられている。
さらに、既存の検出モデルは、制限されたモダリティ内整合性や、制約のない全対全融合に依存しており、ポストと外部の証拠の間のニュアンスな関係を捉えていない。
これらの制限に対処するため、我々はX-POSEを紹介した。X-POSEは、X(以前のTwitter)のコミュニティアノテーション付きマルチモーダル・ポストのベンチマークであり、VLM最適化検索によって検索された完全長のニュース記事で拡張されている。
さらに,3つの並列な相互注意ストリームを用いた証拠三角測量を行う新しいMFCモデルTRENTと,包含と矛盾を明示的にモデル化するリレーショナルフュージョン機構を提案する。
広範囲な評価の結果、TRENTは最先端の特殊モデルや商用VLMよりも一貫して優れていた。
コード、プロンプトテンプレート、データセットはhttps://github.com/stevejpapad/evidence-triangulationで確認できる。
関連論文リスト
- POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch [84.73366911912512]
エージェント・シーディング(Agenic Seeding)は,エージェント行動の抽出に必要な前駆体を織り込むための専用フェーズである。
本稿では、最近の対話を高忠実に保ちながら、歴史的コンテキストをレンダリングを介して視覚空間に折り畳みながら、適応的履歴認識圧縮方式であるV-Foldを提案する。
我々は,最新のマルチモーダルエージェントサーチモデルであるPOINTS-Seeker-8Bを開発した。
論文 参考訳(メタデータ) (2026-04-15T16:09:37Z) - Rethinking Multimodal Fusion for Time Series: Auxiliary Modalities Need Constrained Fusion [12.754011132549167]
核融合戦略を持つマルチモーダルモデルは、しばしば単調TSモデルよりも性能が低いことを示す。
このような統合を制御するために設計された制約付き融合法を提案する。
さまざまなデータセットとTS/テキストモデルにまたがって20K以上の実験を行います。
論文 参考訳(メタデータ) (2026-03-23T07:44:46Z) - NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching [64.10695425442164]
NExT-OMNI(英語版)は、離散フローパラダイムによる統一モデリングを実現するオープンソース・オムニモーダル・ファンデーション・モデルである。
NExT-OMNIは、大規模なインターリーブ付きテキスト、画像、ビデオ、オーディオデータに基づいて訓練され、マルチモーダル生成および理解ベンチマーク上で競合するパフォーマンスを提供する。
さらなる研究を進めるために、トレーニングの詳細、データプロトコル、およびコードとモデルチェックポイントの両方をオープンソース化する。
論文 参考訳(メタデータ) (2025-10-15T16:25:18Z) - Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline [56.790045049514326]
詐欺の2つの主要な形態は、人造誤報とAI生成コンテンツである。
両形態の偽造を扱うためのフレームワークであるUMFDet(Unified Multimodal Fake Content Detection)を提案する。
UMFDetは、両方の誤情報型に対して堅牢で一貫したパフォーマンスを実現し、特殊ベースラインを上回っている。
論文 参考訳(メタデータ) (2025-09-30T09:26:32Z) - Consistency-aware Fake Videos Detection on Short Video Platforms [4.291448222735821]
本稿では,ショートビデオプラットフォーム上でのフェイクニュースの検出に焦点をあてる。
既存のアプローチは通常、分類層を適用する前に生のビデオデータとメタデータの入力を組み合わせる。
この知見に触発された本研究では,クロスモーダルな矛盾を明示的に識別し,活用する新たな検出パラダイムを提案する。
論文 参考訳(メタデータ) (2025-04-30T10:26:04Z) - Deconfounded Reasoning for Multimodal Fake News Detection via Causal Intervention [16.607714608483164]
ソーシャルメディアの急速な成長は、複数のコンテンツ形式にまたがる偽ニュースの普及につながった。
従来の単モーダル検出手法は複雑なクロスモーダル操作に対処するには不十分である。
因果干渉に基づくマルチモーダルデコン検出フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-12T09:57:43Z) - CoLLM: A Large Language Model for Composed Image Retrieval [76.29725148964368]
Composed Image Retrieval (CIR)は、マルチモーダルクエリに基づいた画像検索を目的とした複雑なタスクである。
本稿では,イメージキャプションペアからトリプレットをオンザフライで生成するワンストップフレームワークであるCoLLMを提案する。
我々はLarge Language Models (LLMs) を利用して参照画像の埋め込みと修正テキストを生成する。
論文 参考訳(メタデータ) (2025-03-25T17:59:50Z) - Multimodality Helps Few-shot 3D Point Cloud Semantic Segmentation [61.91492500828508]
FS-PCS (Few-shot 3D point cloud segmentation) は、最小のサポートサンプルで新しいカテゴリを分割するモデルを一般化することを目的としている。
テキストラベルと潜在的に利用可能な2次元画像モダリティを利用したマルチモーダルFS-PCS構成を提案する。
トレーニングバイアスを軽減するため,テスト時間適応型クロスモーダル(TACC)技術を提案する。
論文 参考訳(メタデータ) (2024-10-29T19:28:41Z) - Similarity over Factuality: Are we making progress on multimodal out-of-context misinformation detection? [15.66049149213069]
アウト・オブ・コンテクスト(OOC)の誤報は、マルチモーダルな事実チェックにおいて重大な課題となる。
証拠に基づくOOC検出の最近の研究は、ますます複雑なアーキテクチャへと向かっている。
画像テキスト対と外部画像とテキストエビデンスとの類似性を評価する。
論文 参考訳(メタデータ) (2024-07-18T13:08:55Z) - Dissecting Multimodality in VideoQA Transformer Models by Impairing Modality Fusion [54.33764537135906]
VideoQA Transformerモデルは標準ベンチマークで競合性能を示す。
これらのモデルはビデオとテキストからリッチなマルチモーダル構造とダイナミックスを一緒に捉えていますか?
彼らはバイアスと刺激的な特徴を利用して高いスコアを達成していますか?
論文 参考訳(メタデータ) (2023-06-15T06:45:46Z) - Continual Multimodal Knowledge Graph Construction [62.77243705682985]
現在のマルチモーダル知識グラフ構築(MKGC)モデルは、絶え間なく出現する実体と関係の現実的なダイナミズムに苦慮している。
本研究では,連続的なMKGCドメインの開発を促進するためのベンチマークを紹介する。
マルチメディアデータ処理における既存のMKGCアプローチの欠点を克服するMSPTフレームワークを導入する。
論文 参考訳(メタデータ) (2023-05-15T14:58:28Z) - VERITE: A Robust Benchmark for Multimodal Misinformation Detection
Accounting for Unimodal Bias [17.107961913114778]
マルチモーダルの誤報は ソーシャルメディアのプラットフォームで 増え続けている問題です
本研究では,広範に使用されているMDDベンチマークにおいて,一様偏差の存在を調査・同定する。
リアルな合成学習データを生成するための新しい手法であるCrossmodal HArd Synthetic MisAlignment (CHASMA)を導入する。
論文 参考訳(メタデータ) (2023-04-27T12:28:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。