論文の概要: MM-VeriAgent: Learning to Use Extensive Tools to Verify Multimodal Misinformation with Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.30698v1
- Date: Fri, 25 Sep 2026 02:12:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.186305
- Title: MM-VeriAgent: Learning to Use Extensive Tools to Verify Multimodal Misinformation with Reinforcement Learning
- Title(参考訳): MM-VeriAgent: 強化学習を用いた多モーダル誤情報検証ツールの学習
- Abstract要約: textbfMM-VeriAgentを導入し、ツールと混在するマルチモーダル誤報の検証を学習する。
textbfMM-VeriToolsは誤情報検出のための特殊なツールキットである。
このツールキットの上に、LVLMエージェントを強化学習で訓練し、これらのツールを使って混合ソース検出をよりよく解く方法を教えます。
MMFakeBenchの実験では、推論時に明示的なツール検索を行わずに、ベースモデルよりもかなり精度が向上した。
- 参考スコア(独自算出の注目度): 22.864212811737843
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-world multimodal misinformation often involves mixed forgery sources, requiring sample-specific detection strategies. Existing tool-augmented methods rely on predefined workflows or inference-time planning, limiting adaptability or increasing inference cost. To address this issue, we introduce \textbf{MM-VeriAgent}, which learns to verify mixed-source multimodal misinformation with tools. We first build \textbf{MM-VeriTools}, a specialized toolkit for misinformation detection agents. By benchmarking various candidate models and methods on the sub-tasks required by mixed-source detection, we select the strongest for textual, visual, and cross-modal forgery analysis and encapsulate them as callable tools with a unified interface. On top of this toolkit, we train the LVLM agent with reinforcement learning to teach it how to use these tools to better solve mixed-source detection. Since many of the tools are specialized models whose online execution at every rollout severely limits RL efficiency, we further introduce \textbf{Tool-Execution Cache}, which pre-executes candidate tool calls and reuses their cached outputs during training. This preserves multi-step rollouts while reducing online tool execution, largely improving the training efficiency.Experiments on MMFakeBench demonstrate substantial accuracy gains over the base model without explicit tool search at inference time. Ablation and efficiency analyses further validate the learned tool-use policy and show that Tool-Execution Cache reduces online tool executions during training.
- Abstract(参考訳): 実世界のマルチモーダル誤報は、しばしば混合偽造源を伴い、サンプル固有の検出戦略を必要とする。
既存のツール拡張メソッドは、事前に定義されたワークフローや推論時間計画に依存し、適応性を制限するか、推論コストを増大させる。
この問題に対処するために,ツールと混在するマルチモーダル誤報の検証を学習する <textbf{MM-VeriAgent} を導入する。
まず,誤情報検出エージェント用の特殊なツールキットであるtextbf{MM-VeriTools} を構築した。
混合ソース検出に必要なサブタスクに対して,様々な候補モデルと手法をベンチマークすることにより,テキスト,ビジュアル,およびクロスモーダルのフォージェリ分析において最強の候補を選択し,統一されたインタフェースで呼び出し可能なツールとしてカプセル化する。
このツールキットの上に、LVLMエージェントを強化学習で訓練し、これらのツールを使って混合ソース検出をよりよく解く方法を教えます。
ツールの多くは、ロールアウト毎にオンライン実行がRL効率を著しく制限する特殊なモデルであるため、トレーニング中に候補ツールコールを事前実行し、キャッシュされたアウトプットを再利用する \textbf{Tool-Execution Cache} も導入する。
これはオンラインツールの実行を減らし、トレーニング効率を大幅に向上させながら、複数ステップのロールアウトを保ち、MMFakeBenchの実験では、推論時に明示的なツール検索を行うことなく、ベースモデルに対して大幅な精度の向上が示される。
アブレーションと効率分析は、学習したツール利用ポリシーをさらに検証し、ツール実行キャッシュがトレーニング中のオンラインツール実行を減らすことを示す。
関連論文リスト
- Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act [38.40533345940731]
大規模言語モデル(LLM)エージェントは、外部ツールによる自然言語推論をますますインターリーブする。
RLを訓練したエージェントが、ツール選択ポリシーをいつ、なぜ学習するかについて検討する。
論文 参考訳(メタデータ) (2026-09-14T19:31:04Z) - IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents [12.019312046941396]
本稿では,小言語モデル(SLM)におけるツールコール能力向上のための強化学習法について検討する。
入力成分間の帰属関係をより強力な教師の帰属関係と整合させることにより,マルチモーダルSLMにおけるツール利用を改善するためのRLアルゴリズムであるIAPOを提案する。
Qwen2.5-VL-3B実験の結果,提案手法は既存の視覚ツールの使用状況と比較して,6つのテストセットの平均3%の視覚的質問応答精度を向上させる。
論文 参考訳(メタデータ) (2026-06-10T04:30:37Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - T^2Agent A Tool-augmented Multimodal Misinformation Detection Agent with Monte Carlo Tree Search [51.91311158085973]
多重モーダル誤報は、しばしば混合偽造源から発生し、動的推論と適応的検証を必要とする。
我々はモンテカルロ木探索を用いたツールキットを組み込んだ新しい誤情報検出剤T2Agentを提案する。
大規模な実験により、T2Agentは、混在するマルチモーダル誤報ベンチマークにおいて、既存のベースラインを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2025-05-26T09:50:55Z) - Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger [49.81945268343162]
我々は,外部ツール利用のための適応型意思決定戦略であるMeCoを提案する。
MeCoは、表現空間内の高レベル認知信号をキャプチャすることで、メタ認知スコアを定量化する。
MeCoは微調整不要で、最小限のコストがかかる。
論文 参考訳(メタデータ) (2025-02-18T15:45:01Z) - MetaTool: Facilitating Large Language Models to Master Tools with Meta-task Augmentation [25.360660222418183]
再利用可能なツールセットにまたがって一般化するために設計された,新しいツール学習手法であるMetaToolを紹介する。
メタタスクデータをタスク指向トレーニングに組み込むことで,オープンソースの大規模言語モデルの性能を大幅に向上させる。
論文 参考訳(メタデータ) (2024-07-15T10:15:41Z) - Towards Completeness-Oriented Tool Retrieval for Large Language Models [60.733557487886635]
現実世界のシステムは多種多様なツールを組み込んでおり、全てのツールを大規模言語モデルに入力することは不可能である。
既存のツール検索手法は主にユーザクエリとツール記述間のセマンティックマッチングに焦点を当てている。
我々は,ユーザクエリとツール記述のセマンティックな類似性だけでなく,ツールの協調的情報も考慮した,新しいモデル診断型協調学習型ツール検索手法であるCOLTを提案する。
論文 参考訳(メタデータ) (2024-05-25T06:41:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。