論文の概要: VIG-RL: Learning to Search and Insert for Verified Image Grounding
- arxiv url: http://arxiv.org/abs/2607.28055v1
- Date: Thu, 30 Jul 2026 11:34:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.529529
- Title: VIG-RL: Learning to Search and Insert for Verified Image Grounding
- Title(参考訳): VIG-RL:検証画像グラウンドの検索とインサートを学習する
- Authors: Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang,
- Abstract要約: 知識集約型シナリオでは、信頼できるインターリーブされたテキストイメージ応答を提供するには、検証画像グラウンド(VIG)が必要である。
本稿では,探索-選択-挿入ワークフローを積極的な意思決定プロセスとして定式化する自律エージェントフレームワークであるVIG-RLを提案する。
動的ReActスタイルのループ内で動作し、VIG-RLは強化学習によって最適化され、複合報酬システムによって誘導される。
- 参考スコア(独自算出の注目度): 11.453400061924262
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In knowledge-intensive scenarios, providing reliable interleaved text-image responses requires Verified Image Grounding (VIG): the precise integration of retrieved authentic visual evidence. Existing retrieval-augmented frameworks predominantly rely on decoupled, static pipelines, inherently failing to dynamically reason about when external knowledge is required and where visual assets should be contextually inserted. To bridge this gap, we propose VIG-RL, an autonomous agentic framework that formulates the search-selection-insertion workflow as an active decision-making process. Operating within a dynamic ReAct-style loop, VIG-RL is optimized via reinforcement learning, guided by a composite reward system that holistically evaluates the agent's step-by-step tool execution and final multimodal alignment. Extensive evaluations demonstrate that VIG-RL establishes a new state-of-the-art, significantly outperforming existing static baselines.
- Abstract(参考訳): 知識集約的なシナリオでは、信頼できるインターリーブされたテキストイメージ応答を提供するには、検証画像グラウンド(VIG: Verified Image Grounding)が必要である。
既存の検索強化フレームワークは、主に分離された静的パイプラインに依存しており、本質的には外部の知識がいつ必要か、視覚的資産がコンテキスト的に挿入されるべきかを動的に推論することができない。
このギャップを埋めるために,探索-選択-挿入ワークフローを積極的な意思決定プロセスとして定式化する自律エージェントフレームワークであるVIG-RLを提案する。
動的ReActスタイルのループ内で動作し、VIG-RLは強化学習により最適化され、エージェントのステップバイステップツールの実行と最終的なマルチモーダルアライメントを全体評価する複合報酬システムによって誘導される。
大規模な評価は、VIG-RLが新しい最先端の静的ベースラインを確立し、既存の静的ベースラインを大幅に上回っていることを示している。
関連論文リスト
- Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization [56.150184676745205]
ビデオ異常理解(VAU)は、スパースでコンテキストに依存した手がかりに依存している。
本稿では,映像理解をアクティブな逐次意思決定プロセスとして再認識するクローズドループフレームワークである$Anomtext-$を提案する。
人間のビデオレビュー行動に触発されたこのフレームワークは、内部の認知的推論と戦略的エビデンスを、インターリーブされたポリシーに統一する。
論文 参考訳(メタデータ) (2026-07-01T08:41:49Z) - DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories [52.57197752244638]
本稿では,画像検索を自律探索タスクとして再構成する新しいエージェントパラダイムであるDeepImageSearchを紹介する。
モデルは、暗黙の文脈的手がかりに基づいてターゲットを特定するために、生の視覚履歴に対して多段階の推論を計画し実行しなければならない。
DisBenchは、相互接続された視覚データ上に構築された、挑戦的なベンチマークである。
論文 参考訳(メタデータ) (2026-02-11T12:51:10Z) - Multi-hop Reasoning via Early Knowledge Alignment [68.28168992785896]
アーリー・ナレッジ・アライメント(EKA)は、大規模言語モデルと文脈的に関連づけられた知識を整合させることを目的としている。
EKAは検索精度を大幅に改善し、カスケードエラーを低減し、性能と効率を向上する。
EKAは、大規模モデルにシームレスにスケールする、多目的でトレーニング不要な推論戦略として有効である。
論文 参考訳(メタデータ) (2025-12-23T08:14:44Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z) - VAR: Visual Attention Reasoning via Structured Search and Backtracking [49.427842994857635]
構造化された検索としてグラウンドド推論をリキャストするフレームワークであるVisual Attention Reasoningを紹介する。
VARは、推論プロセスを2つの重要な段階に分解する。
我々は、我々の7BモデルであるVAR-7Bが、幻覚と安全性のベンチマークの包括的なスイートに新しい最先端を設定していることを示します。
論文 参考訳(メタデータ) (2025-10-21T13:18:44Z) - Towards Context-aware Reasoning-enhanced Generative Searching in E-commerce [61.03081096959132]
そこで本稿では,複雑な状況下でのテキストバウンダリングを改善するための,文脈対応推論強化型生成検索フレームワークを提案する。
提案手法は,強力なベースラインに比べて優れた性能を示し,検索に基づく推薦の有効性を検証した。
論文 参考訳(メタデータ) (2025-10-19T16:46:11Z) - DeRIS: Decoupling Perception and Cognition for Enhanced Referring Image Segmentation through Loopback Synergy [20.581841892290672]
RISを認知と認知という2つの重要な構成要素に分解する新しいフレームワークであるDeRISを提案する。
以上の結果から,従来のモデルでは知覚障害ではなく,マルチモーダル認知能力が不十分であることが示唆された。
本稿では,ターゲット存在判定に関連する長期分布問題に対処するため,単純な非参照型サンプル変換データ拡張を提案する。
論文 参考訳(メタデータ) (2025-07-02T14:14:35Z) - mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation [15.991125806837386]
LVLM(Large Vision-Language Models)は、視覚的質問応答、視覚的接地、複雑な推論といったマルチモーダルなタスクにおいて顕著な進歩を遂げている。
Retrieval-Augmented Generation (RAG)は、LVLMが検索機構を介して大規模知識データベースにアクセスできるようにすることにより、これらの課題を軽減するための実用的なソリューションを提供する。
論文 参考訳(メタデータ) (2025-05-29T23:32:03Z) - ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents [27.90338725230132]
ViDoSeekは複雑な推論を必要とする視覚的にリッチなドキュメント上でのRAGパフォーマンスを評価するために設計されたデータセットである。
視覚文書間の複雑な推論に適した新しいマルチエージェントRAGフレームワークであるViDoRAGを提案する。
特にViDoRAGは、競合するViDoSeekベンチマークで既存のメソッドを10%以上上回っている。
論文 参考訳(メタデータ) (2025-02-25T09:26:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。