論文の概要: Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.03493v1
- Date: Thu, 03 Sep 2026 07:52:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.974418
- Title: Making Every Tool Call Count: Necessary Tool-Evidence Path Rewards for Agentic Vision-Language Models
- Title(参考訳): すべてのツールコール数を作る:エージェントビジョンランゲージモデルのためのツールエビデンスパスリワード
- Abstract要約: NTEP(Necessary Tool-Evidence Path, 必要ツール-エビデンスパス)は, 重要な外部証拠を明確に特定する新しいアノテーション手法である。
また,NTEP-R (NTEP-R) も提案する。
提案手法は,プリコール意図を必要な証拠検索目標と整合させ,また,ポストコール観察から要約した情報を必要な証拠と整合させることで,エージェントに報いる。
- 参考スコア(独自算出の注目度): 18.068231324319395
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Modern vision-language models (VLMs) can directly answer many image-grounded questions, yet they often struggle with complex queries requiring fine-grained visual details or external knowledge. To acquire this missing evidence, agentic VLMs invoke tools such as image cropping, image search, and text search. However, existing training paradigms primarily evaluate tool-use based on final answer correctness, leaving evidence acquisition and utilization insufficiently supervised. This leads to two critical shortcomings: (i) models frequently issue redundant or off-target tool calls that fail to gather necessary evidence, and (ii) even when appropriate tools are called, models often fail to extract the necessary information from the resulting observations. To address these limitations, we introduce the NTEP (Necessary Tool-Evidence Path), a novel annotation scheme that explicitly specifies the essential external evidence and corresponding tool calls for each query. Building upon this, we propose NTEP-R (NTEP Reward), a supervision mechanism ensuring that each tool invocation strictly advances the reasoning process toward the final solution. Specifically, our approach rewards the agent for aligning its pre-call intent with a necessary evidence-seeking goal, and for ensuring the information summarized from the post-call observation aligns with the necessary evidence. Furthermore, we introduce a non-repeated-goal regularizer to penalize redundant calls that revisit satisfied NTEP goals. Extensive evaluations on seven image-grounded benchmarks demonstrate that our 8B-parameter instantiation, NTEP-8B, significantly improves both search-oriented accuracy and tool-use efficiency within a unified three-tool framework. These results highlight the critical value of fine-grained tool-evidence path supervision for training robust agentic VLMs.
- Abstract(参考訳): 現代の視覚言語モデル (VLM) は、多くの画像に基づく質問に直接答えることができるが、細かな視覚的詳細や外部知識を必要とする複雑なクエリに苦慮することが多い。
この欠落した証拠を得るために、エージェントVLMは画像トリミング、画像検索、テキスト検索などのツールを起動する。
しかし、既存の訓練パラダイムは主に最終回答の正しさに基づいてツールの使用を評価し、証拠の取得と利用は十分に管理されていない。
これは2つの重大な欠点につながります。
(i)モデルは、必要証拠の収集に失敗する冗長またはオフターゲットのツールコールを頻繁に発行し、
(ii) 適切なツールが呼ばれても、モデルが結果の観測から必要な情報を抽出できない場合が多い。
これらの制約に対処するため、NTEP (Necessary Tool-Evidence Path) という新しいアノテーションスキームを導入する。
そこで我々は,NTEP-R (NTEP-R) を提案する。NTEP-R (NTEP-R) は,各ツールの実行が最終解への推論プロセスを厳密に進めることを保証する監視機構である。
具体的には,プリコール意図と必要なエビデンス検索目標とを一致させ,また,ポストコール観察から要約した情報を必要なエビデンスと整合させることで,エージェントに報いる。
さらに、NTEPの目標を満たさない冗長な呼び出しをペナルティ化するための非繰り返しゴール正規化器を導入する。
7つの画像グラウンドベンチマークにおいて、我々の8Bパラメータのインスタンス化であるNTEP-8Bは、統合された3ツールフレームワークにおいて、検索指向の精度とツール使用効率の両方を著しく改善することを示した。
これらの結果は、堅牢なエージェントVLMを訓練するためのきめ細かなツール・エビデンスパス監視の重要性を強調した。
関連論文リスト
- Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs [35.17881745040865]
ツール拡張マルチモーダル推論は、外部ツールをマルチモーダルな言語モデルに統合する。
ツール強化推論のための検証と動的エラー回復をMLLMに組み込むフレームワークであるReVISEを提案する。
論文 参考訳(メタデータ) (2026-08-29T17:22:08Z) - WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents [53.426679066400844]
WeAgent-Harnessは、ネイティブテキストビジョンインタラクションと実行時リカバリをサポートするマルチモーダルエージェントハーネスである。
WeAgent-MMSearchは,データ構築,エージェントポストトレーニング,マルチモーダルロールアウトにまたがる統合システムである。
また、150タスクの人間認証ベンチマークであるVisTarget-Benchを紹介します。
論文 参考訳(メタデータ) (2026-08-28T08:28:43Z) - Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents [54.050506620820784]
エージェントツールアンラーニング(ATU)は、通常のツール使用を保持しながら、パラメトリックリコールとツールによるリカバリの両方を削減することを目的としている。
ATUは、ツール強化されたエージェントデプロイメント下で、ターゲットの忘れと保持ユーティリティのバランスを向上し、未学習をより堅牢にする。
論文 参考訳(メタデータ) (2026-08-21T18:34:48Z) - FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification [41.86420087238674]
近年の研究では、エージェント型視覚言語モデルがツールを不信に利用することが多いことが判明している。
マルチエージェントの自己判断フレームワークであるFaithEyesを紹介する。
FaithEyesは、視覚知覚と推論ベンチマークの間で、競争力または優れた精度を達成する。
論文 参考訳(メタデータ) (2026-07-30T13:58:08Z) - MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts [10.608824155356377]
MissingBench-Verifiedは、特定の、実用的なシナリオを評価するために設計されたベンチマークである。
外部のツールエビデンスがモデルの視覚的知覚と明確に矛盾している場合でも、一貫性のある、重要な失敗率を観察します。
ツールアシスト検証、自律的な視覚的推論、推論期間の延長、より簡単なデータセットの微調整など、既存の緩和戦略は無視できる改善を提供する。
論文 参考訳(メタデータ) (2026-07-21T03:43:50Z) - Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools [65.7098588070281]
我々は,自己制御能力を中心とした新しい視覚ツールパラダイムであるBeyond the Eye (BEE)を提案する。
BEEは、視覚的ツールの呼び出し動作をトレーニングの目的に取り入れ、自己規制された呼び出しメカニズムを開発するようモデルに促す。
BEEは、一般的な推論タスクにおいて競争力を維持しながら、きめ細かい視覚知覚において最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-13T05:32:00Z) - To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling [13.42769424615184]
本稿では,Web検索ツールの利用判断を評価するために,意思決定理論に着想を得た原則的フレームワークを提案する。
モデルが認識するツールコールの必要性とユーティリティは、多くの場合、その真のニーズとユーティリティと不一致である。
我々の推定器は、意思決定品質を向上し、タスク性能を向上するシンプルなコントローラを可能にする。
論文 参考訳(メタデータ) (2026-05-01T15:38:13Z) - RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation [63.74915464611075]
RecThinkerはツール拡張推論を推奨するエージェントフレームワークである。
我々はRecThinker専用のツール群を開発し、モデルがユーザアイテム側および協調的な情報を取得することを可能にする。
論文 参考訳(メタデータ) (2026-03-10T16:07:17Z) - ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning [103.7657839292775]
ARM-Thinkerはエージェント・マルチモーダル・リワード・モデルであり、検証された証拠で判断を下すために外部ツールを自律的に呼び出す。
ARM-Thinkerを多段階強化学習で訓練し、ツールコール決定と判定精度を協調的に最適化する。
その結果,エージェント能力は報酬モデルの精度と解釈可能性の両方を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-12-04T18:59:52Z) - Improving Large Language Models Function Calling and Interpretability via Guided-Structured Templates [56.73907811047611]
大規模言語モデル(LLM)は強力な推論とツール使用能力を示している。
LLMは、誤ったパラメータ化、悪いツールの選択、ユーザーの意図の誤解釈によって、現実世界のツールインタラクションで失敗することが多い。
我々は、構造化推論テンプレートを利用して、関数呼び出しを生成するためのより故意なステップバイステップ命令を通してLCMをガイドするカリキュラムに着想を得たフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-22T17:55:14Z) - Adaptive Tool Use in Large Language Models with Meta-Cognition Trigger [49.81945268343162]
我々は,外部ツール利用のための適応型意思決定戦略であるMeCoを提案する。
MeCoは、表現空間内の高レベル認知信号をキャプチャすることで、メタ認知スコアを定量化する。
MeCoは微調整不要で、最小限のコストがかかる。
論文 参考訳(メタデータ) (2025-02-18T15:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。