論文の概要: FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
- arxiv url: http://arxiv.org/abs/2607.28225v1
- Date: Thu, 30 Jul 2026 13:58:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.581979
- Title: FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification
- Title(参考訳): FaithEyes: マルチエージェントプロセスイメージ検証による忠実なツール利用を目指して
- Authors: Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang,
- Abstract要約: 近年の研究では、エージェント型視覚言語モデルがツールを不信に利用することが多いことが判明している。
マルチエージェントの自己判断フレームワークであるFaithEyesを紹介する。
FaithEyesは、視覚知覚と推論ベンチマークの間で、競争力または優れた精度を達成する。
- 参考スコア(独自算出の注目度): 41.86420087238674
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic vision-language models (VLMs), which interleave textual reasoning with explicit tool calls such as cropping and code-based image manipulation, have emerged as a compelling paradigm for reliable and interpretable multimodal reasoning. However, recent studies have revealed that such models often use tools unfaithfully. Many process images are irrelevant to the question (e.g., the tool crops the wrong region or misses the queried target), yet the call still receives full credit and the model still answers correctly. Such decorative or misaligned tool calls waste computation and reveal that the model leans on prior knowledge or the original image rather than the evidence it retrieves. This may stem from two limitations of prevailing methods: the tool reward fails to distinguish useful from useless calls, and tool feedback carries no signal of usefulness. To this end, we introduce FaithEyes, a multi-agent self-judging framework. Concretely, we use a VLM to judge whether each process image helps answer the question. The judgement is injected into the reasoning context as part of the tool observation to help subsequent reasoning, and meanwhile is used to scale the tool reward by the helpful-tool ratio to suppress reward hacking. To keep judgement available at evaluation and thus ensure train-test consistency, we further design a multi-agent framework where the model itself serves as a subagent to judge the tool calls from main agent, eliminating any dependence on an external model at inference. Training via a two-stage SFT + RL pipeline on adapted open-source data, FaithEyes attains competitive or superior accuracy across visual perception and reasoning benchmarks, while markedly improving tool faithfulness. The homepage is at https://github.com/Mosi-AI/FaithEyes.
- Abstract(参考訳): エージェント視覚言語モデル(VLM)は、テキスト推論と、トリミングやコードベースの画像操作といった明示的なツールコールをインターリーブし、信頼性と解釈可能なマルチモーダル推論のための魅力的なパラダイムとして登場した。
しかし、最近の研究では、そのようなモデルがしばしば不信なツールを使用することが明らかになっている。
多くのプロセスイメージは問題とは無関係である(例えば、ツールが間違ったリージョンをトリミングしたり、クエリ対象を見逃したりする)。
このような装飾的あるいは不整合のツールは、ムダ計算を呼び出し、モデルが取得した証拠ではなく、事前の知識や元のイメージに依存していることを明らかにする。
これは、ツール報酬が役に立たない呼び出しと役に立たないことと、ツールフィードバックが役に立たないという2つの制限に起因している可能性がある。
この目的のために、マルチエージェントの自己判断フレームワークであるFaithEyesを紹介します。
具体的には、VLMを用いて各プロセスイメージがその質問に答えるかどうかを判断する。
判定は、その後の推論を支援するために、ツール観察の一部として推論コンテキストに注入され、一方、報奨ハッキングを抑制するために、補助ツール比でツール報酬をスケールするために使用される。
評価時の判定を継続し,列車-テストの整合性を確保するために,モデル自体がメインエージェントからのツール呼び出しを判断するためのサブエージェントとして機能し,推論時の外部モデルへの依存を排除したマルチエージェントフレームワークを設計する。
FaithEyesは2段階のSFT + RLパイプラインを通じて、オープンソースのデータに適応してトレーニングを行い、視覚的知覚と推論ベンチマークをまたいで、競争力や優れた精度を達成すると同時に、ツールの忠実性を大幅に向上させる。
ホームページはhttps://github.com/Mosi-AI/FaithEyes.comにある。
関連論文リスト
- Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools [65.7098588070281]
我々は,自己制御能力を中心とした新しい視覚ツールパラダイムであるBeyond the Eye (BEE)を提案する。
BEEは、視覚的ツールの呼び出し動作をトレーニングの目的に取り入れ、自己規制された呼び出しメカニズムを開発するようモデルに促す。
BEEは、一般的な推論タスクにおいて競争力を維持しながら、きめ細かい視覚知覚において最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-13T05:32:00Z) - Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains [20.11899219087138]
画像のエージェントであるThymeとDeepEyesV2を用いて、現実世界の理解、OCR、チャート理解、数学的推論の2つの代表的思考について検討する。
ツールアクセスは、一貫した集約的改善がほとんど得られず、生成したコストを確実に削減することができず、小さなツールのみの解決セットのみを残している。
論文 参考訳(メタデータ) (2026-06-01T15:04:25Z) - Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use [47.29360932085394]
大規模言語モデル(LLM)は、外部ツールを呼び出す時と直接答える時を判断しなければならない自律的なエージェントとして、ますます機能します。
本稿では,各モデルの経験的性能に基づいて,ツール必要度をモデル適応的に定義する。
その結果,26.5~54.0%,30.8~41.8%のミスマッチが認められた。
論文 参考訳(メタデータ) (2026-05-13T18:59:28Z) - TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents [19.156453695628013]
マルチモーダル・ツール・ユース・エージェントにおけるジェネレーティブ・プロビデンスを検証するためのフレームワークであるTRACERを紹介する。
TraCERは、サポートツールターン、エビデンスユニット、セマンティックサポート関係を識別する構造化された証明レコードとともに、各回答文を生成する。
Qwen3-VL-8Bでは、TRACERは78.23%の回答精度と95.72%の要約精度に達し、最強のクローズドソースツール強化ベースラインを23.80ポイント上回った。
論文 参考訳(メタデータ) (2026-05-11T03:32:55Z) - When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning [58.75883713573783]
Tool-Integrated Reasoningは、推論軌道にツール呼び出しと実行を組み込む有望なパラダイムとして登場した。
モデルの推論がツールの結果と矛盾する場合、モデルは自身の推論を信じる傾向にあります。
アダプティブ・ツール・トラスト(ATTC、Adaptive Tool Trust)は、モデルに対して、ツール結果の信頼性や無視を適応的に選択するフレームワークである。
論文 参考訳(メタデータ) (2026-04-09T14:14:37Z) - ForgeryVCR: Visual-Centric Reasoning via Efficient Forensic Tools in MLLMs for Image Forgery Detection and Localization [62.03035862528452]
ForgeryVCRは、視覚中心推論(Visual-Centric Reasoning)を通じて、知覚できないトレースを明示的な視覚中間体に物質化するフレームワークである。
ForgeryVCRは、検出タスクとローカライゼーションタスクの両方において、最先端(SOTA)のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-02-15T11:14:47Z) - ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning [103.7657839292775]
ARM-Thinkerはエージェント・マルチモーダル・リワード・モデルであり、検証された証拠で判断を下すために外部ツールを自律的に呼び出す。
ARM-Thinkerを多段階強化学習で訓練し、ツールコール決定と判定精度を協調的に最適化する。
その結果,エージェント能力は報酬モデルの精度と解釈可能性の両方を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-12-04T18:59:52Z) - CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization [11.951768962241713]
最終回答の精度は、しばしば不誠実な視覚的推論を隠蔽する。
ツール・アウェア・ポリシー・オプティマイゼーションで訓練されたコードベースのビジュアルエージェントであるCodeVを紹介する。
論文 参考訳(メタデータ) (2025-11-24T19:48:46Z) - MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools [54.63478102768333]
十分に校正されたモデル信頼度は、潜在的な行動の報酬に対するリスクを測るために使用することができる。
本稿では,ツール呼び出し時の信頼度を評価するために,モデル内信頼度推定器(MICE)の新たなクラスを提案する。
論文 参考訳(メタデータ) (2025-04-28T18:06:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。