論文の概要: ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision
- arxiv url: http://arxiv.org/abs/2608.08907v1
- Date: Sun, 09 Aug 2026 20:39:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.991979
- Title: ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision
- Title(参考訳): ToolVision: 有能なスーパービジョンでビジュアルツールをいつ、どのように使うかを学ぶ
- Abstract要約: イメージで考えることで、コードを通じて視覚ツールを呼び出すことで、限られた知覚を補うマルチモーダルモデルが可能になる。
SFTはツールの使い方を教えることが期待されているが、より強い教師の軌跡は、小学生が確実に再現または活用できない知覚能力によって成功する可能性がある。
RLはいつツールを使うかを教えることが期待されているが、結果のみの報奨は、ツールの実行が失敗し、ツールの使用が抑制される。
- 参考スコア(独自算出の注目度): 9.636298395366746
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Thinking with images allows a multimodal model to compensate for limited perception by invoking visual tools through code. Yet the prevailing SFT-then-RL recipe creates a different supervision misalignment at each stage. SFT is expected to teach how to use tools, but trajectories from stronger teachers may succeed through perceptual capabilities that a smaller student cannot reliably reproduce or exploit, causing the student to imitate tool-call patterns without learning how to make them useful. RL is expected to teach when to use tools, but outcome-only rewards make fallible tool execution a liability and suppress tool use, whereas a blanket bonus for every correct tool-using trajectory encourages valid but ineffective operations. To address these two misalignments, we introduce ToolVision. During SFT, a multi-agent pipeline explores candidate trajectories, and a committee including student-scale models scores stepwise evidence gain to rank and prune the search branches. Only successfully executed trajectories with correct final answers are retained for SFT. Before RL, ToolVision compares the learner's performance with and without tools, then rewards successful tool use only on questions where tools provide a clear benefit. Both signals are constructed automatically from public task data without additional human annotations of tool use or necessity. ToolVision-8B improves over its base on all seven main benchmarks, surpasses Thyme-7B, CodeVision-8B, and CodeDance-7B on all three high-resolution benchmarks, and outperforms Qwen3-VL-32B-Thinking on V* and HRBench 8K. We will publicly release the datasets and source code.
- Abstract(参考訳): イメージで考えることで、コードを通じて視覚ツールを呼び出すことで、限られた知覚を補うマルチモーダルモデルが可能になる。
しかし、一般的なSFT-then-RLレシピは、それぞれの段階で異なる監督ミスアライメントを生み出す。
SFTはツールの使い方を教えることが期待されているが、より強い教師の軌跡は、小学生が確実に再現または活用できない知覚能力によって成功する可能性がある。
RLはいつツールを使うかを教えることが期待されているが、結果のみの報奨は、偽装ツールの実行に責任を負い、ツールの使用を抑制する。
これら2つの相違に対処するために、ToolVisionを紹介します。
SFTの間、複数エージェントのパイプラインが候補の軌跡を探索し、学生スケールモデルを含む委員会が段階的に証拠を採点し、探索枝をランク付けしてプルーする。
SFTでは、正しい最終回答を持つ正常に実行されるトラジェクトリのみが保持される。
RLの前に、ToolVisionは学習者のパフォーマンスをツールなしで比較し、成功したツールに報酬を与える。
どちらの信号も、ツールの使用や必要のない追加の人間のアノテーションなしで、公開タスクデータから自動的に構築される。
ToolVision-8Bは、Thyme-7B、CodeVision-8B、CodeDance-7Bを3つの高解像度ベンチマークで上回り、V*とHRBench 8KでQwen3-VL-32B-Thinkingを上回っている。
データセットとソースコードを公開します。
関連論文リスト
- Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories [44.795764429083114]
OpenVisToolは、視覚的ツール使用軌跡を構築するためのオープンなフレームワークである。
このフレームワークは、ツールなしでは確実に答えられないクエリを選択するのが難しいこと、ドメイン固有の軌道合成、そして監督検証の3段階で機能する。
このフレームワークを用いて、5つの視覚的推論領域にまたがるデータセットであるOpenVisTool-42Kと、同じドメインをカバーするベンチマークであるOpenVisTool-Benchを構築した。
論文 参考訳(メタデータ) (2026-08-09T08:01:05Z) - Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains [20.11899219087138]
画像のエージェントであるThymeとDeepEyesV2を用いて、現実世界の理解、OCR、チャート理解、数学的推論の2つの代表的思考について検討する。
ツールアクセスは、一貫した集約的改善がほとんど得られず、生成したコストを確実に削減することができず、小さなツールのみの解決セットのみを残している。
論文 参考訳(メタデータ) (2026-06-01T15:04:25Z) - Visual Reasoning through Tool-supervised Reinforcement Learning [18.76805336754779]
本稿では,より効果的なツール・ユース・ラーニングのためのツール・インシュアランス(ToolsRL)フレームワークを提案する。
ズームイン、ローテーション、フリップ、ドローポイント/ラインなど、シンプルな、ネイティブで、解釈可能な一連のビジュアルツールに重点を置いています。
強化学習カリキュラムが開発され、第1段階は、モチベーションの高いツール固有の報酬セットによってのみ最適化され、第2段階は、通話ツールを許可しながら、精度の高い目標報酬で訓練される。
論文 参考訳(メタデータ) (2026-04-21T19:48:19Z) - ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents [16.06309106596998]
ToolTokはGUIエージェントのための多段階パスフィニングの新しいパラダイムである。
我々は,人間のインタラクションの習慣に沿ったツールを考案し,学習可能なトークン埋め込みを用いて各ツールを表現する。
トークン定義質問回答,純テキスト誘導ツールの選択,視覚的パスフィニングの3つのタスクからなる,難易度の高いカリキュラムを構築した。
論文 参考訳(メタデータ) (2026-01-30T08:38:05Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning [63.071280297939005]
提案するTransductive Visual Programming (TVP, Transductive Visual Programming) は、投機ではなく、独自の経験から新しいツールを構築する新しいフレームワークである。
TVPは最先端のパフォーマンスを達成し、GPT-4oを22%上回り、以前の最高のビジュアルプログラミングシステムを11%上回っている。
私たちの研究は、自己進化型ビジュアルプログラミングエージェントを構築するための強力なパラダイムとして、経験駆動型トランスダクティブツールの作成を確立します。
論文 参考訳(メタデータ) (2025-12-24T04:30:21Z) - AdaTooler-V: Adaptive Tool-Use for Images and Videos [36.66944857910871]
AdaTooler-Vは、視覚的な問題が本当にツールを必要とするかどうかを判断し、適応的なツール使用を実行するMLLMである。
AdaTooler-V-7B は高解像度のベンチマーク V* で89.8%の精度を達成し、商用のプロプライエタリモデル GPT-4o と Gemini 1.5 Pro を上回った。
論文 参考訳(メタデータ) (2025-12-18T18:59:55Z) - TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use [74.47746287181383]
大規模言語モデル(LLM)ベースのエージェントは、現実のタスクを完了するためのツールの使用にますます依存している。
LLMのツール使用能力を総合的に評価するためのトラジェクトリ対応ベンチマークであるTRAJECT-Benchを紹介する。
論文 参考訳(メタデータ) (2025-10-06T07:30:25Z) - OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning [57.89304342666846]
OpenThinkIMGは、ツール拡張LVLMのための、最初のオープンソースで包括的なエンドツーエンドフレームワークです。
本稿では,LVLMを学習し,外部視覚ツールを起動するための適応的なポリシーを学ぶための,新しい強化学習フレームワークV-ToolRLを提案する。
V-ToolRLにより、LVLMは最適なツール利用戦略を自律的に発見できる。
論文 参考訳(メタデータ) (2025-05-13T14:35:51Z) - ToolRL: Reward is All Tool Learning Needs [54.16305891389931]
大規模言語モデル(LLM)は、ツールの使用能力を得るために、しばしば監督された微調整(SFT)を行う。
近年の強化学習(RL)の進歩は、有望な推論と一般化能力を示している。
本稿では、RLパラダイムにおけるツール選択とアプリケーションタスクに対する報酬設計に関する最初の総合的研究について述べる。
論文 参考訳(メタデータ) (2025-04-16T21:45:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。