論文の概要: OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories
- arxiv url: http://arxiv.org/abs/2608.08557v1
- Date: Sun, 09 Aug 2026 08:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.867973
- Title: OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories
- Title(参考訳): OpenVisTool: インストラクティブなビジュアルツール使用トラジェクトリを合成するためのオープンレシピ
- Authors: Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu,
- Abstract要約: OpenVisToolは、視覚的ツール使用軌跡を構築するためのオープンなフレームワークである。
このフレームワークは、ツールなしでは確実に答えられないクエリを選択するのが難しいこと、ドメイン固有の軌道合成、そして監督検証の3段階で機能する。
このフレームワークを用いて、5つの視覚的推論領域にまたがるデータセットであるOpenVisTool-42Kと、同じドメインをカバーするベンチマークであるOpenVisTool-Benchを構築した。
- 参考スコア(独自算出の注目度): 44.795764429083114
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual tool use has emerged as a fundamental capability for multimodal agents to actively acquire evidence beyond a fixed image encoding. The prevailing recipe learns this capability from teacher-generated trajectories filtered for answer correctness, implicitly assuming that every successful demonstration provides effective supervision. We argue this assumption is flawed: a strong teacher often reaches the correct answer without needing its tool calls, and imitating such trajectories teaches a student that tool calls accompany correct answers, not that tool observations ground them. We present OpenVisTool, an open framework for constructing instructive visual tool-use trajectories that provide effective supervision for tool learning. The key insight is that a trajectory should be retained only if its answer is correct (outcome validity) and its tool observations causally contribute to that answer (causal utility). The framework operates in three stages: difficulty screening to select queries that are not reliably answerable without tools, domain-specific trajectory synthesis to elicit coherent tool-use trajectories, and supervision verification to jointly test both conditions. Rather than encouraging models to imitate tool calls, the resulting supervision teaches when and how visual evidence should be acquired. Using this framework, we construct OpenVisTool-42K, a dataset spanning five visual reasoning domains, together with OpenVisTool-Bench, a benchmark covering the same domains. Across four backbones (4B-27B), fine-tuning on OpenVisTool-42K consistently improves visual tool-use performance and yields gains on two out-of-distribution benchmarks; the larger models approach leading closed-source systems. The evidence suggests that effective visual tool use is learned from causally grounded supervision rather than tool-calling patterns.
- Abstract(参考訳): ビジュアルツールの使用は、固定画像エンコーディングを超えた証拠を積極的に取得するマルチモーダルエージェントの基本的な機能として登場した。
一般的なレシピでは、教師が作成したトラジェクトリからこの能力を学び、答えの正しさを判断し、すべての成功例が効果的な監督を提供すると暗黙的に仮定する。
強力な教師は、ツールコールを必要とせずに正しい回答に達することが多く、そのような軌跡を模倣することで、ツールコールに付随する正しい回答を学生に教える。
ツール学習を効果的に管理する教育的視覚ツール利用トラジェクトリを構築するためのオープンフレームワークOpenVisToolを提案する。
重要な洞察は、軌道は、その解答が正し(アウトカムの妥当性)、そのツールの観察がその解答(因果的効用)に因果的に寄与する場合にのみ維持されるべきであるということである。
このフレームワークは、ツールなしでは確実に答えられないクエリを選択することの困難さ、コヒーレントなツール使用トラジェクトリを引き出すドメイン固有のトラジェクトリ合成、両方の条件を共同でテストするための監督検証の3段階で機能する。
モデルにツールコールを模倣するように促すのではなく、結果として得られた監督は、いつ、どのようにビジュアルエビデンスを取得するべきかを教える。
このフレームワークを用いて、5つの視覚的推論領域にまたがるデータセットであるOpenVisTool-42Kと、同じドメインをカバーするベンチマークであるOpenVisTool-Benchを構築した。
4つのバックボーン(4B-27B)にわたって、OpenVisTool-42Kの微調整は、視覚ツールのパフォーマンスを一貫して改善し、2つのアウト・オブ・ディストリビューション・ベンチマークで利益を得る。
この証拠は、効果的な視覚ツールの使用は、ツールコールパターンではなく、因果的に根ざした監督から学習されていることを示唆している。
関連論文リスト
- ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision [9.636298395366746]
イメージで考えることで、コードを通じて視覚ツールを呼び出すことで、限られた知覚を補うマルチモーダルモデルが可能になる。
SFTはツールの使い方を教えることが期待されているが、より強い教師の軌跡は、小学生が確実に再現または活用できない知覚能力によって成功する可能性がある。
RLはいつツールを使うかを教えることが期待されているが、結果のみの報奨は、ツールの実行が失敗し、ツールの使用が抑制される。
論文 参考訳(メタデータ) (2026-08-09T20:39:16Z) - VC-Tooler: Learning Compositional and Adaptive Visual Tool Use [45.491241950121214]
エージェントマルチモーダル推論は受動的画像理解を拡張する。
本稿では,合成および適応能力として視覚ツールの使用を学習するVC-Toolerを提案する。
論文 参考訳(メタデータ) (2026-08-03T13:38:37Z) - Visual Reasoning through Tool-supervised Reinforcement Learning [18.76805336754779]
本稿では,より効果的なツール・ユース・ラーニングのためのツール・インシュアランス(ToolsRL)フレームワークを提案する。
ズームイン、ローテーション、フリップ、ドローポイント/ラインなど、シンプルな、ネイティブで、解釈可能な一連のビジュアルツールに重点を置いています。
強化学習カリキュラムが開発され、第1段階は、モチベーションの高いツール固有の報酬セットによってのみ最適化され、第2段階は、通話ツールを許可しながら、精度の高い目標報酬で訓練される。
論文 参考訳(メタデータ) (2026-04-21T19:48:19Z) - AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning [66.24374176797075]
textbfAdaReasonerは、ツール固有の、あるいは明示的な教師付き行動ではなく、一般的な推論スキルとしてツールの使用を学ぶマルチモーダルモデルのファミリーである。
AdaReasonerは、(i)スケーラブルなデータキュレーションパイプラインによって、長期にわたる多段階のツールインタラクションにモデルを公開し、(ii)ツール-GRPO、(ii)ツールの選択とシークエンシングをエンドツーエンドの成功に基づいて優先順位付けする強化学習アルゴリズム、(iii)ツールの使用を動的に規制する適応学習メカニズムによって実現されている。
論文 参考訳(メタデータ) (2026-01-26T16:04:43Z) - VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection [47.259066449806866]
VisTAは新しい強化学習フレームワークで、視覚エージェントが経験的パフォーマンスに基づいた多様なライブラリのツールを動的に探索し、選択し、組み合わせることを可能にする。
トレーニング不要のベースラインよりも,VisTAが大幅なパフォーマンス向上を実現していることを示す。
これらの結果は、VisTAが一般化を強化し、多様なツールを適応的に活用し、柔軟な経験駆動型視覚推論システムを実現する能力を強調している。
論文 参考訳(メタデータ) (2025-05-26T17:59:17Z) - OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning [57.89304342666846]
OpenThinkIMGは、ツール拡張LVLMのための、最初のオープンソースで包括的なエンドツーエンドフレームワークです。
本稿では,LVLMを学習し,外部視覚ツールを起動するための適応的なポリシーを学ぶための,新しい強化学習フレームワークV-ToolRLを提案する。
V-ToolRLにより、LVLMは最適なツール利用戦略を自律的に発見できる。
論文 参考訳(メタデータ) (2025-05-13T14:35:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。