論文の概要: Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning
- arxiv url: http://arxiv.org/abs/2608.09682v1
- Date: Mon, 10 Aug 2026 14:52:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.31991
- Title: Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning
- Title(参考訳): ピクセルではなくツールを考える:ビジュアル推論のためのテキストスキャフォールドとしてのツールコール
- Abstract要約: ツール強化された視覚言語モデル、ますます「イメージで考える」
近年、ブラインドテスト、ゲイン分解、アテンション分析による研究により、返却画像はほとんど寄与していないことが示された。
我々は、返却されたピクセルが到着する前に出力される構造化されたテキストである、と仮定する。
- 参考スコア(独自算出の注目度): 75.00741348880044
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-augmented vision-language models increasingly "think with images": they call crop, zoom, or code tools and reason over the returned pixels. However, recent work using blind tests, gain decompositions, and attention analyses has shown that returned images contribute little, raising the question: if pixels do not carry the gain, what does? We hypothesize that the load-bearing signal is the structured text emitted before any returned pixel arrives: tool name, coordinates, target description, and intent. This textual scaffold encodes where to look and what to find. We introduce TextCall (call-but-no-return) to test this: it keeps the scaffold but replaces returned images with the text placeholder [Image output skipped]. Three studies support the hypothesis. (i) Non-necessity of returned pixels: across LoRA, full fine-tuning, and RL, TextCall matches or exceeds full thinking-with-images; under RL it preserves tool use at the reported checkpoint, avoiding the failure mode where, under matched settings, seeing the returned image causes the model to stop calling tools and answer directly. (ii) Sufficiency of the scaffold: on matched training queries, scaffold-only input yields equivalent accuracy to returned-image input. (iii) Component specificity: decomposing the scaffold into reasoning text and spatial code shows both components contribute, with the dominant one varying by task. Together these results support the Tool-Call Scaffold Hypothesis: in current thinking-with-images distributions, the active signal is the structured text emitted at tool-call time; the returned image is a redundant carrier. TextCall preserves accuracy while reducing latency by 29-46% and eliminating tool-execution API calls. Our claims hold for current thinking-with-images benchmarks; constructing tasks where pixels are genuinely load-bearing remains an open direction.
- Abstract(参考訳): ツール拡張された視覚言語モデルは、作物、ズーム、コードツールと呼ばれ、返されるピクセルを理由付けている。
しかし、近年のブラインドテスト、ゲイン分解、アテンション分析による研究は、返却画像はほとんど寄与せず、ピクセルがゲインを持ち込まない場合、何が起こるのかという疑問を提起している。
我々は、返却されたピクセルが到着する前に出力される構造化されたテキストである、ツール名、座標、ターゲット記述、インテントである、と仮定する。
このテキスト足場は、探すべき場所と見つけるべき場所をエンコードする。
このテストにはTextCall(call-but-no-return)を導入します。足場を維持しますが、返されたイメージをテキストプレースホルダに置き換えます [画像出力がスキップされた]。
3つの研究がその仮説を支持している。
i) 返却されたピクセルの不要性: LoRA、フル微調整、RL、TextCallは、完全な思考とイメージを一致または超える; RLでは、報告されたチェックポイントでツールの使用を保存し、マッチした設定下では、返却された画像を見ることで、ツールの呼び出しを中止し、直接応答する。
(ii)足場十分性:一致したトレーニングクエリでは、足場のみの入力が返却画像の入力に等価な精度をもたらす。
(iii)コンポーネントの特異性:足場を推論テキストと空間コードに分解すると、両方のコンポーネントが寄与し、支配的なコンポーネントはタスクによって異なる。
現在の思考とイメージの分布では、アクティブ信号はツールコール時に出力される構造化されたテキストであり、返された画像は冗長なキャリアである。
TextCallは、レイテンシを29~46%削減し、ツール実行API呼び出しを排除しながら、正確性を維持する。
私たちの主張は、現在の思考とイメージのベンチマークであり、ピクセルが本当にロード可能なタスクを構築することは、まだオープンな方向です。
関連論文リスト
- FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification [41.86420087238674]
近年の研究では、エージェント型視覚言語モデルがツールを不信に利用することが多いことが判明している。
マルチエージェントの自己判断フレームワークであるFaithEyesを紹介する。
FaithEyesは、視覚知覚と推論ベンチマークの間で、競争力または優れた精度を達成する。
論文 参考訳(メタデータ) (2026-07-30T13:58:08Z) - PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation [70.26672362704758]
我々は,Webサイトを視覚的に表現する新しい検索拡張手法であるPixelRAGを紹介する。
PixelRAGはこの形式で完全なウィキペディアコーパス上で動作する最初のパイプラインである。
非検索とテキストベースのRAGベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-01T23:20:51Z) - Exploring Fine-Grained Image-Text Alignment for Referring Remote Sensing Image Segmentation [27.13782704236074]
視覚的および言語的表現を完全に活用するために,新しい参照リモートセンシング画像分割法を提案する。
提案した細粒度画像テキストアライメントモジュール(FIAM)は、入力画像と対応するテキストの特徴を同時に活用する。
本稿では,RefSegRSとRRSIS-Dを含む2つのリモートセンシングデータセットに対する提案手法の有効性を評価する。
論文 参考訳(メタデータ) (2024-09-20T16:45:32Z) - Divide and Conquer: Language Models can Plan and Self-Correct for
Compositional Text-to-Image Generation [72.6168579583414]
CompAgentは、大規模な言語モデル(LLM)エージェントをコアとして、コンポジションテキスト・画像生成のためのトレーニング不要のアプローチである。
提案手法は,オープンワールド合成T2I生成のための総合的なベンチマークであるT2I-CompBenchに対して10%以上の改善を達成している。
論文 参考訳(メタデータ) (2024-01-28T16:18:39Z) - TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification [59.779532652634295]
画像とテキストのペア以外の追加データフォーマットを必要とせずに、画像とテキストの特徴の整合性を向上するための、恥ずかしいほど単純なアプローチを提案する。
画像中に存在する可能性が極めて高い記述からオブジェクトや属性を解析する。
実験は、既存の代替手段よりも平均5.2%のフレームワークの改善を裏付けるものです。
論文 参考訳(メタデータ) (2023-12-21T18:59:06Z) - Decompose Semantic Shifts for Composed Image Retrieval [38.262678009072154]
合成画像検索は、ユーザが参照画像を出発点として提供し、開始点から所望の目標画像へのシフト方法に関するテキストを指定する画像検索タスクの一種である。
本稿では,セマンティック・シフト・ネットワーク(SSN)を提案する。セマンティック・シフト・ネットワーク(SSN)は,セマンティック・シフトを,参照画像から視覚プロトタイプへ,視覚プロトタイプから対象画像へ,という2つのステップに明示的に分解する。
提案したSSNは、CIRRデータセットとFashionIQデータセットでそれぞれ5.42%と1.37%の大幅な改善を示し、新しい最先端のパフォーマンスを確立している。
論文 参考訳(メタデータ) (2023-09-18T07:21:30Z) - Divide, Evaluate, and Refine: Evaluating and Improving Text-to-Image
Alignment with Iterative VQA Feedback [20.78162037954646]
テキストと画像のアライメントの評価と改善に対する分解的アプローチを導入する。
人間のユーザスタディでは、提案手法が従来の最先端の手法を8.7%超え、テキストと画像のアライメントの精度が向上した。
論文 参考訳(メタデータ) (2023-07-10T17:54:57Z) - Re-Imagen: Retrieval-Augmented Text-to-Image Generator [58.60472701831404]
検索用テキスト・ツー・イメージ・ジェネレータ(再画像)
検索用テキスト・ツー・イメージ・ジェネレータ(再画像)
論文 参考訳(メタデータ) (2022-09-29T00:57:28Z) - Detector-Free Weakly Supervised Grounding by Separation [76.65699170882036]
Wakly Supervised phrase-Grounding (WSG)は、画像中の任意のテキストフレーズをローカライズするためにデータを使用するタスクを扱う。
本稿では,事前学習した検出器を使わずにWSGを解くための検出器フリーWSG(DF-WSG)を提案する。
我々は、以前のdf-wsg sotaと比較して最大8.5%の精度向上を示す。
論文 参考訳(メタデータ) (2021-04-20T08:27:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。