論文の概要: The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
- arxiv url: http://arxiv.org/abs/2608.06270v1
- Date: Thu, 06 Aug 2026 17:01:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.810197
- Title: The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
- Title(参考訳): 視覚ツールのイラシオン:画像による思考の因果的オーディション
- Authors: Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu,
- Abstract要約: 思考と想像」操作は、トークンコストがかなり高い直接推論よりも限界あるいは負の利得しか達成しないことが多い。
返却された視覚的証拠が答えに因果関係があるかどうかを問う。
我々は、視覚ツールの使用を因果グラフとして使用し、観察による経路と行動によるショートカットを分離する。
- 参考スコア(独自算出の注目度): 19.417504594148223
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The "thinking-with-images" paradigm equips multimodal LLMs with active visual operations such as crop-and-zoom. However, models using these operations often achieve only marginal or negative gains over direct inference at substantially higher token cost. They may also repeatedly crop irrelevant regions and fail on questions that direct inference answers correctly. We ask whether the returned visual evidence causally affects the answer. To answer this question, we formulate visual tool-use as a causal graph that separates observation-mediated paths from action-induced shortcuts. We then audit it through interventions at the three levels: policy (comparing tool-use with direct inference), trajectory (corrupting all observations during rollout), and step (counterfactually replacing one individual observation under a fixed prefix). Our step-level estimand, Visual Evidence Gain, isolates the contribution of each returned observation. Across six representative models and five fine-grained perception benchmarks, we uncover policy miscalibration with two failure modes. In Calling Without Looking, returned observations have no causal effect on the answer. In Looking Without Planning, observations are informative but the call schedule is incoherent. A trajectory-level diagnostic decomposes the policy-level accuracy gain and shows that the gain is concentrated in a Calibrated minority. We term this discrepancy the illusion of visual tool-use: despite aggregate accuracy gains, visual tool-use is not causally effective across a broad range of rollouts. The code is available at https://github.com/OpenCausaLab/CauAudit.
- Abstract(参考訳): 思考と想像」パラダイムは、作物と動物のような活発な視覚操作を備えたマルチモーダルLLMを装備する。
しかし、これらの演算を用いたモデルは、トークンコストがかなり高い直接推論よりも限界あるいは負の利得しか得られないことが多い。
彼らはまた、無関係な地域を何度も収穫し、直接推論が正しく答える質問に失敗する。
返却された視覚的証拠が答えに因果関係があるかどうかを問う。
この問いに答えるために、我々は、観察による経路と行動によるショートカットを分離する因果グラフとして視覚ツールの使用を定式化する。
次に、ポリシー(直接推論によるツール使用と比較して)、軌道(ロールアウト中にすべての観察を破損させる)、ステップ(固定プレフィックスの下で1つの観察を事実上置き換える)の3段階の介入を通じて監査する。
ステップレベルの推定値であるVisual Evidence Gainは、返却された各観測の寄与を分離する。
6つの代表的なモデルと5つのきめ細かい知覚ベンチマークで、2つの障害モードでポリシーの誤校正を明らかにする。
Calling Without Looking』では、返却された観察は答えに因果関係がない。
計画なしで見る場合、観察は有益なものであるが、呼び出しスケジュールは不整合である。
軌道レベルの診断は、ポリシーレベルの精度ゲインを分解し、そのゲインが校正された少数派に集中していることを示す。
この違いを視覚ツールの使用の錯覚と呼ぶ: 集合的精度の上昇にもかかわらず、視覚ツールの使用は幅広いロールアウトにおいて因果的に有効ではない。
コードはhttps://github.com/OpenCausaLab/CauAudit.comで入手できる。
関連論文リスト
- Interaction Scaling: Grounding the Third Axis of Test-Time Compute [0.33451037881913753]
一つの変数がこの第3の軸を接地として支配し、ループの両側に保持しなければならないと論じる。
固定トークン予算でのハードコーディングタスクでは、推論のみとベストオブNの両方をサンプリングする。
提案手法は, ラン・ツー・ラン分散を伴わず, 100%パスレートに到達した。
論文 参考訳(メタデータ) (2026-07-13T14:22:06Z) - VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? [79.44137632338062]
マルチモーダルな大規模言語モデルが視覚的推論問題に正しく答える場合、その予測はタスククリティカルな視覚的証拠によって実際に支持されているか?
VisualFLIPは1,374枚の画像が基数,属性,空間,論理的タスクにまたがって同一の問合せペアとして配置されたベンチマークである。
ペアの両面を解く必要がある24個のMLLMと、少なくとも一方の面を解くモデルが両方の画像に対して同じ空でない答えを繰り返す頻度を測定するCR(Collapse Rate)を評価した。
論文 参考訳(メタデータ) (2026-06-05T22:06:07Z) - Unveiling the Visual Counting Bottleneck in Vision-Language Models [49.591496870141846]
この研究は視覚的数え上げを3つの認知段階(視覚的識別、大きさ認識、象徴的マッピング)に分解する。
合成Go基板と線形プローブを用いて、視覚的バックボーンは、外挿系にしっかりと、線形に分離可能な量表現を保っていることを示す。
我々は、崩壊をシンボルマッピングステージに向ける。そこでは、モデルがシンボルトークンに有効な視覚的大きさを投影することに失敗する。
論文 参考訳(メタデータ) (2026-05-28T16:20:29Z) - Pando: Do Interpretability Methods Work When Models Won't Explain Themselves? [53.07826484214082]
モデル・オーガニゼーションのベンチマークであるPandoを紹介します。
Pandoは、ラベル付きクエリ-レスポンスペアから、ホールドアウトモデル決定を予測する。
説明が忠実であれば、ブラックボックスの引用はすべてのホワイトボックスメソッドに一致するか、超える。
論文 参考訳(メタデータ) (2026-04-13T06:42:24Z) - Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts [7.071615105094556]
視覚的属性は、初期層から線形にデオード可能であることを示す。
初期のレイヤでのトレーニング不要なアクティベーションは、いくつかの設定で性能を低下させることなく、最大3.8%の視覚的グラウンド化を向上できることを示す。
論文 参考訳(メタデータ) (2026-04-10T14:36:07Z) - CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation [0.996038809132083]
CUE-Rは、単発RAGにおいて、エビデンス単位の操作性を測定するためのフレームワークである。
CUE-RはREMOVE、REPLACE、DUPLICATE演算子を介して個々の証拠項目を摂動し、3つのユーティリティ軸に沿って変化を測定する。
その結果,回答のみの評価は重要なエビデンス効果を見逃し,介入に基づくユーティリティ分析がRAG評価の実践的補完となることが示唆された。
論文 参考訳(メタデータ) (2026-04-07T06:05:08Z) - To See or To Please: Uncovering Visual Sycophancy and Split Beliefs in VLMs [1.9349092719498848]
Tri-Layer Diagnostic Frameworkは、潜在異常検出、ビジュアル必要スコア、コンペティションスコアという3つのメトリクスを通じて幻覚ソースをアンハングルする。
我々の分類では、69.6%のサンプルが視覚的シコファンシーを示しており、モデルは視覚異常を検知するが、ユーザーの期待を満足させるために幻覚を与える。
論文 参考訳(メタデータ) (2026-03-19T00:15:05Z) - Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection [49.26064449816502]
本研究では,テキスト・視覚バイアスと共起バイアスに対処するために,グラディエントベースのインフルエンス・アウェア制約付きデコーディング(GACD)手法を提案する。
GACDは幻覚を効果的に低減し、MLLM出力の視覚的接地を改善する。
論文 参考訳(メタデータ) (2025-09-03T08:13:52Z) - Regularized Contrastive Partial Multi-view Outlier Detection [76.77036536484114]
RCPMOD(Regularized Contrastive partial Multi-view Outlier Detection)と呼ばれる新しい手法を提案する。
このフレームワークでは、コントラスト学習を利用して、ビュー一貫性のある情報を学び、一貫性の度合いでアウトレイラを識別する。
4つのベンチマークデータセットによる実験結果から,提案手法が最先端の競合より優れていることが示された。
論文 参考訳(メタデータ) (2024-08-02T14:34:27Z) - Causal Transportability for Visual Recognition [70.13627281087325]
画像とラベルの関連性は、設定間では転送できないため、標準分類器がフェールすることを示す。
次に、すべての共起源を摂食する因果効果が、ドメイン間で不変であることを示す。
これにより、画像分類における因果効果を推定するアルゴリズムを開発する動機付けとなる。
論文 参考訳(メタデータ) (2022-04-26T15:02:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。