論文の概要: Matching Object or Relation? Tracing Abstract Reasoning Inside VLMs
- arxiv url: http://arxiv.org/abs/2610.07646v1
- Date: Tue, 06 Oct 2026 02:38:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.762656
- Title: Matching Object or Relation? Tracing Abstract Reasoning Inside VLMs
- Title(参考訳): オブジェクトかリレーションか? VLM内の抽象推論の追跡
- Abstract要約: 視覚言語モデル(VLM)は視覚的ベンチマークに優れるが、抽象的推論を必要とするタスクでは体系的に失敗する。
我々は,VLMをマッチングレベル,モデルスケール,リレーショナル単位のオブジェクト数,オブジェクトごとの刺激ノイズの欠如にシフトする4つのレバーを同定した。
モデルを開くと、層ごとの表現類似性解析と因果媒介分析により、VLM抽象推論が2つの競合する回路で実装されていることが明らかになった。
- 参考スコア(独自算出の注目度): 48.56470855119906
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Language Models (VLMs) excel on visual benchmarks but fail systematically on tasks requiring abstract reasoning. Existing benchmarks document this failure but cannot say \emph{why} it happens or which cognitive capability is missing. We close this gap by adopting the Relational Match-to-Sample (RMTS) paradigm from comparative and developmental psychology and pairing it with a mechanistic analysis of the model's internals. On a parametrically controlled stimulus set evaluated across frontier API models (GPT, Claude, Gemini) and three open-source families (Qwen3.5, Gemma-4, InternVL3), we identify four levers that shift VLMs toward the relational match---capability tier, model scale, the number of objects per scene, and the absence of per-object stimulus noise---together producing a developmental-like trajectory that mirrors the human \emph{relational shift}. Opening up the model, a per-layer representational similarity analysis and a causal mediation analysis reveal that VLM abstract reasoning is implemented by two competing circuits: an early circuit that organises images by their surface object features, and a late circuit that organises them by their abstract relation. Extending the analysis to ARC-AGI-1, we find that ablating the relational heads identified on RMTS degrades performance more than ablating random heads, indicating that the relational circuit is recruited beyond our controlled stimuli. We hope this mechanism-level view serves as a step toward understanding how abstract reasoning is implemented in VLMs.
- Abstract(参考訳): 視覚言語モデル(VLM)は視覚的ベンチマークに優れるが、抽象的推論を必要とするタスクでは体系的に失敗する。
既存のベンチマークは、この失敗を文書化するが、それが起こるか、どの認知能力が欠けているかを言うことはできない。
我々は、相対的・発達心理学からRMTS(Relational Match-to-Sample)パラダイムを採用し、モデルの内部の力学解析と組み合わせることで、このギャップを埋める。
また、フロンティアAPIモデル(GPT, Claude, Gemini)とオープンソースファミリ(Qwen3.5, Gemma-4, InternVL3)で評価されたパラメトリック制御された刺激セットを用いて、VLMをリレーショナルマッチング層へシフトさせる4つのレバーを同定した。
モデルを開くと、層ごとの表現類似性解析と因果媒介分析により、VLM抽象推論が2つの競合する回路によって実装されていることが明らかになった。
解析をARC-AGI-1に拡張すると、RMTSで同定されたリレーショナルヘッドの劣化はランダムヘッドの劣化以上の性能を低下させ、リレーショナル回路が制御された刺激を超えてリレーショナル回路が採用されることを示す。
我々は、このメカニズムレベルのビューが、VLMに抽象的推論がどのように実装されているかを理解するためのステップとなることを願っている。
関連論文リスト
- ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation [71.69632267962993]
我々は、操作計画が自然に予測に分解され、次の視覚状態が予測され、逆ダイナミクスとなることを論じる。
我々は、この分解を実現する生成モデルである textbfThinkingVLA を提案する。
シミュレーションと実世界のベンチマークの実験では、ThinkingVLAは最先端のベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-06-16T13:45:17Z) - MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism [70.69809410471993]
現在のVision-Language Modelsは、フル長のビジュアルシーケンスを処理することによって、禁止されたトークンの爆発と注意の希釈を引き起こすため、数時間のビデオに苦労している。
我々はMemDreamerを導入し、知覚と推論を分離し、長いビデオ理解をエージェント探索プロセスに移行する。
MemDreamerは4つの主要なベンチマークでSOTAの結果を達成し、人間の専門家とのギャップをわずか3.7ポイントに縮める。
論文 参考訳(メタデータ) (2026-06-05T17:59:21Z) - From Consumption to Reflection: Designing Human-AI Relations for Stable Reasoning [0.0]
本稿では、聴覚的推論ループを通してリフレクションを運用する推論時ガバナンスであるリフレクティブ・インテリジェンス(RRI)を紹介する。
機械を人間のように考えさせるか、人間を機械のように推論させるのではなく、RRIは両者の制約を補う構造的な相互作用を作り出す。
論文 参考訳(メタデータ) (2026-04-17T08:37:16Z) - BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception [67.89135437537179]
我々は視覚中心の推論ベンチマークであるBLINK-Twiceを紹介した。
外部の知識に頼るのではなく、私たちのタスクは視覚的コンテンツのみから推論するモデルを必要とします。
事前の知覚ベンチマークと比較すると、浅い知覚を超越し、きめ細かい観察と分析的推論を必要とする。
論文 参考訳(メタデータ) (2025-10-10T13:14:13Z) - Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning [53.790502697674754]
本稿では、画像入力を重要な推論段階に移行する戦略であるTake-Allong Visual Conditioning (TVC)を提案する。
TVCは、推論を通して視覚的なコンポーネントへの注意を維持するのに役立つ。
提案手法は,5つの数学的推論ベンチマークにおいて,最先端の性能を平均で達成する。
論文 参考訳(メタデータ) (2025-03-17T16:45:12Z) - V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning [40.18308199837137]
これらの問題点に対処するために,ビデオS-テンポラル推論(V-STa)ベンチマークを導入する。
我々は,ビデオLLMの時空間推論プロセスを実現するためのデータセットを構築した。
14のビデオ-LLMによる実験では、現在のビデオ-LLMと、堅牢で一貫性のある推論の必要性の間に大きなギャップが示されている。
論文 参考訳(メタデータ) (2025-03-14T15:21:44Z) - VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning [63.0285363282581]
MLLM(Multimodal Large Language Models)は、視覚情報とテキスト情報を統合するための強力なツールとなっている。
本稿では,MLLMの知覚的理解と抽象的関係推論を評価するためのベンチマークVOILAを紹介する。
我々は,現在のMLLMが画像間関係の理解に苦慮し,高レベルの関係推論において限られた能力を示すことを明らかにした。
論文 参考訳(メタデータ) (2025-02-25T23:36:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。