論文の概要: Diagnosing the Sources of Compositional Failure in Vision-Language Models: A Controlled Analysis
- arxiv url: http://arxiv.org/abs/2609.31456v1
- Date: Fri, 25 Sep 2026 16:09:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.482597
- Title: Diagnosing the Sources of Compositional Failure in Vision-Language Models: A Controlled Analysis
- Title(参考訳): 視覚言語モデルにおける構成失敗源の診断:制御解析
- Abstract要約: 87Kイメージキャプション対における合成積分のコストを定量化する。
各スキルは、主に独自のプリミティブ型をカウントして分解される。
これらの結果から, 構成劣化は, 結合推論のみに還元できない複数の分離因子を反映していることが示唆された。
- 参考スコア(独自算出の注目度): 4.815168382502417
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models (VLMs) often struggle with compositional reasoning tasks, but the reasons for this underperformance remain unclear. A common hypothesis is that models struggle to integrate multiple components, leading to training interventions to improve compositional binding. However, this assumption has never been directly quantified. Existing benchmarks evaluate captions only in their composed form, making it impossible to separate the cost of joint reasoning from the cost of recognizing individual components under increasing load. We introduce COMPASS (COMPositional Analysis of SkillS), a controlled evaluation framework designed to isolate and measure the distinct factors underlying compositional failure. By comparing performance on composed captions with their decomposed counterparts , we directly quantify the cost of compositional integration across 87K image-caption pairs. Across multiple VLMs, this gap is real but partial, accounting for only part of the observed degradation. This motivates a finer-grained investigation into what additional factors govern model behavior. We analyze performance at the level of individual skills: object detection, attribute binding, and relation reasoning, using skill-targeted perturbations across 274K image-caption pairs. We find a consistent skill-specific pattern: each skill degrades primarily with the count of its own primitive type (self-load), while cross-load effects are predominantly positive, suggesting that primitives of different types provide useful grounding context. This pattern holds across standard contrastive encoders, explicitly trained compositional reasoning models, and non-contrastive architectures. These findings show that compositional degradation reflects multiple separable factors that cannot be reduced to joint reasoning alone.
- Abstract(参考訳): 視覚言語モデル(VLM)は、しばしば構成的推論タスクに苦しむが、この性能の低さの理由はまだ不明である。
一般的な仮説は、モデルが複数のコンポーネントを統合するのに苦労し、構成的結合を改善するためのトレーニングの介入につながるというものである。
しかし、この仮定は直接的に定量化されていない。
既存のベンチマークでは、キャプションを合成形式でのみ評価することで、個々のコンポーネントを認識するコストから共同推論のコストを分離することは不可能である。
CompASS (COMPositional Analysis of SkillS) は,構成不良の原因となる要因を分離・測定する制御された評価フレームワークである。
合成キャプションの性能と分解されたキャプションを比較して,87Kのイメージキャプション対間の合成統合コストを直接定量化する。
複数のVLMにおいて、このギャップは現実であるが部分的であり、観測された劣化の一部のみを考慮に入れている。
このことは、追加の要因がモデル行動を支配するか、よりきめ細かい調査を動機付けている。
対象検出,属性バインディング,関係推論といった個々のスキルのレベルでのパフォーマンスを,274Kイメージキャプチャ対にわたるスキルターゲットの摂動を用いて分析する。
各スキルは、主に独自のプリミティブ型(セルフロード)のカウントで分解されるのに対して、クロスロード効果は主として肯定的であり、異なるタイプのプリミティブが有用な基盤となることを示唆している。
このパターンは、標準的なコントラストエンコーダ、明示的に訓練された構成推論モデル、および非コントラストアーキテクチャにまたがる。
これらの結果から, 構成劣化は, 結合推論のみに還元できない複数の分離因子を反映していることが示唆された。
関連論文リスト
- Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding [10.95036747579563]
ビジョンランゲージモデル(Vision-Language Models)は、優れた能力を示すが、しばしば構成的推論に苦しむ。
本研究は, 陰性試料有効性の基本的な決定因子として, 語彙的特異性を確立した。
Slipformと名付けられた統合フレームワークは、様々な構成評価ベンチマークで最先端の精度を実現している。
論文 参考訳(メタデータ) (2026-04-14T21:28:46Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - Causal-HalBench: Uncovering LVLMs Object Hallucinations Through Causal Intervention [18.08509160653814]
LVLM(Large Vision-Language Models)は、しばしば物体の幻覚に悩まされ、画像中の物体の存在について誤った判断を下す。
我々はLVLMのオブジェクト認識シナリオに因果解析を導入し、構造因果モデル(Structure Causal Model: SCM)を確立する。
カウサル・ハルベンチ(Causal-HalBench)は、カウンターファクトのサンプルで特別に構築され、包括的な因果メトリクスと統合されたベンチマークである。
論文 参考訳(メタデータ) (2025-11-13T12:53:03Z) - A Good CREPE needs more than just Sugar: Investigating Biases in Compositional Vision-Language Benchmarks [32.052113371887124]
視覚言語モデルの構成理解能力の測定によく用いられる17のベンチマークについて検討する。
我々は、データソースやキュレーション手順を含む設計上の選択について精査する。
ブラインドコンストラクションはCLIPモデルと同等に機能し、これらのベンチマークは構成的理解を効果的に測定していないことを示す。
論文 参考訳(メタデータ) (2025-06-09T20:53:43Z) - Role Bias in Diffusion Models: Diagnosing and Mitigating through Intermediate Decomposition [26.196439794056413]
本稿では,アクションベース関係における構成一般化を評価するベンチマークであるRoleBenchを紹介する。
現状のT2Iモデルと構成生成手法は、常に頻繁に反転する関係に対してデフォルトとなることを示す。
本研究は, 構成障害における分布非対称性の役割を強調し, 一般化を改善するための単純かつ効果的な経路を提供する。
論文 参考訳(メタデータ) (2025-03-13T04:38:02Z) - Aggregation Artifacts in Subjective Tasks Collapse Large Language Models' Posteriors [74.04775677110179]
In-context Learning (ICL) は、Large Language Models (LLM) を用いた自然言語処理の主要な手法となっている。
本研究は,低アグリゲーション,異質なアノテーションを組み合わせたアグリゲーションの結果が,プロンプトに有害なノイズを生じさせるアノテーションのアーティファクトに繋がるかどうかを考察する。
この結果から,アグリゲーションは主観的タスクのモデル化において不明瞭な要因であり,代わりに個人をモデリングすることを重視することが示唆された。
論文 参考訳(メタデータ) (2024-10-17T17:16:00Z) - CIParsing: Unifying Causality Properties into Multiple Human Parsing [82.32620538918812]
既存のMHP(Multiple Human Parsing)の手法は、画像とラベル付けされた身体部分との間の基礎となる関係を取得するために統計モデルを適用している。
我々はCIParsingと呼ばれる因果性にインスパイアされた構文解析のパラダイムを提示し、人間の解析に2つの因果性を含む基本的な因果原理に従う。
CIParsingはプラグイン・アンド・プレイ方式で設計されており、既存のMHPモデルに統合することができる。
論文 参考訳(メタデータ) (2023-08-23T15:56:26Z) - Compositional Generalization in Dependency Parsing [15.953482168182003]
しかし、依存性には構成解析ベンチマークがない。
複合分散の増大は依存性性能を低下させるが、意味解析性能ほど劇的ではない。
最も難しい分割において、依存関係の低いパフォーマンスを駆動する多くの構文構造を特定します。
論文 参考訳(メタデータ) (2021-10-13T16:32:24Z) - Deconfounding Scores: Feature Representations for Causal Effect
Estimation with Weak Overlap [140.98628848491146]
推定対象の偏りを伴わずに高い重なりを生じさせる,デコンファウンディングスコアを導入する。
分離スコアは観測データで識別可能なゼロ共分散条件を満たすことを示す。
特に,この手法が標準正規化の魅力的な代替となることを示す。
論文 参考訳(メタデータ) (2021-04-12T18:50:11Z) - Few-shot Visual Reasoning with Meta-analogical Contrastive Learning [141.2562447971]
本稿では,類似推論に頼って,数ショット(または低ショット)の視覚推論問題を解くことを提案する。
両領域の要素間の構造的関係を抽出し、類似学習と可能な限り類似するように強制する。
RAVENデータセット上での本手法の有効性を検証し, トレーニングデータが少ない場合, 最先端の手法より優れることを示す。
論文 参考訳(メタデータ) (2020-07-23T14:00:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。