論文の概要: CCRV-Bench: Constraint-Based Evaluation of Causal Reasoning in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.30979v1
- Date: Fri, 25 Sep 2026 08:26:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.295323
- Title: CCRV-Bench: Constraint-Based Evaluation of Causal Reasoning in Vision-Language Models
- Title(参考訳): CCRV-Bench:視覚言語モデルにおける因果推論の制約に基づく評価
- Abstract要約: 視覚言語モデル(VLM)は視覚タスクにおいて優れた性能を示したが、その視覚因果推論能力は信頼性に欠けていた。
本稿では,制約駆動型視覚因果推論ベンチマークCCRV-Benchを提案する。
- 参考スコア(独自算出の注目度): 16.995082216096787
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) have demonstrated excellent performance in visual tasks, but their visual causal reasoning capabilities still lack reliable evaluation. Existing evaluations struggle to distinguish whether a model is performing causal reasoning based on visual evidence or relying on statistical correlations for shortcut learning, thereby potentially overestimating their actual capabilities. This paper proposes CCRV-Bench, a constraint-driven visual causal reasoning benchmark for single-image physical scenarios. We construct an orthogonal framework that evaluates four causal task dimensions: causal relation discovery, state prediction, causal diagnosis, and intervention. We further introduce entity symbolization, spatial grounding, the factual adversarial constraint, and minimalist output constraints to reduce shortcut cues while preserving the physical commonsense required by the task. Experiments across 15 multimodal models show that constraint sensitivity is task- and model-dependent: intervention has the largest average effective degradation among the four causal tasks, spatial grounding is the most damaging constraint on average, and the factual adversarial constraint improves DCR for all evaluated models. These results show that unconstrained performance does not determine constrained robustness and that a single aggregate score can obscure distinct failures in causal identification, spatial grounding, and constraint-compliant expression. CCRV-Bench provides a standardized framework for diagnosing image-grounded causal reasoning under controlled constraints. The code is available at https://github.com/0815linyuan/CCRV-Bench-Constraint-Based-Evaluation-of-Causal-Reasoning-in-Vision- Language-Models
- Abstract(参考訳): 視覚言語モデル(VLM)は視覚タスクにおいて優れた性能を示したが、その視覚因果推論能力は信頼性に欠けていた。
既存の評価は、あるモデルが視覚的証拠に基づいて因果推論を行っているか、あるいはショートカット学習のための統計的相関に依存しているかを区別するのに苦労し、それによって実際の能力を過大評価する可能性がある。
本稿では,制約駆動型視覚因果推論ベンチマークCCRV-Benchを提案する。
我々は,因果関係の発見,状態予測,因果診断,介入の4つの因果関係の次元を評価する直交的枠組みを構築した。
さらに,作業に必要な物理コモンセンスを保ちながら,実体の記号化,空間的接地,現実の逆制約,最小限の出力制約を導入する。
15のマルチモーダルモデルに対する実験では、制約感度はタスク依存およびモデル依存であることが示され、介入は4つの因果的タスクの中で最大の平均的有効劣化を示し、空間的接地は平均的に最も有害な制約であり、現実的対向的制約は全ての評価モデルに対してDCRを改善する。
これらの結果から,制約付き頑健性は判定されず,因果同定,空間的接地,制約に順応する表現において,単一集合スコアが明確な障害を生じさせる可能性が示唆された。
CCRV-Benchは、制御された制約の下でイメージグラウンドの因果推論を診断するための標準化されたフレームワークを提供する。
コードはhttps://github.com/0815linyuan/CCRV-Bench-Constraint-based-evaluation-of-Causal-Reasoning-in-Vision- Language-Modelsで公開されている。
関連論文リスト
- LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination [66.06027569507403]
textbfViewpoint Imagination (VIM) は、観測された証拠と想像された証拠の両方について、隠蔽された一次観測と条件の行動予測から補完的な視点を生成する。
VIMは、追加のカメラをデプロイ時に必要とせずに、タスクスイート、オクルージョンタイプ、重大度レベルの堅牢性を改善する。
論文 参考訳(メタデータ) (2026-06-09T13:39:49Z) - Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models [28.981226513192535]
最近のVision-Language-Action(VLA)モデルでは、標準的なロボットベンチマークで顕著な成功率が報告されている。
最近の証拠は、標準ベンチマークの成功と真の具体的推論の体系的な不一致を示唆している。
本稿では,ロボットポリシーにおける真の身体的推論の診断ベンチマークであるBeTTERを紹介する。
論文 参考訳(メタデータ) (2026-04-20T09:25:30Z) - Counting to Four is still a Chore for VLMs [3.017198998175514]
視覚言語モデル(VLM)は、複雑なマルチモーダル推論タスクにおいて印象的な性能を達成した。
それらは依然として、オブジェクトカウントのような単純な接地スキルで失敗します。
本稿では, 挙動解析と力学解析の両方を通して, VLM計数行動の実証的研究を行った。
論文 参考訳(メタデータ) (2026-04-11T05:23:19Z) - Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models [62.932580559941414]
VLM(Vision-Language Models)は、しばしば「ハロシン化(hallucinate)」する。
本稿では,静的な出力誤差からモデル計算認知の動的病理へ再キャストし,幻覚を診断するための新しいパラダイムを提案する。
論文 参考訳(メタデータ) (2026-03-16T17:20:38Z) - Observationally Informed Adaptive Causal Experimental Design [55.998153710215654]
本稿では,観測モデルを基礎的先行として活用する新たなパラダイムであるアクティブ残留学習を提案する。
このアプローチは、実験的な焦点を、目標因果量の学習から、観察バイアスの補正に必要な残差を効率的に推定するへとシフトさせる。
合成および半合成ベンチマークの実験は、R-Designがベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-03-04T06:52:37Z) - Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models [15.849480549367684]
本稿では,DAG生成タスクとして脆弱性推論をモデル化する新しいフレームワークであるDAGVulを提案する。
さらにReinforcement Learning with Verifiable Rewards (RLVR)を導入することで、モデル推論トレースをプログラム固有の論理と整合させる。
我々のフレームワークは、すべてのベースラインに対して平均18.9%の推論F1スコアを改善します。
論文 参考訳(メタデータ) (2026-02-06T13:19:45Z) - VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension [51.76841625486355]
Referring Expression (REC) は、自然言語クエリに対応する画像領域をローカライズすることを目的としている。
最近のニューロシンボリックRECアプローチは、大規模言語モデル(LLM)と視覚言語モデル(VLM)を利用して構成推論を行う。
推論ステップ内に軽量な演算子レベルの検証器を組み込む,ニューロシンボリックなフレームワークであるVIROを紹介する。
論文 参考訳(メタデータ) (2026-01-19T07:21:19Z) - LTD-Bench: Evaluating Large Language Models by Letting Them Draw [57.237152905238084]
LTD-Benchは、大規模言語モデル(LLM)のブレークスルーベンチマークである。
LLMの評価を抽象的なスコアから直接観察可能な視覚出力に変換する。
LTD-Benchの視覚出力は強力な診断分析を可能にし、モデル類似性を調べるための潜在的アプローチを提供する。
論文 参考訳(メタデータ) (2025-11-04T08:11:23Z) - Causal Representation Learning Made Identifiable by Grouping of Observational Variables [8.157856010838382]
因果表現学習(Causal Representation Learning)は、データ駆動型で隠れた機能の因果モデルを学ぶことを目的としている。
ここでは、新規で弱い制約に基づく識別可能性を示す。
また,モデルに整合した新たな自己教師付き推定フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-24T10:38:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。