論文の概要: Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
- arxiv url: http://arxiv.org/abs/2605.13047v1
- Date: Wed, 13 May 2026 06:11:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.838849
- Title: Revealing the Gap in Human and VLM Scene Perception through Counterfactual Semantic Saliency
- Title(参考訳): 対人的セマンティック・サリエンシによる人間とVLMシーン知覚のギャップの解明
- Authors: Ziqi Wen, Parsa Madinei, Miguel P. Eckstein,
- Abstract要約: オブジェクトの重要度を測定するために、CSS(Counterfactual Semantic Saliency)を導入する。
AIと人間のセマンティックアライメントを評価するために,人間の心理物理学ベースラインに対して目立った視覚言語モデルを検証した。
モデルは、大きな物体(サイズバイアス)、画像の中心にある物体(中心バイアス)、高い塩分濃度オブジェクトに対して、(人間に関する)過度な信頼を示す。
- 参考スコア(独自算出の注目度): 3.9792042887828565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating whether large vision-language models (VLMs) align with human perception for high-level semantic scene comprehension remains a challenge. Traditional white-box interpretability methods are inapplicable to closed-source architectures and passive metrics fail to isolate causal features. We introduce Counterfactual Semantic Saliency (CSS). This black-box, model-agnostic framework quantifies the importance of objects by measuring the semantic shift induced by their causal ablation from a scene. To evaluate AI-human semantic alignment, we tested prominent VLMs against a human psychophysics baseline comprising 16,289 valid responses across 307 complex natural scenes and 1,306 high-fidelity counterfactual variants. Our analysis reveals a pervasive scene comprehension gap: models exhibit an overreliance (relative to humans) on large objects (size bias), objects at the center of the image (center bias), and high saliency objects. In contrast, models rely less on people in the scenes than our human participants to describe the images. A model's size bias is a primary driver explaining variations in model-human semantic divergence. Code and data will be available at https://github.com/starsky77/Counterfactual-Semantic-Saliency.
- Abstract(参考訳): 大規模視覚言語モデル(VLM)が人間の知覚と一致しているかを評価することは依然として課題である。
従来のホワイトボックス解釈方法はクローズドソースアーキテクチャには適用不可能であり、パッシブメトリクスは因果的特徴の分離に失敗する。
本稿では,CSS(Counterfactual Semantic Saliency)を紹介する。
このブラックボックス・モデルに依存しないフレームワークは、シーンからの因果的アブレーションによって引き起こされるセマンティックシフトを測定することによって、オブジェクトの重要性を定量化する。
AIと人間のセマンティックアライメントを評価するために、307の複雑な自然シーンに16,289の有効な応答と1,306の高忠実な反事実変異を含む、人間の心理物理学ベースラインに対して顕著なVLMを検証した。
モデルは、大きな物体(サイズバイアス)、画像の中心にある物体(中心バイアス)、高い塩分濃度オブジェクトに対して、過度(人間に関係)を示す。
対照的に、モデルでは、画像を記述するのに人間の参加者よりも、シーン内の人々を頼りにしない。
モデルのサイズバイアスは、モデル・ヒューマン・セマンティック・ダイバージェンス(英語版)のバリエーションを説明する主要なドライバである。
コードとデータはhttps://github.com/starsky77/Counterfactual-Semantic-Saliency.comから入手できる。
関連論文リスト
- Contextual inference from single objects in Vision-Language models [10.367669666212473]
一つのオブジェクトがどれくらいのシーンコンテキストを持つかは、人間のシーン知覚においてよく研究されている問題である。
この能力が視覚言語モデル(VLM)でどのように構成されるかはいまだに理解されていない。
本研究では,単一対象からの文脈推論の系統的・機械的解析を通じて,この問題を考察する。
論文 参考訳(メタデータ) (2026-03-20T13:24:15Z) - Evaluating the encoding competence of visual language models using uncommon actions [5.816389980109022]
UAITは、視覚言語モデル(VLM)の動作シーンにおける意味理解能力をテストするために設計された新しい評価ベンチマークである。
我々は,大規模言語モデル,少数ショットプロンプトエンジニアリング,テキスト・ツー・イメージ・ジェネレーションを用いて,高品質な非常識画像テキストサンプルを合成する。
我々は、複数の最先端ビジュアル言語モデルを評価し、コントラスト学習に基づくモデルと比較する。
論文 参考訳(メタデータ) (2026-01-12T17:15:45Z) - Objectness Similarity: Capturing Object-Level Fidelity in 3D Scene Evaluation [57.48883165305971]
既存のメトリクスは、画像の全体的な品質を評価し、人間の知覚に相違をもたらす。
神経心理学的な洞察にインスパイアされた我々は、人間の3Dシーン認識は基本的に個々の物体への注意を伴うという仮説を立てた。
本稿では,「対象」に焦点を絞った3次元シーンの新たな評価指標であるOSIM(Objectness SIMilarity)を提案する。
論文 参考訳(メタデータ) (2025-09-11T04:33:27Z) - Understanding and evaluating computer vision models through the lens of counterfactuals [2.2819712364325047]
この論文は、視覚分類器および生成モデルにおけるバイアスの説明、監査、緩和に反事実を使用するフレームワークを開発する。
体系的に意味のある属性を体系的に変更し、他の属性を固定することで、これらの手法は突発的な相関を明らかにする。
これらの貢献は、識別モデルと生成モデルの両方において、解釈可能性、公正性、因果性のための統一レンズとして反事実を示す。
論文 参考訳(メタデータ) (2025-08-28T15:11:49Z) - Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models [65.82564074712836]
テキストと画像の拡散モデルに光を流す新しいHOI検出器であるDIFfusionHOIを紹介する。
まず、埋め込み空間における人間と物体の関係パターンの表現をインバージョンベースで学習する戦略を考案する。
これらの学習された関係埋め込みはテキストのプロンプトとして機能し、スタイア拡散モデルが特定の相互作用を記述する画像を生成する。
論文 参考訳(メタデータ) (2024-10-26T12:00:33Z) - Evaluating Multiview Object Consistency in Humans and Image Models [68.36073530804296]
我々は、物体の形状に関するゼロショット視覚的推論を必要とする認知科学の実験的設計を活用する。
我々は500人以上の参加者から行動データの35万件の試行を収集した。
次に、一般的な視覚モデルの性能を評価する。
論文 参考訳(メタデータ) (2024-09-09T17:59:13Z) - Closely Interactive Human Reconstruction with Proxemics and Physics-Guided Adaption [64.07607726562841]
既存の人間再建アプローチは主に、正確なポーズの回復や侵入を避けることに焦点を当てている。
本研究では,モノクロ映像から密に対話的な人間を再構築する作業に取り組む。
本稿では,視覚情報の欠如を補うために,確率的行動や物理からの知識を活用することを提案する。
論文 参考訳(メタデータ) (2024-04-17T11:55:45Z) - An Analysis of Human Alignment of Latent Diffusion Models [4.301861805545143]
大量のデータに基づいて訓練された拡散モデルは、画像合成に顕著な性能を示した。
それらは、人間とのエラーの整合性が高く、分類に使用するときのテクスチャバイアスも低い。
このような表現が3重の奇数ワンアウトタスクにおいて、人間の反応にどの程度うまく一致しているかを分析する。
論文 参考訳(メタデータ) (2024-03-13T12:31:08Z) - Attack to Fool and Explain Deep Networks [59.97135687719244]
対人摂動における人為的意味のパターンの証拠を提供することによって、私たちは逆転する。
我々の主な貢献は、その後視覚モデルを理解するためのツールに変換される、新しい実用的対人攻撃である。
論文 参考訳(メタデータ) (2021-06-20T03:07:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。