論文の概要: Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
- arxiv url: http://arxiv.org/abs/2606.31407v1
- Date: Tue, 30 Jun 2026 09:35:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.166437
- Title: Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
- Title(参考訳): 視覚意味エントロピー:視覚言語モデルは視覚的曖昧さを認識するか?
- Abstract要約: 視覚言語モデルは、視覚的にあいまいな入力に対して自信ある答えを生じさせ、バイアスのある予測をもたらす。
テキストクエリを固定したまま、画像のみを摂動して近傍の視覚変化を探索する視覚意味エントロピー(VSE)を提案する。
VSEは視覚的曖昧さを効果的に捉え、VLMの不確実性評価のための新しい最先端技術を確立する。
- 参考スコア(独自算出の注目度): 14.469911934779558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models can produce confident answers on visually ambiguous inputs, resulting in biased predictions. Common entropy-based methods, such as Semantic Entropy (SE), rely on output diversity. Yet our analysis shows that overconfident visual embeddings suppress output diversity under stochastic decoding, causing SE to underestimate uncertainty in such cases. Recent methods instead probe output diversity through input perturbations, including textual paraphrasing or joint text-image perturbations, and show improved performance. We study these approaches and reveals that the resulting variability is often dominated by textual changes rather than visual evidence, causing uncertainty estimates to reflect prompt sensitivity rather than visual ambiguity. We therefore propose Visual Semantic Entropy (VSE), which perturbs only the image to probe nearby visual variations while keeping the text query fixed. VSE measures uncertainty by clustering generated answers into semantic prototypes and computing the mass-weighted dispersion among them. Extensive evaluation across five modern vision-language models and five diverse VQA benchmarks demonstrates that VSE effectively captures visual ambiguity, establishing a new state-of-the-art for VLM uncertainty estimation.
- Abstract(参考訳): 視覚言語モデルは、視覚的にあいまいな入力に対して自信ある答えを生じさせ、バイアスのある予測をもたらす。
セマンティックエントロピー(SE)のような共通エントロピーに基づく手法は出力の多様性に依存する。
しかし,本解析は,確率的復号化の下での出力多様性を過信な視覚埋め込みが抑制し,SEが不確かさを過小評価することを示した。
入力摂動によって出力の多様性を探索する最近の手法では、テキストパラフレーズや共同動画像摂動などがあり、性能が向上している。
これらのアプローチについて検討し、結果の変動は視覚的証拠よりもテキスト的変化に支配されることが多く、不確実な推定は視覚的曖昧さよりも迅速な感度を反映していることを示した。
そこで本研究では,テキストクエリを固定したまま,画像のみを摂動して近傍の視覚変化を探索する視覚意味エントロピー(VSE)を提案する。
VSEは、生成した回答をセマンティックプロトタイプにクラスタリングし、それらの間の質量重み付き分散を計算することで不確実性を測定する。
5つの現代視覚言語モデルと5つの多様なVQAベンチマークによる広範囲な評価は、VSEが視覚的曖昧さを効果的に捉え、VLMの不確実性評価のための新たな最先端技術を確立していることを示している。
関連論文リスト
- Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation [10.212763020484092]
不確実性定量化(UQ)は、LVLM(Large Vision Language Models)において重要な課題である。
VIG-TUQ(Visual-Grounded Token UQ)を提案する。
論文 参考訳(メタデータ) (2026-05-26T15:04:55Z) - Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision? [10.315515647818009]
ベンチマーク精度はしばしば、視覚言語モデルにおける基底的な視覚的理解を反映していると仮定される。
我々は、このミスマッチをオープンソースの視覚言語モデルで体系的に研究する。
VLMは視覚入力を取り入れているが、その予測はきめ細かい視覚的証拠の喪失にはあまり敏感ではない。
論文 参考訳(メタデータ) (2026-05-21T17:35:04Z) - When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models [0.5461938536945722]
非顔オブジェクトにおける顔の知覚である顔パリドリアは、この行動の制御されたプローブを提供する。
本研究では,顔パレドリア画像における検出,局所化,不確実性,偏見,難易度,感情を解析する表現レベル診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-04T12:33:36Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Thinking with Deltas: Incentivizing Reinforcement Learning via Differential Visual Reasoning Policy [75.66913260900726]
検証可能なリワードによる強化学習は、大規模言語モデルにおいてかなり高度な推論能力を持っている。
既存のパラダイムは、テキスト中心の成果報酬によって推進され、モデルが視覚的知覚をバイパスすることを奨励します。
我々はtextbfDifferential Visual Reasoning Policy によって駆動されるフレームワーク Deltas を用いた textbfThinking を提案する。
論文 参考訳(メタデータ) (2026-01-11T08:25:34Z) - Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models [93.46875303598577]
視覚言語モデル(VLM)は、マルチモーダル情報処理において急速に進歩しているが、競合する信号の整合性は未解明のままである。
この研究は、VLMがASCIIアートをどう処理するかを考察する。
論文 参考訳(メタデータ) (2025-04-02T10:47:07Z) - From Uncertainty to Trust: Enhancing Reliability in Vision-Language Models with Uncertainty-Guided Dropout Decoding [6.115580421973011]
大規模視覚言語モデル(LVLM)は多モーダルタスクにおいて顕著な能力を示すが、視覚入力を誤解釈する傾向があり、幻覚や信頼できない出力をもたらすことが多い。
本稿では,視覚的トークンの不確実性を定量化し,不確実なトークンを選択的にマスクしてデコードを改善する新しい推論時間手法であるDropout Decodingを提案する。
CHAIR, THRONE, MMBenchなどのベンチマークによる評価では、Dropout Decodingはオブジェクト幻覚(OH)を大幅に低減し、LVLM出力の信頼性と品質を向上させる。
論文 参考訳(メタデータ) (2024-12-09T13:21:07Z) - Beyond Coarse-Grained Matching in Video-Text Retrieval [50.799697216533914]
きめ細かい評価のための新しいアプローチを導入する。
テストキャプションを自動的に生成することで,既存のデータセットにアプローチを適用することができる。
きめ細かい評価実験は、このアプローチがきめ細かな違いを理解するモデルの能力を高めることを実証している。
論文 参考訳(メタデータ) (2024-10-16T09:42:29Z) - Uncertainty in latent representations of variational autoencoders optimized for visual tasks [3.9504737666460037]
変分オートエンコーダ(VAE)の推論特性について検討する。
従来のコンピュータビジョンからインスピレーションを得て、VAEに誘導バイアスを導入する。
復元された推論能力は、推論ネットワークでモチーフを開発することによって提供される。
論文 参考訳(メタデータ) (2024-04-23T16:26:29Z) - Visual Perturbation-aware Collaborative Learning for Overcoming the
Language Prior Problem [60.0878532426877]
本稿では,視覚的摂動校正の観点から,新しい協調学習手法を提案する。
具体的には、異なる摂動範囲で2種類のキュレートされた画像を構築するための視覚コントローラを考案する。
2つの診断VQA-CPベンチマークデータセットの実験結果は、その効果を明らかに示している。
論文 参考訳(メタデータ) (2022-07-24T23:50:52Z) - Learning Disentangled Representations with Latent Variation
Predictability [102.4163768995288]
本稿では,潜在不整合表現の変動予測可能性について述べる。
逆生成プロセス内では、潜時変動と対応する画像対の相互情報を最大化することにより、変動予測可能性を高める。
本研究では,潜在表現の絡み合いを測るために,基礎的構造的生成因子に依存しない評価指標を開発する。
論文 参考訳(メタデータ) (2020-07-25T08:54:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。