論文の概要: Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs
- arxiv url: http://arxiv.org/abs/2605.11218v1
- Date: Mon, 11 May 2026 20:31:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.414088
- Title: Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs
- Title(参考訳): 数字を見てはならない:VLMにおけるビジュアルアンカリングバイアスとレイヤワイズ表現
- Authors: M. Shalankin,
- Abstract要約: アンカー効果は、画像品質の悪化よりも2.5倍大きく、バイアスが再現可能な視覚的変化ではないことを確認する。
層ワイドプローブ: 飽和飽和層(L12-L34)が品質予測に最適である層(R2 = 0.69-0.91)がより深い層(R2 = 0.69-0.91)
融合解析はアーキテクチャに依存した統合(L1-L2での即時核融合)を2つのモデルで定義する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embedded numeric anchors on images systematically bias Vision-Language Model quality judgments across six VLMs from five architectural families (ANOVA eta^2 = 0.18-0.77, all p < 0.001). Anchor effects are 2.5x larger than severe image quality degradation, confirming bias is not reducible to visual changes. Layer-wise probing reveals consistent dissociation: layers where anchor classification saturates (L12-L34) are suboptimal for quality prediction, with optimal layers deeper (R^2 = 0.69-0.91). Fusion analysis identifies architecture-dependent integration -- instant fusion at L1-L2 in two models versus partial or no fusion in three others. These results establish a causal account of visual anchoring bias, linking behavioral susceptibility to representation dynamics.
- Abstract(参考訳): 5つのVLM(ANOVA eta^2 = 0.18-0.77, all p < 0.001)による視覚・言語モデルの品質判断を体系的にバイアスする画像に埋め込まれた数値アンカー。
アンカー効果は、画像品質の悪化よりも2.5倍大きく、視覚的変化に対してバイアスが再現できないことを確認する。
アンカー分類飽和層(L12-L34)が品質予測に最適であり、最適層はより深い(R^2 = 0.69-0.91)。
融合解析はアーキテクチャに依存した統合(L1-L2での即時核融合)を2つのモデルで定義する。
これらの結果は、視覚的アンカーバイアスの因果関係を確立し、行動感受性と表現力学をリンクする。
関連論文リスト
- GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations [19.262982037123447]
視覚言語モデル(VLM)は、他の視覚的推論タスクよりも精度がかなり低いため、タスクのカウントにおいて持続的な幻覚を示す。
物体検出モデルから空間的接地を明示的に拡張して幻覚を緩和するフレームワークであるGroundCountを提案する。
論文 参考訳(メタデータ) (2026-03-11T17:04:30Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Suppressing VLM Hallucinations with Spectral Representation Filtering [49.52703800684483]
視覚言語モデル(VLM)は、画像に存在しないオブジェクト、属性、関係の記述の形で幻覚をしばしば生成する。
本稿では,モデル表現の共分散構造を解析し,補正することにより,このような幻覚を抑制するための軽量な訓練不要な手法であるスペクトル表現フィルタ(SRF)を提案する。
論文 参考訳(メタデータ) (2025-11-15T13:49:27Z) - Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials [34.77694214755808]
MHSA(Multi-Head Self-Attention)の代替品であるVCA(Visual-Contrast Attention)を導入する。
VCAは、O(N N C) から O(N n C) への理論複雑性を n N で減少させながら、識別の明示的な概念を注入する。
モジュールはDeiT-Tinyのバックボーンに0.3M以下のパラメータを追加し、追加のFLOPを必要とせず、完全にアーキテクチャに依存しない。
論文 参考訳(メタデータ) (2025-11-02T07:04:12Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - The Remarkable Robustness of LLMs: Stages of Inference? [5.346230590800585]
本研究では,Large Language Models (LLM) の構造的介入に対するロバスト性について検討する。
驚くべきことに、モデルは微調整なしでオリジナルのトップ1予測精度の72-95%を維持している。
論文 参考訳(メタデータ) (2024-06-27T17:57:03Z) - You Only Train Once: A Unified Framework for Both Full-Reference and No-Reference Image Quality Assessment [45.62136459502005]
本稿では,完全な参照 (FR) と非参照 (NR) IQA を行うネットワークを提案する。
まず、入力画像から多レベル特徴を抽出するためにエンコーダを用いる。
FRおよびNR入力のユニバーサルアダプタとして階層的注意(HA)モジュールを提案する。
エンコーダの浅い層と深い層との間の特徴相関を調べるために, セマンティック・ディストーション・アウェア (SDA) モジュールを提案する。
論文 参考訳(メタデータ) (2023-10-14T11:03:04Z) - Layer-wise Linear Mode Connectivity [52.6945036534469]
ニューラルネットワークパラメータの平均化は、2つの独立したモデルの知識の直感的な方法である。
フェデレートラーニングにおいて最も顕著に用いられている。
私たちは、単一グループやグループを平均化するモデルの性能を分析します。
論文 参考訳(メタデータ) (2023-07-13T09:39:10Z) - A trainable monogenic ConvNet layer robust in front of large contrast
changes in image classification [0.0]
低レベルの幾何学的特徴を検知するバイオインスパイアされた新しいエントリ層M6を提案する。
我々はM6と従来の畳み込み層(C)と決定論的四元数局所位相層(Q9)を比較した。
数値的な結果から、M6のモデルが最も頑丈であることが分かる。
論文 参考訳(メタデータ) (2021-09-14T18:50:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。