論文の概要: Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs
- arxiv url: http://arxiv.org/abs/2605.11218v1
- Date: Mon, 11 May 2026 20:31:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.414088
- Title: Don't Look at the Numbers: Visual Anchoring Bias and Layer-wise Representation in VLMs
- Title(参考訳): 数字を見てはならない:VLMにおけるビジュアルアンカリングバイアスとレイヤワイズ表現
- Abstract要約: アンカー効果は、画像品質の悪化よりも2.5倍大きく、バイアスが再現可能な視覚的変化ではないことを確認する。
層ワイドプローブ: 飽和飽和層(L12-L34)が品質予測に最適である層(R2 = 0.69-0.91)がより深い層(R2 = 0.69-0.91)
融合解析はアーキテクチャに依存した統合(L1-L2での即時核融合)を2つのモデルで定義する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embedded numeric anchors on images systematically bias Vision-Language Model quality judgments across six VLMs from five architectural families (ANOVA eta^2 = 0.18-0.77, all p < 0.001). Anchor effects are 2.5x larger than severe image quality degradation, confirming bias is not reducible to visual changes. Layer-wise probing reveals consistent dissociation: layers where anchor classification saturates (L12-L34) are suboptimal for quality prediction, with optimal layers deeper (R^2 = 0.69-0.91). Fusion analysis identifies architecture-dependent integration -- instant fusion at L1-L2 in two models versus partial or no fusion in three others. These results establish a causal account of visual anchoring bias, linking behavioral susceptibility to representation dynamics.
- Abstract(参考訳): 5つのVLM(ANOVA eta^2 = 0.18-0.77, all p < 0.001)による視覚・言語モデルの品質判断を体系的にバイアスする画像に埋め込まれた数値アンカー。
アンカー効果は、画像品質の悪化よりも2.5倍大きく、視覚的変化に対してバイアスが再現できないことを確認する。
アンカー分類飽和層(L12-L34)が品質予測に最適であり、最適層はより深い(R^2 = 0.69-0.91)。
融合解析はアーキテクチャに依存した統合(L1-L2での即時核融合)を2つのモデルで定義する。
これらの結果は、視覚的アンカーバイアスの因果関係を確立し、行動感受性と表現力学をリンクする。
関連論文リスト
- The Visual Insensitivity Gap: Diagnosing When Vision-Language Models Fail to Use Visual Evidence [1.7844382164707184]
我々はこの現象を視覚不感ギャップと呼び、サンプルごとの視覚感度指数(VSI)で定量化する。
この仮定は、6つのVLMと3つの知覚的ベンチマークで40%~97%のサンプルで失敗することを示す。
論文 参考訳(メタデータ) (2026-09-01T08:01:57Z) - DARTS: Decoder-Aware Representation Tuning via Surgery for Model Merging [0.30586855806896046]
手術によるDecoder-Aware Representation Tuning(DARTS)を提案する。
DARTSは、エラーが生成品質に最も影響を与える高エントロピー位置でのアップウェイト補正に、新しいエントロピー重み付きL1損失を用いる。
DARTSは, 既往のパラメータを付加しながら, 標準的な手術法よりも有意に改善したことを示す。
論文 参考訳(メタデータ) (2026-08-28T17:22:47Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment [0.4790056963046066]
MST-CLIPIQAは、明示的な表現分離によって階層的な視覚言語アライメントを実現するマルチスケールの2ストリームフレームワークである。
アーキテクチャは2つのCLIPエンコーダを補完的なパッチの粒度で利用し、グローバルなセマンティックコヒーレンスをキャプチャする。
実験によって新しい最先端の結果が確立され、品質では1.11パーセントのSRCC、テキスト画像対応予測では2.35パーセントのSRCCが平均的に改善された。
論文 参考訳(メタデータ) (2026-06-15T14:40:30Z) - ANCHOR: Autoregressive Non-intrusive Chunk-Ordered Refinement for Joint Multi-Resolution Speech Quality Modeling [62.983372215479925]
ストリーミングと生成システムは、部分的なオーディオから漸進的な推定を必要とする。
多分解能オートレタスクとしてインクリメンタルアセスメントを改良したANCHORを提案する。
2秒プレフィックスの48%のPLCMOSエラー削減を含む、部分入力下でのかなりの堅牢性を示す実験。
論文 参考訳(メタデータ) (2026-06-08T22:46:30Z) - When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception [0.0]
モデルが正確な内部表現を維持しつつ、意図的に偽の出力を生成するような知覚的アライメントは、AIの安全性において依然として中心的な課題である。
我々は、5つの変圧器モデルの真正かつ偽証的な変種を同じ質問分布上でLoRAを用いて微調整するマルチモデルパラダイムを提案する。
平均プールされた隠れ状態で訓練された線形プローブは、ほぼ完璧なAUCで合成の不完全性を検出する。
魚の識別率、有効ランク、セントロイド幾何、方向キャリブレーション、キャリブレーション(ECE)の力学解析により、ピチア/ラマ/クウェンの表現的崩壊と高次元保存の2つの安定性が明らかになった。
論文 参考訳(メタデータ) (2026-05-28T01:20:06Z) - GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinations [19.262982037123447]
視覚言語モデル(VLM)は、他の視覚的推論タスクよりも精度がかなり低いため、タスクのカウントにおいて持続的な幻覚を示す。
物体検出モデルから空間的接地を明示的に拡張して幻覚を緩和するフレームワークであるGroundCountを提案する。
論文 参考訳(メタデータ) (2026-03-11T17:04:30Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - Same Answer, Different Representations: Hidden instability in VLMs [65.36933543377346]
本稿では,内部埋め込みドリフト,スペクトル感度,構造的滑らかさを計測する表現認識・周波数認識評価フレームワークを提案する。
このフレームワークを,SEEDBench,MMMU,POPEデータセットを対象とする最新のビジョン言語モデル(VLM)に適用する。
論文 参考訳(メタデータ) (2026-02-06T12:24:26Z) - Suppressing VLM Hallucinations with Spectral Representation Filtering [49.52703800684483]
視覚言語モデル(VLM)は、画像に存在しないオブジェクト、属性、関係の記述の形で幻覚をしばしば生成する。
本稿では,モデル表現の共分散構造を解析し,補正することにより,このような幻覚を抑制するための軽量な訓練不要な手法であるスペクトル表現フィルタ(SRF)を提案する。
論文 参考訳(メタデータ) (2025-11-15T13:49:27Z) - Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials [34.77694214755808]
MHSA(Multi-Head Self-Attention)の代替品であるVCA(Visual-Contrast Attention)を導入する。
VCAは、O(N N C) から O(N n C) への理論複雑性を n N で減少させながら、識別の明示的な概念を注入する。
モジュールはDeiT-Tinyのバックボーンに0.3M以下のパラメータを追加し、追加のFLOPを必要とせず、完全にアーキテクチャに依存しない。
論文 参考訳(メタデータ) (2025-11-02T07:04:12Z) - DeLeaker: Dynamic Inference-Time Reweighting For Semantic Leakage Mitigation in Text-to-Image Models [55.30555646945055]
テキスト・ツー・イメージ(T2I)モデルはセマンティック・リークに対して脆弱である。
DeLeakerは、モデルのアテンションマップに直接介入することで、漏洩を緩和する軽量なアプローチである。
SLIMはセマンティックリークに特化した最初のデータセットである。
論文 参考訳(メタデータ) (2025-10-16T17:39:21Z) - The Remarkable Robustness of LLMs: Stages of Inference? [5.346230590800585]
本研究では,Large Language Models (LLM) の構造的介入に対するロバスト性について検討する。
驚くべきことに、モデルは微調整なしでオリジナルのトップ1予測精度の72-95%を維持している。
論文 参考訳(メタデータ) (2024-06-27T17:57:03Z) - You Only Train Once: A Unified Framework for Both Full-Reference and No-Reference Image Quality Assessment [45.62136459502005]
本稿では,完全な参照 (FR) と非参照 (NR) IQA を行うネットワークを提案する。
まず、入力画像から多レベル特徴を抽出するためにエンコーダを用いる。
FRおよびNR入力のユニバーサルアダプタとして階層的注意(HA)モジュールを提案する。
エンコーダの浅い層と深い層との間の特徴相関を調べるために, セマンティック・ディストーション・アウェア (SDA) モジュールを提案する。
論文 参考訳(メタデータ) (2023-10-14T11:03:04Z) - Layer-wise Linear Mode Connectivity [52.6945036534469]
ニューラルネットワークパラメータの平均化は、2つの独立したモデルの知識の直感的な方法である。
フェデレートラーニングにおいて最も顕著に用いられている。
私たちは、単一グループやグループを平均化するモデルの性能を分析します。
論文 参考訳(メタデータ) (2023-07-13T09:39:10Z) - A trainable monogenic ConvNet layer robust in front of large contrast
changes in image classification [0.0]
低レベルの幾何学的特徴を検知するバイオインスパイアされた新しいエントリ層M6を提案する。
我々はM6と従来の畳み込み層(C)と決定論的四元数局所位相層(Q9)を比較した。
数値的な結果から、M6のモデルが最も頑丈であることが分かる。
論文 参考訳(メタデータ) (2021-09-14T18:50:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。