論文の概要: Corrupted but Correct: Why Vision-Language Models Lie to Themselves Internally
- arxiv url: http://arxiv.org/abs/2610.03445v1
- Date: Fri, 02 Oct 2026 15:27:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.452175
- Title: Corrupted but Correct: Why Vision-Language Models Lie to Themselves Internally
- Title(参考訳): 失敗するが正しい: ビジョン・ランゲージ・モデルが内部に潜む理由
- Abstract要約: 目標摂動は、固定された目標キャプションに対する教師による訓練損失を、視覚シリアルモデル(VLM)のほぼゼロに駆動することができる。
我々はこの解離を列車/干渉ギャップと呼び、Qwen2.5-VL-7B-Instructの正確な機械的説明を与える。
- 参考スコア(独自算出の注目度): 0.713496583173065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A targeted adversarial perturbation can drive a vision-language model's (VLM's) teacher-forced training loss for a fixed target caption to near zero, yet the same model, allowed to generate freely, produces the original, correct description with no trace of the target. We call this dissociation the train/inference gap, and give it a precise mechanistic account on Qwen2.5-VL-7B-Instruct using a controlled two-stage PGD attack on 200 held-out COCO images. First, we show that image-level pixel statistics, including a correctly re-implemented, texture-based attackability measure from the CNN robustness literature, have essentially no predictive power over which images are corrupted (best predictor r=-0.050, p=0.484; ridge regression R^2=0.069). Second, using the logit lens, we localise the gap to a single autoregressive step: the rank of the target token, conditioned on the correct first token already being generated, is fixed at exactly 3,488 out of 152,064 vocabulary entries for every image and every condition, with zero variance. Third, tracking target-token rank across all 28 LLM decoder layers reveals that the visual encoder corrupts every image's representation by a comparable margin regardless of eventual outcome, but the language model decoder then differentially arbitrates: amplifying the corrupted signal for susceptible images and actively suppressing it, past its clean-image baseline, for resistant ones (p<0.001, rank-biserial r=0.579). A linear probe on the merger hidden state separates these two outcomes with AUC=0.858, though we flag a circularity concern in this estimate. Together these results argue that adversarial robustness in autoregressive VLMs is substantially a property of the language decoder's prior, not the visual encoder, with direct implications for where faithfulness evaluations and defenses for deployed VLM systems should be targeted.
- Abstract(参考訳): 目標対向的摂動は、固定された目標キャプションに対して視覚言語モデル(VLM)の教師が強制した訓練損失をゼロ付近に駆動するが、同じモデルが自由に生成でき、ターゲットの痕跡を残さずにオリジナルの正しい記述を生成する。
我々はこの解離を列車/衝突ギャップと呼び、200枚のCOCO画像に対して2段階のPGD攻撃を制御し、Qwen2.5-VL-7B-Instructの正確な力学的説明を与える。
まず,CNNロバスト性文献からのテクスチャベースの攻撃性指標を含む画像レベルの画素統計は,画像が劣化する予測力を持たないことを示す(最良の予測器 r=-0.050, p=0.484; リッジ回帰R^2=0.069; )。
第2に、ロジットレンズを用いてギャップを1つの自己回帰ステップにローカライズする: ターゲットトークンのランクは、既に生成されている正しい第1トークンに条件付けられており、各画像および各条件に対する152,064語彙エントリのうち、正確に3,488で、ばらつきなく固定される。
第3に、28のLDMデコーダ層をまたぐターゲットトーケンのランクの追跡により、視覚エンコーダは最終的な結果に関わらず、すべての画像の表現を同等のマージンで劣化させるが、言語モデルデコーダは、差分的に仲裁する: 受信可能な画像に対する破壊信号を増幅し、そのクリーンイメージベースラインを通り、抵抗性のあるもの(p<0.001, rank-biserial r=0.579)。
合併隠れ状態に関する線形プローブは、これらの2つの結果をAUC=0.858で分離するが、この推定では円度の懸念にフラグを立てる。
これらの結果は、自己回帰的VLMの対向的堅牢性は、視覚的エンコーダではなく、言語デコーダの以前の特性であり、デプロイされたVLMシステムに対する忠実度の評価と防御がどこに標的にすべきかという直接的な意味を持つと主張している。
関連論文リスト
- It Takes Little to Rewrite Perception: Targeted Semantic Substitution in Vision-Language Models at $ε\leq 4/255$ [11.409958156154707]
既存の表現アライメント攻撃は、VLMがターゲットイメージを認識させるが、$varepsilon leq 4/255$で限定的に成功する。
目的のセマンティック置換が同じ範囲で成功するため、このロバスト性は保たないことを示す。
我々はまた,大言語モデルが矛盾する視覚信号をコヒーレントな物語に合理化する意味融合現象も観察する。
論文 参考訳(メタデータ) (2026-09-29T17:52:39Z) - LeVJEPA: Efficient & Scalable Video Pretraining without the Heuristics [50.45297537821907]
我々はLeJEPAの崩壊のない目的の下で訓練された最初のビデオエンコーダLeVJEPAを紹介する。
単一のエンコーダは、クリップのグローバルおよびローカルビューよりも分散損失で訓練される。
LeVJEPAはV-JEPA 2とVT-S/B/Lの5.6から20.8倍の速さで一致または超える。
論文 参考訳(メタデータ) (2026-08-27T17:26:24Z) - Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models [89.0460992131069]
本稿では,CLIPのプレトレーニングプロセスのトレーニングレシピに従うAdvFLYPを提案する。
具体的には、AdvFLYPは、Webから収集された画像とテキストのペアに基づいて生成された敵画像とCLIPを微調整し、対照的な損失によって対応するテキストとマッチングする。
また,ロジットレベルの正規化条件と特徴レベルの正規化条件は,それぞれ堅牢性とクリーンな精度に有益であることを示す。
論文 参考訳(メタデータ) (2026-04-13T14:54:25Z) - Arbitration Failure, Not Perceptual Blindness: How Vision-Language Models Resolve Visual-Linguistic Conflicts [7.071615105094556]
視覚的属性は、初期層から線形にデオード可能であることを示す。
初期のレイヤでのトレーニング不要なアクティベーションは、いくつかの設定で性能を低下させることなく、最大3.8%の視覚的グラウンド化を向上できることを示す。
論文 参考訳(メタデータ) (2026-04-10T14:36:07Z) - CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization [122.88484422855934]
本稿では,MeanFlowデコーダを備えた1次元因果画像トークンであるCaTokを紹介する。
時間間隔でトークンを選択することで、CaTokは高速なワンステップ生成と高忠実なマルチステップサンプリングの両方をサポートする因果1D表現を学ぶ。
実験により、CaTokはImageNet再構成の最先端の結果を達成し、0.75 FID、22.53 PSNR、0.674 SSIMに達した。
論文 参考訳(メタデータ) (2026-03-06T16:39:17Z) - Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies [62.653984010274485]
VLA(Vision-Language-Action)モデルは、画像や命令をロボットアクションにマッピングするために、大きな視覚言語バックボーンを適応させる。
prevailingAsは、固定された左から右への順序で自動回帰的にアクションを生成するか、バックボーンの外側で分離または拡散ヘッドをアタッチする。
本稿では離散拡散を伴う離散化作用チャンクをモデル化する統一変換器ポリシである離散拡散VLAを提案する。
論文 参考訳(メタデータ) (2025-08-27T17:39:11Z) - Centroid-centered Modeling for Efficient Vision Transformer Pre-training [44.24223088955106]
Masked Image Modeling (MIM)は、視覚変換器(ViT)を用いた新しい自己教師型ビジョン事前学習パラダイムである。
提案するCentroid-based approach, CCViT は k-means clustering を利用して画像モデリングのためのCentroid を得る。
提案手法は, 外部監督や蒸留訓練を伴わずに, 最近のベースラインと競合する結果が得られる。
論文 参考訳(メタデータ) (2023-03-08T15:34:57Z) - Exploring Discrete Diffusion Models for Image Captioning [104.69608826164216]
DDCapと呼ばれる拡散型キャプションモデルを提案する。
本稿では,ベストファースト推論,集中注意マスク,テキスト長予測,画像のないトレーニングなど,いくつかの重要な手法を提案する。
4Mビジョン言語による事前学習画像とベースサイズのモデルを用いて,COCO上のCIDErスコア125.1に達する。
論文 参考訳(メタデータ) (2022-11-21T18:12:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。