論文の概要: Still There, No Longer Seen: Exposing Compression-Induced Risk in Large Vision-Language Models
- arxiv url: http://arxiv.org/abs/2609.35002v1
- Date: Mon, 28 Sep 2026 12:06:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 17:55:40.519216
- Title: Still There, No Longer Seen: Exposing Compression-Induced Risk in Large Vision-Language Models
- Title(参考訳): 巨大視線モデルにおける圧縮誘発リスクの顕在化
- Abstract要約: 我々は,大規模視覚言語モデルに対する圧縮誘導型リスクアタックであるCIRAを提案する。
CIRAはダウンストリームの質問やラベルは使用せず、言語モデル、デプロイされた圧縮機、正確な圧縮予算へのアクセスを必要としない。
その結果、CIRAのCSFRの平均値は20.35%であり、攻撃成功率は6.92%に制限されている。
- 参考スコア(独自算出の注目度): 20.07886405027695
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual token compression reduces the inference cost of Large Vision-Language Models (LVLMs). However, aggregate robustness measures do not reveal whether a particular adversarial failure is induced by compression or inherited from the underlying model. We define a compression-specific failure (CSF) as an adversarial input that remains correct under full-token inference but fails after compression, casting compression-induced risk as a paired failure attribution problem. Within a controlled diagnostic cohort, counterfactuals show that retained-set allocation causally changes compressed correctness and reveal a negative association between recovery and representation drift in displaced evidence. Motivated by these findings, we propose CIRA, a Compression-Induced Risk Attack for Large Vision-Language Models. Under a vision-encoder white-box setting, CIRA optimizes image perturbations through encoder-side objectives that manipulate token priorities across candidate compression budgets while preserving displaced evidence. CIRA uses no downstream questions or labels and requires no access to the language model, deployed compressor, or exact compression budget. Across 12 dataset-compressor settings evaluated at four budgets, CIRA achieves a mean CSFR of 20.35% while limiting full-token attack success to 6.92%, with similar behavior on additional LVLM families. A cross-view selection-stabilization defense substantially suppresses CIRA, although Adaptive CIRA partially restores its effectiveness. These results show that compression-specific failures persist under restricted access and support paired evaluation of full-token and compressed inference for attributing risk to visual-token compression.
- Abstract(参考訳): 視覚トークン圧縮は、LVLM(Large Vision-Language Models)の推論コストを低減する。
しかし, 集合的ロバスト性測定では, 圧縮によって特定の対向的故障が誘発されるか, 基礎モデルから継承されるかは明らかになっていない。
我々は、圧縮固有の障害(CSF)を、完全な推論の下では正しくないが圧縮後に失敗する逆入力として定義し、圧縮誘起リスクをペアの障害帰属問題とみなす。
制御された診断コホート内では、反事実は、保持セットの割り当てが圧縮された正しさを因果的に変化し、置換された証拠における回復と表現のドリフトの間に負の相関が現れることを示した。
これらの知見に触発され,大規模視覚言語モデルに対する圧縮誘導型リスクアタックであるCIRAを提案する。
ビジョンエンコーダのホワイトボックス設定の下で、CIRAはエンコーダ側の目的を通じて画像摂動を最適化する。
CIRAはダウンストリームの質問やラベルは使用せず、言語モデル、デプロイされた圧縮機、正確な圧縮予算へのアクセスを必要としない。
CIRAは4つの予算で評価された12のデータセット圧縮機設定で、CSFRの平均20.35%を達成し、完全な攻撃成功を6.92%に制限した。
クロスビュー選択安定化ディフェンスはCIRAを著しく抑制するが、Adaptive CIRAはその効果を部分的に回復する。
これらの結果から, 圧縮特異的な故障は制限されたアクセス下で継続し, 視覚的圧縮に起因するリスクを考慮し, フルトーケンと圧縮推論のペア評価をサポートすることがわかった。
関連論文リスト
- Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models [62.522141464687195]
本稿では,単に目立った差分(JND)の原理を具体化するためのアクションJNDを紹介する。
トークンの変化は、誘導された行動偏差が許容範囲内に留まっている場合にのみ許容できると考えられる。
結果として生じるアクション耐性スコアは、VLA圧縮パラダイムのプラグアンドプレイ基準として機能する。
論文 参考訳(メタデータ) (2026-08-21T15:59:37Z) - The Asymmetric Harms of LLM Compression [9.45803162325743]
大規模言語モデル(LLM)圧縮は、デプロイメントコストを削減しますが、パープレキシティや精度といった標準的な集約メトリクスは、基礎となる振る舞いシフトを隠蔽します。
本研究では,11個の圧縮法にまたがる3つのLLMを体系的に評価し,圧縮が知識保持,モデル信頼,社会的偏見に及ぼす影響について検討した。
論文 参考訳(メタデータ) (2026-08-20T06:06:14Z) - Compression as an Adversarial Amplifier Through Decision Space Reduction [14.526561120852532]
本研究は, 従来未探索の敵の攻撃を, 直接圧縮表現に適用する手法について検討する。
同一名の摂動予算の下では、圧縮認識攻撃はピクセル空間攻撃よりもかなり効果的である。
この効果は,非可逆な情報損失変換を生じる圧縮による決定空間の低減に起因する。
論文 参考訳(メタデータ) (2026-04-08T11:15:45Z) - Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression [22.436953683970007]
既存のエンコーダベースの攻撃は、圧縮視覚言語モデル(LVLM)の堅牢性を大幅に過大評価できることを示す。
本稿では, 圧縮機構やトークンの予算を仮定することなく, 摂動最適化と圧縮推論を一致させる圧縮-AliGnEd攻撃(CAGE)を提案する。
論文 参考訳(メタデータ) (2026-01-29T10:47:21Z) - Less Is More -- Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models [69.84867664371826]
視覚トークン圧縮はLVLM(Large Vision-Language Models)のロバスト性を大幅に低下させることを示す。
小さくて知覚不能な摂動はトークンの重要度を著しく変更し、圧縮機構が誤ってタスククリティカル情報を破棄する。
我々は,この脆弱性を体系的に研究し,活用するための圧縮認識攻撃を提案する。
論文 参考訳(メタデータ) (2026-01-17T13:02:41Z) - VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs [82.72388893596555]
MLLM(Multimodal Large Language Models)は、計算とメモリのボトルネックに遭遇する。
従来のトークン圧縮技術は、重要な情報を破棄するリスクを負うルールによって制約されることが多い。
我々は,トークン圧縮をエンドツーエンドの学習可能な決定プロセスに再構成する軽量なプラグアンドプレイフレームワークとして,トークン圧縮を再構成する。
論文 参考訳(メタデータ) (2025-10-18T17:54:18Z) - Joint Lossless Compression and Steganography for Medical Images via Large Language Models [63.454510290574355]
医用画像のための新しい非破壊圧縮・ステガノグラフィーフレームワークを提案する。
ビットプレーンスライシング(BPS)にインスパイアされて、医療画像にプライバシーメッセージを埋め込むことができる。
論文 参考訳(メタデータ) (2025-08-03T14:45:51Z) - UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective [85.08718140718707]
UNCompは不確実性を認識したフレームワークで、適応圧縮に使用できる空間パターンを明らかにする。
スパーシティパターンを詳細に分析する不確実性に注目して、UNCompはKVキャッシュサイズを4.74%に削減し、6%のプリフィルスピードアップを実現し、スループットを6.4倍改善した。
論文 参考訳(メタデータ) (2024-10-04T02:32:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。