論文の概要: Steal the Patch Size: Adversarially Manipulate Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.00174v1
- Date: Tue, 30 Jun 2026 20:47:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.638072
- Title: Steal the Patch Size: Adversarially Manipulate Vision-Language Models
- Title(参考訳): ステレオ・ザ・パッチサイズ:視覚言語モデルの逆操作
- Abstract要約: デプロイされた視覚言語モデルのプライベート・ビジョン・トケナイザ構成を復元するブラックボックス・モデルステーリング・アタックを提案する。
このようなリークは,事前処理を意識した転送攻撃や,モデル対象の逆操作を可能にする。
- 参考スコア(独自算出の注目度): 17.50063576561453
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a black-box model-stealing attack that recovers private vision-tokenizer configurations of deployed vision-language models (VLMs), including the visual patch size and input preprocessing pipeline. The key idea is a task-level side channel induced by ViT-style patchification: when a synthetic grid image is aligned with the hidden patch grid, boundary cues are erased at tokenization, causing periodic accuracy drop. By sweeping the grid cell size and measuring these collapses, we infer the patch size; by introducing padding and a consistency-check test, we further identify whether preprocessing is dynamic- or fixed-resolution and recover the target resize resolution. Across open-source Qwen-VL variants and proprietary models including GPT and Claude, we reliably recover tokenizer-related parameters. Finally, we show that such leakage enables preprocessing-aware transfer attacks and model-targeted adversarial manipulation.
- Abstract(参考訳): 本稿では,視覚的パッチサイズや入力前処理パイプラインを含む視覚言語モデル(VLM)のプライベートビジョントケナイザ構成を復元するブラックボックスモデルステアリング攻撃を提案する。
鍵となるアイデアは、ViTスタイルのパッチ化によって引き起こされるタスクレベルのサイドチャネルである: 合成グリッドイメージが隠れパッチグリッドと整列すると、トークン化時に境界キューが消去され、周期的精度が低下する。
グリッドセルサイズを網羅し,これらの崩壊を計測することにより,パッチサイズを推定し,パディングと整合性検査を導入することにより,プリプロセッシングが動的か固定分解能かを確認し,ターゲットのリサイズ解像度を復元する。
オープンソースQwen-VL 変種と GPT や Claude を含むプロプライエタリモデル全体では,トークン化関連パラメータを確実に回収する。
最後に、このようなリークにより、事前処理対応の転送攻撃とモデル目標の逆操作が可能となることを示す。
関連論文リスト
- Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models [62.522141464687195]
本稿では,単に目立った差分(JND)の原理を具体化するためのアクションJNDを紹介する。
トークンの変化は、誘導された行動偏差が許容範囲内に留まっている場合にのみ許容できると考えられる。
結果として生じるアクション耐性スコアは、VLA圧縮パラダイムのプラグアンドプレイ基準として機能する。
論文 参考訳(メタデータ) (2026-08-21T15:59:37Z) - Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding [49.540751364954666]
Visual Token Codecは、グローバルトークンとパッチトークンを専用のコーディングパスに分離する。
VTCは, 分類, セグメンテーション, 検出タスクにおいて, 代表的VT特徴量ベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-08-09T17:32:04Z) - ViP-Rig: Visual-Prompted Controllable Rigging [66.07397903377584]
ViP-Rigは、プロンプトファーストリギングと結果誘導編集の両方をサポートするビジュアルプロンプトフレームワークである。
その結果,ViP-Rigは形状条件のベースラインよりもターゲット骨格やスキンの重量をより正確に回収できることがわかった。
論文 参考訳(メタデータ) (2026-07-30T10:26:37Z) - Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors [48.881343993730844]
安全性に整合した大規模言語モデル(LLM)は、現実世界のパイプラインにますますデプロイされている。
敵は通常の評価では動作しないバックドアのチェックポイントを配布することができる。
最近のポストホック重み付け法は、そのようなバックドアを注入するための効率的なアプローチを提供する。
論文 参考訳(メタデータ) (2026-04-14T06:48:33Z) - Variational Feature Compression for Model-Specific Representations [16.34000934736747]
ディープラーニング推論は、ますます共有およびクラウドベースの設定にデプロイされている。
あるタスクに送信されたデータは、別のタスクのために許可されていないモデルによって再利用される。
指定された分類器の精度を保ちながら、クロスモデル転送を抑制する特徴抽出フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-08T03:34:46Z) - The Compression Gap: Why Discrete Tokenization Limits Vision-Language-Action Model Scaling [0.0]
ビジョンエンコーダのアップグレードによるVLAモデルのスケールアップにより,下流操作性能が向上することが期待される。
この期待は、アクションが離散トークンとして表現されるときに失敗することを示す。
任意のビジュモータパイプラインでは、スケーリングの振る舞いは、最も厳しい情報のボトルネックの位置によって管理される。
論文 参考訳(メタデータ) (2026-04-03T17:06:31Z) - Shape and Substance: Dual-Layer Side-Channel Attacks on Local Vision-Language Models [2.1198879079315573]
デバイス上のビジョンランゲージモデル(VLM)は、ローカル実行を通じてデータのプライバシを約束する。
動的高分解能前処理へのアーキテクチャシフトは,アルゴリズム的なサイドチャネルを導入している。
ローカルなVLMに対する2層アタック・フレームワークを実演する。
論文 参考訳(メタデータ) (2026-03-26T12:53:49Z) - VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer [18.348454274148185]
ゼロショット異常検出(ZSAD)では、ターゲットクラスの異常サンプルにアクセスせずに異常を検出し、位置を特定する必要がある。
この作業は、ZSADのテキストブランチの必要性を再考し、ビジョントランスフォーマー上に構築された純粋に視覚的なフレームワークであるVisualADを提示する。
VisualADは、産業ドメインと医療ドメインにまたがる13のゼロショット異常検出ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-09T04:33:56Z) - V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs [66.81402538540458]
本稿では,局所的セマンティックアタックの新しい手法であるV-Attackを提案する。
V-Attackは、最先端の手法よりも平均して36%の攻撃成功率を改善する。
論文 参考訳(メタデータ) (2025-11-25T11:51:17Z) - Stanceformer: Target-Aware Transformer for Stance Detection [59.69858080492586]
スタンス検出は、テキストで表現されたスタンスを特定の主題やターゲットに向けて識別する。
以前の作業は、ターゲットを効果的に優先順位付けする能力に欠ける既存のトランスフォーマーモデルに依存していた。
本稿では,学習と推論の両方において,目標に対する注意を高めるターゲット対応トランスフォーマーモデルであるStanceformerを紹介する。
論文 参考訳(メタデータ) (2024-10-09T17:24:28Z) - Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training [55.12082817901671]
我々はMasked and Permuted Vision Transformer(MaPeT)という自己教師型事前学習手法を提案する。
MaPeTは、自動回帰および置換予測を使用して、パッチ内依存関係をキャプチャする。
以上の結果から,MaPeTはベースラインやコンペティターと同一のモデル設定で比較して,ImageNet上での競合性能を実証した。
論文 参考訳(メタデータ) (2023-06-12T18:12:19Z) - Self-Supervised Training with Autoencoders for Visual Anomaly Detection [61.62861063776813]
我々は, 正規サンプルの分布を低次元多様体で支持する異常検出において, 特定のユースケースに焦点を当てた。
我々は、訓練中に識別情報を活用する自己指導型学習体制に適応するが、通常の例のサブ多様体に焦点をあてる。
製造領域における視覚異常検出のための挑戦的なベンチマークであるMVTec ADデータセットで、最先端の新たな結果を達成する。
論文 参考訳(メタデータ) (2022-06-23T14:16:30Z) - Defending Object Detectors against Patch Attacks with Out-of-Distribution Smoothing [21.174037250133622]
本稿では,敵対パッチの除去を目的としたアプローチの特性を特徴付けるOODSmootherを紹介する。
このフレームワークは、1)既存のオブジェクト検出器に対するパッチアタックを壊す新しいアダプティブアタック、2)セマンティックプリミティブを利用する新しいディフェンスアプローチであるSemPriorを設計するのに役立つ。
SemPriorだけでは40%増、既存の防衛と組み合わせれば60%増だ。
論文 参考訳(メタデータ) (2022-05-18T15:20:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。