論文の概要: QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.29445v1
- Date: Fri, 31 Jul 2026 14:10:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.759148
- Title: QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
- Title(参考訳): QR構造熱トリガーを用いた赤外線ビジョンランゲージモデルを用いたセマンティックアタック
- Abstract要約: 赤外線視覚言語モデル(IR-VLM)は、熱知覚を開語彙分類、画像キャプション、視覚的質問応答に拡張する。
IR-VLMのセマンティックステアリングを目的としたQR-STT(QR-Structured Thermal Triggers)を提案する。
QR-STTは、視覚的ステルスを維持しながら、選択した概念に対して画像テキストアライメントを一貫してリダイレクトすることを示す。
- 参考スコア(独自算出の注目度): 15.94973805868716
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Infrared vision-language models (IR-VLMs) extend thermal perception to open-vocabulary classification, image captioning, and visual question answering. However, their robustness to structured thermal perturbations and the stability of cross-modal semantic alignment remain insufficiently studied. We propose QR-Structured Thermal Triggers (QR-STT), a stealthy, training-free, black-box framework for targeted semantic steering of IR-VLMs. QR-STT preserves the functional regions of a QR pattern while optimizing its internal modules, each of which is assigned a cold, neutral, or hot thermal state. The framework jointly searches module topology and rendering parameters, including position, scale, rotation, intensity, blur, and roundness. A three-stage gradient-free procedure with greedy module-flip refinement efficiently handles the mixed discrete and continuous search space. The objective promotes alignment with an attacker-selected target, suppresses source-class evidence, and regularizes QR structure and visual similarity. Experiments on multiple CLIP-style encoders show that QR-STT consistently redirects image-text alignment toward chosen concepts while maintaining visual stealth. Perturbations optimized for classification also transfer to image captioning and VQA, causing target-consistent semantic drift in generated outputs. These results identify QR-structured thermal patterns as an interpretable attack surface for language-driven infrared perception and highlight the need for robustness evaluation against structured cross-task semantic attacks.
- Abstract(参考訳): 赤外線視覚言語モデル(IR-VLM)は、熱知覚を開語彙分類、画像キャプション、視覚的質問応答に拡張する。
しかし, 構造的熱摂動に対するロバスト性や, モーダル間のセマンティックアライメントの安定性は十分に研究されていない。
本稿では,QR-STT(QR-Structured Thermal Triggers)を提案する。
QR-STTはQRパターンの機能領域を保ち、内部モジュールを最適化する。
このフレームワークは、モジュールトポロジとレンダリングパラメータ(位置、スケール、回転、強度、ぼかし、丸みなど)を共同で検索する。
グリーディ・モジュール・フリップを改良した3段階の勾配フリー・プロシージャは、離散的かつ連続的な探索空間を効率的に扱う。
この目的は、攻撃者が選択したターゲットとのアライメントを促進し、ソースクラスのエビデンスを抑制し、QR構造と視覚的類似性を規則化する。
複数のCLIPスタイルのエンコーダの実験では、QR-STTは、視覚的ステルスを維持しながら、選択した概念への画像テキストアライメントを一貫してリダイレクトしている。
分類に最適化された摂動は、画像キャプションやVQAにも伝達され、生成した出力に目標一貫性のセマンティックドリフトを引き起こす。
これらの結果はQR構造熱パターンを言語駆動型赤外線知覚のための解釈可能な攻撃面として同定し、構造化されたクロスタスクセマンティックアタックに対する堅牢性評価の必要性を強調した。
関連論文リスト
- Balancing Emotional Alignment and Semantic Consistency in Image Generation via Reinforcement Learning with Valence-Arousal Anchoring [55.57242007016976]
テキスト・ツー・イメージ生成における継続的な感情制御は、プロンプトによって記述されたオブジェクトやレイアウト、シーンを変更することなく、感情的アライメントを改善するモデルを必要とする。
既存の教師付き感情注入法は、しばしば特徴空間プロキシを最適化し、したがって感情のセマンティックドリフトを示す。
本稿では,連続的原子価覚醒条件設定,グループ相対ポリシー最適化,中立的セマンティックアンカーを組み合わせたフローマッチング画像生成フレームワークを用いてこの問題に対処する。
論文 参考訳(メタデータ) (2026-09-11T13:24:35Z) - SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation [52.62632888060867]
可視赤外画像変換は、豊富な可視画像を用いて赤外線トレーニングデータを拡張するための実用的な方法を提供する。
既存の拡散に基づくメソッドは、通常、外部条件としてのみセマンティックプリエントを使用する。
SC-Diffは、条件付きガイダンスと内部自己注意校正の両方にセマンティックな事前情報を利用する意味論的潜伏拡散フレームワークである。
論文 参考訳(メタデータ) (2026-08-09T07:57:40Z) - CLUIE: Clustering-Aware Recurrent Propagation with Local Structural Compensation for Underwater Image Enhancement [92.78545064386485]
水中画像の強調は、波長依存性の光吸収、散乱、後方散乱により依然として困難である。
本稿では,従来のRWKVの一定繰り返し伝搬経路をコンテント適応トークン軌道に変換するクラスタリング対応RWKVフレームワークを提案する。
複数の水中画像強調ベンチマークの実験は、CRWKVが最先端の定量的性能と優れた視覚的品質を達成することを示した。
論文 参考訳(メタデータ) (2026-07-23T16:09:36Z) - InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models [6.982777059279356]
InfraQRは、QRにインスパイアされた、赤外線ビジョン言語モデルのための構造化パッチアタックである。
我々は、赤外線分類、キャプション転送、質問応答型視覚質問応答タスクについて評価した。
その結果、赤外線ビジョン言語モデルは、構造化されたエッジ配置の摂動に弱いままであることがわかった。
論文 参考訳(メタデータ) (2026-07-08T11:28:15Z) - CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion [3.7521959864518593]
CogSENetは、ワシの視覚システムにインスパイアされた動的でセマンティックな再構築フレームワークである。
CogSENetoutperは、より少ないパラメータで、視覚的品質と構造的忠実度の両方で最先端のデブロアリングメソッドを生成する。
論文 参考訳(メタデータ) (2026-06-29T09:29:21Z) - ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images [51.53960096934913]
リモートセンシングビジュアルグラウンドティング(RSVG)は、自由形式の自然言語記述を用いて、高解像度のRS画像中の特定の物体を特定することを目的としている。
マルチモーダル大言語モデル(MLLM)の最近の進歩は、そのようなオープン語彙RSVGに大きな可能性を示している。
Inemplar-driven Calibrated Refinement (ExACT)を提案する。
論文 参考訳(メタデータ) (2026-06-27T13:50:39Z) - Physically-Induced Atmospheric Adversarial Perturbations: Enhancing Transferability and Robustness in Remote Sensing Image Classification [54.952203312050564]
敵対的攻撃は、リモートセンシング(RS)画像分類におけるディープラーニングモデルの信頼性に深刻な脅威をもたらす。
本稿ではフォグフール(FogFool)を提案する。
2つのベンチマークRSデータセットの実験は、FogFoolが優れたパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-04-16T05:47:57Z) - ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery [11.547362584832769]
ヴィジュアル言語モデル(VLM)はRGB画像において高い性能を達成するが、熱画像には一般化しない。
サーマルセンシングは、夜間監視、捜索救助、自律運転、医療スクリーニングなど、可視光が失敗する状況において重要な役割を果たす。
本稿ではサーマルビジョン言語理解に必要な基礎的プリミティブを評価するベンチマークであるThermEval-Bを紹介する。
論文 参考訳(メタデータ) (2026-02-16T18:16:19Z) - SPIRIT: Adapting Vision Foundation Models for Unified Single- and Multi-Frame Infrared Small Target Detection [18.86422994684341]
赤外線小目標検出(IRSTD)は監視と早期警戒に不可欠であり、単一フレーム分析とビデオモード追跡の両方に展開する。
本稿では,軽量な物理インフォームドプラグインによってVFMをIRSTDに適応させる,統一的でVFM互換のフレームワークであるSPIRITを提案する。
論文 参考訳(メタデータ) (2026-02-02T09:15:29Z) - IrisNet: Infrared Image Status Awareness Meta Decoder for Infrared Small Targets Detection [92.56025546608699]
IrisNetは、入力赤外線画像ステータスに検出戦略を適用する、新しいメタ学習フレームワークである。
提案手法は,赤外線画像特徴量とデコーダパラメータ全体の動的マッピングを確立する。
NUDT-SIRST、NUAA-SIRST、IRSTD-1Kデータセットの実験は、我々のIrisNetの優位性を示している。
論文 参考訳(メタデータ) (2025-11-25T13:53:54Z) - Contourlet Refinement Gate Framework for Thermal Spectrum Distribution Regularized Infrared Image Super-Resolution [54.293362972473595]
画像超解像(SR)は、高解像度(HR)画像を低解像度(LR)画像から再構成することを目的としている。
SRタスクに対処する現在のアプローチは、RGB画像の特徴を抽出するか、同様の劣化パターンを仮定するものである。
スペクトル分布の忠実さを保ちつつ、赤外線変調特性を復元するコントゥーレット改質ゲートフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-19T14:24:03Z) - You Only Train Once: A Unified Framework for Both Full-Reference and No-Reference Image Quality Assessment [45.62136459502005]
本稿では,完全な参照 (FR) と非参照 (NR) IQA を行うネットワークを提案する。
まず、入力画像から多レベル特徴を抽出するためにエンコーダを用いる。
FRおよびNR入力のユニバーサルアダプタとして階層的注意(HA)モジュールを提案する。
エンコーダの浅い層と深い層との間の特徴相関を調べるために, セマンティック・ディストーション・アウェア (SDA) モジュールを提案する。
論文 参考訳(メタデータ) (2023-10-14T11:03:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。