論文の概要: InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.07288v1
- Date: Wed, 08 Jul 2026 11:28:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.361016
- Title: InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models
- Title(参考訳): InfraQR:赤外線ビジョンランゲージモデル上でのQRにヒントを得た構造的パッチアタック
- Abstract要約: InfraQRは、QRにインスパイアされた、赤外線ビジョン言語モデルのための構造化パッチアタックである。
我々は、赤外線分類、キャプション転送、質問応答型視覚質問応答タスクについて評価した。
その結果、赤外線ビジョン言語モデルは、構造化されたエッジ配置の摂動に弱いままであることがわかった。
- 参考スコア(独自算出の注目度): 6.982777059279356
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Infrared vision-language models are increasingly used for perception under low-light and adverse visual conditions, yet their robustness to localized structured perturbations remains underexplored. Existing infrared adversarial studies mainly focus on object detectors, leaving the security of infrared vision-language models less systematically examined. We present InfraQR, a QR-inspired structured patch attack for infrared vision-language models. Unlike localized attacks that attach perturbations to the target object, InfraQR places a compact structured patch along image boundaries and optimizes learnable grid cells through surrogate CLIP-style encoders. The resulting patch has a near-binary structured appearance, but is not required to be a valid or machine-readable QR code. We evaluate InfraQR on infrared classification, caption transfer, and question-answer-aware visual question answering (VQA) tasks. On a 300-image infrared benchmark, InfraQR sharply reduces the accuracy of multiple CLIP-style classifiers, including reducing OpenAI CLIP accuracy from 98.67% to 0.70%. The generated adversarial images also transfer to black-box captioning and VQA models, causing semantic degradation in captions and more error-prone answers under GPT-5.4-based evaluation. These results show that infrared vision-language models remain vulnerable to structured edge-placed perturbations, motivating further study of cross-task robustness beyond direct object occlusion.
- Abstract(参考訳): 赤外線視覚言語モデルは、低照度で有害な視覚条件下での知覚にますます使用されるが、局所的な構造的摂動に対する頑健さはいまだに未発見である。
既存の赤外線対外研究は主に物体検出器に焦点を当てており、赤外線視覚言語モデルの安全性は体系的に検討されていない。
InfraQRは、QRにインスパイアされた、赤外線ビジョン言語モデルのための構造化パッチアタックである。
ターゲットオブジェクトに摂動をアタッチするローカライズされた攻撃とは異なり、InfraQRはイメージ境界に沿ってコンパクトな構造化パッチを配置し、CLIPスタイルのエンコーダを通じて学習可能なグリッドセルを最適化する。
パッチの外観はバイナリに近いが、有効またはマシン可読のQRコードである必要はない。
我々は、赤外線分類、キャプション転送、質問応答型視覚質問応答(VQA)タスクについて、InfraQRを評価した。
300イメージの赤外線ベンチマークでは、InfraQRは、OpenAI CLIPの精度を98.67%から0.70%に下げるなど、複数のCLIPスタイルの分類器の精度を劇的に下げている。
生成された逆画像はブラックボックスキャプションやVQAモデルにも変換され、キャプションのセマンティックな劣化や、GPT-5.4ベースの評価の下でよりエラーを起こしやすい回答が生じる。
これらの結果は、赤外線視覚言語モデルが、構造されたエッジ配置の摂動に弱いままであり、直接物体の閉塞を超えるクロスタスクロバスト性の研究を動機付けていることを示している。
関連論文リスト
- InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models [9.310612317083928]
赤外線視覚適応モデル(IR-VLM)は、低視認性条件下でのマルチモーダル知覚のための有望なパラダイムとして登場した。
IR-VLMに対するデジタルグレースケールパッチ攻撃を対象とするフレームワークであるInfraPatchを提案する。
論文 参考訳(メタデータ) (2026-09-02T07:42:27Z) - SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation [52.62632888060867]
可視赤外画像変換は、豊富な可視画像を用いて赤外線トレーニングデータを拡張するための実用的な方法を提供する。
既存の拡散に基づくメソッドは、通常、外部条件としてのみセマンティックプリエントを使用する。
SC-Diffは、条件付きガイダンスと内部自己注意校正の両方にセマンティックな事前情報を利用する意味論的潜伏拡散フレームワークである。
論文 参考訳(メタデータ) (2026-08-09T07:57:40Z) - FaithIR: Rethinking Infrared Image Super-Resolution from Perceptual Sharpness to Task Relevant Fidelity [50.75932774177958]
FaithIRは信頼性の高いマシン認識のための忠実な赤外線超解像度フレームワークである。
FLIR-IISR、M3FD、FMBの実験は、強い再構成忠実度、クロスデータセットの一般化、オブジェクト検出とセマンティックセグメンテーションにおける優れた性能を示す。
論文 参考訳(メタデータ) (2026-08-04T04:23:30Z) - QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models [15.94973805868716]
赤外線視覚言語モデル(IR-VLM)は、熱知覚を開語彙分類、画像キャプション、視覚的質問応答に拡張する。
IR-VLMのセマンティックステアリングを目的としたQR-STT(QR-Structured Thermal Triggers)を提案する。
QR-STTは、視覚的ステルスを維持しながら、選択した概念に対して画像テキストアライメントを一貫してリダイレクトすることを示す。
論文 参考訳(メタデータ) (2026-07-31T14:10:57Z) - MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation [12.037405766509274]
MonoIR-RSは、大規模な赤外線リモートセンシングビジョン言語データセットである。
IR対応データ構築とCLIPスタイルのコントラスト適応とVLM命令チューニングを結合する。
合成した赤外線画像は、グレースケール変換よりも実際の熱画像に近いことが示される。
論文 参考訳(メタデータ) (2026-07-07T17:53:58Z) - Knowledge-Guided Adversarial Training for Infrared Object Detection via Thermal Radiation Modeling [49.887347082863194]
本研究では,異なるクラス間の相対的な熱放射関係を,敵対的事例や共通の腐敗の複雑なシナリオの下で信頼性の高い知識源とみなすことができることを示す。
本稿では,赤外線物体検出のための知識誘導型逆トレーニング(KGAT)を提案する。
論文 参考訳(メタデータ) (2026-03-26T08:43:43Z) - Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description [1.7786984823452563]
赤外線カメラは、視覚システムが苦戦する低照度環境や囲い込み機械における製造環境に利点をもたらす。
視覚言語システム(VLM)の最近の進歩は、RGBデータに関連する新たなテキスト内予測を提供する。
本研究は、FLIRボソンカメラで撮影された画像の事前処理により、VLMを赤外線データに適応させるゼロショットエンコーダを導入する。
論文 参考訳(メタデータ) (2025-12-11T20:20:38Z) - DuGI-MAE: Improving Infrared Mask Autoencoders via Dual-Domain Guidance [20.484726951373602]
本稿では,MAE(DuGI-MAE)に基づくデュアルドメイン誘導赤外線基盤モデルを提案する。
まず,トークンエントロピーに基づく決定論的マスキング戦略を設計し,情報性を高めるために高エントロピートークンのみを復元する。
次に、Dual-Domain Guidance (DDG)モジュールを導入し、同時にグローバルトークンの関係をキャプチャし、赤外線画像に存在する非一様背景雑音を適応的にフィルタリングする。
Inf-590Kで事前訓練されたDuGI-MAEは、赤外線オブジェクト検出、セマンティックセグメンテーション、小さなターゲット検出など、さまざまな下流タスクにまたがる強力な一般化機能を示す
論文 参考訳(メタデータ) (2025-12-04T06:45:20Z) - IrisNet: Infrared Image Status Awareness Meta Decoder for Infrared Small Targets Detection [92.56025546608699]
IrisNetは、入力赤外線画像ステータスに検出戦略を適用する、新しいメタ学習フレームワークである。
提案手法は,赤外線画像特徴量とデコーダパラメータ全体の動的マッピングを確立する。
NUDT-SIRST、NUAA-SIRST、IRSTD-1Kデータセットの実験は、我々のIrisNetの優位性を示している。
論文 参考訳(メタデータ) (2025-11-25T13:53:54Z) - DISTA-Net: Dynamic Closely-Spaced Infrared Small Target Unmixing [55.366556355538954]
本稿では,動的フレームワーク内で従来のスパース再構築を再現する動的反復収縮閾値ネットワーク(DISTA-Net)を提案する。
DISTA-Netは、密接な空間を持つ赤外線小ターゲットのアンミックスのために特別に設計された最初のディープラーニングモデルである。
私たちはこの分野におけるさらなる研究を促進するために、最初のオープンソースエコシステムを確立しました。
論文 参考訳(メタデータ) (2025-05-25T13:52:00Z) - SAGA: Semantic-Aware Gray color Augmentation for Visible-to-Thermal Domain Adaptation across Multi-View Drone and Ground-Based Vision Systems [1.891522135443594]
ドメイン適応型熱オブジェクト検出は、可視(RGB)から熱(IR)への適応を促進する上で重要な役割を果たす。
色やテクスチャの手がかりの欠如など、赤外線画像の固有の制限は、RGB訓練されたモデルに課題をもたらす。
本稿では,カラーバイアスを緩和し,領域ギャップを埋めるための新しい戦略であるセマンティック・アウェア・グレイカラー拡張(SAGA)を提案する。
論文 参考訳(メタデータ) (2025-04-22T09:22:11Z) - Multi-Domain Biometric Recognition using Body Embeddings [51.36007967653781]
身体埋め込みは中波長赤外線(MWIR)領域と長波長赤外線(LWIR)領域の顔埋め込みよりも優れていた。
我々は、IJB-MDFデータセット上でのベンチマーク結果を確立するために、ビジョントランスフォーマーアーキテクチャを活用している。
また, クロスエントロピーとトリプルト損失の単純な組み合わせで, VISデータにのみ事前訓練された体モデルを微調整することで, 最先端のmAPスコアが得られることを示す。
論文 参考訳(メタデータ) (2025-03-13T22:38:18Z) - Contourlet Refinement Gate Framework for Thermal Spectrum Distribution Regularized Infrared Image Super-Resolution [54.293362972473595]
画像超解像(SR)は、高解像度(HR)画像を低解像度(LR)画像から再構成することを目的としている。
SRタスクに対処する現在のアプローチは、RGB画像の特徴を抽出するか、同様の劣化パターンを仮定するものである。
スペクトル分布の忠実さを保ちつつ、赤外線変調特性を復元するコントゥーレット改質ゲートフレームワークを提案する。
論文 参考訳(メタデータ) (2024-11-19T14:24:03Z) - Infrared Small-Dim Target Detection with Transformer under Complex
Backgrounds [155.388487263872]
変換器を用いた赤外線小径目標検出手法を提案する。
画像特徴の相互作用情報をより広い範囲で学習するために,変換器の自己認識機構を採用する。
最小限のターゲットの機能を学習するための機能拡張モジュールも設計しています。
論文 参考訳(メタデータ) (2021-09-29T12:23:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。