論文の概要: Technical Report on the CVPR 2026@AdvML Workshop Challenge
- arxiv url: http://arxiv.org/abs/2607.11560v1
- Date: Mon, 13 Jul 2026 13:42:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.484929
- Title: Technical Report on the CVPR 2026@AdvML Workshop Challenge
- Title(参考訳): CVPR 2026@AdvMLワークショップ報告
- Abstract要約: 視覚言語エージェント(VLA)は、複雑な運転シーンを解釈し、安全クリティカルな推論をサポートするためにますます使われている。
CVPR 2026@AdvML Workshop Challenge on adversarial multimodal attack against autonomous-driving VLAs。
- 参考スコア(独自算出の注目度): 212.8018524968403
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language agents (VLAs) are increasingly used to interpret complex driving scenes and support safety-critical reasoning. This report presents the CVPR 2026@AdvML Workshop Challenge on adversarial multimodal attacks against autonomous-driving VLAs. Built on DriveLM-style multi-view visual question answering, the challenge represents each scene with six synchronized camera images and a structured collection of driving-related question-answer pairs. Participants generate adversarial images and suffix-only textual perturbations that induce model responses to deviate from reference answers while preserving image fidelity and limiting textual cost. The competition comprises two phases, with Phase II adding a hidden black-box model to assess transferability. We describe the task design, submission rules, evaluation protocol, and leaderboard results, and then examine five leading submissions for which technical reports were available. Across these reports, several recurring patterns emerge: image-side attacks are favored by the suffix penalty; scene-level, multi-view optimization is more effective than treating views in isolation; QA types and graph structure provide useful priors for allocating attack budget; feature-space objectives can improve black-box transfer; and typographic content embedded in camera images exposes a persistent vulnerability in driving VLAs. These findings provide a practical reference for future robustness evaluation and defense design in multimodal autonomous-driving systems.
- Abstract(参考訳): 視覚言語エージェント(VLA)は、複雑な運転シーンを解釈し、安全クリティカルな推論をサポートするためにますます使われている。
CVPR 2026@AdvML Workshop Challenge on adversarial multimodal attack against autonomous-driving VLAs。
DriveLMスタイルの多視点視覚質問応答に基づいて構築されたこの課題は、6つの同期カメライメージと、駆動関連の質問応答ペアの構造化されたコレクションで各シーンを表現している。
参加者は、画像の忠実さを保ち、テキストコストを制限しながら、参照応答から逸脱するモデル応答を誘導する、逆画像と接尾辞のみのテキスト摂動を生成する。
コンペティションは2つのフェーズで構成されており、フェーズ2は転送可能性を評価するために隠れたブラックボックスモデルを追加する。
本稿では,タスク設計,提案ルール,評価プロトコル,およびリーダボードの結果について述べる。
これらのレポート全体で、イメージサイドの攻撃はサフィックスペナルティによって好まれる、シーンレベルのマルチビュー最適化は、分離されたビューを扱うよりも効果的である、QAタイプとグラフ構造は、攻撃予算を割り当てるための有用な事前情報を提供する、フィーチャースペースの目的はブラックボックス転送を改善する、カメライメージに埋め込まれたタイポグラフィコンテンツは、VLAを駆動する際の永続的な脆弱性を露呈する、といった繰り返しパターンが出現する。
これらの知見は,マルチモーダル自動運転システムにおける将来のロバストネス評価と防衛設計の実践的参考となる。
関連論文リスト
- Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model [73.59026525350808]
2つのモードからの視覚的および意味的な監視信号を協調的に最適化する二重対向微調整フレームワークを提案する。
本手法は, ゼロショット分類, 画像キャプション, 視覚的質問応答タスクにおいて, 対向ロバスト性評価における最先端手法よりも優れている。
論文 参考訳(メタデータ) (2026-07-21T10:49:29Z) - V2XCrafter: Learning to Generate Driving Scene Across Agents [52.22336670088219]
協調運転システムは、運転安全性を高めるために、車両間通信(V2X)を利用して協調認識を行う。
エージェントのカメラビューにまたがって制御可能で現実的な協調運転シーンを生成するための最初のフレームワークであるV2XCrafterを提案する。
実験により,V2XCrafterはエージェント間の整合性を持った高忠実かつ制御可能なストリートビューを生成できることがわかった。
論文 参考訳(メタデータ) (2026-05-28T07:03:51Z) - Perception-Aware Multimodal Spatial Reasoning from Monocular Images [57.42071289037214]
単眼画像からの空間的推論は 自律運転には不可欠です
現在のヴィジュアルランゲージモデル(VLM)は、微粒な幾何学的知覚に苦慮している。
本稿では,VLMを明示的な対象中心の接地能力を持つ知覚認識型マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T02:05:12Z) - Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning Framework with Vision-Language Models [6.117371161379208]
本稿では,MP-PVIR(Multi-view Phase-aware Pedestrian-Vehicle Incident Reasoning)を紹介する。
MP-PVIRは、多視点ビデオストリームを4段階にわたって構造化された診断レポートに処理する統合フレームワークである。
インシデントを自動的に認知フェーズに分割し、各フェーズ内で同期多視点分析を行い、目的とする予防戦略で因果連鎖に結果を合成することで行動理論を運用する。
論文 参考訳(メタデータ) (2025-11-18T04:12:24Z) - ERMV: Editing 4D Robotic Multi-view images to enhance embodied agents [14.75400720374728]
ERMV(Robotic Multi-View 4D data framework)は、単一フレームの編集とロボットの状態条件に基づいて、全マルチビューシーケンスを効率的に編集する。
創発されたデータは、シミュレーションと実世界の両方の環境でモデルの堅牢性とガイダンスを著しく向上させる。
論文 参考訳(メタデータ) (2025-07-23T12:41:11Z) - AnyAttack: Towards Large-scale Self-supervised Adversarial Attacks on Vision-language Models [39.34959092321762]
VLM(Vision-Language Models)は、画像ベースの敵攻撃に対して脆弱である。
我々は、従来の攻撃の制限を超越した自己教師型フレームワークであるAnyAttackを紹介する。
論文 参考訳(メタデータ) (2024-10-07T09:45:18Z) - Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships [9.059990548158716]
この研究は、視覚言語(VL)タスクにおけるマルチモーダル攻撃に対する防衛戦略を初めて探求した。
本稿では、画像とテキストの両モードに逆方向の摂動を組み込んだマルチモーダル対位トレーニング(MAT)を提案する。
これを解決するために,我々は一対多の関係を活用して強靭性を高めるための総合的な研究を行っている。
論文 参考訳(メタデータ) (2024-05-29T05:20:02Z) - Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective [42.04728834962863]
CLIPのような事前訓練された視覚言語モデル(VLM)は、様々な下流タスクにまたがる例外的な一般化を示している。
近年の研究では、テキストベースおよびマルチモーダル攻撃に対する防御がほとんど未調査のままであり、敵攻撃に対する脆弱性が明らかにされている。
本研究は,画像,テキスト,マルチモーダル入力を標的とした攻撃に対して,VLMの対角的堅牢性を改善するための最初の総合的研究である。
論文 参考訳(メタデータ) (2024-04-30T06:34:21Z) - VQAttack: Transferable Adversarial Attacks on Visual Question Answering
via Pre-trained Models [58.21452697997078]
本稿では,画像とテキストの摂動を設計モジュールで生成できる新しいVQAttackモデルを提案する。
5つの検証モデルを持つ2つのVQAデータセットの実験結果は、提案したVQAttackの有効性を示す。
論文 参考訳(メタデータ) (2024-02-16T21:17:42Z) - Adversarial Prompt Tuning for Vision-Language Models [86.5543597406173]
AdvPT(Adversarial Prompt Tuning)は、視覚言語モデル(VLM)における画像エンコーダの対向ロバスト性を高める技術である。
我々は,AdvPTが白箱攻撃や黒箱攻撃に対する抵抗性を向上し,既存の画像処理による防御技術と組み合わせることで相乗効果を示すことを示した。
論文 参考訳(メタデータ) (2023-11-19T07:47:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。