論文の概要: Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
- arxiv url: http://arxiv.org/abs/2608.20748v1
- Date: Fri, 21 Aug 2026 05:16:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.390959
- Title: Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
- Title(参考訳): 幾何接地変圧器の多視点逆解析例の生成
- Abstract要約: Visual Geometry Grounded Transformer (VGGT) は多視点画像からのフィードフォワード3D再構成を可能にする。
このような高性能モデルのデプロイは、重大なセキュリティ上の脆弱性を露呈する可能性がある。
従来の対向摂動はシーンごとのコストのかかる最適化を必要とするが、Universal Adrial Perturbations (UAP)は単一の静的パターンに依存し、VGGTを効果的に攻撃することができない。
フィードフォワードパスで複数のビューに一貫した摂動を生成する多視点対向摂動発生器であるtextbfMVAP-G を提案する。
- 参考スコア(独自算出の注目度): 23.012613078922598
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The Visual Geometry Grounded Transformer (VGGT) enables unified feed-forward 3D reconstruction from multi-view images. However, deploying such a high-performance model may expose critical security vulnerabilities. Traditional adversarial perturbations require costly per-scene optimization, while Universal Adversarial Perturbations (UAPs) rely on a single static pattern and fail to effectively attack VGGT. To address these limitations, we propose \textbf{MVAP-G}, a multi-view adversarial perturbation generator that produces imperceptible consistent perturbations across multiple views in a single feed-forward pass. To ensure perturbation consistency across diverse scenes, we design a cross-view adversarial alignment mechanism to process multi-view images. Experiments demonstrate that MVAP-G significantly degrades VGGT performance without iterative optimization during inference. This work pioneers multi-view adversarial attacks on 3D foundation models, uncovering severe vulnerabilities and underscoring the urgent need for robust 3D vision systems. The code is available at https://github.com/qsong2001/mvap-g.
- Abstract(参考訳): Visual Geometry Grounded Transformer (VGGT) は多視点画像からのフィードフォワード3D再構成を可能にする。
しかし、そのような高性能なモデルをデプロイすると、重大なセキュリティ上の脆弱性が露呈する可能性がある。
一方、UAPは単一の静的パターンに依存しており、VGGTを効果的に攻撃することができない。
これらの制約に対処するため,複数ビューにまたがる一貫した摂動を単一フィードフォワードパスで生成する多視点対向摂動発生器である \textbf{MVAP-G} を提案する。
多様なシーンにまたがる摂動の整合性を確保するため,多視点画像を処理するクロスビュー対向アライメント機構を設計する。
実験により、MVAP-Gは推論中に繰り返し最適化することなく、VGGTの性能を著しく低下させることが示された。
この研究は、3Dファウンデーションモデルに対するマルチビューの敵攻撃の先駆者であり、深刻な脆弱性を明らかにし、堅牢な3Dビジョンシステムに対する緊急の必要性を強調している。
コードはhttps://github.com/qsong2001/mvap-gで入手できる。
関連論文リスト
- Diversity-aware View Partitioning for Scalable VGGT [48.654660686945526]
VGGTは、グローバルな注目を集めた複数のビューを共同で推論することで、強力なパフォーマンスを達成する。
本稿では,多様性を意識したバランスの取れたチャンクにビューを整理する,トレーニングフリーでプラグアンドプレイな推論フレームワークを提案する。
我々のフレームワークは既存のVGGTの変種を補完し、幾何学的忠実さを犠牲にすることなくスケーラブルな多視点再構成を可能にする。
論文 参考訳(メタデータ) (2026-07-02T08:37:56Z) - Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction [77.75911117889915]
現在のエンドツーエンドのマルチビュー3D再構成手法は、目覚ましい結果を得るが、制限的な静的仮定に依存している。
この理想的な入力への依存は、最も高度なメソッドでさえ、現実世界の設定で失敗する原因となる。
非一貫性の視点から頑健な再構築を行うためのエンドツーエンドフレームワークであるWildにおけるビジュアルジオメトリトランスフォーマーを提案する。
論文 参考訳(メタデータ) (2026-06-22T02:52:22Z) - MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation [59.75554954111619]
マルチビュー3D参照表現(MV-3DRES)を導入し、モデルがシーン構造を復元し、参照対象をスパースなマルチビュー画像から直接セグメント化する必要がある。
本稿では,言語情報をスパースビュー幾何学的推論に組み込む,効率的なエンドツーエンドフレームワークであるMultimodal Visual Geometry Grounded Transformer (MVGGT)を提案する。
実験により、MVGGTは最初の強力なベースラインを確立し、高精度かつ高速な推論を達成し、既存の選択肢よりも優れていることが示された。
論文 参考訳(メタデータ) (2026-01-11T11:44:07Z) - VGGT-DP: Generalizable Robot Control via Vision Foundation Models [13.41554759983567]
VGGT-DPは、事前学習された3次元知覚モデルから幾何的先入観を受容的フィードバックと統合するビジュモータ・ポリシー・フレームワークである。
我々は,視覚的エンコーダとしてVGGT(Visual Geometry Grounded Transformer)を採用し,視覚的知覚と内部ロボットの状態との整合性を実現するために,プロプリセプション誘導型視覚学習戦略を導入する。
挑戦的なMetaWorldタスクの実験では、VGGT-DPはDPやDP3のような強力なベースライン、特に精度クリティカルで長期のシナリオにおいて著しく優れていた。
論文 参考訳(メタデータ) (2025-09-23T08:15:30Z) - 3D Gaussian Splatting Driven Multi-View Robust Physical Adversarial Camouflage Generation [50.03578546845548]
物理敵攻撃法は、ディープニューラルネットワークの脆弱性を露呈し、自律運転のような安全クリティカルなシナリオに重大な脅威をもたらす。
カモフラージュをベースとした物理的な攻撃は、パッチベースの攻撃よりも有望なアプローチであり、複雑な物理的環境においてより強力な対逆効果を提供する。
本稿では,PGAと命名された3Dガウススティング(3DGS)に基づく物理的攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-02T05:10:16Z) - DiVE: Efficient Multi-View Driving Scenes Generation Based on Video Diffusion Transformer [56.98400572837792]
DiVEは高忠実で、時間的コヒーレントで、相互に一貫したマルチビュービデオを生成する。
これらの革新は総じて、最小品質の劣化を伴う2.62倍のスピードアップを達成する。
論文 参考訳(メタデータ) (2025-04-28T09:20:50Z) - One Noise to Rule Them All: Multi-View Adversarial Attacks with Universal Perturbation [1.4680035572775534]
本稿では,3次元物体認識における頑健な多視点対角的例を生成するために,新しい普遍摂動法を提案する。
単一のビューに制限された従来の攻撃とは異なり、我々のアプローチは複数の2Dイメージで動作し、実用的でスケーラブルなソリューションを提供する。
論文 参考訳(メタデータ) (2024-04-02T20:29:59Z) - Hyper-VolTran: Fast and Generalizable One-Shot Image to 3D Object
Structure via HyperNetworks [53.67497327319569]
画像から3Dまでを1つの視点から解く新しいニューラルレンダリング手法を提案する。
提案手法では, 符号付き距離関数を表面表現として使用し, 幾何エンコードボリュームとハイパーネットワークスによる一般化可能な事前処理を取り入れた。
本実験は,一貫した結果と高速な生成による提案手法の利点を示す。
論文 参考訳(メタデータ) (2023-12-24T08:42:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。