論文の概要: REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles
- arxiv url: http://arxiv.org/abs/2607.05649v1
- Date: Mon, 06 Jul 2026 21:25:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.332413
- Title: REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles
- Title(参考訳): ReVIVE: 自律走行車におけるヴァンダリズム検出と回復のためのマルチモーダルフレームワーク
- Abstract要約: 本稿では,視覚能力向上のためのVandalized Image for Vision Excellence(REVIVE)フレームワークの回復と拡張について述べる。
これは、バイナリVOA検出、(2)マルチクラスVOAパターン識別、(3)効率の良いNetベースのU-Netセグメンテーション、(4)タイプ認識リカバリを統合している。
500個の追跡されたクリーン/バンダライズされた画像対において、未発見のVOAsはYOLOv8lのオブジェクト検出リコールを0.588に削減し、直接のピクセル置換は0.967とF1スコアを0.970にリコールした。
- 参考スコア(独自算出の注目度): 0.6445605125467572
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Autonomous vehicles (AVs) face increasing threats from vandalism-induced occlusion attacks (VOAs) that compromise camera-based perception. While detection frameworks can identify vandalized images, restoring camera-stream utility after physical occlusion remains underexplored. This paper presents present the Recovery and Enhancement of Vandalized Images for Vision Excellence (REVIVE) framework, a vandalism recovery pipeline integrating: (1) binary VOA detection, (2) multi-class VOA pattern identification, (3) EfficientNet-based U-Net segmentation, and (4) type-aware recovery using Bootstrapping Language-Image Pre-training (BLIP)-guided Stable Diffusion inpainting, direct pixel replacement, or adaptive median filtering. Stable Diffusion shows variable reconstruction performance (per-pattern SSIM 0.667-0.867, PSNR 15.4-26.7dB) across VOA patterns, while aligned direct pixel replacement achieves near-identical reconstruction under the aligned-reference condition. On 500 tracked clean/vandalized image pairs, unrecovered VOAs reduce YOLOv8l object-detection recall to 0.588, while direct pixel replacement restores recall to 0.967 and F1-score to 0.970 under that aligned-reference condition. LaMa, Telea, and Navier-Stokes baselines improve image similarity but provide more limited downstream detection recovery, and Stable Diffusion is treated as an asynchronous recovery branch subject to a quality gate rather than a blocking real-time perception step. We evaluate a reference-available quality gate that filters recovered candidates before downstream use: without it, type-aware routing degrades per-image recall to 0.304, whereas with it, recall returns to 0.608, at or above the unrecovered baseline, ensuring the forwarded stream is never worse than the unrecovered frame. REVIVE therefore, provides a structured recovery framework from VOAs in AVs.
- Abstract(参考訳): 自律走行車(AV)は、カメラによる知覚を損なう破壊行為による閉塞攻撃(VOA)の脅威が増大する。
検出フレームワークは破壊的なイメージを識別できるが、物理的排除後のカメラストリームユーティリティの回復は未調査のままである。
本稿では,(1)バイナリVOA検出,(2)マルチクラスVOAパターン識別,(3)効率的なNetベースのU-Netセグメンテーション,(4)Bootstrapping Language-Image Pre-training (BLIP)誘導の安定拡散処理,直接ピクセル置換,あるいは適応型中央フィルタリングによるタイプアウェアリカバリを行う。
安定拡散は、VOAパターン間の可変再構成性能(パターンごとのSSIM 0.667-0.867、PSNR 15.4-26.7dB)を示す一方、アライメントされた直接画素置換は、アライメント参照条件下でほぼ同一の再構成を実現する。
500個の追跡されたクリーン/バンダライズされた画像対において、未発見のVOAsはYOLOv8lのオブジェクト検出リコールを0.588に減らし、直接のピクセル置換はアライメント参照条件下で0.967とF1スコアを0.970にリコールする。
LaMa、Telea、Navier-Stokesのベースラインは画像類似性を向上するが、より制限された下流検出回復を提供し、安定拡散はブロックリアルタイム認識ステップではなく、品質ゲートを受ける非同期回復分岐として扱われる。
我々は、ダウンストリーム使用前に検索候補をフィルタリングする参照可能な品質ゲートの評価を行う:それなしでは、タイプ認識ルーティングは画像毎のリコールを0.304に低下させるが、それに対して、未検索ベースライン以上の0.608にリコールし、フォワードストリームが未取得フレームよりも悪くならないようにする。
したがって、REVIVEはAVのVOAから構造化された回復フレームワークを提供する。
関連論文リスト
- Restore What Matters: Lessons from Joint Restoration and Recognition [72.91692240810536]
認識パイプラインは通常、再認識ワークフローを採用するが、数十年の経験から、視覚的に満足な画像を生成することは、認識を改善するためにめったにないことを示している。
下流のタスクが本当に必要とするものだけを復元し、タスク信号がどこで、どのくらい、そして、修復が必要なのかを判断する。
我々は、より良い外観のイメージは必要でも十分でもないと結論付け、復元モジュールはタスク駆動で、選択的で、物理的に認識されなければならない。
論文 参考訳(メタデータ) (2026-09-12T08:08:08Z) - Balancing Emotional Alignment and Semantic Consistency in Image Generation via Reinforcement Learning with Valence-Arousal Anchoring [55.57242007016976]
テキスト・ツー・イメージ生成における継続的な感情制御は、プロンプトによって記述されたオブジェクトやレイアウト、シーンを変更することなく、感情的アライメントを改善するモデルを必要とする。
既存の教師付き感情注入法は、しばしば特徴空間プロキシを最適化し、したがって感情のセマンティックドリフトを示す。
本稿では,連続的原子価覚醒条件設定,グループ相対ポリシー最適化,中立的セマンティックアンカーを組み合わせたフローマッチング画像生成フレームワークを用いてこの問題に対処する。
論文 参考訳(メタデータ) (2026-09-11T13:24:35Z) - DRIFT: Removing Diffusion Watermarks by Deflecting the Generative Trajectory [9.706332101916248]
拡散透かしは、検証可能な信号を生成過程に埋め込む。
我々は,部分的な前方拡散と逆再サンプリングを組み合わせたブラックボックス攻撃であるDRIFTを提案する。
3つのパラダイムにまたがる9つの透かしのうち、DRIFTは98-100%の攻撃成功と最高の画質を達成する。
論文 参考訳(メタデータ) (2026-09-08T03:54:17Z) - Restoring Without Forgetting: Continual Learning Across Image Degradations [6.288045889067255]
画像復元の最近の進歩は、単一のネットワーク内で複数の劣化を共同処理するオールインワンアーキテクチャに集約されている。
実際には、フィールドデプロイシステムは徐々に新しい環境条件に直面しているため、分解が順次発生する。
連続的なドメイン・インクリメンタルな学習問題として,多段劣化画像復元を定式化する。
論文 参考訳(メタデータ) (2026-08-24T20:04:18Z) - Bend the Basics: Degradation-Aware Deformable Tokenization for All-in-One Image Restoration [72.64498743287601]
オールインワン画像復元は、多様で空間的に一様でない腐敗によって劣化した画像を復元できる単一のモデルを求める。
パイプライン全体にわたる劣化認識をモデル化するフレキシブル・イメージ・トランスフォーマー(FIT)を提案する。
FITは、30.72dBの平均PSNRを5次劣化設定で32.83dBを3次劣化設定で達成し、最近の統一修復法を+0.5$sim$1.1dBで上回った。
論文 参考訳(メタデータ) (2026-08-07T05:44:31Z) - Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution [51.31474187379532]
Scene Text Image Super- resolution (STISR) は、劣化した入力から文字の意味を保ちながら、視覚的に可視な外観を回復することを目的としている。
本稿では,STISRを連成連続離散生成として定式化する統合フレームワークであるDualTSRを提案する。
条件付きフローマッチングは連続した画像ラテントを復元し、吸収状態の離散拡散はテキストトークンを再構成する。
論文 参考訳(メタデータ) (2026-08-05T06:57:30Z) - Gaussian Process Prior Variational Autoencoder for Endoscopic Videos [6.831828660437534]
ビデオシーケンスは、スペックリフレクション、モーションアーティファクト、欠落フレームによって定期的に劣化する。
内視鏡的ビデオ修復のためのGPVAE(Gaussian Process Prior Variational Autoencoder)フレームワークを提案する。
C3VDv2の大腸内視鏡データセットでは、最高のGPVAE変種は画像再構成RMSEを平均21.9%削減した。
論文 参考訳(メタデータ) (2026-06-18T08:03:55Z) - Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation [50.139984798361375]
遅延不一致による冗長性を除去する学習自由フレームワークを提案する。
LD-Pruningは、Infinity-8Bの最大2.35倍のスピードアップを実現し、高い生成品質を維持しながら推論を大幅に削減する。
論文 参考訳(メタデータ) (2026-05-29T19:34:39Z) - Restoration-Aligned Generative Flow Models for Blind Motion Deblurring [57.425021485907756]
本稿では,フロー軌跡自体を再構成することで,不整合を解消するフレームワークであるDeFlowを紹介する。
この定式化の下では、標準フローマッチング損失は自然に残留損失の形を取る。
GoPro、HIDE、RealBlur、RWBIの実験では、DeFlowは強力な復元忠実性と知覚リアリズムを実現している。
論文 参考訳(メタデータ) (2026-05-09T10:05:51Z) - SoLAR: Error-Resilient Streamable Long-Horizon Free-Viewpoint Video Reconstruction with Anchor Activation and Latent Recalibration [57.159190580279585]
ビット割り当て理論により、速度歪み最適化フレームワーク内で動的アンカーベースのボリュームビデオ表現を解析する。
我々は,長いシーケンスの復元品質を安定的に維持する,エラー回復性の最初のFVVフレームワークである textbfSoLAR を提案する。
論文 参考訳(メタデータ) (2026-05-08T06:48:59Z) - UniV2D: Bridging Visual Restoration and Semantic Perception for Underwater Salient Object Detection [71.83097731030254]
視覚的回復と有能な物体検出を協調的に最適化するUnified Vision-to-Detection Network (UniV2D)を提案する。
UniV2Dは、セマンティック駆動学習パラダイムを導入している。
定量評価と定性評価の両方において最先端の手法を著しく上回る。
論文 参考訳(メタデータ) (2026-05-08T02:31:45Z) - Compositional-Degradation UAV Image Restoration: Conditional Decoupled MoE Network and A Benchmark [27.358052049742764]
UAV画像は、大面積マッピング、インフラ検査、緊急応答などのアプリケーションに重要である。
現実の飛行環境では、雨や迷路、騒音など、複数の劣化要因によって単一の画像が影響を受けることが多い。
DAME-Netは、劣化条件付き再構成から明確な劣化知覚を分離する、劣化認識用混合処理ネットワークである。
論文 参考訳(メタデータ) (2026-04-10T13:27:39Z) - D3R-Net: Dual-Domain Denoising Reconstruction Network for Robust Industrial Anomaly Detection [0.0]
非教師付き異常検出(UAD)は、現代の製造において、自動視覚検査の鍵となる要素である。
本稿では、D3R-Netについて紹介する。D3R-Netは、自己教師型「癒し」タスクと周波数認識正規化を結合したデュアルドメイン・デノベーション・コンストラクションフレームワークである。
空間平均二乗誤差に加えて、周波数領域の整合性を促進するFast Fourier Transform (FFT) 等級損失を用いる。
論文 参考訳(メタデータ) (2026-01-27T23:21:59Z) - Learning to Restore Multi-Degraded Images via Ingredient Decoupling and Task-Aware Path Adaptation [51.10017611491389]
現実のイメージは、雨、騒音、ヘイズのような複数の共存する劣化に悩まされることが多い。
本稿では, 劣化成分の分解表現を利用して, 画像の再構成を行う適応型多重劣化画像復元ネットワークを提案する。
その結果、IMDNetと呼ばれる密に統合されたアーキテクチャは、実験を通じて広範囲に検証されている。
論文 参考訳(メタデータ) (2025-11-07T01:50:36Z) - Delving into Cascaded Instability: A Lipschitz Continuity View on Image Restoration and Object Detection Synergy [95.93943805282868]
リプシッツ規則化物体検出(LROD)
本稿では,リプシッツ規則化YOLO(LR-YOLO)を提案する。
ヘイズと低照度ベンチマークの実験では、LR-YOLOは検出安定性、最適化のスムーズさ、全体的な精度を一貫して改善している。
論文 参考訳(メタデータ) (2025-10-28T09:41:42Z) - CapRecover: A Cross-Modality Feature Inversion Attack Framework on Vision Language Models [11.201984255831126]
CapRecoverは、ラベルやキャプションなどの高レベルのセマンティックコンテンツを、画像再構成なしで中間機能から直接復元する。
本稿では,各層における中間機能にランダムノイズを付加し,次層におけるノイズを除去する,シンプルで効果的な保護手法を提案する。
論文 参考訳(メタデータ) (2025-07-30T16:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。