論文の概要: A Degradation-Tolerance Benchmark for Camera-Only End-to-End Driving
- arxiv url: http://arxiv.org/abs/2608.29005v1
- Date: Sat, 29 Aug 2026 02:34:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 13:06:07.836948
- Title: A Degradation-Tolerance Benchmark for Camera-Only End-to-End Driving
- Title(参考訳): カメラ専用エンド・ツー・エンド駆動のための耐劣化性ベンチマーク
- Authors: Haohua Que, Handong Yao,
- Abstract要約: DriveDegradeは、カメラのみのE2Eドライブにおける画像劣化耐性のベンチマークである。
軽度の劣化は計画にはほとんど影響を与えず、それを壊す家族は重度の最中に明確な閾値を持つ。
- 参考スコア(独自算出の注目度): 0.4588028371034407
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Camera-only end-to-end (E2E) driving models are nearing deployment, where the camera stream is degraded by blur, noise, low light, weather, frame loss, and memory faults. How much a policy tolerates before its driving breaks is unclear. Corruption-robustness benchmarks target detection or bird's-eye-view perception, not the planning output that drives the car. We present DriveDegrade, a benchmark for image-degradation tolerance in camera-only E2E driving. Sixteen corruption families at five severities are injected on the fly inside the image loader, one operator reaching fifteen policies, and we evaluate open-loop planning on nuScenes and NAVSIM plus a CARLA closed-loop anchor. First, mild degradation barely affects planning, and the families that break it have a clear threshold at mid severity. Second, fragility is corruption-dependent: blur, JPEG, and raindrop damage planning most, while weather and bit error are tolerated far into the range. Third, a flat curve is ambiguous, so we separate corruptions that degrade the image from those that remove it. A planner that reads its camera must lose accuracy when information is deleted, whatever it does under quality loss. On these two axes the planners separate sharply, quantifying the ego-status shortcut without mistaking indifference for robustness. A released vision-language-action planner is flat on both axes, and blinding all six of its cameras costs it only 11.5 percent.
- Abstract(参考訳): カメラのみのエンド・ツー・エンド(E2E)駆動モデルは、ブラー、ノイズ、低光、天候、フレーム損失、メモリ障害によってカメラストリームが劣化するデプロイメントに近づいている。
運転停止前にどれだけの政策が容認されるかは不明だ。
破壊破壊性ベンチマークは、車を駆動する計画出力ではなく、目標検出または鳥の目視知覚を目標とする。
カメラのみのE2E駆動における画像劣化耐性のベンチマークであるDriveDegradeを提案する。
画像ローダ内では16の汚職家族がハエに注入され、1人のオペレーターが15のポリシーに到達し、我々はnuScenesとNAVSIMとCARLAクローズドループアンカーのオープンループ計画を評価する。
第一に、軽度の劣化は計画にほとんど影響を与えず、それを壊す家族は深刻度の中盤に明確な閾値を持つ。
第二に、不安定性は腐敗に依存し、ぼやけ、JPEG、雨滴の被害が最も多く計画されている。
第3に、平坦な曲線は曖昧であるので、画像を削除したものから分解する汚職を分離します。
カメラを読み取るプランナーは、情報が削除されたときに正確さを失う必要がある。
これら2つの軸上で、プランナーは鋭く分離し、強靭性に対する無関心を誤ることなく、エゴスタットのショートカットを定量化する。
発売予定のヴィジュアル・ランゲージ・アクション・プランナーは両軸に平らで、カメラ6台を点滅させると11.5パーセントのコストしかかからない。
関連論文リスト
- A VideoMAE-v2 Approach to Zero-Shot Traffic Accident Anticipation [20.309082260025992]
本稿では,フレームレベルの時間的リスク推定タスクと,粗いラベル付き2値事故データセットとのギャップを埋める枠組みを提案する。
本手法は,2026年CVPR@AUTOPILOTゼロショット事故予測大会で2位となる。
論文 参考訳(メタデータ) (2026-06-08T14:25:16Z) - Bench2Drive-Robust: Benchmarking Closed-Loop Autonomous Driving under Deployment Perturbations [122.22391796628408]
Bench2Drive-Robustは、クローズドループのエンドツーエンド自動運転のための最初のデバイス中心の堅牢性ベンチマークである。
我々は,カメラストリーム障害,エゴ状態推定誤差,計算による制御遅延という3つの主要な原因から生じる展開指向の摂動を系統的に評価した。
以上の結果から,これらの展開に伴う摂動は閉ループ駆動性能を著しく低下させる可能性が示唆された。
論文 参考訳(メタデータ) (2026-05-18T08:45:24Z) - DRIVE-C: A Controlled Corruption Dataset for Autonomous Driving [0.0]
DRIVE-Cは、自律運転システムの視覚知覚を評価するために設計された制御された汚職データセットである。
昼間、夜間、都市部、農村部、高速道路、駐車場で収集された現実の前方向け運転ビデオから構築されている。
データセットには、10のクリーンクリップと600の破損したクリップが含まれ、5つの深刻度レベルにわたる12のカメラ劣化タイプにまたがる。
論文 参考訳(メタデータ) (2026-05-10T21:36:56Z) - Hierarchical Reasoning with Vision-Language Models for Incident Reports from Dashcam Videos [0.03598453624340711]
本稿では,ダッシュカムビデオからのインシデントレポート生成のための階層的推論フレームワークを提案する。
視覚言語モデルにフレームレベルのキャプション、インシデントフレームの検出、微粒化推論を統合する。
公式の2COOOLオープンリーダーボードでは、29チーム中2位にランクされ、最高のCIDEr-Dスコアを獲得しています。
論文 参考訳(メタデータ) (2025-10-14T06:36:41Z) - Goal-Based Vision-Language Driving [2.1485350418225244]
NovaDriveは、フロントカメライメージ、HDマップタイル、LiDAR深さ、テキストのウェイポイントを単一のブランチで処理する、単一ブランチの視覚言語アーキテクチャである。
軽量で2段階のクロスアテンションブロックは、最初にウェイポイントトークンをHDマップと整列させ、その後、きめ細かい画像や奥行きのパッチに注意を向ける。
視覚言語バックボーンの上位15層を微調整し、リアルタイムの推論を可能にします。
論文 参考訳(メタデータ) (2025-07-30T19:12:42Z) - Improved Single Camera BEV Perception Using Multi-Camera Training [4.003066044908734]
大規模生産において、コスト効率は最適化の目標であり、カメラの使用を減らすことがより重要になる。
これにより、低コストのセンサー設定で十分な性能を提供するBEV知覚モデルの開発が問題となる。
本研究の目的は,最新のマルチカメラサラウンドビューモデルを用いて,上記の性能低下を極力低減することである。
論文 参考訳(メタデータ) (2024-09-04T13:06:40Z) - ScatterNeRF: Seeing Through Fog with Physically-Based Inverse Neural
Rendering [83.75284107397003]
本稿では,シーンをレンダリングし,霧のない背景を分解するニューラルネットワークレンダリング手法であるScatterNeRFを紹介する。
本研究では,散乱量とシーンオブジェクトの非絡み合い表現を提案し,物理に着想を得た損失を伴ってシーン再構成を学習する。
マルチビューIn-the-Wildデータをキャプチャして,大規模な霧室内でのキャプチャを制御し,本手法の有効性を検証した。
論文 参考訳(メタデータ) (2023-05-03T13:24:06Z) - Cognitive Accident Prediction in Driving Scenes: A Multimodality
Benchmark [77.54411007883962]
本研究では,視覚的観察と運転者の注意に対する人為的な文章記述の認識を効果的に活用し,モデルトレーニングを容易にする認知事故予測手法を提案する。
CAPは、注意テキスト〜ビジョンシフト融合モジュール、注意シーンコンテキスト転送モジュール、運転注意誘導事故予測モジュールによって構成される。
我々は,1,727件の事故ビデオと219万フレーム以上の大規模ベンチマークを構築した。
論文 参考訳(メタデータ) (2022-12-19T11:43:02Z) - Minimum Latency Deep Online Video Stabilization [77.68990069996939]
本稿では,オンラインビデオ安定化作業のための新しいカメラパス最適化フレームワークを提案する。
本研究では,近年の市販の高品位深度モーションモデルを用いて動き推定を行い,カメラの軌道を復元する。
我々の手法は、定性的にも量的にも最先端のオンライン手法を大きく上回っている。
論文 参考訳(メタデータ) (2022-12-05T07:37:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。