論文の概要: FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness
- arxiv url: http://arxiv.org/abs/2607.10071v1
- Date: Sat, 11 Jul 2026 01:51:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.287561
- Title: FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness
- Title(参考訳): FlashBEV:IOを意識した高速かつメモリ効率の良いBEV変換
- Abstract要約: バードアイビュー(Bird's-eye-view、BEV)は、自律運転におけるカメラベースの3D理解の中核となる要素である。
サンプリング-VTは高分解能および長距離知覚のための高密度かつ連続的なBEVアグリゲーションをサポートするため、魅力的である。
Smpling-VTの標準化された実装は、大きな高さ依存の中間体を明示的に実現している。
我々は,Smpling-VT(Same operator output)と数学的に等価なFlashBEVを提案し,グローバルメモリトラフィックとカーネル起動オーバーヘッドを大幅に低減した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Bird's-eye-view (BEV) perception is a core component of camera-based 3D understanding in autonomous driving, where view transformation (VT) maps multi-camera image features into a unified BEV representation. Sampling-based view transformation (Sampling-VT) is attractive because it supports dense and continuous BEV aggregation for high-resolution and long-range perception. Its deployment bottleneck, however, is systems-level: standard tensorized implementations of Sampling-VT -- which we refer to as Tensorized Sampling-VT -- explicitly materialize large height-dependent intermediate tensors, causing memory and latency costs that scale poorly with vertical resolution and the number of cameras. We revisit Tensorized Sampling-VT from an operator-execution perspective and show that it follows a gather-reduction pattern: each BEV query independently accumulates contributions across cameras and height bins, enabling thread-local accumulation with on-the-fly recomputation that eliminates the need to materialize height- and camera-dependent intermediates. Based on this insight, we propose FlashBEV, a fully fused and IO-aware execution strategy mathematically equivalent to Tensorized Sampling-VT (same operator output) while substantially reducing global memory traffic and kernel-launch overhead. Experiments show that FlashBEV achieves more than an order of magnitude lower peak GPU memory and significant inference-latency speedups, with memory effectively independent of the number of height bins, reducing the operator's peak memory to O(BCXY) (output only). This unlocks higher BEV range/resolution and vertical discretization within fixed deployment budgets on memory-constrained devices. Our contribution is an execution redesign -- same math, different execution -- that removes a key scalability barrier for deployment-ready Sampling-VT. Code available at https://github.com/yokosyun/FlashBEV
- Abstract(参考訳): Bird's-eye-view(BEV)知覚は、ビュートランスフォーメーション(VT)がマルチカメラ画像の特徴を統合されたBEV表現にマッピングする、自律運転におけるカメラベースの3D理解のコアコンポーネントである。
サンプリングベースのビュートランスフォーメーション(Sampling-VT)は、高解像度で長距離の知覚のために、高密度かつ連続的なBEVアグリゲーションをサポートするため、魅力的である。
しかし、その展開ボトルネックはシステムレベルである: Smpling-VT の標準的なテンソル化実装 -- テンソル化 Smpling-VT は、高に依存する中間テンソルを明示的に具体化し、垂直解像度とカメラ数によってメモリと遅延コストが低くなる。
各BEVクエリは、カメラと高さビン間で独立してコントリビューションを蓄積し、オンザフライ再計算によるスレッドローカルなコントリビューションを可能にし、高さ依存とカメラ依存の中間体を具現化する必要がなくなる。
この知見に基づいて,全メモリトラフィックとカーネル起動オーバーヘッドを大幅に低減しつつ,テンソル化サンプリング-VT(Saming-VT)と数学的に等価な,完全に融合したIO対応実行戦略であるFlashBEVを提案する。
実験の結果、FlashBEVは最大GPUメモリの桁数以上を達成し、推論レイテンシの大幅な高速化を実現し、メモリは高さビンの数に事実上依存せず、演算子のピークメモリはO(BCXY)に減少する(出力のみ)。
これにより、メモリ制限されたデバイス上の固定されたデプロイメント予算内で、より高いBEVレンジ/解像度と垂直的な離散化が可能になる。
私たちのコントリビューションは実行の再設計 -- 同じ数学、異なる実行 -- です。
https://github.com/yokosyun/FlashBEV
関連論文リスト
- Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - CycleBEV: Regularizing View Transformation Networks via View Cycle Consistency for Bird's-Eye-View Semantic Segmentation [3.0447481187978886]
我々は、既存のビュー変換モデルを強化するCycleBEVと呼ばれる新しい正規化フレームワークを提案する。
サイクル一貫性に着想を得て,BEVセグメンテーションマップをPVセグメンテーションマップにマップする逆ビュートランスフォーメーション(IVT)ネットワークを考案した。
サイクル整合性を幾何空間と表現空間に拡張する2つの新しいアイデアを導入する。
論文 参考訳(メタデータ) (2026-02-27T00:56:02Z) - LSSInst: Improving Geometric Modeling in LSS-Based BEV Perception with Instance Representation [10.434754671492723]
本稿では,BEVおよびインスタンス表現をタンデムに組み込んだ2段階物体検出器であるLSSInstを提案する。
提案した検出器は、既存のLSSベースのBEVネットワークに柔軟に統合可能な、きめ細かいピクセルレベルの特徴を利用する。
提案するフレームワークは,高性能な一般化能力と性能を備え,ベルやホイッスルを使わずに,現代のLSSベースのBEV認識手法の性能を向上させる。
論文 参考訳(メタデータ) (2024-11-09T13:03:54Z) - fVDB: A Deep-Learning Framework for Sparse, Large-Scale, and High-Performance Spatial Intelligence [55.582429009401956]
fVDBは、大規模な3Dデータのディープラーニングのための新しいフレームワークである。
私たちのフレームワークは、既存のパイプラインとの相互運用性を可能にするPyTorchと完全に統合されています。
論文 参考訳(メタデータ) (2024-07-01T20:20:33Z) - Improving Bird's Eye View Semantic Segmentation by Task Decomposition [42.57351039508863]
元のBEVセグメンテーションタスクを,BEVマップ再構成とRGB-BEV機能アライメントという2つの段階に分割する。
我々のアプローチは、知覚と生成を異なるステップに組み合わせることの複雑さを単純化し、複雑で挑戦的なシーンを効果的に扱うためのモデルを構築します。
論文 参考訳(メタデータ) (2024-04-02T13:19:45Z) - U-BEV: Height-aware Bird's-Eye-View Segmentation and Neural Map-based Relocalization [81.76044207714637]
GPS受信が不十分な場合やセンサベースのローカライゼーションが失敗する場合、インテリジェントな車両には再ローカライゼーションが不可欠である。
Bird's-Eye-View (BEV)セグメンテーションの最近の進歩は、局所的な景観の正確な推定を可能にする。
本稿では,U-NetにインスパイアされたアーキテクチャであるU-BEVについて述べる。
論文 参考訳(メタデータ) (2023-10-20T18:57:38Z) - FB-BEV: BEV Representation from Forward-Backward View Transformations [131.11787050205697]
本稿では,Bird-Eye-View (BEV) 表現のためのビュートランスフォーメーションモジュール (VTM) を提案する。
我々は提案したモジュールをFB-BEVでインスタンス化し、nuScenesテストセット上で62.4%のNDSの最先端結果を達成する。
論文 参考訳(メタデータ) (2023-08-04T10:26:55Z) - BEV-IO: Enhancing Bird's-Eye-View 3D Detection with Instance Occupancy [58.926593676054424]
我々は,BEV表現をインスタンス占有情報で拡張する新しい3次元検出パラダイムであるBEV-IOを提案する。
BEV-IOは、パラメータや計算オーバーヘッドの無視できる増加しか加えず、最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-05-26T11:16:12Z) - A Cross-Scale Hierarchical Transformer with Correspondence-Augmented
Attention for inferring Bird's-Eye-View Semantic Segmentation [13.013635162859108]
マルチカメラビュー画像に条件付きBEVセマンティックセマンティックセマンティクスを推定することは、安価なデバイスとリアルタイム処理としてコミュニティで人気がある。
セマンティックセグメンテーション推論のための対応強化された注目度を持つ新しいクロススケール階層変換器を提案する。
マルチカメラビュー画像上でのBEVセマンティックセマンティックセグメンテーションの推測における最先端性能を有する。
論文 参考訳(メタデータ) (2023-04-07T13:52:47Z) - MatrixVT: Efficient Multi-Camera to BEV Transformation for 3D Perception [33.63530499693689]
本稿では, MatrixVT と呼ばれる3次元知覚のための, Bird's-Eye-View (BEV) ビュー変換手法を提案する。
我々の手法は、畳み込みと行列乗法(MatMul)のみで効率よくBEV特徴を生成する。
論文 参考訳(メタデータ) (2022-11-19T05:41:34Z) - Scalable Visual Transformers with Hierarchical Pooling [61.05787583247392]
本稿では,視覚的トークンを徐々にプールしてシーケンス長を縮小する階層的ビジュアルトランスフォーマ(hvt)を提案する。
計算の複雑さを増すことなく、深さ/幅/解像度/パッチサイズの寸法をスケールすることで、大きなメリットをもたらします。
当社のHVTはImageNetとCIFAR-100データセットの競合ベースラインを上回っています。
論文 参考訳(メタデータ) (2021-03-19T03:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。