論文の概要: SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection
- arxiv url: http://arxiv.org/abs/2605.14110v1
- Date: Wed, 13 May 2026 20:53:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.502894
- Title: SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection
- Title(参考訳): SToRe3D: 効率的な多視点3Dオブジェクト検出のためのViTのスパーストークン関連性
- Authors: Sandro Papais, Lezhou Feng, Charles Cossette, Lingting Ge,
- Abstract要約: ビジョントランスフォーマー(ViT)は強力なマルチビュー3D検出を可能にするが、高密度トークンからの高い推論遅延と、複数のビューと大きな3D領域にわたるクエリ処理によって制限される。
SToRe3Dは2次元画像トークンと3次元オブジェクトクエリを協調的に選択し、再活性化のためのフィルタ機能を格納する。
- 参考スコア(独自算出の注目度): 2.148411555253816
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Transformers (ViTs) enable strong multi-view 3D detection but are limited by high inference latency from dense token and query processing across multiple views and large 3D regions. Existing sparsity methods, designed mainly for 2D vision, prune or merge image tokens but do not extend to full-model sparsity or address 3D object queries. We introduce SToRe3D, a relevance-aligned sparsity framework that jointly selects 2D image tokens and 3D object queries while storing filtered features for reactivation. Mutual 2D-3D relevance heads allocate compute to driving-critical content and preserve other embeddings. Evaluated on nuScenes and our new nuScenes-Relevance benchmark, SToRe3D achieves up to 3x faster inference with marginal accuracy loss, establishing real-time large-scale ViT-based 3D detection while maintaining accuracy on planning-critical agents.
- Abstract(参考訳): ビジョントランスフォーマー(ViT)は強力なマルチビュー3D検出を可能にするが、高密度トークンからの高い推論遅延と、複数のビューと大きな3D領域にわたるクエリ処理によって制限される。
既存の空間的手法は、主に2次元視覚、プルーヌ、またはマージ画像トークン用に設計されているが、フルモデルの空間性や3次元オブジェクトクエリに拡張されていない。
SToRe3Dは2次元画像トークンと3次元オブジェクトクエリを協調的に選択し、再活性化のためのフィルタ機能を格納する。
相互2D-3D関連ヘッドは、計算を駆動クリティカルなコンテンツに割り当て、他の埋め込みを保存する。
nuScenesと新しいnuScenes-Relevanceベンチマークに基づいて、SToRe3Dは、限界精度の損失で最大3倍高速な推論を実現し、計画クリティカルエージェントの精度を維持しながら、大規模なVTベースの3D検出をリアルタイムに確立する。
関連論文リスト
- StereoMV2D: A Sparse Temporal Stereo-Enhanced Framework for Robust Multi-View 3D Object Detection [31.8104389684728]
本稿では2次元検出誘導多視点3D検出器に時間的ステレオモデリングを統合する統合フレームワークであるStereoMV2Dを提案する。
StereoMV2Dは、隣接するフレームにまたがる同じオブジェクトの時間的差異を利用して、深度知覚を強化し、クエリ先行を洗練する。
nuScenesとArgoverse 2データセットの実験により、StereoMV2Dは計算オーバーヘッドを発生させることなく、優れた検出性能を実現することが示された。
論文 参考訳(メタデータ) (2025-12-19T14:25:46Z) - Sparse Multiview Open-Vocabulary 3D Detection [27.57172918603858]
3Dオブジェクト検出は伝統的に、固定されたカテゴリのセットを検出するトレーニングによって解決されてきた。
本研究では,オープンボキャブラリによる3次元物体検出の課題について検討する。
我々のアプローチは、計算コストのかかる3D特徴フュージョンを使わずに、事前訓練されたオフザシェルフ2Dファンデーションモデルに頼っている。
論文 参考訳(メタデータ) (2025-09-19T12:22:24Z) - Make Your ViT-based Multi-view 3D Detectors Faster via Token Compression [78.93023152602525]
スロー推論速度は、自律運転のようなリアルタイムの要求の高いタスクにマルチビュー3D検出器を配置する上で最も重要な問題の一つである。
TokenCompression3D (ToC3D) と呼ばれるシンプルで効果的な方法を提案する。
提案手法は, 最大30%の推論スピードアップで最近のSOTAの性能をほぼ維持できる。
論文 参考訳(メタデータ) (2024-09-01T06:58:08Z) - DatasetNeRF: Efficient 3D-aware Data Factory with Generative Radiance Fields [68.94868475824575]
本稿では,無限で高品質な3Dアノテーションを3Dポイントクラウドセグメンテーションとともに生成できる新しいアプローチを提案する。
我々は3次元生成モデルに先立って強力なセマンティクスを活用してセマンティクスデコーダを訓練する。
トレーニングが完了すると、デコーダは遅延空間を効率よく一般化し、無限のデータの生成を可能にする。
論文 参考訳(メタデータ) (2023-11-18T21:58:28Z) - 3DiffTection: 3D Object Detection with Geometry-Aware Diffusion Features [70.50665869806188]
3DiffTectionは、単一の画像から3Dオブジェクトを検出する最先端の方法である。
拡散モデルを微調整し、単一の画像に条件付けされた新しいビュー合成を行う。
さらに、検出監視により、ターゲットデータ上でモデルをトレーニングする。
論文 参考訳(メタデータ) (2023-11-07T23:46:41Z) - 3D Small Object Detection with Dynamic Spatial Pruning [62.72638845817799]
本稿では,3次元小物体検出のための効率的な特徴解析手法を提案する。
空間分解能の高いDSPDet3Dというマルチレベル3次元検出器を提案する。
ほぼ全ての物体を検知しながら、4500k以上のポイントからなる建物全体を直接処理するには2秒もかからない。
論文 参考訳(メタデータ) (2023-05-05T17:57:04Z) - CMR3D: Contextualized Multi-Stage Refinement for 3D Object Detection [57.44434974289945]
本稿では,3次元オブジェクト検出(CMR3D)フレームワークのためのコンテキスト型マルチステージリファインメントを提案する。
我々のフレームワークは3Dシーンを入力として取り、シーンの有用なコンテキスト情報を明示的に統合しようと試みている。
3Dオブジェクトの検出に加えて,3Dオブジェクトカウント問題に対するフレームワークの有効性について検討する。
論文 参考訳(メタデータ) (2022-09-13T05:26:09Z) - SRCN3D: Sparse R-CNN 3D for Compact Convolutional Multi-View 3D Object
Detection and Tracking [12.285423418301683]
本稿では,スパースクエリ,ボックスワイズサンプリングによるスパースアテンション,スパース予測を組み込んだ新しい2段フルスパース検出器であるスパースR-CNN3Dを提案する。
nuScenesデータセットの実験では、SRCN3Dは3Dオブジェクト検出とマルチオブジェクト追跡の両方で競合性能を達成している。
論文 参考訳(メタデータ) (2022-06-29T07:58:39Z) - Graph-DETR3D: Rethinking Overlapping Regions for Multi-View 3D Object
Detection [17.526914782562528]
グラフ構造学習(GSL)による多視点画像情報を自動的に集約するグラフDETR3Dを提案する。
我々の最良のモデルは、nuScenesテストリーダーボード上で49.5 NDSを達成し、様々な画像ビュー3Dオブジェクト検出器と比較して新しい最先端技術を実現している。
論文 参考訳(メタデータ) (2022-04-25T12:10:34Z) - Improving 3D Object Detection with Channel-wise Transformer [58.668922561622466]
我々は手作りの最小限の設計で2段階の3Dオブジェクト検出フレームワーク(CT3D)を提案する。
CT3Dは、提案対応の埋め込みとチャンネルワイドコンテキストアグリゲーションを同時に行う。
これはKITTIテスト3D検出ベンチマークで中等車カテゴリーで81.77%のAPを達成した。
論文 参考訳(メタデータ) (2021-08-23T02:03:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。