論文の概要: Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction
- arxiv url: http://arxiv.org/abs/2607.12293v1
- Date: Tue, 14 Jul 2026 03:05:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.017907
- Title: Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction
- Title(参考訳): 歩行者交叉意図予測のためのスパース注意を伴う適応的クロスモーダルフュージョン
- Abstract要約: ADAPT(Adaptive Domain-Aware Pedestrian Crossing Transformer)は、歩行者の横断意図を予測するための多モードフレームワークである。
ADAPTは、RGB画像、局所深度マップ、グローバルセマンティックマップ、グローバル深度マップを含む4つの整列された視覚モードを処理する。
JAADとPIEベンチマークデータセットの実験は、ADAPTが既存の最先端メソッドを一貫して上回っていることを示している。
- 参考スコア(独自算出の注目度): 4.8915598762204135
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Predicting pedestrian crossing intention is a safety-critical task for autonomous driving, yet existing approaches often rely on single-modal inputs or dense multimodal fusion strategies that inadequately capture complementary visual and kinematic information while introducing redundant inter-modal interactions. We propose ADAPT (Adaptive Domain-Aware Pedestrian Crossing Transformer), a multimodal framework that jointly models local and global visual context together with temporal motion dynamics for accurate pedestrian crossing intention prediction. ADAPT processes four spatially aligned visual modalities, including RGB images, local depth maps, global semantic maps, and global depth maps, together with ego-vehicle speed, pedestrian bounding boxes, and skeleton pose information through five specialized modules: a weight-shared Swin Transformer V2 backbone for visual feature extraction, a Cross-Modality Guided Attention module for hierarchical visual fusion, a Mamba-based Motion Feature Encoding module for efficient temporal modeling, a Sparse Cross-Modal Attention module that selectively preserves the most informative inter-modal interactions, and a Vision Transformer-based Temporal Feature Fusion module for sequence-level prediction. Extensive experiments on the JAAD and PIE benchmark datasets demonstrate that ADAPT consistently outperforms existing state-of-the-art methods while maintaining low computational complexity. On JAAD, the proposed method achieves an AUC of 0.73 on JAADbeh and 0.85 on JAADall, while on PIE it achieves an accuracy of 0.92 and an AUC of 0.90. Furthermore, ADAPT performs inference in only 17.23 ms per sample, offering an effective balance between predictive accuracy and real-time deployment efficiency for intelligent transportation and autonomous driving applications.
- Abstract(参考訳): 歩行者横断意図の予測は自動運転の安全上重要な課題であるが、既存のアプローチでは、冗長なモーダル間相互作用を導入しながら、補完的な視覚情報や運動情報を不十分にキャプチャする単一モーダル入力や密集多モーダル融合戦略に頼っていることが多い。
本稿では,局所的およびグローバルな視覚コンテキストと時間的動きのダイナミクスを併用した,正確な歩行者横断意図予測のためのマルチモーダルフレームワークであるADAPTを提案する。
ADAPTは、RGB画像、局所深度マップ、グローバルセマンティックマップ、およびグローバル深度マップを含む4つの空間的に整合した視覚的モダリティを処理し、エゴ車速度、歩行者境界ボックス、骨格は、視覚的特徴抽出のためのウェイトシェアリングスウィントランスフォーマーV2バックボーン、階層的視覚融合のためのクロスモダリティガイド付アテンションモジュール、効率的な時間的モデリングのためのマンバベースのモーション・フィーチャー・アテンションモジュール、最も情報性の高いインターモーダル相互作用を選択的に保存するスパース・クロスモーダル・アテンションモジュール、シーケンスレベルの予測のためのビジョン・トランスフォーマーベースのテンポラル・フィーチャー・イリュージョンモジュールの5つの特別なモジュールを通して情報を提供する。
JAADとPIEベンチマークデータセットの大規模な実験は、ADAPTが計算複雑性を低く保ちながら既存の最先端手法を一貫して上回っていることを示している。
JAAD では JAADbeh では 0.73 、JAADall では 0.85 、PIE では 0.92 、AUC では 0.90 となる。
さらに、ADAPTは1サンプル当たり17.23ミリ秒で推論を行い、インテリジェントトランスポートと自律運転アプリケーションのための予測精度とリアルタイムデプロイメント効率の効果的なバランスを提供する。
関連論文リスト
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - BMCR: Adaptive Backbone Module Composition via Reinforcement Learning for Remote Sensing Object Detection [4.303688954031907]
オブジェクト検出検出のための強化学習(BMCR)によるバックボーンモジュール構成を提案する。
BMCRは、既製のCNNとViTのバックボーンから分解された再利用可能なモジュールから入力適応推論パスを組み立てる。
BMCRは, それぞれ79.31%, 73.41%, 71.86% mAPを達成し, 強い静的および動的ベースラインを2.5ポイント超えた。
論文 参考訳(メタデータ) (2026-06-04T02:04:15Z) - DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking [10.270441242480482]
本稿では,マルチモーダル融合を反復的特徴アライメントプロセスとして再構成する新しいフレームワークであるDM$3$Tを提案する。
提案するクロスモーダル拡散融合(C-MDF)モジュールを用いて,反復的クロスモーダル調和を行う。
トラッカーのロバスト性をさらに向上するために,信頼性推定を適応的に処理する階層型トラッカーを設計する。
論文 参考訳(メタデータ) (2025-11-28T06:02:58Z) - ACIT: Attention-Guided Cross-Modal Interaction Transformer for Pedestrian Crossing Intention Prediction [3.878105750489656]
本稿では,歩行者横断意図予測のための注意誘導型クロスモーダル・インタラクション・トランス (ACIT) を提案する。
ACITは6つの視覚的モダリティと運動的モダリティを活用し、3つの相互作用ペアにグループ化される。
ACITは最先端の手法より優れており、JAADbehとJAADallのデータセットで70%と89%の精度を達成する。
論文 参考訳(メタデータ) (2025-11-25T07:41:11Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - DiFSD: Ego-Centric Fully Sparse Paradigm with Uncertainty Denoising and Iterative Refinement for Efficient End-to-End Self-Driving [55.53171248839489]
我々は、エンドツーエンドの自動運転のためのエゴ中心の完全スパースパラダイムであるDiFSDを提案する。
特に、DiFSDは主にスパース知覚、階層的相互作用、反復的な運動プランナーから構成される。
nuScenesとBench2Driveデータセットで実施された実験は、DiFSDの優れた計画性能と優れた効率を実証している。
論文 参考訳(メタデータ) (2024-09-15T15:55:24Z) - Trajeglish: Traffic Modeling as Next-Token Prediction [67.28197954427638]
自動運転開発における長年の課題は、記録された運転ログからシードされた動的運転シナリオをシミュレートすることだ。
車両、歩行者、サイクリストが運転シナリオでどのように相互作用するかをモデル化するために、離散シーケンスモデリングのツールを適用します。
我々のモデルはSim Agents Benchmarkを上回り、リアリズムメタメトリックの先行作業の3.3%、インタラクションメトリックの9.9%を上回ります。
論文 参考訳(メタデータ) (2023-12-07T18:53:27Z) - Ret3D: Rethinking Object Relations for Efficient 3D Object Detection in
Driving Scenes [82.4186966781934]
Ret3Dと呼ばれるシンプルで効率的で効果的な2段階検出器を導入する。
Ret3Dの中核は、新しいフレーム内およびフレーム間関係モジュールの利用である。
無視できる余分なオーバーヘッドにより、Ret3Dは最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-08-18T03:48:58Z) - Joint Spatial-Temporal and Appearance Modeling with Transformer for
Multiple Object Tracking [59.79252390626194]
本稿ではTransSTAMという新しい手法を提案する。Transformerを利用して各オブジェクトの外観特徴とオブジェクト間の空間的時間的関係の両方をモデル化する。
提案手法はMOT16, MOT17, MOT20を含む複数の公開ベンチマークで評価され, IDF1とHOTAの両方で明確な性能向上を実現している。
論文 参考訳(メタデータ) (2022-05-31T01:19:18Z) - Multi-Modal Fusion Transformer for End-to-End Autonomous Driving [59.60483620730437]
画像表現とLiDAR表現を注目で統合する,新しいマルチモードフュージョントランスフォーマであるTransFuserを提案する。
本手法は, 衝突を76%低減しつつ, 最先端駆動性能を実現する。
論文 参考訳(メタデータ) (2021-04-19T11:48:13Z) - Shared Cross-Modal Trajectory Prediction for Autonomous Driving [24.07872495811019]
本稿では,複数入力モダリティの利用のメリットを活かしたクロスモーダルな埋め込みフレームワークを提案する。
2つのベンチマーク駆動データセットを用いて,提案手法の有効性を示すため,広範囲な評価を行った。
論文 参考訳(メタデータ) (2020-11-15T07:18:50Z) - Shared Cross-Modal Trajectory Prediction for Autonomous Driving [24.07872495811019]
本稿では,複数入力モダリティの利用のメリットを活かしたクロスモーダルな埋め込みフレームワークを提案する。
2つのベンチマーク駆動データセットを用いて,提案手法の有効性を示すため,広範囲な評価を行った。
論文 参考訳(メタデータ) (2020-04-01T02:44:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。