論文の概要: LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design
- arxiv url: http://arxiv.org/abs/2607.01772v1
- Date: Thu, 02 Jul 2026 06:44:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.701581
- Title: LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design
- Title(参考訳): LLMを利用した自律運転用マルチモーダルフュージョンフレームワーク:セマンティックエンハンスメントとチャネル適応設計
- Authors: Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui,
- Abstract要約: 本稿では,大規模言語モデル中心のセマンティック・レイヤ・チャネル・アウェア・インテグレート・パーセプション・フレームワークを提案する。
ローカルな視覚ストリームと、知覚盲点をカバーするために使用される品質の変化した外部レーダーストリームを融合させる。
nuScenesとVIRATの実験は、我々のアプローチを検証する。
- 参考スコア(独自算出の注目度): 56.76240343283953
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-radar fusion is central to robust autonomous driving, combining dense visual semantics with precise range and velocity measurements from radar. However, real-world fusion quality is fundamentally challenged by dynamically varying input quality, stemming from occlusion, adverse weather, and channel noise. To address this, we re-frame the problem from static data fusion to channel-aware semantic reasoning and propose a Large Language Model-centric Semantic-layer Channel-aware Integrated Perception (LM-SCIP) framework. It places a Large Language Model (LLM) as a central reasoning core to fuse a local visual stream with a quality-varying external radar stream used to cover perception-blind spots. Concretely, LM-SCIP couples a hierarchical radar-vision encoder with a Channel-Adaptive Semantic Module (CASM) that maps link indicators into a "Channel Prompt" to dynamically gate external radar features. A parameter-efficient, LoRA-tuned LLM, in conjunction with a heterogeneous Mixture-of-Experts (H-MoE), then arbitrates between local visual cues and the channel-conditioned radar context. Finally, a decoupled multi-task decoder outputs localization, trajectory forecasting, and image reconstruction. Experiments on nuScenes and VIRAT validate our approach. On nuScenes, under a controlled toggle of radar input, LM-SCIP reduces localization RMSE by 40.0% versus a vision-only baseline. On VIRAT, the model attains a 0.214m localization RMSE and 0.179m minFDE (k=1). These results reveal that the proposed LM-SCIP enables a robust vision-dominant fallback at low SNR and synergistic fusion at high SNR.
- Abstract(参考訳): ビジョンレーダー融合は堅牢な自律運転の中心であり、密集した視覚的意味論とレーダからの正確な距離と速度の測定を組み合わせる。
しかし、現実世界の核融合の品質は、包摂性、悪天候、チャネルノイズから生じる動的に変化する入力品質によって、基本的には挑戦されている。
そこで我々は,静的データ融合からチャネル認識セマンティック推論へと問題を再構築し,Large Language Model-centric Semantic-layer Channel-aware Integrated Perception (LM-SCIP) フレームワークを提案する。
LLM(Large Language Model)を中央の推論コアとして配置し、視覚的ストリームと品質変化のある外部レーダーストリームを融合させ、認識盲点をカバーする。
具体的には、LM-SCIPは階層的なレーダービジョンエンコーダとチャネル適応セマンティックモジュール(CASM)を結合し、リンクインジケータを「チャネル・プロンプト」にマッピングして外部レーダーの特徴を動的にゲートする。
パラメータ効率の高い LoRA-tuned LLM とヘテロジニアスなMixture-of-Experts (H-MoE) を組み合わせると、局所的な視覚的手がかりとチャネル条件のレーダーコンテキストを仲裁する。
最後に、デカップリングされたマルチタスクデコーダは、ローカライズ、軌道予測、画像再構成を出力する。
nuScenesとVIRATの実験は、我々のアプローチを検証する。
nuScenesでは、レーダー入力の制御トグルの下で、LM-SCIPは、視野のみのベースラインに対して、RMSEのローカライゼーションを40.0%削減する。
VIRAT では、このモデルは 0.214m の RMSE と 0.179m minFDE (k=1) を満たす。
これらの結果から,提案したLM-SCIPは低SNR,高SNRでの相乗的融合において,堅牢な視覚優位のフォールバックを可能にすることがわかった。
関連論文リスト
- RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation [11.345174599707859]
RAVENはFMCWレーダ認識のための計算効率の良いディープラーニングアーキテクチャである。
自動車レーダのベンチマークでは、強力な物体検出とBEV自由空間セグメンテーション性能が報告されている。
論文 参考訳(メタデータ) (2026-04-06T07:30:45Z) - Unsupervised Radio Map Construction in Mixed LoS/NLoS Indoor Environments [34.91945910235526]
本稿では,チャネル伝播シーケンスから直接データ収集軌道を復元することを目的とする。
提案手法は,室内環境における平均局部位置精度0.65mを実現する。
論文 参考訳(メタデータ) (2025-10-09T09:53:24Z) - NOVA: Navigation via Object-Centric Visual Autonomy for High-Speed Target Tracking in Unstructured GPS-Denied Environments [56.35569661650558]
我々はNOVAというオブジェクト中心のフレームワークを導入し、ロバストな目標追跡と衝突認識ナビゲーションを可能にした。
グローバルマップを構築するのではなく、NOVAはターゲットの参照フレーム内での知覚、推定、制御を定式化する。
我々は,都市迷路や森林の小道,間欠的なGPS損失を伴う建物内の繰り返し遷移など,現実の挑戦的なシナリオにまたがってNOVAを検証する。
論文 参考訳(メタデータ) (2025-06-23T14:28:30Z) - Large Language Model-Driven Distributed Integrated Multimodal Sensing and Semantic Communications [5.646293779615063]
本稿では,新しい大規模言語モデル (LLM) による分散分散マルチモーダルセンシングとセマンティックコミュニケーションフレームワークを提案する。
具体的には、RFモジュールとカメラモジュールを備えた複数の協調センシング装置で構成されている。
Genesis シミュレーションエンジンにより生成された合成多視点RF-視覚データセットの評価結果から,LLM-DiSAC が良好な性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-05-20T08:00:00Z) - ALSS-YOLO: An Adaptive Lightweight Channel Split and Shuffling Network for TIR Wildlife Detection in UAV Imagery [7.35275281315994]
熱赤外線カメラを搭載した無人航空機(UAV)は、夜間野生生物の密猟と戦う上で重要な役割を担っている。
現在のUAVに展開されている従来の軽量ネットワークは、ぼやけた小さなターゲットから特徴を引き出すのに苦労している。
我々は、TIR空中画像に最適化された効率的で軽量な検出器であるALSS-YOLOを開発した。
論文 参考訳(メタデータ) (2024-09-10T07:02:01Z) - Deep Reinforcement Learning for IRS Phase Shift Design in
Spatiotemporally Correlated Environments [93.30657979626858]
本稿では,チャネル相関と目的地動きを考慮したディープアクター批判アルゴリズムを提案する。
チャネルが時間的に相関している場合、コンバージェンスを抑制する方法において、関数近似を伴う状態表現にSNRを組み込むことが示される。
論文 参考訳(メタデータ) (2022-11-02T22:07:36Z) - Distributional Reinforcement Learning for mmWave Communications with
Intelligent Reflectors on a UAV [119.97450366894718]
無人航空機(UAV)搭載のインテリジェントリフレクタ(IR)を用いた新しい通信フレームワークを提案する。
ダウンリンク和率を最大化するために、最適プリコーディング行列(基地局)と反射係数(IR)を共同で導出する。
論文 参考訳(メタデータ) (2020-11-03T16:50:37Z) - Deep Denoising Neural Network Assisted Compressive Channel Estimation
for mmWave Intelligent Reflecting Surfaces [99.34306447202546]
本稿では,mmWave IRSシステムに対するディープデノイングニューラルネットワークを用いた圧縮チャネル推定法を提案する。
我々はまず、受信チェーンをほとんど使わず、アップリンクのユーザ-IRSチャネルを推定するハイブリッド・パッシブ/アクティブIRSアーキテクチャを導入する。
完全チャネル行列は、圧縮センシングに基づいて限られた測定値から再構成することができる。
論文 参考訳(メタデータ) (2020-06-03T12:18:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。