論文の概要: Vision-Wireless Fusion for Multi-User Localization: A Cross-Modal Transformer Approach
- arxiv url: http://arxiv.org/abs/2609.23372v1
- Date: Sun, 20 Sep 2026 05:46:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.805515
- Title: Vision-Wireless Fusion for Multi-User Localization: A Cross-Modal Transformer Approach
- Title(参考訳): マルチユーザローカライゼーションのためのビジョンレスフュージョン:クロスモーダル変圧器アプローチ
- Abstract要約: 本稿では,パイロットインデクシングチャネル状態情報(CSI)を用いたマルチユーザローカライズのためのビジョンワイヤレス融合フレームワークを提案する。
このモデルは、各パイロットインデックスのCSI観察をクエリトークンとして符号化し、クロスアテンションを使用して、空間的視覚記憶からユーザ固有の情報を検索する。
異なるデータセットの実験では、モデルベース、CSIのみ、マルチモーダルフュージョンベースラインよりも一貫した改善が示されている。
- 参考スコア(独自算出の注目度): 28.504279442160378
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate multi-user localization is challenging in complex urban environments, where wireless measurements can become ambiguous under noise, blockage, and multipath, while visual observations provide complementary spatial context. This paper presents a vision-wireless fusion framework for multi-user localization using pilot-indexed channel state information (CSI). Orthogonal pilot indices preserve the identities of the communicating UEs in the CSI token sequence and localization outputs. The model encodes each pilot-indexed CSI observation as a query token and uses cross-attention to retrieve user-specific information from spatial visual memory. Self-attention among CSI tokens further captures inter-user interactions, while the resulting multimodal representations are used for user-wise localization. Experiments on different datasets show consistent improvements over model-based, CSI-only, and multimodal-fusion baselines. Further experiments evaluate the model under different wireless and visual conditions.
- Abstract(参考訳): 複雑な都市環境では、視覚的観察が相補的な空間的コンテキストを提供するのに対し、無線測定はノイズ、遮蔽、マルチパスの下であいまいになる可能性がある。
本稿では,パイロットインデクシングチャネル状態情報(CSI)を用いたマルチユーザローカライズのためのビジョンワイヤレス融合フレームワークを提案する。
直交パイロット指標は、CSIトークンシーケンスとローカライゼーション出力における通信UEのアイデンティティを保持する。
このモデルは、各パイロットインデックスのCSI観察をクエリトークンとして符号化し、クロスアテンションを使用して、空間的視覚記憶からユーザ固有の情報を検索する。
CSIトークン間の自己アテンションはさらにユーザ間のインタラクションをキャプチャし、結果として得られるマルチモーダル表現はユーザワイドなローカライゼーションに使用される。
異なるデータセットの実験では、モデルベース、CSIのみ、マルチモーダルフュージョンベースラインよりも一貫した改善が示されている。
さらなる実験では、異なる無線および視覚条件下でモデルを評価する。
関連論文リスト
- Multi-View Mixture-of-Experts with Vision-Language Reranking for Cross-View Object Geo-Localization [41.12300370913897]
クロスビューオブジェクトジオローカライゼーション(CVOGL)は、ドローンやストリートビュークエリを使用して衛星画像のターゲットを特定する。
既存の手法では、それぞれの視点で別々の検出器を訓練し、パラメータの冗長性を損なうとともに、クロスビューな知識共有を妨げる。
本稿では,複数の視点を統一し,モデルの冗長性を低減するための効率的なフレームワークMVLGeoを提案する。
論文 参考訳(メタデータ) (2026-09-16T05:21:54Z) - Object Detection as an Optional Basis: A Graph Matching Network for Cross-View UAV Localization [17.908597896653045]
本稿では,対象物検出によるマップマッチングを行うUAVローカライゼーションフレームワークを提案する。
典型的なパイプラインでは、UAVの視覚的ローカライゼーションは画像検索の問題として定式化されている。
本手法は, グラフベースノード類似度測定法を用いて, 高精度な検索とローカライズ性能を実現する。
論文 参考訳(メタデータ) (2025-11-04T11:25:31Z) - MGCR-Net:Multimodal Graph-Conditioned Vision-Language Reconstruction Network for Remote Sensing Change Detection [55.702662643521265]
マルチモーダルデータのセマンティックインタラクション機能を検討するために,マルチモーダルグラフ条件付き視覚言語再構成ネットワーク(MGCR-Net)を提案する。
4つの公開データセットによる実験結果から,MGCRは主流CD法に比べて優れた性能を示した。
論文 参考訳(メタデータ) (2025-08-03T02:50:08Z) - MultiSensor-Home: A Wide-area Multi-modal Multi-view Dataset for Action Recognition and Transformer-based Sensor Fusion [2.7745600113170994]
ホーム環境における包括的行動認識のための新しいベンチマークであるMultiSensor-Homeデータセットを紹介する。
また,マルチモーダルマルチビュー変換器を用いたセンサフュージョン (MultiTSF) 法を提案する。
論文 参考訳(メタデータ) (2025-04-03T05:23:08Z) - Robust Multi-View Learning via Representation Fusion of Sample-Level Attention and Alignment of Simulated Perturbation [61.64052577026623]
実世界のマルチビューデータセットは、しばしば不均一で不完全である。
本稿では,表現融合とアライメントを同時に行う新しいロバストMVL法(RML)を提案する。
我々のRMLは自己教師型であり、正規化として下流のタスクにも適用できます。
論文 参考訳(メタデータ) (2025-03-06T07:01:08Z) - ViFi-ReID: A Two-Stream Vision-WiFi Multimodal Approach for Person Re-identification [3.3743041904085125]
人物再識別(ReID)は、安全検査、人員計数などにおいて重要な役割を担っている。
現在のReIDアプローチのほとんどは、主に目的条件の影響を受けやすい画像から特徴を抽出する。
我々は、Wi-Fi信号のチャネル状態情報(CSI)を介して歩行者からの歩行情報をキャプチャすることで、広く利用可能なルータをセンサデバイスとして活用する。
論文 参考訳(メタデータ) (2024-10-13T15:34:11Z) - Cross-domain Learning Framework for Tracking Users in RIS-aided Multi-band ISAC Systems with Sparse Labeled Data [55.70071704247794]
統合センシング・通信(ISAC)は6G通信において重要であり、再構成可能なインテリジェントサーフェス(RIS)の急速な発展によって促進される
本稿では,複数の帯域にまたがるマルチモーダルCSIインジケータを協調的に活用し,クロスドメイン方式で追跡機能をモデル化するX2Trackフレームワークを提案する。
X2Trackの下では、トランスフォーマーニューラルネットワークと逆学習技術に基づいて、トラッキングエラーを最小限に抑える効率的なディープラーニングアルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-05-10T08:04:27Z) - Sketched Multi-view Subspace Learning for Hyperspectral Anomalous Change
Detection [12.719327447589345]
異常変化検出のためのスケッチ付きマルチビューサブスペース学習モデルを提案する。
提案モデルでは,画像ペアからの主要な情報を保存し,計算複雑性を向上させる。
実験は、ベンチマークハイパースペクトルリモートセンシングデータセットと自然なハイパースペクトルデータセットで実施される。
論文 参考訳(メタデータ) (2022-10-09T14:08:17Z) - MD-CSDNetwork: Multi-Domain Cross Stitched Network for Deepfake
Detection [80.83725644958633]
現在のディープフェイク生成法では、偽画像やビデオの周波数スペクトルに識別的アーティファクトが残されている。
MD-CSDNetwork(MD-CSDNetwork)と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2021-09-15T14:11:53Z) - Co-Saliency Spatio-Temporal Interaction Network for Person
Re-Identification in Videos [85.6430597108455]
本稿では,ビデオにおける人物の身元確認のためのCSTNet(Co-Saliency Spatio-Temporal Interaction Network)を提案する。
ビデオフレーム間の共通した有意な前景領域をキャプチャし、そのような領域からの空間的時間的長距離コンテキストの相互依存性を探索する。
CSTNet内の複数の空間的時間的相互作用モジュールを提案し,その特徴と空間的時間的情報相関の空間的・時間的長期的相互依存性を利用した。
論文 参考訳(メタデータ) (2020-04-10T10:23:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。