論文の概要: Vision Transformer Based User Equipment Positioning
- arxiv url: http://arxiv.org/abs/2511.08549v1
- Date: Wed, 12 Nov 2025 02:04:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-11-12 20:17:03.862307
- Title: Vision Transformer Based User Equipment Positioning
- Title(参考訳): 視覚変換器を用いたユーザ機器の位置決め
- Abstract要約: 本稿では,CSI行列からのアングル遅延プロファイル(ADP)に着目した視覚変換器(ViT)アーキテクチャを提案する。
我々のアプローチは、DeepMIMOとViWiのレイトレーシングデータセットに基づいて検証され、屋内で0.55m、DeepMIMOで13.59m、ViWiの屋外シナリオで3.45mのRoot Mean Squared Error(RMSE)が得られた。
- 参考スコア(独自算出の注目度): 3.256016355612436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recently, Deep Learning (DL) techniques have been used for User Equipment (UE) positioning. However, the key shortcomings of such models is that: i) they weigh the same attention to the entire input; ii) they are not well suited for the non-sequential data e.g., when only instantaneous Channel State Information (CSI) is available. In this context, we propose an attention-based Vision Transformer (ViT) architecture that focuses on the Angle Delay Profile (ADP) from CSI matrix. Our approach, validated on the `DeepMIMO' and `ViWi' ray-tracing datasets, achieves an Root Mean Squared Error (RMSE) of 0.55m indoors, 13.59m outdoors in DeepMIMO, and 3.45m in ViWi's outdoor blockage scenario. The proposed scheme outperforms state-of-the-art schemes by $\sim$ 38\%. It also performs substantially better than other approaches that we have considered in terms of the distribution of error distance.
- Abstract(参考訳): 近年,ユーザ機器(UE)の位置決めにDeep Learning(DL)技術が用いられている。
しかし、そのようなモデルの主な欠点は次のとおりである。
一 入力全体に対して同じ注意を払っていること。
二 即時チャネル状態情報(CSI)のみが利用可能である場合において、非系列データegに適していないこと。
そこで本研究では,CSI行列からのアングル遅延プロファイル(ADP)に着目した視覚変換器(ViT)アーキテクチャを提案する。
提案手法は,DeepMIMO および 'ViWi' レイトレーシングデータセットを用いて,屋内0.55m,DeepMIMO の屋外13.59m,ViWi の屋外ブロックシナリオ3.45mのルート平均正方形誤差(RMSE)を実現する。
提案手法は最先端のスキームを$\sim$38\%で上回る。
また、誤差距離の分布の観点から検討した他の手法よりも大幅に性能が向上する。
関連論文リスト
- Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation [53.88286427894783]
視覚言語モデル(VLM)は、ロボット分野において、言語コンテキストによる環境認識を可能にする強力なツールとして登場した。
しかし、彼らの計算フットプリントは、通常、それらをクラウド実行に制限し、リソースに制約のあるロボットへのローカルなデプロイによる低レイテンシの推論を妨げる。
本稿では,大規模フロンティアモデルからの複雑な空間意味推論を,組み込みGPUデバイス上でエッジ実行を行うための軽量な4BパラメータローカルVLMに転送する蒸留戦略を提案する。
論文 参考訳(メタデータ) (2026-06-26T09:11:59Z) - TALON: Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation [14.854437007037683]
モノアテンション6-F宇宙船は、個々のフレームを処理し、操作中に取得した画像シーケンスに存在する時間情報を破棄する。
本稿では,凍結したViTビジョントランスの自己調整層に3Dアダプタを注入する TALON (Token-conditioned Adapter) を提案する。
Pre-Alignedは、凍結された注意を時間的に濃縮されたトークンの推論を可能にし、ポストアテンションの代替よりもブロック毎に1つのアダプタでパフォーマンスを向上する。
SPADESデータセットでは、TAは前回の最先端よりもポーズエラーを50%削減し、スイスのデータセットではADD-0.1dで21.8%上回る。
論文 参考訳(メタデータ) (2026-05-29T12:21:52Z) - Instance-level Visual Active Tracking with Occlusion-Aware Planning [61.982298426203165]
Visual Active Tracking (VAT)は、カメラを3D空間でターゲットに追従することを目的としている。
VATは、視覚的に類似したイントラクタからの混乱と、閉塞下での深刻な障害という、現実世界のデプロイメントにおいて2つの重要なボトルネックに直面している。
3つの相補的なモジュールを持つ統一パイプラインであるOA-VATを提案する。
論文 参考訳(メタデータ) (2026-04-23T09:11:50Z) - HyPCV-Former: Hyperbolic Spatio-Temporal Transformer for 3D Point Cloud Video Anomaly Detection [1.475698751142657]
HyV-Formerは、複数の異常カテゴリにわたる最先端の異常検出を実現し、TIMoデータセットは7%改善され、DADデータセットは5.6%向上した。
論文 参考訳(メタデータ) (2025-08-01T09:50:20Z) - RoMeO: Robust Metric Visual Odometry [11.381243799745729]
ビジュアルオドメトリー(VO)は、視覚入力からカメラのポーズを推定することを目的としている。
既存のアプローチでは、この困難なシナリオ下で堅牢性が欠如し、目に見えないデータ(特に屋外)に一般化できない
本稿では,事前学習した深度モデルから,これらの問題を解決する新しい手法であるRoMeO(Roust Metric Visual Odometry)を提案する。
論文 参考訳(メタデータ) (2024-12-16T08:08:35Z) - DECADE: Towards Designing Efficient-yet-Accurate Distance Estimation Modules for Collision Avoidance in Mobile Advanced Driver Assistance Systems [5.383130566626935]
本稿では,距離推定モデルであるDECADEについて述べる。
これらのモジュールを任意の検出器にアタッチして物体検出を高速な距離推定で拡張できることを実証する。
論文 参考訳(メタデータ) (2024-10-25T06:40:42Z) - ET-Former: Efficient Triplane Deformable Attention for 3D Semantic Scene Completion From Monocular Camera [53.20087549782785]
本稿では,単一単眼カメラを用いたセマンティックシーン補完のための新しいエンドツーエンドアルゴリズムET-Formerを紹介する。
本手法は,単一のRGB観測からセマンティック占有マップを生成すると同時に,セマンティック予測のための不確実性推定を行う。
論文 参考訳(メタデータ) (2024-10-14T19:14:49Z) - Stanceformer: Target-Aware Transformer for Stance Detection [59.69858080492586]
スタンス検出は、テキストで表現されたスタンスを特定の主題やターゲットに向けて識別する。
以前の作業は、ターゲットを効果的に優先順位付けする能力に欠ける既存のトランスフォーマーモデルに依存していた。
本稿では,学習と推論の両方において,目標に対する注意を高めるターゲット対応トランスフォーマーモデルであるStanceformerを紹介する。
論文 参考訳(メタデータ) (2024-10-09T17:24:28Z) - V-DETR: DETR with Vertex Relative Position Encoding for 3D Object
Detection [73.37781484123536]
DETRフレームワークを用いた点雲のための高性能な3次元物体検出器を提案する。
限界に対処するため,新しい3次元相対位置(3DV-RPE)法を提案する。
挑戦的なScanNetV2ベンチマークで例外的な結果を示す。
論文 参考訳(メタデータ) (2023-08-08T17:14:14Z) - iSDF: Real-Time Neural Signed Distance Fields for Robot Perception [64.80458128766254]
iSDFは実時間符号付き距離場再構成のための連続学習システムである。
より正確な再構築と、衝突コストと勾配のより良い近似を生成する。
論文 参考訳(メタデータ) (2022-04-05T15:48:39Z) - Neural RF SLAM for unsupervised positioning and mapping with channel
state information [51.484516640867525]
アイソメトリによるユーザ位置と環境マッピングを共同で学習するニューラルネットワークアーキテクチャを提案する。
提案モデルでは,物理ベースのデコーダを適用すれば,解釈可能な潜在能力,すなわちユーザ位置を学習できる。
論文 参考訳(メタデータ) (2022-03-15T21:32:44Z) - Progressive Coordinate Transforms for Monocular 3D Object Detection [52.00071336733109]
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
論文 参考訳(メタデータ) (2021-08-12T15:22:33Z) - D3DLO: Deep 3D LiDAR Odometry [1.1172382217477126]
LiDAR odometry (LO) は、その後のLiDAR点雲のアライメントを見つけるタスクを記述している。
このアライメントは、LiDARセンサーが装着されているプラットフォームの動きを推定するために使用することができる。
本稿では,3次元点雲を直接処理することでLOを学習するネットワークアーキテクチャを提案する。
論文 参考訳(メタデータ) (2021-01-28T19:23:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。