論文の概要: CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications
- arxiv url: http://arxiv.org/abs/2608.15972v1
- Date: Sun, 16 Aug 2026 23:55:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.49213
- Title: CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications
- Title(参考訳): CM-MAE:ビジョンレスアプリケーションのための物理誘導型クロスモーダル自己監視学習フレームワーク
- Authors: Yubo Zhang, Yiyao Liu,
- Abstract要約: CM-MAEは、クロスシナリオ表現転送のための無線事前トレーニングフレームワークである。
CM-MAEはRGBフレームとDeepSense 6Gで利用可能な64ビーム受信パワーベクトルのみを使用する。
- 参考スコア(独自算出の注目度): 4.943233471540466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Synchronized camera and wireless measurements observe the same scene through different physical channels. The central difficulty is that a representation learned in one deployment can fail when viewpoint, traffic, illumination, and propagation geometry change. This paper presents CM-MAE, a self-supervised vision--wireless pretraining framework for cross-scenario representation transfer. The evaluated real-data model uses only RGB frames and the measured 64-beam received-power vector available in DeepSense 6G; it does not use ray-traced paths, calibrated depth, or beam-index labels during pretraining. Its central pretraining term is a \emph{soft contrastive alignment loss}. Instead of making the synchronized image--wireless pair the only positive pair, this loss builds a target distribution from similarities between measured beam-power profiles, so nonidentical samples with similar directional responses are not forced apart as false negatives. A masked joint decoder provides the complementary local objective by reconstructing hidden visual patches and wireless angular clusters under modality dropout. After pretraining, a differential-rate fine-tuning rule lets a new fusion head adapt quickly while the encoders move slowly. Under a sequence-disjoint DeepSense 6G protocol, adding the soft alignment loss improves a matched linear-probe transfer average from 24.88\% to 29.49\%. Mild fusion fine-tuning reaches 77.38\% Top-1 accuracy on unseen Scenarios 6--8, and optional transductive normalization adaptation reaches 78.69\%. Since the fusion setting uses the contemporaneous 64-beam power vector at inference, these results should be read as representation-transfer diagnostics, not as proactive beam-prediction or reduced-sweeping claims.
- Abstract(参考訳): 同期カメラと無線測定は、異なる物理チャネルを通して同じシーンを観測する。
中心的な困難は、1つのデプロイメントで学んだ表現が、視点、トラフィック、照明、伝播幾何学が変化したときに失敗する可能性があることである。
本稿では,自己教師型視覚-ワイヤレス事前学習フレームワークであるCM-MAEについて述べる。
評価された実データモデルは、RGBフレームと、DeepSense 6Gで利用可能な64ビーム受信パワーベクトルのみを使用する。
その中心的な事前訓練項は「emph{soft contrastive alignment loss」である。
同期された画像-ワイヤレス対を唯一の正の対にする代わりに、この損失は測定されたビームパワープロファイル間の類似性からターゲット分布を構築するため、同じ方向応答を持つ非正のサンプルは偽陰性として分解されることはない。
マスク付きジョイントデコーダは、モダリティ・ドロップアウトの下で隠れた視覚パッチと無線角クラスターを再構成することにより、補完的な局所目的を提供する。
事前訓練後、差分レートの微調整規則は、エンコーダがゆっくりと動く間、新しい融合ヘッドを迅速に適応させる。
シーケンス非結合のDeepSense 6Gプロトコルでは、ソフトアライメントロスが追加され、一致した線形プローブ転送平均が24.88\%から29.49\%に改善される。
軽核融合微調整は、目に見えないシナリオ6〜8で77.38\%のTop-1精度に達し、任意のトランスダクティブ正規化適応は78.69\%に達する。
融合設定では、同時64ビームのパワーベクトルを推論時に使用するので、これらの結果は、前向きビーム予測や縮小スウィーピングのクレームではなく、表現伝達診断として読み取るべきである。
関連論文リスト
- Boundary-Aligned Contribution Routing for Robust Optical--SAR Object Detection [8.665369041430969]
光-SAR融合はリモートセンシングオブジェクト検出に魅力的である。
しかし、不完全な空間的、時間的、意味的な対応は、不完全なストリームを条件付きで有害にすることができる。
我々は,検出監視のみを用いてタスク条件付きコントリビューションルーティングを学習する。
論文 参考訳(メタデータ) (2026-08-15T14:37:23Z) - Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing [55.13802890769086]
我々は、専用のRGB-Event解析用に特別に設計された最初の統一バックボーンであるEvitaを紹介する。
深いモーダルなシナジーを達成するため、Evitaはすべてのエンコーダ層に直接固有のコラーニングモジュール群を組み込む。
Evitaは、リアルタイムマルチモーダル認識において、より優れた精度とレイテンシのトレードオフを提供しながら、新しい最先端メトリクスを確立する。
論文 参考訳(メタデータ) (2026-07-10T06:52:09Z) - Flow Map Denoisers: Traversing the Distortion-Perception Plane for Inverse Problems [48.501415601682815]
画像復元は基本的なトレードオフに直面している: エラーを最小限に抑える手法はぼやけた再構成を生み出し、知覚的品質を最大化する手法はシャープだが忠実でない画像を生み出す。
フローマップモデルは、歪み知覚フロンティアを連続的に分散する1パラメータのデノイザ群を暗黙的に定義する。
Plug-and-Playソルバ内では、同じメカニズムが一般的な逆問題にまで拡張され、知覚的アライメントとデータの一貫性のトレードオフを制御する。
論文 参考訳(メタデータ) (2026-06-18T05:15:43Z) - LightSplit: Practical Privacy-Preserving Split Learning via Orthogonal Projections [54.51153206716027]
Split Learning(SL)は、ニューラルネットワークをクライアントと中央サーバに分割することで、協調的なトレーニングを可能にする。
カット層に軽量な固定ランダムプロジェクションを適用することにより,情報露出を制限し,通信オーバーヘッドを低減するLightSplitを提案する。
提案手法は, 伝送次元の最大32倍の精度で, 95%以上の精度を維持できることを示した。
論文 参考訳(メタデータ) (2026-05-13T09:45:49Z) - EfficientPENet: Real-Time Depth Completion from Sparse LiDAR via Lightweight Multi-Modal Fusion [1.9903316442426757]
既存の手法は、標準ベンチマークで高い精度を達成するが、組み込みハードウェアへのリアルタイムデプロイメントを妨げる重いバックボーンアーキテクチャに依存している。
本稿では,従来のResNetエンコーダを近代化したConvNeXtバックボーンに置き換えた2分岐深度補完ネットワークであるEfficientPENetを提案する。
KITTIの深さ補完ベンチマークでは、EfficientPENet は 36.24M パラメータを持つ 631.94 mm のRMSEと、48.76 FPS で動作する 20.51 ms のレイテンシを達成した。
論文 参考訳(メタデータ) (2026-04-20T19:56:04Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - Do Foundation Models Know Geometry? Probing Frozen Features for Continuous Physical Measurement [0.0]
視覚言語モデルは、それらのテキスト経路が表現できないような幾何学を符号化する。
ロラ微調整(r=16, 2,000枚)は、このギャップを6.5度に縮める。
これらの知見は、単一の凍結したバックボーンがマルチタスク幾何学的センサーとして機能することを可能にした。
論文 参考訳(メタデータ) (2026-03-06T16:48:27Z) - Cross-Modal Alignment and Fusion for RGB-D Transmission-Line Defect Detection [11.637942429146172]
本稿では,RGBの外観と深度幾何学を原理化されたヒューズ・パラダイムを通じて統合したクロスモーダルアライメント・アンド・フュージョン・ネットワークであるCMAFNetを提案する。
CMAFNetは、辞書ベースの特徴浄化を行うセマンティック再構成モジュールで構成されている。
軽量な派生型は228 FPSで24.8% mAP50に達し、わずか4.9Mのパラメータしか持たない。
論文 参考訳(メタデータ) (2026-02-02T06:11:33Z) - Progressive Coordinate Transforms for Monocular 3D Object Detection [52.00071336733109]
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
本稿では,学習座標表現を容易にするために,PCT(Em Progressive Coordinate Transforms)と呼ばれる,新しい軽量なアプローチを提案する。
論文 参考訳(メタデータ) (2021-08-12T15:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。