論文の概要: Semantic Reconstruction and 3-D Detection via Learned Multi-Pair Fusion in RF Imaging
- arxiv url: http://arxiv.org/abs/2608.23249v1
- Date: Mon, 24 Aug 2026 13:41:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.120522
- Title: Semantic Reconstruction and 3-D Detection via Learned Multi-Pair Fusion in RF Imaging
- Title(参考訳): RF画像における学習多対融合による意味再構成と3次元検出
- Authors: Amir Rezaei, Wen-Xin Pan, Giuseppe Caire,
- Abstract要約: 異方性を有するマルチスタティックラジオ周波数イメージングの問題点を考察する。
目標は、ビューのフィールドのボクセルを、有限のセマンティッククラスのセットでラベル付けし、それらをオブジェクトインスタンスにグループ化することです。
- 参考スコア(独自算出の注目度): 45.88028371034407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We consider a multistatic radio-frequency imaging problem with anisotropy, in which the reflection from a point depends on the positions of the transmit (Tx) and receive (Rx) arrays. The goal is to label the voxels of a field of view by a finite set of semantic classes and to group them into object instances. For the image formation of each Tx--Rx pair we apply a standard inverse-problem solver, and we feed the resulting per-pair reconstructions into a trained three-dimensional (3-D) U-Net that performs the fusion implicitly and the per-voxel classification explicitly. On a controlled, under-determined multistatic setup, we consider the following image formation methods: back-projection (BP) and the least absolute shrinkage and selection operator (LASSO) from a single deterministic snapshot, and incoherent BP and group-LASSO from multiple fading snapshots. For each imaging method we train a separate U-Net that fuses the six Tx--Rx pairs (its input channels) and assigns each voxel a probability vector over the classes. Taking the most probable class gives a labeled volume---the semantic reconstruction. Object instances and their oriented bounding boxes then follow by geometric post-processing (clustering and principal-component analysis). Across a wide range of signal-to-noise ratio, the semantic reconstruction (scored against ground truth by segmentation intersection-over-union) and the resulting 3-D detection degrade far more gracefully than the classical intensity reconstruction: the detection in particular stays reliable well into noise levels at which that reconstruction has dissolved. Because real scenes contain objects of classes the network was not trained on, we add an explicit unknown class trained by outlier exposure, which labels held-out novel objects as unknown instead of mislabeling them as a known class by reconstructed shape.
- Abstract(参考訳): 異方性を持つマルチスタティック無線周波数イメージング問題について考察し,伝送(Tx)の位置と受信(Rx)アレイに依存する点からの反射について考察する。
目標は、ビューフィールドのボクセルを、有限のセマンティッククラスのセットでラベル付けし、それらをオブジェクトインスタンスにグループ化することです。
各Tx-Rx対の画像形成には、標準逆プロブレム解法を適用し、その結果得られるペアごとの再構成を3次元(3-D)のトレーニングされたU-Netに供給し、その融合を暗黙的に実行し、ボクセルごとの分類を明示的に行う。
制御された非決定的マルチスタティック・セットアップでは、単一の決定論的スナップショットからの後方投影(BP)と最小絶対縮小選択演算子(LASSO)、複数のフェードスナップショットからの不整合BPとグループLASSOについて検討する。
各撮像法では、6つのTx-Rxペア(入力チャネル)を融合させ、各ボクセルにクラス上の確率ベクトルを割り当てる独立したU-Netを訓練する。
オブジェクトインスタンスとその向き付けられたバウンディングボックスは、幾何学的後処理(クラスタリングと主成分分析)によって従う。
幅広い信号対雑音比、意味的再構成(セグメンテーション・オーバ・ユニオンによる地上真実に反する)、結果の3次元検出は、古典的な強度再構成よりもはるかに優雅に低下する。
実際のシーンは、ネットワークがトレーニングしていないクラスのオブジェクトを含むため、外周露光によって訓練された明示的な未知のクラスを追加します。
関連論文リスト
- Exploring the Untouched Sweeps for Conflict-Aware 3D Segmentation Pretraining [41.145598142457686]
LiDARカメラによる3D画像の事前学習は、3D知覚タスクと関連する応用に有意な可能性を示唆している。
未探索フレームからLiDAR-画像ペアを精巧に選択するための,ビジョン・ファウンデーション・モデル駆動型サンプル探索モジュールを提案する。
我々の手法は、既存の最先端の事前訓練フレームワークを3つの主要な公道走行データセットで一貫して上回っている。
論文 参考訳(メタデータ) (2024-07-10T08:46:29Z) - Fine-grained Image-to-LiDAR Contrastive Distillation with Visual Foundation Models [55.99654128127689]
Visual Foundation Models (VFM) は、弱い教師付きピクセル対ポイントのコントラスト蒸留のためのセマンティックラベルを生成するために使用される。
我々は,空間分布とカテゴリー周波数の不均衡に対応するために,点のサンプリング確率を適応させる。
我々の手法は、下流タスクにおける既存の画像からLiDARへのコントラスト蒸留法を一貫して超越している。
論文 参考訳(メタデータ) (2024-05-23T07:48:19Z) - DiAD: A Diffusion-based Framework for Multi-class Anomaly Detection [55.48770333927732]
本稿では,拡散型異常検出(Difusion-based Anomaly Detection, DAD)フレームワークを提案する。
画素空間オートエンコーダ、安定拡散の復調ネットワークに接続する潜在空間セマンティックガイド(SG)ネットワーク、特徴空間事前学習機能抽出器から構成される。
MVTec-ADとVisAデータセットの実験は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2023-12-11T18:38:28Z) - Occ$^2$Net: Robust Image Matching Based on 3D Occupancy Estimation for
Occluded Regions [14.217367037250296]
Occ$2$Netは、3D占有率を用いて閉塞関係をモデル化し、閉塞領域の一致点を推測する画像マッチング手法である。
本手法は実世界とシミュレーションデータセットの両方で評価し,いくつかの指標における最先端手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2023-08-14T13:09:41Z) - Unsupervised Multi-View Object Segmentation Using Radiance Field
Propagation [55.9577535403381]
本稿では,未ラベルのシーンの多視点画像のみを考慮し,再構成中の3次元オブジェクトのセグメント化に新たなアプローチを提案する。
提案手法の核となるのは,2方向光度損失を持つ個々の物体の放射界に対する新しい伝搬戦略である。
我々の知る限り、RFPはニューラルレイディアンスフィールド(NeRF)のための3次元シーンオブジェクトセグメンテーションに取り組むための最初の教師なしアプローチである。
論文 参考訳(メタデータ) (2022-10-02T11:14:23Z) - Shelf-Supervised Mesh Prediction in the Wild [54.01373263260449]
本研究では,物体の3次元形状とポーズを1つの画像から推定する学習手法を提案する。
まず、カメラのポーズとともに、標準フレーム内の体積表現を推定する。
粗い体積予測はメッシュベースの表現に変換され、予測されたカメラフレームでさらに洗練される。
論文 参考訳(メタデータ) (2021-02-11T18:57:10Z) - DDR-ID: Dual Deep Reconstruction Networks Based Image Decomposition for
Anomaly Detection [2.4589632879498478]
画像異常検出(AD)における重要な課題の1つは、通常のクラストレーニングからのみ識別情報を学習することである。
本稿では,DDR-ID(Double Deep Restructed Network based Image decomposition)と呼ばれるAD手法を提案する。
2つの異常スコアを算出し、通常のクラス潜在空間または再構成画像空間における画像の異常度を定量化する。
論文 参考訳(メタデータ) (2020-07-18T13:54:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。