論文の概要: CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition
- arxiv url: http://arxiv.org/abs/2605.08663v1
- Date: Sat, 09 May 2026 04:02:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.798527
- Title: CAST: Channel-Aware Spatial Transfer Learning with Pseudo-Image Radar for Sign Language Recognition
- Title(参考訳): CAST:手話認識のための擬似画像レーダを用いたチャネル認識型空間移動学習
- Abstract要約: 本稿では,チャネル認識型空間移動学習を利用した2重ストリームアーキテクチャであるCASTを提案する。
提案フレームワークは3つの物理対応アーキテクチャと事前訓練された視覚バックボーンを組み合わせており、レーダーのみの制約の下で動作している。
実験の結果、アーキテクチャは5倍のクロスバリデーションで80.5%のTop-1精度を達成した。
- 参考スコア(独自算出の注目度): 4.779774528361377
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We propose CAST, a dual-stream architecture that utilizes channel-aware spatial transfer learning for isolated sign language recognition addressing the challenges of magnitude-only 60~GHz radar Range-Time Maps (RTM). The proposed framework combines three physics-aware architectures with pretrained vision backbones, which operate under radar-only constraints across clinical and alphabetical gestures. First, an explicit decibel-to-linear inversion is combined with a windowed fast Fourier transform that extracts Cadence Velocity Diagrams (CVD) while avoiding the harmonic artifacts that arise from the spectral analysis of log-compressed signals. Second, a cross-antenna spatial attention module applies attention to raw antenna channels before the convolution, preserving inter-receiver amplitude covariance. Third, an asymmetric cross-attention mechanism fuses representations from parallel ConvNeXt-Tiny (CVD) and EfficientNetV2-S (RTM) backbones. Extensive experiments reveal that the architecture achieves a Top-1 accuracy of 80.5% under 5-fold cross-validation, establishing a 3.3% improvement over the best single-model baseline (77.2%). The findings suggest that physics-aware signal representations form a promising direction for radar-only sign language recognition under constrained sensor modalities. The source code is available at: https://github.com/Shakhoyat/CAST-at-SignEval2026.
- Abstract(参考訳): CASTはチャネル認識型空間移動学習を応用した2重ストリームアーキテクチャであり,60〜GHz帯のレーダ・レンジ・タイム・マップ(RTM)の課題に対処する一意手話認識を実現する。
提案するフレームワークは、3つの物理認識アーキテクチャと事前訓練された視覚バックボーンを組み合わせており、臨床およびアルファベットのジェスチャーに対するレーダーのみの制約の下で動作している。
まず, 対数圧縮信号のスペクトル解析から生じる高調波アーチファクトを回避しつつ, キャデンス速度図(CVD)を抽出する窓付き高速フーリエ変換と, 明確なデシベル-線形インバージョンを結合する。
第二に、アンテナ間の空間的注意モジュールは、畳み込みの前に生のアンテナチャネルに注意を向け、受信者間の振幅共分散を保存する。
第3に、非対称なクロスアテンション機構は並列ConvNeXt-Tiny(CVD)とEfficientNetV2-S(RTM)のバックボーンから表現を融合させる。
大規模な実験により、アーキテクチャは5倍のクロスバリデーションで80.5%のTop-1精度を達成し、最高のシングルモデルベースライン(77.2%)よりも3.3%改善されていることが判明した。
この結果から, 物理認識信号表現は, センサの制約条件下でのレーダのみの手話認識において有望な方向を形成することが示唆された。
ソースコードは、https://github.com/Shakhoyat/CAST-at-SignEval2026で公開されている。
関連論文リスト
- mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis [18.777328493392762]
我々は,高分解能な3次元レーダデータを合成するために,高密度仮想開口からの実撮と再レンダリングを行う物理モデルに適合する,オープンソースの微分可能周波数変調型連続波レーダmmIRを提案する。
レーダー分解能は幾何を直接復元するには大きすぎるため、mmIRはLiDARから派生したメッシュを幾何学的な足場としてLiDAR支援逆レンダリングを行う。
7つの屋外および6つの屋内ColoRadarシーンにおいて、mmIRは、Sionna-RTの0.307に対して、レンジアジマスマップのパーソン相関平均0.914を達成する。
論文 参考訳(メタデータ) (2026-08-28T22:21:47Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design [56.76240343283953]
本稿では,大規模言語モデル中心のセマンティック・レイヤ・チャネル・アウェア・インテグレート・パーセプション・フレームワークを提案する。
ローカルな視覚ストリームと、知覚盲点をカバーするために使用される品質の変化した外部レーダーストリームを融合させる。
nuScenesとVIRATの実験は、我々のアプローチを検証する。
論文 参考訳(メタデータ) (2026-07-02T06:44:02Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Implicit Neural Representations: A Signal Processing Perspective [54.57279006229212]
入射神経表現(INR)は、離散的なサンプルデータから連続的な機能的表現へと、信号モデリングの根本的な変化を示す。
本稿では、信号処理の観点からのINRの進化を考察し、スペクトル挙動、サンプリング理論、マルチスケール表現を強調する。
医療・レーダ画像の逆問題,圧縮,3次元シーン表現など,幅広い応用分野におけるINRの有用性を強調した。
論文 参考訳(メタデータ) (2026-04-16T14:12:06Z) - RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation [11.345174599707859]
RAVENはFMCWレーダ認識のための計算効率の良いディープラーニングアーキテクチャである。
自動車レーダのベンチマークでは、強力な物体検出とBEV自由空間セグメンテーション性能が報告されている。
論文 参考訳(メタデータ) (2026-04-06T07:30:45Z) - Learning Spatial Structure from Pre-Beamforming Per-Antenna Range-Doppler Radar Data via Visibility-Aware Cross-Modal Supervision [2.348805691644085]
アンテナ間距離-ドップラー測定から有意義な空間構造を直接学べるか?
実験は6-TX x 8-RX (48仮想アンテナ)で行われた。
エンド・ツー・エンド・エンド・エンド・データ駆動方式で訓練されたデュアルチャープ共有重み付きエンコーダを用いて、アンテナ毎のRDテンソルの事前動作を行う。
論文 参考訳(メタデータ) (2026-04-02T11:39:00Z) - Leveraging Transformer Decoder for Automotive Radar Object Detection [9.764772760421792]
本稿では,新しいトランスフォーマーデコーダを用いた3次元レーダオブジェクト検出のためのトランスフォーマーベースアーキテクチャを提案する。
Pyramid Token Fusion (PTF)は、特徴ピラミッドを統一されたスケール対応トークンシーケンスに変換する。
我々はRADDet上で提案したフレームワークを評価し、最先端のレーダー専用ベースラインよりも大幅に改善した。
論文 参考訳(メタデータ) (2026-01-19T20:44:24Z) - Exploring Efficient Open-Vocabulary Segmentation in the Remote Sensing [55.291219073365546]
Open-Vocabulary Remote Sensing Image (OVRSIS)は、OVS(Open-Vocabulary)をリモートセンシング(RS)ドメインに適応させる新しいタスクである。
textbfRSKT-Segは、リモートセンシングに適した新しいオープン語彙セグメンテーションフレームワークである。
RSKT-Segは高いOVSベースラインを+3.8 mIoUと+5.9 mACCで上回り、効率的なアグリゲーションによって2倍高速な推論を実現している。
論文 参考訳(メタデータ) (2025-09-15T15:24:49Z) - Few-Shot Radar Signal Recognition through Self-Supervised Learning and Radio Frequency Domain Adaptation [48.265859815346985]
レーダー信号認識は電子戦(EW)において重要な役割を果たす
近年のディープラーニングの進歩は、レーダー信号認識の改善に大きな可能性を示している。
これらの手法は、注釈付き無線周波数(RF)データが少ない、あるいは入手できないEWシナリオでは不十分である。
論文 参考訳(メタデータ) (2025-01-07T01:35:56Z) - Multi-task Learning for Radar Signal Characterisation [48.265859815346985]
本稿では,マルチタスク学習(MTL)問題として,レーダ信号の分類と特徴化に取り組むためのアプローチを提案する。
本稿では,複数のレグレッションタスクと分類タスクを同時最適化するIQST(IQ Signal Transformer)を提案する。
合成レーダデータセット上で提案したMTLモデルの性能を示すとともに,レーダ信号の特徴付けのための一級ベンチマークも提供する。
論文 参考訳(メタデータ) (2023-06-19T12:01:28Z) - Semantic Segmentation of Radar Detections using Convolutions on Point
Clouds [59.45414406974091]
本稿では,レーダ検出を点雲に展開する深層学習手法を提案する。
このアルゴリズムは、距離依存クラスタリングと入力点雲の事前処理により、レーダ固有の特性に適応する。
我々のネットワークは、レーダポイント雲のセマンティックセグメンテーションのタスクにおいて、PointNet++に基づく最先端のアプローチよりも優れています。
論文 参考訳(メタデータ) (2023-05-22T07:09:35Z) - TWR-MCAE: A Data Augmentation Method for Through-the-Wall Radar Human
Motion Recognition [19.7631142728486]
本稿では,マルチリンク自動符号化ニューラルネットワーク(TWR-MCAE)データ拡張手法を提案する。
提案アルゴリズムは、より優れたピーク信号-雑音比(PSNR)を得る。
実験により,提案アルゴリズムはより優れたピーク信号対雑音比(PSNR)が得られることが示された。
論文 参考訳(メタデータ) (2023-01-06T12:56:53Z) - Dense Label Encoding for Boundary Discontinuity Free Rotation Detection [69.75559390700887]
本稿では,分類に基づく比較的研究の少ない方法論について検討する。
我々は2つの側面でフロンティアを推し進めるための新しい手法を提案する。
航空画像のための大規模公開データセットの実験と視覚解析は,我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2020-11-19T05:42:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。