論文の概要: Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding
- arxiv url: http://arxiv.org/abs/2608.04127v2
- Date: Sun, 09 Aug 2026 09:08:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 13:55:18.55864
- Title: Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding
- Title(参考訳): mmWaveを読むための基礎モデル:人間の行動理解のためのPose-Guided Kinematic Representation
- Authors: Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang,
- Abstract要約: ミリ波(mmWave)レーダーは、プライバシーに優しく、接触のない知覚モダリティを提供する。
既存のレーダー言語法は、しばしば合成データに依存するか、人体構造や運動力学の明確な監督を欠いている。
同期3ポーズトレーニングモデルを用いたレーダ言語モデルmmMindを提案する。
- 参考スコア(独自算出の注目度): 23.73222950886392
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model agents need to perceive human behavior in physical environments. Millimeter-wave (mmWave) radar provides a privacy-friendly and contactless sensing modality, but radar observations are difficult to align with language. Existing radar-language methods often rely on synthetic data or lack explicit supervision for human body structure and motion. We present mmMind, a radar-language model that uses synchronized 3D pose as training-only supervision. A spatio-temporal radar encoder is pretrained to capture body configuration and motion dynamics, after which the pose head is removed so that inference requires radar alone. The learned radar representations are then aligned with an LLM for behavior captioning and spatio-temporal question answering. We also introduce mmMind-Bench, a real-world mmWave-language benchmark containing 17.9 hours of recordings from 23 participants across seven indoor environments. Experiments on captioning, question answering, and unseen-action generalization show that mmMind consistently outperforms existing radar-language baselines, while ablations confirm the importance of pose-guided pretraining.
- Abstract(参考訳): 大規模言語モデルエージェントは、物理的環境における人間の振る舞いを知覚する必要がある。
ミリ波レーダ(mmWave)は、プライバシーに配慮し、接触のない知覚モダリティを提供するが、レーダー観測は言語と整合するのは難しい。
既存のレーダー言語法は、しばしば合成データに依存するか、人体の構造や動きの明確な監督を欠いている。
レーダ言語モデルであるmmMindを提案する。
時空間レーダーエンコーダは、体の構成と動きのダイナミクスをキャプチャするために事前訓練され、その後、推論がレーダーのみを必要とするように、ポーズヘッドを除去する。
学習したレーダー表現は、行動キャプションと時空間質問応答のためのLLMと整列される。
また、実際のmmWaveベンチマークであるmmMind-Benchを紹介し、7つの屋内環境にわたる23人の参加者による17.9時間の録音を含む。
キャプション、質問応答、そして目に見えない動作の一般化の実験では、mmMindは既存のレーダー言語ベースラインを一貫して上回り、アブレーションはポーズ誘導事前訓練の重要性を証明している。
関連論文リスト
- Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching [66.91228384649921]
Talk2Sensorsは、カメラ、LiDAR、および4Dレーダ上に構築された最初のマルチセンサ3Dビジュアルグラウンドデータセットである。
本稿では,自動走行における言語誘導型3次元視覚グラウンドのためのトランスフォーマーベースの統合フレームワークTSFormerを提案する。
論文 参考訳(メタデータ) (2026-08-05T07:58:35Z) - RadarTwin: Scene-Specific mmWave Radar Simulation and Learning for Mobile Indoor Perception [2.0255467447384015]
RadarTwinは、実際のデータ収集の前にデプロイメント固有のレーダートレーニングデータを生成するためのフレームワークである。
シミュレーションと実レーダは同じ物体識別形状と材料特性を共有していることを示す。
シミュレーションだけで訓練された表現は、実際のレーダーラベルのない2.5倍の確率で実際の物体を認識し、いくつかのラベル付き例では、これを12方向の認識タスクで95.3%に引き上げている。
論文 参考訳(メタデータ) (2026-06-24T05:50:26Z) - RadarGen: Automotive Radar Point Cloud Generation from Cameras [64.69976771710057]
マルチビューカメラ画像からリアルな自動車用レーダー点雲を合成するための拡散モデルRadarGenを提案する。
RadarGenは、鳥の目視でレーダー計測を表現することで、レーダ領域への効率的な画像遅延拡散を適応する。
本稿では,RadarGenが特徴的レーダ計測分布を捕捉し,実データに基づいて学習した知覚モデルとのギャップを小さくすることを示す。
論文 参考訳(メタデータ) (2025-12-19T18:57:33Z) - RadarLLM: Empowering Large Language Models to Understand Human Motion from Millimeter-wave Point Cloud Sequence [10.115852646162843]
本稿では、ミリ波レーダをセンシングモードとして用いた人間の理解に大規模言語モデル(LLM)を利用する最初のフレームワークであるRadar-LLMを提案する。
データ不足に対処するために、モーションテキストデータセットからリアルなレーダテキストペアを生成する物理対応パイプライン合成を導入する。
Radar-LLMは、合成および実世界のベンチマークの両方で最先端のパフォーマンスを実現し、ミリ波信号の自然言語記述への正確な変換を可能にする。
論文 参考訳(メタデータ) (2025-04-14T04:18:25Z) - RobuRCDet: Enhancing Robustness of Radar-Camera Fusion in Bird's Eye View for 3D Object Detection [68.99784784185019]
暗い照明や悪天候はカメラの性能を低下させる。
レーダーは騒音と位置のあいまいさに悩まされる。
本稿では,BEVの頑健な物体検出モデルであるRobuRCDetを提案する。
論文 参考訳(メタデータ) (2025-02-18T17:17:38Z) - Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension [21.598751853520834]
4Dミリ波レーダは従来のレーダよりも密度の高い点雲を提供し、オブジェクトの意味的および物理的特性の両方を知覚する。
3次元視覚接地のためのレーダシーンにおける自然言語による文脈理解の開発を促進するため,最初のデータセットTalk2Radarを構築した。
本研究では,ポイントクラウド上での3次元参照表現のための新しいモデルであるT-RadarNetを提案し,Talk2Radarデータセット上でのステートオフ・ザ・アート(SOTA)性能を実現する。
論文 参考訳(メタデータ) (2024-05-21T14:26:36Z) - Radar Fields: Frequency-Space Neural Scene Representations for FMCW Radar [62.51065633674272]
本稿では,アクティブレーダイメージア用に設計されたニューラルシーン再構成手法であるRadar Fieldsを紹介する。
提案手法では,暗黙的ニューラルジオメトリとリフレクタンスモデルを用いて,暗黙的な物理インフォームドセンサモデルを構築し,生のレーダ測定を直接合成する。
本研究では,密集した車両やインフラを備えた都市景観を含む,多様な屋外シナリオにおける手法の有効性を検証する。
論文 参考訳(メタデータ) (2024-05-07T20:44:48Z) - RadarNet: Exploiting Radar for Robust Perception of Dynamic Objects [73.80316195652493]
我々は、自動運転車の文脈における認識のためにRadarを利用する問題に取り組む。
我々は、LiDARとRadarの両方のセンサーを知覚に利用した新しいソリューションを提案する。
RadarNetと呼ばれる我々のアプローチは、ボクセルベースの早期核融合と注意に基づく後期核融合を特徴としている。
論文 参考訳(メタデータ) (2020-07-28T17:15:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。