論文の概要: MVRD-Bench: Multi-View Learning and Benchmarking for Dynamic Remote Photoplethysmography under Occlusion
- arxiv url: http://arxiv.org/abs/2603.22826v1
- Date: Tue, 24 Mar 2026 06:01:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.326373
- Title: MVRD-Bench: Multi-View Learning and Benchmarking for Dynamic Remote Photoplethysmography under Occlusion
- Title(参考訳): MVRD-Bench:Occlusion下での動的リモート光胸腺撮影のためのマルチビュー学習とベンチマーク
- Authors: Zuxian He, Xu Cheng, Zhaodong Sun, Haoyu Chen, Jingang Shi, Xiaobai Li, Guoying Zhao,
- Abstract要約: リモート光胸腺撮影(Remote Photoplethysmography, CFA)は、顔画像の微妙な肌の色変化を分析し、生理的信号を推定するノンコンタクト技術である。
既存のrメソッドは、静的およびシングルビューの顔ビデオに依存するため、顔の動きやシナリオ下での性能劣化に遭遇することが多い。
本研究は、多視点顔ビデオにおけるr測定における運動誘発リズム閉塞問題に対処することに焦点を当てる。
- 参考スコア(独自算出の注目度): 38.964013784587436
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Remote photoplethysmography (rPPG) is a non-contact technique that estimates physiological signals by analyzing subtle skin color changes in facial videos. Existing rPPG methods often encounter performance degradation under facial motion and occlusion scenarios due to their reliance on static and single-view facial videos. Thus, this work focuses on tackling the motion-induced occlusion problem for rPPG measurement in unconstrained multi-view facial videos. Specifically, we introduce a Multi-View rPPG Dataset (MVRD), a high-quality benchmark dataset featuring synchronized facial videos from three viewpoints under stationary, speaking, and head movement scenarios to better match real-world conditions. We also propose MVRD-rPPG, a unified multi-view rPPG learning framework that fuses complementary visual cues to maintain robust facial skin coverage, especially under motion conditions. Our method integrates an Adaptive Temporal Optical Compensation (ATOC) module for motion artifact suppression, a Rhythm-Visual Dual-Stream Network to disentangle rhythmic and appearance-related features, and a Multi-View Correlation-Aware Attention (MVCA) for adaptive view-wise signal aggregation. Furthermore, we introduce a Correlation Frequency Adversarial (CFA) learning strategy, which jointly enforces temporal accuracy, spectral consistency, and perceptual realism in the predicted signals. Extensive experiments and ablation studies on the MVRD dataset demonstrate the superiority of our approach. In the MVRD movement scenario, MVRD-rPPG achieves an MAE of 0.90 and a Pearson correlation coefficient (R) of 0.99. The source code and dataset will be made available.
- Abstract(参考訳): リモート光胸腺撮影(Remote Photoplethysmography, RPPG)は、顔画像の微妙な肌の色変化を分析して生理的信号を推定する非接触技術である。
既存のrPPG法は、静的かつ単一視点の顔ビデオに依存しているため、顔の動きや閉塞シナリオ下での性能劣化に遭遇することが多い。
そこで本研究では,rPPG測定における動作誘発閉塞問題に対処することに焦点を当てた。
具体的には,静止,発話,頭部運動の3視点からの顔映像の同期を特徴とする,高品質なベンチマークデータセットであるMulti-View rPPG Dataset (MVRD)を紹介した。
また,MVRD-rPPGは,特に運動条件下での顔の皮膚被覆性を維持するために,相補的な視覚的手がかりを融合した統合多視点rPPG学習フレームワークである。
提案手法では,動作アーチファクト抑圧のための適応時間補償 (ATOC) モジュール,リズム・ビジュアル・デュアルストリーム・ネットワークによるリズミカル・外観関連特徴の分散化,および適応的な視線信号集約のための多視点相関認識 (MVCA) モジュールを統合した。
さらに,予測信号の時間的正確性,スペクトルの整合性,知覚的リアリズムを両立させる相関周波数適応学習戦略を導入する。
MVRDデータセットに関する大規模な実験とアブレーション研究は、我々のアプローチの優位性を実証している。
MVRD移動シナリオでは、MVRD-rPPGは0.90のMAEと0.99のピアソン相関係数(R)を達成する。
ソースコードとデータセットが利用可能になる。
関連論文リスト
- PhysNeXt: Next-Generation Dual-Branch Structured Attention Fusion Network for Remote Photoplethysmography Measurement [50.524262997433546]
ハーモグラフィーは、心臓の脈動によって引き起こされる顔の皮膚の色変化を分析し、心拍数やその他の重要な兆候を測定することができる。
現在の手法は主に生のビデオからエンド・ツー・エンドのモデリング、または微妙な心拍マップ(ST)表現に基づいている。
本稿では,ビデオフレームとST表現を併用したデュアルインプットディープラーニングフレームワークであるPhysMapXtを提案する。
論文 参考訳(メタデータ) (2026-03-20T08:37:02Z) - MIORe & VAR-MIORe: Benchmarks to Push the Boundaries of Restoration [53.180212987726556]
動作回復ベンチマークの限界に対処する2つの新しいマルチタスクデータセットであるMIOReとVAR-MIOReを紹介する。
私たちのデータセットは、複雑なエゴカメラの動き、動的マルチオブジェクト相互作用、深さ依存のぼかし効果など、幅広い動きシナリオを捉えています。
論文 参考訳(メタデータ) (2025-09-08T15:34:31Z) - Periodic-MAE: Periodic Video Masked Autoencoder for rPPG Estimation [6.32655874508904]
本研究では,肌の色調の微妙な変化を経時的に捉え,顔画像から周期的な信号の一般的な表現を学習する手法を提案する。
提案手法をPURE, U-BFCr, MMPD, V-BFC4Vデータセット上で評価した。
その結果,特にクロスデータセット評価の課題において,大幅な性能向上が見られた。
論文 参考訳(メタデータ) (2025-06-27T02:18:10Z) - PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing [49.243031514520794]
LLM(Large Language Models)は、テキスト中心の設計のため、長距離信号の取得に優れる。
PhysLLMは最先端の精度とロバスト性を実現し、照明のバリエーションや動きのシナリオにまたがる優れた一般化を示す。
論文 参考訳(メタデータ) (2025-05-06T15:18:38Z) - Temporal-Consistent Video Restoration with Pre-trained Diffusion Models [51.47188802535954]
ビデオ復元(VR)は、劣化したビデオから高品質なビデオを復元することを目的としている。
事前訓練拡散モデル(DM)を用いた最近のゼロショットVR法は,逆拡散時の近似誤差と時間的整合性の欠如に悩まされている。
本稿では,DMのシード空間におけるビデオフレームを直接パラメータ化し,近似誤差を排除した新しいMAP(Posterior Maximum)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-19T03:41:56Z) - Dual-path TokenLearner for Remote Photoplethysmography-based
Physiological Measurement with Facial Videos [24.785755814666086]
本稿では,学習可能なトークンの概念を利用して,ビデオのグローバルな視点から空間的・時間的情報的コンテキストを統合する。
TTL(Temporal TokenLearner)は、頭部運動などの時間的乱れを排除し、心拍の準周期パターンを推定するように設計されている。
論文 参考訳(メタデータ) (2023-08-15T13:45:45Z) - Learning Motion-Robust Remote Photoplethysmography through Arbitrary
Resolution Videos [31.512551653273373]
実世界の長期健康モニタリングのシナリオでは、参加者と頭の動きの距離は時間によって異なり、その結果、不正確なrの測定結果となる。
本稿では,カメラと参加者の一定距離を設計した従来のRモデルと異なり,PFE (physiological signal feature extract block) とTFA (temporal face alignment block) の2つのプラグ・アンド・プレイブロックを提案する。
論文 参考訳(メタデータ) (2022-11-30T11:50:08Z) - Slow-Fast Visual Tempo Learning for Video-based Action Recognition [78.3820439082979]
アクション・ビジュアル・テンポ(Action visual tempo)は、アクションのダイナミクスと時間スケールを特徴付ける。
以前の方法は、複数のレートで生のビデオをサンプリングするか、階層的にバックボーンの特徴をサンプリングすることによって、視覚的テンポをキャプチャする。
単一層における低レベルバックボーン特徴からアクション・テンポを抽出するための時間相関モジュール(TCM)を提案する。
論文 参考訳(メタデータ) (2022-02-24T14:20:04Z) - TransPPG: Two-stream Transformer for Remote Heart Rate Estimate [4.866431869728018]
遠隔光麻痺(r)を用いた非接触顔画像による心拍数推定は,多くの応用において大きな可能性を秘めている。
しかし、現実的な応用には、頭部の動きや不安定な照明を伴う複雑な環境下であっても、正確な結果が必要である。
オーバーラップを用いたマルチスケール適応空間・テンポラルマップと呼ばれる特徴マップに,各顔映像シーケンスを埋め込む新しい映像埋め込み手法を提案する。
論文 参考訳(メタデータ) (2022-01-26T11:11:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。