論文の概要: FUSE: Frame-Unified Stress Estimation from Facial Video
- arxiv url: http://arxiv.org/abs/2608.10442v2
- Date: Tue, 18 Aug 2026 05:21:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 15:55:59.072583
- Title: FUSE: Frame-Unified Stress Estimation from Facial Video
- Title(参考訳): FUSE:顔映像からのフレーム統一応力推定
- Abstract要約: FUSEは、時間的ウィンドウや外部セグメンテーションを使わずに、完全な記録を単一の入力として処理する、顔とビデオのストレス検出フレームワークである。
t = 1 の時間ストライドでは、FUSE は完全な 120 秒の記録を 1 入力として保持し、30 fps で 3,600 フレームに対応する。
FUSE は t = 15 で 69.44% の最高テスト精度を達成し、フルフレーム構成は 69.03% で競争力を維持している。
- 参考スコア(独自算出の注目度): 2.952577829076549
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automatic stress detection from facial video offers a practical path to non-intrusive affect monitoring, yet existing video-based approaches commonly decompose full recordings into short temporal windows before classification. This design introduces additional choices regarding window length, overlap, and aggregation, while limiting direct analysis of temporal information across the entire recording. In this study, we present FUSE (Frame-Unified Stress Estimation), a facial-video stress detection framework that processes complete recordings as a single input without temporal windowing or external segmentation. The name reflects the defining operation of the method: rather than dividing a recording into short clips, all frames are fused into one unified two-dimensional representation from which the stress state is estimated. This unification is realized by folding the temporal dimension into the channel dimension of the spatial representation, and the resulting high-dimensional input is processed using a unified asymmetric-attention architecture. At a temporal stride of t = 1, FUSE retains the full 120-second recording as one input, corresponding to 3,600 frames at 30 fps. Experiments on a 58-subject stress dataset using a stratified subject-level protocol evaluate seven temporal-stride configurations, ranging from full-frame input to sparse subsampling. FUSE achieves the highest test accuracy of 69.44% at t = 15, while the full-frame configuration remains competitive at 69.03%. Across the stride range, computational cost varies from 12.48 to 348.78 GFLOPs, showing the trade-off between temporal density and efficiency. These results demonstrate that temporal windowing is not required for effective facial-video stress detection in this setting, and that complete-recording inference can be achieved within a single unified architecture.
- Abstract(参考訳): 顔画像からの自動ストレス検出は、非侵襲的な影響モニタリングへの実践的な経路を提供するが、既存のビデオベースのアプローチでは、分類する前に全録音を短い時間窓に分解することが多い。
この設計では、ウィンドウ長、オーバーラップ、アグリゲーションに関する追加の選択肢を導入し、記録全体の時間情報の直接解析を制限した。
本研究では,FUSE (Frame-Unified Stress Estimation) を提案する。このフレームワークは,時間ウィンドウや外部セグメンテーションを使わずに,完全な記録を単一の入力として処理する。
記録を短いクリップに分割する代わりに、すべてのフレームは、ストレス状態が推定される1つの統一された2次元表現に融合される。
この統一化は、時間次元を空間表現のチャネル次元に折り曲げることで実現され、結果として得られる高次元入力は、統一された非対称アテンションアーキテクチャを用いて処理される。
t = 1 の時間ストライドでは、FUSE は完全な 120 秒の記録を 1 入力として保持し、30 fps で 3,600 フレームに対応する。
階層化された被写体レベルプロトコルを用いた58目的応力データセットの実験は、フルフレーム入力からスパースサブサンプリングまでの7つの時間的ストライド構成を評価した。
FUSE は t = 15 で 69.44% の最高テスト精度を達成し、フルフレーム構成は 69.03% で競争力を維持している。
ストライド範囲全体で計算コストは 12.48 から 348.78 GFLOP まで様々であり、時間密度と効率のトレードオフを示している。
これらの結果から, この環境では, 時間的ウィンドウ化は顔と映像の効果的なストレス検出には必要ではなく, 単一統一アーキテクチャで完全に記録された推論が達成できることが示唆された。
関連論文リスト
- A Multi-Task Deep Learning Framework for Real-Time Intelligent Video Surveillance with Temporal Event Validation [0.0]
本稿では,顔認識,ナンバープレート認識,武器検出,火災・煙検知,人間の行動認識を同時に行うマルチタスク深層学習フレームワークを提案する。
連続ビデオの堅牢性を改善するため、全ての検出モジュールは時間的イベントバリデーションアーキテクチャに統合される。
その結果,コモディティハードウェア上では,フレーム毎のレイテンシが100ミリ秒未満のリアルタイム動作が維持されていることがわかった。
論文 参考訳(メタデータ) (2026-07-03T09:20:58Z) - VigilFormer: Deformable Attention for Video Anomaly Detection with Causal Risk Inference [2.538209532048867]
本稿では,ビデオ監視映像の異常を検出するために,変形可能な注意と因果時間モデルを組み合わせた統合フレームワークを提案する。
VigilFormer, ShanghaiTech, CUHK Avenueのフレームワークを1つのGPU上で41.5 FPSで評価した。
論文 参考訳(メタデータ) (2026-05-31T14:27:57Z) - TIE: Time Interval Encoding for Video Generation over Events [50.66585165263848]
ディレクタースタイルのプロンプト、ロボットアクション予測、インタラクティブなビデオエージェントは、同時イベントに対する時間的根拠を要求する。
現代のビデオジェネレータは、ポイントワイドな位置エンコーディングを通して、タイムを離散的なポイントとして表現する。
Time Interval TIEは、プラグイン・アンド・プレイ・インターバル・アウェアの一般化である。
論文 参考訳(メタデータ) (2026-05-11T13:23:14Z) - Event-based Visual Deformation Measurement [76.25283405575108]
視覚的変形測定は、カメラ観測から表面の動きを追跡することによって、高密度な変形場を復元することを目的としている。
従来の画像ベースの手法は、対応検索空間を制限するため、最小限のフレーム間動作に依存している。
本研究では,時間的に密集した動きキューやフレームのイベントを利用して,空間的に密集した正確な推定を行うイベントフレーム融合フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-16T01:04:48Z) - StableDPT: Temporal Stable Monocular Video Depth Estimation [14.453483279783908]
本稿では,最新の画像ベース(深度)推定モデルをビデオ処理に適用する手法を提案する。
我々のアーキテクチャは、市販のViTエンコーダ上に構築され、Dense Prediction Transformer (DPT) ヘッドが強化されている。
複数のベンチマークデータセットに対する評価では、リアルタイムシナリオにおける時間的一貫性の向上、最先端のパフォーマンスの競争力、および上位2倍高速な処理が示されている。
論文 参考訳(メタデータ) (2026-01-06T08:02:14Z) - FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing [97.35186681023025]
FFP-300Kは、720p解像度と81フレームの高忠実度ビデオペアの大規模データセットである。
本稿では,第1フレームの外観維持とソース映像の動作保存の緊張を解消する,真の誘導不要なFFPのための新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-05T01:46:22Z) - You Can Ground Earlier than See: An Effective and Efficient Pipeline for
Temporal Sentence Grounding in Compressed Videos [56.676761067861236]
ビデオがトリミングされていない場合、時間的文のグラウンド化は、文問合せに従って目的のモーメントを意味的に見つけることを目的としている。
それまでの優れた作品は、かなり成功したが、それらはデコードされたフレームから抽出されたハイレベルな視覚的特徴にのみ焦点を当てている。
本稿では,圧縮された映像を直接視覚入力として利用する,圧縮された領域のTSGを提案する。
論文 参考訳(メタデータ) (2023-03-14T12:53:27Z) - Towards Streaming Perception [70.68520310095155]
本稿では、リアルタイムオンライン知覚のための単一のメトリクスにレイテンシと精度を協調的に統合するアプローチを提案する。
この指標の背後にある重要な洞察は、瞬間ごとに認識スタック全体の出力を共同で評価することである。
本稿では,都市ビデオストリームにおけるオブジェクト検出とインスタンスセグメンテーションの具体的タスクに注目し,高品質で時間依存的なアノテーションを備えた新しいデータセットを寄贈する。
論文 参考訳(メタデータ) (2020-05-21T01:51:35Z) - Efficient Semantic Video Segmentation with Per-frame Inference [117.97423110566963]
本研究では,フレームごとの効率的なセマンティックビデオセグメンテーションを推論プロセス中に処理する。
そこで我々は,コンパクトモデルと大規模モデルのパフォーマンスギャップを狭めるために,新しい知識蒸留法を設計した。
論文 参考訳(メタデータ) (2020-02-26T12:24:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。