論文の概要: Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring
- arxiv url: http://arxiv.org/abs/2607.16760v1
- Date: Sat, 18 Jul 2026 10:52:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.254973
- Title: Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring
- Title(参考訳): ドライバー監視のための2サイクルオートエンコーダを用いた時空間行動単位検出
- Abstract要約: ドライバー監視システムは、悲しみ、気晴らし、認知的負荷をリアルタイムで推測するために、顔の手がかりに依存している。
既存のAU検出器は、空間的外観と時間力学を別々に扱う。
本稿では、2つのサイクル一貫性を持つオートエンコーダブランチからなるツインサイクルオートエンコーダ(TCA)を提案する。
組込みJetson NXプラットフォーム上でのリアルタイムスループットの持続性を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Driver monitoring systems (DMS) increasingly rely on facial cues to infer drowsiness, distraction, and cognitive load in real time. Facial Action Units (AUs), grounded in the Facial Action Coding System (FACS), provide an objective and interpretable representation of such states, but their automatic detection in the driving context is complicated by low and variable illumination, partial occlusion, head-pose variation, and the subtlety and short duration of relevant AU activations. Existing AU detectors largely treat spatial appearance and temporal dynamics separately, limiting their ability to exploit self-supervisory signal from abundant unlabeled driving video. We propose the Twin Cycle Autoencoder (TCA), a spatiotemporal architecture composed of two coupled cycle-consistent autoencoder branches: a Spatial Cycle Autoencoder that disentangles AU-relevant appearance from identity through image-level cycle consistency, and a Temporal Cycle Autoencoder that enforces forward-backward consistency over latent AU trajectories to capture onset-apex-offset dynamics. The two branches are coupled through a cross-branch latent alignment loss and fused via an attention module before multi-label AU classification. We evaluate TCA on the DISFA and BP4D benchmarks and on an in-cabin naturalistic driving dataset, and observe consistent improvements over CNN-RNN, 3D-CNN, and graph-based AU baselines, particularly for low-intensity and rapidly transitioning AUs relevant to fatigue (AU45, AU43) and yawning (AU26). We further show the model sustains real-time throughput on an embedded Jetson Xavier NX platform, supporting its use in production-grade advanced driver assistance systems (ADAS).
- Abstract(参考訳): ドライバー監視システム(DMS)は、悲しみ、気晴らし、認知的負荷をリアルタイムで推測するために、顔の手がかりにますます依存している。
ファシアル・アクション・コーディング・システム(FACS)に根ざした顔行動ユニット(AU)は、これらの状態の客観的かつ解釈可能な表現を提供するが、運転コンテキストにおけるそれらの自動検出は、低照度および可変照度、部分閉塞、主目的変動、関連するAUアクティベーションの微妙で短い持続時間によって複雑である。
既存のAU検出器は、空間的な外観と時間的ダイナミクスを別々に扱い、豊富なラベルのない運転ビデオから自己監督信号を利用する能力を制限している。
本稿では、2つの結合したサイクル一貫性を持つオートエンコーダブランチからなる時空間アーキテクチャであるツインサイクルオートエンコーダ(TCA)と、画像レベルのサイクル整合性を通じてAU関連外観を識別から切り離す時空間サイクルオートエンコーダ(TCA)と、遅延AUトラジェクトリを前方に整合させてオンセット・アプテック・オフセットダイナミクスを捕捉する時空間サイクルオートエンコーダ(TCA)を提案する。
2つの分岐は、分岐遅延アライメント損失を介して結合され、マルチラベルAU分類の前にアテンションモジュールを介して融合される。
我々は,DisFAおよびBP4Dベンチマークおよびキャビン内自然主義運転データセット上でTCAを評価し,CNN-RNN,3D-CNN,グラフベースのAUベースラインに対する一貫した改善,特に疲労に関連するAU(AU45,AU43)およびあくび(AU26)について検討した。
さらに,本モデルが組み込まれたJetson Xavier NXプラットフォーム上でリアルタイムスループットを維持することを示し,実運用レベルの高度な運転支援システム(ADAS)での利用をサポートする。
関連論文リスト
- Real-Time Automatic License Plate Recognition Using YOLOv8, SORT Tracking, and Temporal Data Interpolation [0.0]
本研究は,自動ナンバープレート認識のための5段階のエンドツーエンドアルゴリズムパイプラインを提案する。
提案されたアーキテクチャは、車両をローカライズするための非常に強力なYOLOv8ナノモデルを活用する。
さらに重要なのは、時間境界ボックスのオフラインメカニズムが、断片化されたパスを再キャストするために開始されることだ。
論文 参考訳(メタデータ) (2026-06-03T10:05:18Z) - A Topology-Aware Spatiotemporal Handover Framework for Continuous Multi-UAV Tracking [6.2002105625228845]
本稿では,グローバルなアイデンティティの持続性を扱うために,リアルタイムマルチカメラマルチ車両追跡(MCMT)システムを提案する。
本稿では,トポロジに基づく時空間ハンドオーバ機構を提案する。
交差点や合流交通を含む複雑な都市環境に関する実験結果は、連続交通流の99.8%のハンドオーバ成功率(HOSR)を示す。
論文 参考訳(メタデータ) (2026-05-15T09:38:09Z) - Efficient Sequential Neural Network with Spatial-Temporal Attention and Linear LSTM for Robust Lane Detection Using Multi-Frame Images [3.8825198843426345]
レーン検出は、自動走行車(AV)と先進運転支援システムにとって重要な認識課題である。
現行の手法では、正確で堅牢でリアルタイムに車線検出を実現するための汎用性が欠如している。
本研究では,車線の重要な特徴に焦点をあてる空間的注意機構を備えた新しい逐次ニューラルネットワークモデルを提案する。
論文 参考訳(メタデータ) (2026-02-03T15:51:29Z) - STREAM-VAE: Dual-Path Routing for Slow and Fast Dynamics in Vehicle Telemetry Anomaly Detection [1.7751300245073598]
STREAM-VAEは、自動車テレメトリ時系列データにおける異常検出のための変分自動エンコーダである。
モデルでは,低速ドリフトと高速スパイク信号のダイナミックスを分離するためにデュアルパスエンコーダと,過渡偏差を表すデコーダを用いる。
論文 参考訳(メタデータ) (2025-11-19T10:58:40Z) - Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos [58.156141601478794]
マルチオブジェクトトラッキング(UAVT)は、ビデオのフレーム間で一貫したアイデンティティを維持しながら、複数のオブジェクトを追跡することを目的としている。
既存の手法は、通常、動作キューと外観を別々にモデル化し、それらの相互作用を見渡して、最適下追跡性能をもたらす。
本稿では、AMC行列とMTCモジュールの2つの主要コンポーネントを通して、外観と動きの手がかりを利用するAMOTを提案する。
論文 参考訳(メタデータ) (2025-08-03T12:06:47Z) - Electromyography-Based Gesture Recognition: Hierarchical Feature Extraction for Enhanced Spatial-Temporal Dynamics [0.7083699704958353]
本稿では, 時間的時間的特徴抽出手法として, 軽量な圧縮励起深層学習手法を提案する。
提案したモデルは、Ninapro DB2、DB4、DB5データセットでそれぞれ96.41%、92.40%、93.34%の精度でテストされた。
論文 参考訳(メタデータ) (2025-04-04T07:11:12Z) - DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving [62.62464518137153]
DriveTransformerは、スケールアップを簡単にするためのシンプルなE2E-ADフレームワークである。
タスク・セルフ・アテンション、センサー・クロス・アテンション、時間的クロス・アテンションという3つの統合された操作で構成されている。
シミュレーションされたクローズドループベンチマークBench2Driveと、FPSの高い実世界のオープンループベンチマークnuScenesの両方で、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-07T11:41:18Z) - Self-Supervised Representation Learning from Temporal Ordering of
Automated Driving Sequences [49.91741677556553]
本研究では、認識タスクのための地域レベルの特徴表現を事前学習するための時間順述前文タスクであるTempOを提案する。
我々は各フレームを、オブジェクト検出やトラッキングシステムにとって自然な表現である、未順序な特徴ベクトルのセットで埋め込む。
BDD100K、nu Images、MOT17データセットの大規模な評価は、私たちのTempO事前学習アプローチがシングルフレームの自己教師型学習方法よりも優れていることを示している。
論文 参考訳(メタデータ) (2023-02-17T18:18:27Z) - A Spatio-Temporal Multilayer Perceptron for Gesture Recognition [70.34489104710366]
自律走行車におけるジェスチャー認識のための多層状態重み付きパーセプトロンを提案する。
提案手法の有望な性能を示すため,TCGおよびDrive&Actデータセットの評価を行った。
私たちは、そのリアルタイム能力と安定した実行を示すために、モデルを自動運転車にデプロイします。
論文 参考訳(メタデータ) (2022-04-25T08:42:47Z) - Dual Causal/Non-Causal Self-Attention for Streaming End-to-End Speech
Recognition [58.69803243323346]
注意に基づくエンドツーエンド自動音声認識(ASR)システムは、最近、多くのタスクに対する最先端の結果を実証している。
しかし、自己注意および注意に基づくエンコーダデコーダモデルの応用は、ASRのストリーミングでは依然として困難である。
二重因果的/非因果的自己注意アーキテクチャを提案するが、これは制限された自己意識とは対照的に、全体的なコンテキストが単一のレイヤのルックアヘッドを超えて成長することを妨げている。
論文 参考訳(メタデータ) (2021-07-02T20:56:13Z) - A Driving Behavior Recognition Model with Bi-LSTM and Multi-Scale CNN [59.57221522897815]
運転行動認識のための軌道情報に基づくニューラルネットワークモデルを提案する。
提案手法を公開BLVDデータセット上で評価し,満足な性能を実現する。
論文 参考訳(メタデータ) (2021-03-01T06:47:29Z) - DS-Net: Dynamic Spatiotemporal Network for Video Salient Object
Detection [78.04869214450963]
時間情報と空間情報のより効果的な融合のための新しい動的時空間ネットワーク(DSNet)を提案する。
提案手法は最先端アルゴリズムよりも優れた性能が得られることを示す。
論文 参考訳(メタデータ) (2020-12-09T06:42:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。