論文の概要: Learning When to Listen: Gated Affect Fusion for Human Motion Prediction
- arxiv url: http://arxiv.org/abs/2607.00296v1
- Date: Wed, 01 Jul 2026 00:47:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.674263
- Title: Learning When to Listen: Gated Affect Fusion for Human Motion Prediction
- Title(参考訳): 音を聴くときの学習 : 人間の動作予測のためのゲーテッド・アフェクト・フュージョン
- Abstract要約: 本研究では,感情条件付き予測システムの有用性と時間的制約について検討する。
本稿では,Gated Affect Transformer (GAT)を導入し,モーダル情報の流れを動的に制御する。
以上の結果から, 顔への影響は相補的行動の手がかりとみなす必要があるという実証的証拠が得られた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Human motion forecasting in unconstrained real-world videos remains challenging due to the ambiguity of future behaviors and the presence of noisy multimodal observations. While facial affect potentially provides complementary behavioral cues, its practical utility and mechanistic boundaries within motion forecasting frameworks remain poorly understood. In this work, we present a systematic study investigating the utility and temporal limitations of affect-conditioned forecasting in-the-wild. We establish a rigorous multimodal pipeline combining MediaPipe body pose trajectories with HSEmotion facial affect representations, and introduce the Gated Affect Transformer (GAT) to dynamically regulate cross-modal information flow. Through extensive multi-horizon evaluations under a strict subject-wise protocol, we demonstrate that naive early cross-modal concatenation consistently degrades forecasting accuracy relative to pose-only baselines. Conversely, our proposed gating mechanism stabilizes cross-modal integration by adaptively controlling the affective stream. Crucially, controlled counterfactual experiments using shuffled and randomized affect inputs reveal that the learned gate successfully suppresses unstructured cross-modal noise while remaining responsive to plausible affective signals. Furthermore, our empirical results indicate that facial affect features provide bounded, horizon-dependent predictive cues strictly within short-to-medium windows (e.g., 30 frames), whereas long-term trajectories remain predominantly governed by intrinsic kinematic continuity. Our findings provide empirical evidence that facial affect should be regarded as a complementary behavioral cue rather than a dominant driver of future motion, offering practical guidance for selective multimodal fusion in unconstrained human motion forecasting.
- Abstract(参考訳): 制約のない実世界のビデオにおける人間の動きの予測は、将来の行動の曖昧さとノイズの多いマルチモーダルな観察の存在のため、依然として困難である。
顔の影響は相補的な行動の手がかりをもたらす可能性があるが、その実用性と運動予測フレームワーク内の機械的境界は理解されていない。
本研究では,感情条件付き予測システムの有用性と時間的制約について検討する。
我々は、MediaPipeのボディポーズ軌道とHSEmotionの表情影響表現を組み合わせた厳密なマルチモーダルパイプラインを構築し、Gated Affect Transformer (GAT)を導入し、クロスモーダル情報フローを動的に制御する。
厳密な主観的プロトコルの下での広範囲なマルチホライズン評価を通じて、素早いクロスモーダル結合がポーズのみのベースラインに対する予測精度を一貫して低下させることを示した。
逆に,提案したゲーティング機構は,感情の流れを適応的に制御することで,モーダル間統合を安定化させる。
重大に、シャッフルされたランダムな影響入力を用いた制御された反ファクト実験により、学習されたゲートは、プラプシブルな感情信号に応答しながら、非構造的なクロスモーダルノイズを効果的に抑制できることが判明した。
さらに,本実験の結果から,短期から30フレームの窓内(例えば,30フレーム)において,顔への影響が厳密に有界・地平依存性の予測手がかりとなり,長期的軌道は内在的運動の連続性によって支配されていることが示唆された。
本研究は, 将来の運動の主流者というよりは, 顔への影響が相補的行動のキューと見なされるべきであることを示す実証的証拠を提供し, 制約のない人間の動作予測における選択的マルチモーダルフュージョンの実践的ガイダンスを提供する。
関連論文リスト
- SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation [65.81476183180527]
両パラダイムの長所を統合するクローズドループビズモータポリシであるSegDiffを紹介する。
SegDiffはデモをキーセグメンテーション間で動作セグメントに分解し、現在の状態から次のキーセグメンテーションまでの連続的な軌跡を予測することを学習する。
SegDiffは、さまざまなシミュレートされた実世界のシナリオにおいて、既存のアプローチよりも大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-07-13T02:48:03Z) - SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics [49.771521708359955]
SurgVistaは、空間的相互作用の不整合と時間的忠実性の崩壊を緩和する外科的世界モデルである。
それは、視覚的品質、時間的一貫性、相互作用の忠実性にまたがる最先端の手法を一貫して上回ります。
論文 参考訳(メタデータ) (2026-06-18T07:47:28Z) - Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model [0.0]
短期的な人間のポーズ予測は、対話システム、補助ロボット、感情に敏感な人間とコンピュータの相互作用において重要な役割を果たす。
本稿では,表情に基づく感情の埋め込みが,短時間のポーズ予測に補助的な条件付き信号を提供するかどうかを検討する。
論文 参考訳(メタデータ) (2026-04-26T04:56:45Z) - F2F-AP: Flow-to-Future Asynchronous Policy for Real-time Dynamic Manipulation [62.06267255986041]
非同期推論はロボット操作における主要なパラダイムとして現れている。
本稿では,予測対象の流れを利用して将来の観測を合成する新しい枠組みを提案する。
本手法は複雑な動的操作タスクにおける応答性と成功率を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-02T17:57:15Z) - \ extsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation [50.027425808733994]
textscNaVIDAは、ポリシー学習とアクショングラウンドの視覚力学と適応実行を結合した統合VLNフレームワークである。
textscNaVIDAは、チャンクベースの逆ダイナミクスによるトレーニングを強化し、視覚変化と対応するアクションの因果関係を学習する。
実験の結果,textscNaVIDAはパラメータが少ない最先端の手法に比べてナビゲーション性能が優れていることがわかった。
論文 参考訳(メタデータ) (2026-01-26T06:16:17Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - Neural Interaction Energy for Multi-Agent Trajectory Prediction [55.098754835213995]
ニューラル・インタラクション・エナジー(MATE)によるマルチエージェント軌道予測(Multi-Agent Trajectory Prediction)というフレームワークを導入する。
MATEは神経相互作用エネルギーを用いてエージェントの対話運動を評価する。
時間的安定性を高めるために,エージェント間相互作用制約とエージェント内動作制約という2つの制約を導入する。
論文 参考訳(メタデータ) (2024-04-25T12:47:47Z) - Motion-Scenario Decoupling for Rat-Aware Video Position Prediction:
Strategy and Benchmark [49.58762201363483]
本研究では,個人や環境の影響要因を考慮し,生物ロボットの動き予測データセットであるRatPoseを紹介する。
本稿では,シナリオ指向とモーション指向を効果的に分離するDual-stream Motion-Scenario Decouplingフレームワークを提案する。
難易度が異なるタスクに対して,提案したtextitDMSD フレームワークの大幅な性能向上を示す。
論文 参考訳(メタデータ) (2023-05-17T14:14:31Z) - BeLFusion: Latent Diffusion for Behavior-Driven Human Motion Prediction [26.306489700180627]
本研究では,人間の動作予測(HMP)における潜伏拡散モデルを利用して,行動がポーズや動きから切り離されている潜伏空間からサンプルを採取するモデルであるBeLFusionを提案する。
サンプルの動作を進行中の動作に転送する能力のおかげで、Belfusion氏の予測は、芸術の状況よりもはるかに現実的なさまざまな行動を示す。
論文 参考訳(メタデータ) (2022-11-25T18:59:03Z) - Prediction by Anticipation: An Action-Conditional Prediction Method
based on Interaction Learning [23.321627835039934]
潜在確率的生成過程の観点から相互作用を観察する予測による予測を提案する。
このビューでは、連続データフレームをアクション条件分布から順次サンプルに分解することができる。
提案する予測モデルである変分ベイズ型は,この条件分布のエビデンス下限 (elbo) を最大化するために訓練されている。
論文 参考訳(メタデータ) (2020-12-25T01:39:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。