論文の概要: Residual Flow Matching with Dynamic Cross-Interaction for 3D Multi-Person Motion Prediction
- arxiv url: http://arxiv.org/abs/2608.03379v1
- Date: Tue, 04 Aug 2026 09:28:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.112149
- Title: Residual Flow Matching with Dynamic Cross-Interaction for 3D Multi-Person Motion Prediction
- Title(参考訳): 3次元マルチパーソン動作予測のための動的クロスインタラクションによる残留流のマッチング
- Abstract要約: 3次元多対人動作予測は、個々の運動学と対人相互作用の両方をモデル化する必要がある。
フローマッチングは、予測精度を向上させるために多仮説生成に有効である。
本稿では,事前ガイド型残留流れマッチングフレームワークを提案する。
- 参考スコア(独自算出の注目度): 10.207329247559242
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D multi-person motion prediction requires modeling both individual kinematics and inter-person interactions. While Flow Matching is effective for multi-hypothesis generation to improve prediction accuracy, directly predicting skeletal sequences from pure noise often compromises structural consistency and introduces unreliable cross-agent interactions during early noise-dominated integration steps. To address this, we propose a Prior-Guided Residual Flow Matching framework. First, a Deterministic Coarse Prior (DCP) establishes a kinematic anchor, formulating the generative process as a conditional flow over motion residuals to simplify the generative objective and preserve structural stability. Second, a Dynamic Cross-Interaction (DCI) mechanism temporally synchronizes inter-agent message-passing with the integration progress, ensuring the extraction of reliable social contexts and improving multi-person motion fidelity. Finally, a decoupled joint-motion architecture with bidirectional fusion effectively preserves fine-grained kinematic coherence. Extensive experiments demonstrate that our approach achieves state-of-the-art prediction accuracy across multiple datasets. Code is available at https://github.com/Wei-Wei-a/Residual-Flow-Matching-with-Dynamic-Cross-Interaction-for-3D-Multi-Pers on-Motion-Prediction.
- Abstract(参考訳): 3次元多対人動作予測は、個々の運動学と対人相互作用の両方をモデル化する必要がある。
Flow Matchingはマルチハイプセシス生成に有効であり、予測精度を向上させるが、純粋なノイズからの骨格配列を直接予測することは、しばしば構造的一貫性を損なうことがあり、初期ノイズに支配された統合ステップにおいて、信頼性の低いクロスエージェント相互作用を導入する。
そこで本研究では,事前ガイド型残留流れマッチングフレームワークを提案する。
第一に、決定論的粗い前駆体 (DCP) がキネマティックアンカーを確立し、生成過程を運動残差上の条件流として定式化し、生成目的を簡素化し、構造安定性を維持する。
第2に、動的クロスアクション(DCI)機構は、エージェント間メッセージパッシングと統合の進捗を時間的に同期させ、信頼性の高い社会的コンテキストの抽出を確実にし、複数対人動作の忠実度を向上させる。
最後に、双方向融合による分離された関節運動構造は、きめ細かな運動コヒーレンスを効果的に保存する。
大規模な実験により,複数のデータセットにまたがる最先端の予測精度が得られた。
コードはhttps://github.com/Wei-Wei-a/Residual-Flow-Matching-with-Dynamic-Cross-Interaction-for-3D-Multi-Pers on-Motion-Predictionで公開されている。
関連論文リスト
- HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching [113.81911881001905]
HO-Flowはテキストと正準3Dオブジェクトから現実的な手動動作シーケンスを合成するためのフレームワークである。
まず、手動と物体の動きのシーケンスを統一された潜在多様体に符号化するために、相互作用を意識した変分オートエンコーダを用いる。
次に、自己回帰的時間的推論と連続的な潜伏生成を組み合わせたマスク付きフローマッチングモデルを利用する。
論文 参考訳(メタデータ) (2026-04-12T22:06:11Z) - Sequence Diffusion Model for Temporal Link Prediction in Continuous-Time Dynamic Graph [5.83093727437226]
既存の時間グラフニューラルネットワークは、主に歴史的相互作用の学習表現に焦点を当てている。
本稿では,動的グラフ学習を生成的認知と統合する,新しいシーケンスレベルの拡散フレームワークを提案する。
我々は,時間的リンク予測タスクにおいて,このフレームワークが常に最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2026-01-30T18:02:12Z) - InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs [72.5651722107621]
InterAgentはテキスト駆動型物理ベースのマルチエージェントヒューマノイド制御のためのエンドツーエンドフレームワークである。
本稿では,マルチストリームブロックを備えた自己回帰拡散トランスフォーマーを提案する。
また,空間依存性の微粒化を明示的に捉えた対話グラフのエクスセプション表現を提案する。
論文 参考訳(メタデータ) (2025-12-08T10:46:01Z) - Multimodal Quantitative Measures for Multiparty Behaviour Evaluation [6.709251546882382]
骨格運動データにおける多人数社会的行動の客観的評価のための統合的介入駆動型フレームワークを提案する。
3つの理論駆動摂動による計量感度の検証を行った。
混合効果分析により、予測可能な、共同非依存的なシフトが明らかになる。
論文 参考訳(メタデータ) (2025-08-01T13:46:12Z) - Multi-Modal Graph Convolutional Network with Sinusoidal Encoding for Robust Human Action Segmentation [10.122882293302787]
人間の行動の時間的セグメンテーションは 知的ロボットにとって 協調的な環境において 不可欠です
本稿では,低フレームレート(例えば1fps)の視覚データと高フレームレート(例えば30fps)のモーションデータを統合するマルチモーダルグラフ畳み込みネットワーク(MMGCN)を提案する。
我々の手法は、特にアクションセグメンテーションの精度において最先端の手法よりも優れている。
論文 参考訳(メタデータ) (2025-07-01T13:55:57Z) - ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions [91.55655961014027]
シーン理解には3次元セマンティック占有とフロー予測が不可欠である。
本稿では,3つの改善点を目標とした視覚ベースのフレームワークを提案する。
我々の純粋な畳み込みアーキテクチャは、セマンティック占有率とジョイントセマンティックフロー予測の両方のために、複数のベンチマーク上で新しいSOTA性能を確立する。
論文 参考訳(メタデータ) (2024-11-12T11:32:56Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - Modeling Continuous Motion for 3D Point Cloud Object Tracking [54.48716096286417]
本稿では,各トラックレットを連続ストリームとみなす新しいアプローチを提案する。
各タイムスタンプでは、現在のフレームだけがネットワークに送られ、メモリバンクに格納された複数フレームの履歴機能と相互作用する。
頑健な追跡のためのマルチフレーム機能の利用性を高めるために,コントラッシブシーケンス強化戦略を提案する。
論文 参考訳(メタデータ) (2023-03-14T02:58:27Z) - Flow-based Spatio-Temporal Structured Prediction of Motion Dynamics [21.24885597341643]
条件付き流れ (CNF) は、高次元と相互相関を持つ複雑な分布を表現できるフレキシブルな生成モデルである。
本研究では,時間的入力特徴の出力を自己回帰的に正規化する新しい手法としてMotionFlowを提案する。
本稿では,予測,動き予測時系列予測,二分節分割などのタスクに本手法を適用した。
論文 参考訳(メタデータ) (2021-04-09T14:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。