論文の概要: Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion
- arxiv url: http://arxiv.org/abs/2607.05938v1
- Date: Tue, 07 Jul 2026 07:40:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.433597
- Title: Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion
- Title(参考訳): Pre-First, Condition-Second: スケーラブルで制御可能なハンドモーションコンプリート
- Abstract要約: 身体条件付きハンドモーションコンプリートのためのプレファースト・コンプリート・セカンド・フレームワークを提案する。
本研究の枠組みは,身体力学から協調的,運動論的に一貫した手の動きをリアルタイムで生成する。
我々のフレームワークは、エンドツーエンドの条件付きベースラインと比較して、キネマティックな妥当性、堅牢性、および制御性を改善します。
- 参考スコア(独自算出の注目度): 27.154998447721102
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthesizing hand motion that matches the full body motion and the semantic labels is a difficult task due to their high degrees of freedom and the lack of semantic labels. To cope with this issue, we propose a prior-first, condition-second framework for body-conditioned hand motion completion. Our framework first learns a generic body-hand kinematic prior from large-scale unstructured and unlabeled motion data, capturing the intrinsic coordination between global body dynamics and hand articulation. Semantic control is then introduced through lightweight adaptation on top of the frozen prior, avoiding the need to relearn kinematic structure for each control interface. Our framework centers on a streaming, autoregressive body-hand prior that generates coherent, kinematically consistent hand motion from body dynamics in real time, using structured kinematic modeling to maintain mechanical body-hand coupling. To enable practical controllability under limited supervision, we introduce semantically-layered adapters that inject conditioning signals at appropriate kinematic levels, supporting both self-supervised attribute control and weakly supervised text-driven control with only a few hours of labeled data. Extensive evaluations demonstrate that our framework improves kinematic plausibility, robustness, and controllability compared to end-to-end conditioned baselines, particularly in low-resource and cross-dataset settings. We further showcase real-time inference and an interactive authoring workflow, highlighting the applicability to production animation pipelines. Homepage: https://AIGAnimation.github.io/HandPrior/
- Abstract(参考訳): 全身運動と意味ラベルに一致する手の動きを合成することは、その自由度の高さと意味ラベルの欠如のために難しい作業である。
この問題に対処するため,身体条件付きハンドモーションコンプリートのためのプレファースト・コンプリート・セカンド・フレームワークを提案する。
筆者らはまず,大域的な身体力学と手関節の内在的協調を捉えるとともに,大規模で非構造的かつ未ラベルな動作データから全身運動学を学習する。
セマンティック制御は、凍結した前者の上の軽量な適応によって導入され、各制御インタフェースのキネティック構造を学習する必要がなくなる。
本フレームワークは, 機械的手関節結合を維持する構造的キネマティックモデリングを用いて, 身体動態からコヒーレントかつキネマティックに一貫した手の動きをリアルタイムに生成する, 自己回帰的手関節前処理に重点を置いている。
限定的な管理下での実用的な制御性を実現するため, 条件付き信号を適切なキネマティックレベルで注入するセマンティック層型アダプタを導入し, 自己教師付属性制御と弱教師付テキスト駆動制御の両方を, わずか数時間のラベル付きデータでサポートした。
大規模評価の結果,特に低リソースおよびクロスデータセット設定において,我々のフレームワークは,エンド・ツー・エンド条件のベースラインと比較して,キネマティック・ポーラビリティ,ロバスト性,制御性の向上を図っている。
さらに、リアルタイム推論とインタラクティブなオーサリングワークフローを紹介し、プロダクションアニメーションパイプラインの適用性を強調します。
ホームページ:https://AIGAnimation.github.io/HandPrior/
関連論文リスト
- MotionPyramid: Hierarchical Motion Representation and Residual Interfaces [9.880977839912811]
ヒューマノイド制御では、低レベル動作は即時運動コマンドを指定し、意味のある動作はより長い時間スケールで組織される。
我々は、モーションデータからそのような構造を学習する階層的なアクション表現であるMotionPyramidを紹介する。
MotionPyramidは再利用可能なマルチレベル表現に整理でき、制御性を犠牲にすることなく構造化された抽象化を提供する。
論文 参考訳(メタデータ) (2026-06-15T18:00:11Z) - SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control [72.5651722107621]
SCRIPTは、言語駆動の物理に基づくヒューマノイド制御のための多段階トレーニングフレームワークを備えたスケーラブルな拡散ポリシーである。
SCRIPTの中核はJAST-DiT(Joint Action-State-Text Diffusion Transformer)であり、アクション、物理状態、テキストを専用トークンストリームとして表現している。
自己回帰制御を安定させるために,近年の密集した文脈を保存し,長期的歴史から疎開したサンプルを抽出する非線形履歴条件付け機構を導入する。
論文 参考訳(メタデータ) (2026-05-21T14:17:21Z) - MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation [66.66098171359995]
MotionMERGEは、モーション言語モデルの粒度のギャップを埋める統合フレームワークである。
まず,詳細な理解と局所的な編集を含む,粒度の細かい言語誘導型モーションコントロールの研究の先駆者となる。
第2に,粒度調整を共同で行う新しい戦略である粒度事前学習を意識したReasoningAware Granularity-Synergyを設計する。
第3に、第1の微細時間補正命令とモーショングラウンドCoTアノテーションを備えた大規模データセットであるMotionFineEditをキュレートする。
論文 参考訳(メタデータ) (2026-05-18T18:00:04Z) - From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation [43.4347713269043]
動作条件付き手術用ビデオ生成は、ロボット手術にとって非常に難しい問題である。
そこで本研究では,音声キネマティクスを5つの画像整列制御モダリティの統一集合に変換するキネマティクス対視覚リフティングパラダイムを提案する。
本手法は,多様なベースライン上での行動忠実度,視覚的忠実度,ドメイン間の一般化を継続的に改善する。
論文 参考訳(メタデータ) (2026-05-09T05:48:51Z) - HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching [113.81911881001905]
HO-Flowはテキストと正準3Dオブジェクトから現実的な手動動作シーケンスを合成するためのフレームワークである。
まず、手動と物体の動きのシーケンスを統一された潜在多様体に符号化するために、相互作用を意識した変分オートエンコーダを用いる。
次に、自己回帰的時間的推論と連続的な潜伏生成を組み合わせたマスク付きフローマッチングモデルを利用する。
論文 参考訳(メタデータ) (2026-04-12T22:06:11Z) - SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing [76.349958946335]
本稿では,映像編集をセマンティックアンカーとモーションモデリングに分解するフレームワークであるSAMA(factorized Semantic Anchoring and Motion Alignment)を提案する。
まずセマンティックアンカリング(Semantic Anchoring)を導入し、スパースアンカフレームでのセマンティックトークンとビデオ潜在者を共同で予測することで、信頼性の高い視覚アンカを確立する。
第2に、モーションアライメントは同じバックボーンをモーション中心のビデオ復元のプリテキストタスクで事前トレーニングする。
論文 参考訳(メタデータ) (2026-03-19T17:59:51Z) - SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation [50.792027578906804]
本稿では,高調波とコヒーレントなアニメーションを実現するR2V(Image-to-Video)パラダイムベースのフレームワークであるSteadyDancerを紹介する。
実験により,SteadyDancerは外観の忠実さとモーションコントロールの両方において最先端の性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-24T17:15:55Z) - Motion Synthesis with Sparse and Flexible Keyjoint Control [10.592822014277631]
スパースおよびフレキシブルなキージョイント信号を尊重する制御可能なモーション合成フレームワークを提案する。
多様なデータセットやシナリオに関する総合的な実験を通じて,スパースかつフレキシブルなキージョイント制御の有効性を実証する。
論文 参考訳(メタデータ) (2025-03-18T21:21:15Z) - TLControl: Trajectory and Language Control for Human Motion Synthesis [68.09806223962323]
本稿では,人間のリアルな動き合成のための新しい手法であるTLControlを提案する。
低レベルのTrajectoryと高レベルのLanguage semanticsコントロールが組み込まれている。
インタラクティブで高品質なアニメーション生成には実用的である。
論文 参考訳(メタデータ) (2023-11-28T18:54:16Z) - Motion In-Betweening with Phase Manifolds [29.673541655825332]
本稿では,周期的オートエンコーダによって学習された位相変数を利用して,文字のターゲットポーズに到達するための,新たなデータ駆動型動作制御システムを提案する。
提案手法では,経験的ニューラルネットワークモデルを用いて,空間と時間の両方のクラスタの動きを,異なる専門家の重みで解析する。
論文 参考訳(メタデータ) (2023-08-24T12:56:39Z) - Enhanced Fine-grained Motion Diffusion for Text-driven Human Motion
Synthesis [21.57205701909026]
我々は,KeyFrames Collaborated を用いたテキスト駆動動作合成のための条件拡散モデル DiffKFC を提案する。
提案モデルでは, 意味的忠実度の観点から最先端のパフォーマンスを実現するが, より重要なことは, 退屈な労力を伴わずに細かなガイダンスによりアニメーターの要求を満たすことができることである。
論文 参考訳(メタデータ) (2023-05-23T07:41:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。