論文の概要: Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction
- arxiv url: http://arxiv.org/abs/2607.23517v1
- Date: Sun, 26 Jul 2026 07:34:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.139178
- Title: Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction
- Title(参考訳): 上半身人間-物体相互作用のための実時間人間-中心世界モデリング
- Abstract要約: 本研究では,人を中心としたコヒーレントな局所世界ダイナミクスを合成することを目的とした,上半身の対話的生成のためのリアルタイムな人中心世界モデルを提案する。
我々は,連続的人間状態と離散的相互作用状態の2つの相補的成分を持つ連続的離散的共同制御方式を採用する。
実験では、よりきめ細かい動きの忠実さ、より手動の調整、効果的なリアルタイム相互作用が実証された。
- 参考スコア(独自算出の注目度): 15.252158606421752
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present a real-time human-centric world model for upper-body interactive generation, aiming to synthesize coherent local world dynamics centered on a person, where coordinated body, hand, and facial motions evolve jointly with controllable human-object discrete interaction. To this end, we adopt a continuous-discrete joint control scheme with two complementary components: a continuous human state and a discrete interaction state. For continuous human-state control, we introduce a unified implicit representation based on multi-scale motion encoding, in which motion latents from the upper body, hands, and face are fused into a shared latent space. This multi-scale design improves expressiveness across different spatial scales, captures fine-grained human dynamics more effectively, and enables direct control without explicit retargeting. For discrete object interaction-state control, we represent object contact using a small set of language-encoded discrete interaction states, where text serves as an explicit interaction-state command, such as \emph{no contact} or \emph{grasp}, rather than an open-ended generation prompt, and we further construct a dedicated rendering pipeline for human-object interaction data to supervise such discrete interaction states. By combining continuous implicit human-state control with discrete interaction-state control, our model enables precise modeling of how a person moves and interacts with the local environment, including controllable changes to nearby scene states. Finally, we distill the model for efficient streaming real-time inference, achieving 25 FPS on two H100 GPUs. Experiments demonstrate improved fine-grained motion fidelity, more realistic hand-object coordination, and effective real-time interaction, establishing a practical step beyond motion reproduction toward real-time human-centric world modeling.
- Abstract(参考訳): 本研究では, 人体・手・顔の動きが協調的に進行し, 制御可能な人体・物体の離散的相互作用を伴う, 人を中心としたコヒーレントな局所世界ダイナミクスを合成することを目的とした, 上半身の対話的生成のための実時間人中心世界モデルを提案する。
この目的のために、連続的な人間状態と離散的な相互作用状態の2つの相補的な構成要素を持つ連続的な離散的な共同制御方式を採用する。
本研究では,人体,手,顔の動作潜伏者を共有潜伏空間に融合させるマルチスケール動作符号化に基づく統一的な暗黙的表現を導入する。
このマルチスケール設計は、異なる空間スケールにわたる表現性を向上し、きめ細かい人間のダイナミクスをより効果的に捉え、明示的な再ターゲティングなしに直接制御できる。
離散オブジェクト間相互作用状態制御では,テキストがオープンな生成プロンプトではなく,「emph{no contact}」や「emph{grasp}」のような明示的な相互作用状態コマンドとして機能する,言語符号化された離散相互作用状態の小さなセットを用いてオブジェクト接触を表現する。
連続的な暗黙的人間状態制御と個別の相互作用状態制御を組み合わせることで、近隣のシーン状態に対する制御可能な変化を含む、局所環境の移動と相互作用の正確なモデリングを可能にする。
最後に、2つのH100 GPU上で25FPSを達成し、効率的なストリーミングリアルタイム推論のためのモデルを蒸留する。
実験では、よりきめ細かい動きの忠実さ、よりリアルなハンドオブジェクトのコーディネーション、効果的なリアルタイムインタラクションが実証され、リアルタイムな人間中心の世界モデリングへの動きの再現を超えた実践的なステップが確立された。
関連論文リスト
- GNOCHI: Generative Neural mOdel for Close Human-Human Interactions [7.759879304243429]
本稿では,条件付き変分オートエンコーダ(cVAE)を用いた近接3次元人間-人間のインタラクションのための新しい生成モデルを提案する。
我々は、データ不足と衝突認識という、人間と人間の相互作用の分野での2つの長年の課題に対処する。
我々は、現在の最先端手法では生成できない、多種多様なプラウチブルで物理的に正しい相互作用を実証する。
論文 参考訳(メタデータ) (2026-07-11T17:19:32Z) - AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization [79.26935895370191]
AnchorWorldは、対話の整合性を強化することで、エゴセントリックなシミュレーションを促進するフレームワークである。
補助訓練監督は、エージェントのファーストパーソンセンタリウムから切り離された視点を取り入れている。
我々は、自己進化する世界をカスタマイズするためのシンプルで効果的なメカニズムを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:43:13Z) - SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance [49.69016078147708]
密接な相互作用シナリオにおける人間の行動の正確な再構築は、拡張現実における現実的な仮想インタラクションの実現に不可欠である。
本稿では,これらの問題に効果的に対処するための意味的および幾何学的手がかりを統合する拡散ベースのフレームワークであるSocialMirrorを提案する。
SocialMirrorはインタラクティブなヒューマンメッシュを再構築する上で,最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-04-15T07:41:52Z) - ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data [38.85809416362408]
ReMoGenはリアルタイムインタラクションと反応生成のためのモジュラー学習フレームワークである。
これは、他の動作、シーン幾何学、オプションのハイレベルなセマンティック入力を含む動的マルチソースキューから、エゴの将来の動きを生成する。
ReMoGenは、様々な相互作用シナリオを効果的に一般化しながら、高品質でコヒーレントで応答性のある反応を生成する。
論文 参考訳(メタデータ) (2026-04-01T16:12:23Z) - Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models [80.28579390566298]
テキスト条件付き自己回帰拡散モデルであるInteract2Arを導入する。
ハンドキネマティクスは専用のパラレルブランチを通じて組み込まれ、高忠実度フルボディ生成を可能にする。
我々のモデルは、時間的動きの合成、外乱へのリアルタイム適応、ディヤディックからマルチパーソンシナリオへの拡張など、一連のダウンストリームアプリケーションを可能にする。
論文 参考訳(メタデータ) (2025-12-22T18:59:50Z) - Towards Immersive Human-X Interaction: A Real-Time Framework for Physically Plausible Motion Synthesis [51.95817740348585]
Human-Xは、様々な実体をまたいだ没入的で物理的に妥当なヒューマンインタラクションを可能にするために設計された、新しいフレームワークである。
本手法は, 自己回帰型反応拡散プランナを用いて, リアルタイムに反応と反応を同時予測する。
我々のフレームワークは、人間とロボットのインタラクションのための仮想現実インターフェースを含む、現実世界のアプリケーションで検証されている。
論文 参考訳(メタデータ) (2025-08-04T06:35:48Z) - Controllable Human-Object Interaction Synthesis [77.56877961681462]
本研究では,3次元シーンにおける同期物体の動きと人間の動きを生成するための制御可能な人間-物体相互作用合成(CHOIS)を提案する。
ここでは,高レベルな計画から効果的に抽出できるスタイルや意図を言語記述が通知し,シーン内の動きをグラウンド化する。
我々のモジュールは経路計画モジュールとシームレスに統合され、3D環境における長期的相互作用の生成を可能にします。
論文 参考訳(メタデータ) (2023-12-06T21:14:20Z) - InterControl: Zero-shot Human Interaction Generation by Controlling Every Joint [67.6297384588837]
関節間の所望距離を維持するために,新しい制御可能な運動生成手法であるInterControlを導入する。
そこで本研究では,既成の大規模言語モデルを用いて,ヒューマンインタラクションのための結合ペア間の距離を生成できることを実証した。
論文 参考訳(メタデータ) (2023-11-27T14:32:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。