論文の概要: AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment
- arxiv url: http://arxiv.org/abs/2607.22241v2
- Date: Thu, 30 Jul 2026 03:34:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.248265
- Title: AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment
- Title(参考訳): AgentHOI:インプシット表現アライメントによるヒューマンオブジェクトインタラクションビデオ生成のためのマルチエージェント推論
- Authors: Ziyao Huang, Shunkai Li, Juan Cao, Chenyu Li, Youliang Zhang, Zixiang Zhou, Cong Wang, Yuan Zhou, Qinglin Lu, Fan Tang,
- Abstract要約: AgentHOIはテキスト駆動のHOIビデオ生成で、高いレベルのテキスト意図と物理的実行のギャップを埋める。
我々は,動画拡散モデルに先行したテキストを蒸留する暗黙のテキスト移動アライメント戦略を導入する。
実験により、AgentHOIは相互作用の自然性、オブジェクトの外観の保存、複雑なテキスト命令への付着性を著しく改善することが示された。
- 参考スコア(独自算出の注目度): 32.90190674554767
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in video diffusion models have spurred interest in human-object interaction (HOI) video generation, which demands fine-grained control over interaction logic beyond single-subject animation. However, existing HOI methods rely heavily on explicit motion control, limiting scalability and generalization across diverse objects and interactions. In this study, we propose AgentHOI, a text-driven HOI video generation following a thinking-before-generation framework that bridges the gap between high-level textual intent and physical execution through multi-agent reasoning over perception, interaction, and motion planning. Building upon the generated interaction plans, we further strengthen text-driven motion understanding. We introduce an implicit text-motion alignment strategy that distills text-to-motion priors into the video diffusion model, enabling robust HOI synthesis without explicit motion inputs at inference. Experiments show that AgentHOI significantly improves interaction naturalness, object appearance preservation, and adherence to complex textual instructions across challenging object-centric scenarios such as wearing and riding. The code is available at https://github.com/bone-11/agenthoi.
- Abstract(参考訳): ビデオ拡散モデルの最近の進歩は、シングルオブジェクトアニメーションを超えたインタラクションロジックのきめ細かい制御を必要とする、人-物間相互作用(HOI)ビデオ生成への関心を喚起している。
しかし、既存のHOI法は明示的な動き制御に大きく依存しており、様々な物体や相互作用にまたがるスケーラビリティや一般化を制限している。
本研究では,高レベルのテキスト意図と身体的実行のギャップを,知覚,インタラクション,行動計画に対するマルチエージェント推論を通じて橋渡しする,テキスト駆動型HOIビデオ生成ツールのAgentHOIを提案する。
生成した相互作用計画に基づいて、テキスト駆動の動作理解をさらに強化する。
本研究では,ビデオ拡散モデルにテキストから動画への先行情報を蒸留する暗黙のテキスト・モーションアライメント戦略を導入し,推論時の明示的な動作入力を伴わずに,堅牢なHOI合成を可能にする。
実験により、AgentHOIは、着用や乗馬といった課題のある対象中心のシナリオにまたがって、インタラクションの自然性、オブジェクトの外観の保存、複雑なテキスト命令の順守を著しく改善することが示された。
コードはhttps://github.com/bone-11/agenthoi.comで公開されている。
関連論文リスト
- SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation [29.683204938136758]
ヒューマンオブジェクトインタラクション生成は、多様なオブジェクトを操作する現実的な人間を合成することを目的としている。
この問題に対する既存のアプローチは、密集した時間的ガイダンスに依存している。
ビデオ生成のための新しいスパース時間制御フレームワークであるSparseCtrl-HOIを紹介する。
論文 参考訳(メタデータ) (2026-07-07T08:29:25Z) - InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance [20.740979380270126]
対話型ダイアディック力学の合成フレームワークであるInterDyadを提案する。
我々はまず、参照ビデオから抽出されたアイデンティティ非依存の動作先に基づいて、ビデオの再現を実現するInteractiveを設計する。
MLLM(Multimodal Large Language Model)を利用して,音声から言語意図を抽出し,反応の正確なタイミングと適切性を決定する。
包括的実験により、InterDyadは、自然と文脈的に基底付けられた2人のインタラクションを生成において、最先端の手法を著しく上回っていることが示された。
論文 参考訳(メタデータ) (2026-03-24T12:27:52Z) - VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification [65.15340059997273]
VHOIは、ビデオにおける現実的な人間とオブジェクトの相互作用を作成するためのフレームワークである。
そこで本研究では,人体と物体の運動だけでなく,身体部分特異的な動特性も識別するために,色エンコーディングを用いた新しいHOI対応動作表現を提案する。
実験は、制御可能なHOIビデオ生成における最先端の結果を示す。
論文 参考訳(メタデータ) (2025-12-10T13:40:24Z) - Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control [72.00655365269]
本稿では,協調的軌跡定式化を通じてオブジェクト間ダイナミクスをモデル化する新しいフレームワークであるRoboMasterを紹介する。
オブジェクトを分解する従来の方法とは異なり、我々のコアは、相互作用プロセスを3つのサブステージ(相互作用前、相互作用後、相互作用後)に分解することである。
提案手法は既存の手法よりも優れており,ロボット操作のための軌道制御ビデオ生成における最先端性能を確立している。
論文 参考訳(メタデータ) (2025-06-02T17:57:06Z) - InterDyn: Controllable Interactive Dynamics with Video Diffusion Models [50.38647583839384]
我々は、初期フレームと駆動対象またはアクターの動作を符号化する制御信号が与えられたインタラクティブな動画像を生成するフレームワークであるInterDynを提案する。
我々の重要な洞察は、大規模なビデオ生成モデルは、大規模ビデオデータからインタラクティブなダイナミクスを学習し、ニューラルと暗黙の物理シミュレーターの両方として機能できるということです。
論文 参考訳(メタデータ) (2024-12-16T13:57:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。