論文の概要: H3-World: Turning Language Understanding into World Control
- arxiv url: http://arxiv.org/abs/2609.01560v1
- Date: Tue, 01 Sep 2026 17:21:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.892698
- Title: H3-World: Turning Language Understanding into World Control
- Title(参考訳): H3-World: 言語理解を世界制御に変換する
- Authors: Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin,
- Abstract要約: H3-Worldは、33B MiniMax-H3ビデオジェネレータをインタラクティブな世界モデルに変える効率的なフレームワークである。
8000のゲームプレイサンプル、10,000のLORA最適化ステップ、0.199%のトレーニング可能なパラメータで、H3-Worldは効果的なキャラクタとカメラ制御を実現している。
- 参考スコア(独自算出の注目度): 38.637364873040276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present H3-World, an efficient framework that turns the 33B MiniMax-H3 video generator into an interactive world model. Our key finding is that, as large video generators become more capable, language is emerging as a natural interface for control. MiniMax-H3, for example, already supports zero-shot control of character behavior and camera motion through natural-language instructions. Building on this, H3-World turns this coarse language interface into precise, temporally grounded world control, without introducing dedicated action modules. Specifically, we represent each action as a structured combination of character and camera instructions, and align them with the corresponding temporal video latents. To make the control temporally precise, we further introduce temporal attention routing, which restricts each instruction to its intended time interval and reduces control leakage across actions. Importantly, H3-World directly reuses the semantic representations learned during large-scale video pretraining and requires only lightweight adaptation. With only 8,000 gameplay samples, 10,000 LoRA optimization steps, and 0.199% trainable parameters, H3-World achieves effective character and camera control while preserving strong generation quality. It also generalizes to unseen scenarios. These results show that the control capabilities emerging in large video generators can be efficiently transformed into interactive world control.
- Abstract(参考訳): 本稿では,33B MiniMax-H3ビデオジェネレータをインタラクティブな世界モデルに変換する,効率的なフレームワークであるH3-Worldを紹介する。
私たちの重要な発見は、大きなビデオジェネレータがより能力を持つようになるにつれて、言語がコントロールの自然なインターフェースとして現れていることです。
たとえばMiniMax-H3は、自然言語による文字の振る舞いとカメラの動きのゼロショット制御をすでにサポートしている。
この上に構築されたH3-Worldは、この粗い言語インターフェースを、専用のアクションモジュールを導入することなく、正確な時間的基盤を持つ世界制御に変換する。
具体的には、各アクションをキャラクタとカメラの命令の構造化された組み合わせとして表現し、対応する時間的ビデオラテントと整合させる。
さらに、時間的注意ルーティングを導入し、各命令を意図した時間間隔に制限し、動作間の制御リークを低減する。
重要なことは、H3-Worldは大規模なビデオ事前学習で学んだ意味表現を直接再利用し、軽量な適応しか必要としないことである。
8000のゲームプレイサンプル、10,000のLORA最適化ステップ、0.199%のトレーニング可能なパラメータで、H3-Worldは強力な世代品質を維持しながら、効果的なキャラクタとカメラ制御を実現している。
また、目に見えないシナリオにも一般化される。
これらの結果から,大規模なビデオジェネレータで発生する制御能力を,インタラクティブな世界制御に効率的に変換できることが示唆された。
関連論文リスト
- Wonder: Video World Model Done Better [70.28870858365214]
We present Wonder, a general-purpose video world model for real-time, camera-controllable world exploration。
画像や条件付きビデオが与えられたWonderは、ユーザがカメラを動かして対話的にナビゲートできるプレイ可能な世界を構築する。
本研究では、空間的に整列した動きと向きを与える高密度座標場を用いた新しいカメラコンディショニングを提案する。
論文 参考訳(メタデータ) (2026-07-28T17:45:25Z) - ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU [41.37131555577374]
ABot-World-0は、リアルタイムで長時間のクローズドループインタラクションのためのアクション条件付きビデオワールドモデルである。
WorldExplorerは、トレーニングフィードバックによってガイドされたエージェント駆動のコレクションを実行する。
統一パイプラインは、14の決定論的品質チェック、VLMベースのアセスメント、同期アクションとテキストアノテーションを適用している。
論文 参考訳(メタデータ) (2026-07-21T15:26:50Z) - M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming [26.912855667055307]
M$text4$Worldはマルチビューおよびマルチモーダル生成駆動世界モデルである。
微粒なオブジェクト操作はフレキシブルなコンディショニングインタフェースによって実現される。
安定した分長ストリーミングは、マルチステージのトレーニングフレームワークを通じて実現される。
論文 参考訳(メタデータ) (2026-07-15T16:36:33Z) - SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation [29.683204938136758]
ヒューマンオブジェクトインタラクション生成は、多様なオブジェクトを操作する現実的な人間を合成することを目的としている。
この問題に対する既存のアプローチは、密集した時間的ガイダンスに依存している。
ビデオ生成のための新しいスパース時間制御フレームワークであるSparseCtrl-HOIを紹介する。
論文 参考訳(メタデータ) (2026-07-07T08:29:25Z) - Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control [56.828569670698975]
デレクシング・ザ・ワールド(Directing the World)は、人体動作とカメラ軌道制御を備えた、制御可能な世界モデルビデオ生成のための高速自動回帰フレームワークである。
私たちのキーとなるアイデアは、前もって統合された自己回帰ビデオを保持しながら、制御学習を分離することです。
人間の動作制御のために、t誘導型動的投射機構と洗練されたモーション-CFG戦略を設計する。
論文 参考訳(メタデータ) (2026-06-26T11:08:09Z) - X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving [45.260296714057766]
我々は,アクション条件付きマルチカメラ生成世界モデルであるX-Worldを紹介し,ビデオ空間における将来の観測を直接シミュレートする。
X-Worldは動的トラフィックエージェントと静的道路要素のオプションコントロールをサポートし、外観レベルの制御のためのテキストプロンプトインターフェイスを保持する。
実験により,X-Worldは高画質のマルチビュービデオ生成を実現し,カメラ間の高精細性を実現した。
論文 参考訳(メタデータ) (2026-03-20T14:23:32Z) - VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control [74.5434726968562]
制御ネットライクなコンディショニング機構を用いて3次元カメラ制御のためのトランスフォーマー映像の改ざん方法を示す。
我々の研究は、トランスフォーマーに基づくビデオ拡散モデルのカメラ制御を可能にする最初のものである。
論文 参考訳(メタデータ) (2024-07-17T17:59:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。