論文の概要: ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
- arxiv url: http://arxiv.org/abs/2607.19191v1
- Date: Tue, 21 Jul 2026 15:26:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.464002
- Title: ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
- Title(参考訳): ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
- Authors: Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo,
- Abstract要約: ABot-World-0は、リアルタイムで長時間のクローズドループインタラクションのためのアクション条件付きビデオワールドモデルである。
WorldExplorerは、トレーニングフィードバックによってガイドされたエージェント駆動のコレクションを実行する。
統一パイプラインは、14の決定論的品質チェック、VLMベースのアセスメント、同期アクションとテキストアノテーションを適用している。
- 参考スコア(独自算出の注目度): 41.37131555577374
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present ABot-World-0, an action-conditioned video world model for real-time, long-horizon closed-loop interaction, supported by a multi-source data infrastructure spanning AAA games, simulation engines, and internet videos to learn controllable world dynamics. WorldExplorer performs agent-driven collection guided by training feedback, while a unified pipeline applies 14 deterministic quality checks, VLM-based assessment, and synchronized action and text annotation. We progressively distill a bidirectional action-conditioned teacher into a causal student through teacher forcing and ODE distillation, and introduce LongForcing to align long student self-rollouts with an extended-horizon teacher, mitigating accumulated distribution shift and autoregressive drift. Raw keyboard actions provide a unified control interface for scene roaming and third-person character interaction, while reference-character memory provides persistent appearance cues for identity consistency during third-person rollouts. For deployment, we co-design a streaming inference stack with a lightweight VAE decoder, efficient attention, memory-aware scheduling, and low-bit DiT inference. Across optimized low-bit configurations, ABot-World-0 streams 720P video at up to 16 FPS on a single NVIDIA RTX 5090 desktop GPU, with 1.2s action-to-first-frame latency and approximately 19GiB peak VRAM. Experiments on WorldRoamBench and extended interactive rollouts demonstrate competitive controllability and coherent long-horizon world evolution.
- Abstract(参考訳): 我々は,AAAゲーム,シミュレーションエンジン,インターネットビデオにまたがるマルチソースデータインフラストラクチャがサポートし,制御可能な世界ダイナミクスを学習する,リアルタイムで長時間のクローズドループインタラクションのためのアクション条件付きビデオワールドモデルであるABot-World-0を提案する。
WorldExplorerはトレーニングフィードバックによってガイドされたエージェント駆動のコレクションを実行し、統一パイプラインは14の決定論的品質チェック、VLMベースのアセスメント、同期アクションとテキストアノテーションを適用している。
本研究では, 双方向動作条件の教師を, 教師強制, ODE蒸留により因果学生に段階的に蒸留し, ロングフォースを導入し, 長期学生の自己ロールアウトを延長水平教師と整列させ, 累積分布シフトを緩和し, 自己回帰ドリフトを緩和する。
生キーボードアクションはシーンロームと3人称文字インタラクションのための統一されたコントロールインターフェースを提供するが、参照-文字メモリは3人称ロールアウト時のアイデンティティ一貫性のための永続的な外観ヒントを提供する。
デプロイには、軽量なVAEデコーダ、効率的な注意、メモリ認識スケジューリング、低ビットのDiT推論を備えたストリーミング推論スタックを共同設計する。
最適化されたロービット構成全体で、ABot-World-0は720Pビデオを最大16FPSのNVIDIA RTX 5090デスクトップGPUでストリーミングする。
WorldRoamBenchの実験と拡張された対話型ロールアウトは、競争力のある制御性とコヒーレントな長距離世界進化を示す。
関連論文リスト
- AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report [39.20781986625199]
AlayaWorldは、24fpsの動画を540pと720pで生成する、インタラクティブなロングホライゾンビデオワールドモデルである。
AlayaWorldは15Bビデオ拡散トランスフォーマーをベースとして、カメラの軌道下で短時間の潜伏チャンクを自動回帰的に生成する。
iWorld-Benchでは、AlayaWorldは長距離世代よりも最高のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-07-20T17:15:41Z) - DriftWorld: Fast World Modeling through Drifting [49.014235003131596]
本稿では,ドリフト生成モデルに基づく行動条件付き世界モデルDriftWorldを紹介する。
DriftWorldは、推論時に反復的に飾るのではなく、トレーニング中にアクション条件付きドリフトを学ぶ。
DriftWorldは、正確かつ高速にロールアウトすることで、最先端の意思決定パフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-07-16T14:37:43Z) - Infinite Worlds with Versatile Interactions [72.56254206708059]
LingBot-World 2.0(LingBot-World-Infinity)は、LingBot-Worldの先進的なイテレーションである。
今回のアップデートでは、より広い範囲のアクションを含む、非常に多様なインタラクティブな要素が導入されている。
共有体験を容易にするために,複数のプレイヤーが同時にこの鮮やかな世界シミュレータに没入できるインタフェースを開発した。
論文 参考訳(メタデータ) (2026-07-08T15:33:25Z) - CausalDrive: Real-time Causal World Models for Autonomous Driving [60.66609721457312]
制御可能でリアルタイムなファンデーション駆動の世界であるCausalDriveを紹介します。
CaulDriveは、最初のフロントビューフレーム、エゴ車両の軌道、マクロテキストプロンプトのみで動作する。
本稿では,(1)衝突アーティファクトを著しく緩和した生成的クローズループ評価,(2)ビデオ2Rewardモジュールによる大規模強化学習(RL)後トレーニング,(3)リアルタイムの人間-イン-ザ・ループシミュレーション,の3つのダウンストリームアプリケーションにおける汎用性を実証する。
論文 参考訳(メタデータ) (2026-06-13T15:04:44Z) - Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models [18.614835778452345]
Incantationは、ラテンフレームごとの自然言語コンディショニングを備えた世界初のインタラクティブなビデオワールドモデルである。
我々は、クロス・エンタリティ・トランスファーとアウト・オブ・ボキャブラリ・プロンプトのAction-Indexベースラインを超えている。
我々は、同じアーキテクチャとトレーニングのレシピを『The King of Fighters』に適用し、参加者ごとのアクションボキャブラリスロットだけを変更する。
論文 参考訳(メタデータ) (2026-05-18T16:12:52Z) - RELIC: Interactive Video World Model with Long-Horizon Memory [74.81433479334821]
真のインタラクティブな世界モデルは、リアルタイムの長距離ストリーミング、一貫した空間記憶、正確なユーザ制御を必要とする。
この3つの課題を完全に解決する統合フレームワークであるRELICを紹介します。
単一の画像とテキスト記述が与えられた後、RELICは任意のシーンをリアルタイムにメモリを意識した長期探索を可能にする。
論文 参考訳(メタデータ) (2025-12-03T18:29:20Z) - MotionStream: Real-Time Video Generation with Interactive Motion Controls [60.403597895657505]
単一GPU上で最大29FPSのストリーミング生成が可能なサブ秒レイテンシを実現するMotionStreamを提案する。
提案手法は,グローバルなテキストプロンプトとローカルなモーションガイダンスに準拠する高品質なビデオを生成するが,リアルタイムでは推論を行わないモーションコントロールによるテキスト・ツー・ビデオモデルの拡張から始まる。
我々のモデルでは、動きの追従と映像の質を2桁高速化し、無限長のストリーミングを可能にする。
論文 参考訳(メタデータ) (2025-11-03T06:37:53Z) - Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model [15.16063778402193]
Matrix-Game 2.0はインタラクティブな世界モデルで、数ステップの自己回帰拡散を通じて長時間の動画をオンザフライで生成する。
超高速25FPSで、さまざまなシーンで高品質のミニレベルビデオを生成することができる。
論文 参考訳(メタデータ) (2025-08-18T15:28:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。