論文の概要: Advancing Open-source World Models
- arxiv url: http://arxiv.org/abs/2601.20540v1
- Date: Wed, 28 Jan 2026 12:37:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-29 15:46:06.926569
- Title: Advancing Open-source World Models
- Title(参考訳): オープンソースワールドモデルの改善
- Abstract要約: LingBot-World(リンク)は、ビデオ生成から派生したオープンソースのワールドシミュレータである。
広い範囲の環境において、高い忠実度と堅牢なダイナミクスを維持している。
リアルタイムの対話性をサポートし、毎秒16フレームを生成すると1秒未満のレイテンシを実現する。
- 参考スコア(独自算出の注目度): 92.17462908419326
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present LingBot-World, an open-sourced world simulator stemming from video generation. Positioned as a top-tier world model, LingBot-World offers the following features. (1) It maintains high fidelity and robust dynamics in a broad spectrum of environments, including realism, scientific contexts, cartoon styles, and beyond. (2) It enables a minute-level horizon while preserving contextual consistency over time, which is also known as "long-term memory". (3) It supports real-time interactivity, achieving a latency of under 1 second when producing 16 frames per second. We provide public access to the code and model in an effort to narrow the divide between open-source and closed-source technologies. We believe our release will empower the community with practical applications across areas like content creation, gaming, and robot learning.
- Abstract(参考訳): 我々は、ビデオ生成から派生したオープンソースの世界シミュレータLingBot-Worldを紹介する。
トップクラスのワールドモデルとして位置づけられているLingBot-Worldは、以下の機能を提供する。
1) 現実主義, 科学的文脈, 漫画のスタイルなど, 幅広い環境において, 高い忠実さと堅牢性を維持している。
2) 長期記憶(long-term memory)とも呼ばれる文脈整合性を維持しながら、最小レベルの水平線を可能にする。
(3) リアルタイムの対話性をサポートし,毎秒16フレームを生成する場合,1秒未満のレイテンシを実現する。
オープンソースとクローズドソースのテクノロジ間の隔たりを狭めるため、コードとモデルへのパブリックアクセスを提供しています。
われわれのリリースは、コンテンツ制作、ゲーム、ロボット学習といった分野にまたがる実践的な応用をコミュニティに与えてくれると信じている。
関連論文リスト
- Wonder: Video World Model Done Better [70.28870858365214]
We present Wonder, a general-purpose video world model for real-time, camera-controllable world exploration。
画像や条件付きビデオが与えられたWonderは、ユーザがカメラを動かして対話的にナビゲートできるプレイ可能な世界を構築する。
本研究では、空間的に整列した動きと向きを与える高密度座標場を用いた新しいカメラコンディショニングを提案する。
論文 参考訳(メタデータ) (2026-07-28T17:45:25Z) - AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report [39.20781986625199]
AlayaWorldは、24fpsの動画を540pと720pで生成する、インタラクティブなロングホライゾンビデオワールドモデルである。
AlayaWorldは15Bビデオ拡散トランスフォーマーをベースとして、カメラの軌道下で短時間の潜伏チャンクを自動回帰的に生成する。
iWorld-Benchでは、AlayaWorldは長距離世代よりも最高のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-07-20T17:15:41Z) - Infinite Worlds with Versatile Interactions [72.56254206708059]
LingBot-World 2.0(LingBot-World-Infinity)は、LingBot-Worldの先進的なイテレーションである。
今回のアップデートでは、より広い範囲のアクションを含む、非常に多様なインタラクティブな要素が導入されている。
共有体験を容易にするために,複数のプレイヤーが同時にこの鮮やかな世界シミュレータに没入できるインタフェースを開発した。
論文 参考訳(メタデータ) (2026-07-08T15:33:25Z) - AlayaWorld: Long-Horizon and Playable Video World Generation [36.52656377442462]
インタラクティブな生成世界を構築するためのフルスタックのオープンソースフレームワークである textbfAlayaWorld を提示する。
AlayaWorldはオープンなリアルタイムインタラクションを可能にし、ユーザーは自由に戦闘、スペルキャスティング、モンスター呼び出しなどの多様なアクションを操作できる。
論文 参考訳(メタデータ) (2026-07-07T13:59:57Z) - RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation [52.855830378221775]
一般的なロボットポリシーを評価するためのスケーラブルな代替手段として、ビデオワールドモデルが登場しつつある。
タスクプログレス対応の視覚言語モデルスコアリングと,高速なビデオワールドモデルを組み合わせた自動評価パイプラインであるRoboWorldを紹介する。
論文 参考訳(メタデータ) (2026-07-01T15:22:41Z) - GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation [53.6619853878637]
本稿では,ロボット操作のためのクローズドループビデオワールドシミュレータGE-Sim 2.0(Genie Envisioner World Simulator 2.0)を紹介する。
Genie Envisionerのアクションコンディション付きビデオ生成フレームワークをベースにGE-Sim 2.0は、何千時間もの現実世界のロボットデータに基づいて再訓練されている。
ビデオシミュレーションからポリシー学習まで,3つの新しいモジュールがループを閉じている。
論文 参考訳(メタデータ) (2026-05-26T16:23:05Z) - Beyond Pixel Histories: World Models with Persistent 3D State [50.4601060508243]
PERSISTは、潜伏した3Dシーンの進化をシミュレートする世界モデルの新たなパラダイムである。
既存の手法に比べて空間記憶,3次元整合性,長期安定性が大幅に向上した。
論文 参考訳(メタデータ) (2026-03-03T19:58:31Z) - DreamWorld: Unified World Modeling in Video Generation [32.857497363728584]
我々は、相補的な世界の知識をビデオジェネレータに統合する統合フレームワーク、textbfDreamWorldを紹介した。
我々はDreamWorldが世界の一貫性を改善し、VBenchでWan2.1を2.26ポイント上回ることを示す。
論文 参考訳(メタデータ) (2026-02-28T05:02:39Z) - Web World Models [60.208836336654315]
Web World Model (WWM) は「世界状態と物理」が通常のWebコードで実装される中核となる。
リアルなウェブスタック上にWWMのスイートを構築し、現実の地理や架空の銀河探検家、ウェブスケールの百科事典や物語の世界、シミュレーションやゲームのような環境を基盤とする無限の旅行アトラスを構築します。
この結果から,ウェブスタック自体が世界モデルのスケーラブルな基盤として機能し,制御可能かつオープンな環境を実現することが示唆された。
論文 参考訳(メタデータ) (2025-12-29T18:31:45Z) - Yume-1.5: A Text-Controlled Interactive World Generation Model [78.93049063633084]
Methodは、単一の画像やテキストプロンプトから現実的でインタラクティブで連続的な世界を生成するように設計された新しいフレームワークである。
メソッドは、キーボードベースの生成世界を探索するフレームワークを慎重に設計し、これを実現している。
論文 参考訳(メタデータ) (2025-12-26T17:52:49Z) - WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling [34.486078065308995]
WorldPlay(ワールドプレイ)は、リアルタイムでインタラクティブな世界モデリングと長期的幾何整合性を実現するストリーミングビデオ拡散モデルである。
ユーザのキーボードやマウスの入力に応答して,ロバストなアクション制御を可能にするために,デュアルアクション表現を使用する。
また,メモリ・アウェア・モデルのための新しい蒸留法であるContext Forcingを提案する。
論文 参考訳(メタデータ) (2025-12-16T17:22:46Z) - UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation [61.98887854225878]
私たちは、世界対応のビデオ生成のための統合フレームワークUnityVideoを紹介します。
提案手法は,(1)異種学習パラダイムを統一するための動的ノイズ化,(2)文脈内学習者によるモダリティ・スイッチャーの2つのコアコンポーネントを特徴とする。
私たちは、UnityVideoが優れたビデオ品質、一貫性、物理世界の制約との整合性を改善することを実証した。
論文 参考訳(メタデータ) (2025-12-08T18:59:01Z) - LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation [35.4193352348583]
本稿では,3D環境の産業生産パイプラインを効率化する,シンプルで効果的な3Dワールドジェネレーションフレームワークを提案する。
LatticeWorldは、競合するマルチエージェントインタラクションを特徴とする、動的エージェントを備えた大規模な3Dインタラクティブワールドを生成する。
LatticeWorldは90倍以上の工業生産効率の向上を実現している。
論文 参考訳(メタデータ) (2025-09-05T17:22:33Z) - Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model [15.16063778402193]
Matrix-Game 2.0はインタラクティブな世界モデルで、数ステップの自己回帰拡散を通じて長時間の動画をオンザフライで生成する。
超高速25FPSで、さまざまなシーンで高品質のミニレベルビデオを生成することができる。
論文 参考訳(メタデータ) (2025-08-18T15:28:53Z) - Video World Models with Long-term Spatial Memory [110.530715838396]
本稿では,ビデオワールドモデルの長期的整合性を高める新しい枠組みを提案する。
我々のフレームワークは、長期空間記憶から情報を保存・取得する機構を含んでいる。
評価の結果,関連するベースラインに比べて品質,一貫性,コンテキスト長が向上した。
論文 参考訳(メタデータ) (2025-06-05T17:42:34Z) - Open-Sora: Democratizing Efficient Video Production for All [15.68402186082992]
高忠実度ビデオコンテンツを作成するために設計された,オープンソースのビデオ生成モデルであるOpen-Soraを開発した。
Open-Soraは、テキスト・ツー・イメージ生成、テキスト・ツー・ビデオ生成、画像・ビデオ生成など、幅広いビジュアル生成タスクをサポートしている。
オープンソース原則を受け入れることで、Open-Soraはトレーニング/推論/データ準備コードとモデルウェイトへの完全なアクセスを民主化します。
論文 参考訳(メタデータ) (2024-12-29T08:52:49Z) - WonderWorld: Interactive 3D Scene Generation from a Single Image [38.83667648993784]
我々はインタラクティブな3Dシーン生成のための新しいフレームワークWonderWorldを紹介する。
WonderWorldは、単一のA6000 GPU上で10秒未満で接続された多様な3Dシーンを生成する。
論文 参考訳(メタデータ) (2024-06-13T17:59:10Z) - Self-supervised novel 2D view synthesis of large-scale scenes with
efficient multi-scale voxel carving [77.07589573960436]
実シーンの新たなビューを生成するために,効率的なマルチスケールのボクセル彫刻手法を提案する。
我々の最終的な高解像度出力は、ボクセル彫刻モジュールによって自動的に生成されるデータに基づいて効率よく自己学習される。
実環境における複雑で大規模なシーンにおける本手法の有効性を実証する。
論文 参考訳(メタデータ) (2023-06-26T13:57:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。