論文の概要: SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
- arxiv url: http://arxiv.org/abs/2609.02886v1
- Date: Wed, 02 Sep 2026 17:59:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.487837
- Title: SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
- Title(参考訳): SolarWM: 長距離ビデオワールドモデルのためのオープンデータとスケーラブルトレーニング
- Abstract要約: 我々は、データ準備から長距離推論まで、インタラクティブなビデオワールドモデルを構築するための完全にオープンな基盤であるSolarWMを紹介した。
SolarWMは、再構成可能なマルチソースデータエンジンとバックボーンネイティブ適応フレームワークとの結合に対処する。
Wan2.2、LTX-2.5、MiniMax-H3に基づく4つの5B-33Bモデルを、ネイティブ表現と目的を保存しながらインスタンス化する。
結果として生じる因果モデルにより、わずか5秒のシーケンスでトレーニングされた数分から数時間のロールアウトをリアルタイムに対話することができる。
- 参考スコア(独自算出の注目度): 88.64689505355055
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce SolarWM, a fully open foundation for building interactive video world models from data preparation through long-horizon inference. Training across heterogeneous data sources and video backbones is challenging: datasets differ in temporal scale, camera geometry, visual quality, motion, and captioning styles, while video generators use distinct representations and architectures. Naive data mixing and model-specific implementations therefore produce inconsistent supervision and make results difficult to reproduce and compare. SolarWM addresses this coupling with a reconfigurable multi-source data engine and a backbone-native adaptation framework. The engine converts 1.43 million canonical clips from 10 datasets into a unified, frame-aligned contract covering visual observations, metric camera geometry, captions, quality metadata, selection decisions, and provenance, while decoupling source processing from mixture construction. Under shared camera-conditioning, training, and inference interfaces, we instantiate four 5B--33B models based on Wan2.2, LTX-2.5, and MiniMax-H3 while preserving their native representations and objectives. A unified three-stage recipe combines bidirectional adaptation, teacher-forced autoregressive initialization, and distribution matching distillation. The resulting causal models enable real-time interaction over rollouts ranging from minutes to hours after being trained on only 5s sequences. By releasing the resulting data, pipeline, recipes, weights, and framework, SolarWM provides a reproducible and extensible foundation for interactive world-model research.
- Abstract(参考訳): 我々は、データ準備から長距離推論まで、インタラクティブなビデオワールドモデルを構築するための完全にオープンな基盤であるSolarWMを紹介した。
データセットは時間スケール、カメラ幾何学、視覚的品質、動き、キャプションスタイルで異なり、ビデオジェネレータは異なる表現とアーキテクチャを使用している。
したがって、データミキシングとモデル固有の実装は一貫性のない監視を生み出し、結果の再現と比較を困難にします。
SolarWMは、再構成可能なマルチソースデータエンジンとバックボーンネイティブ適応フレームワークとの結合に対処する。
このエンジンは、10のデータセットから133万の標準クリップを、視覚的観察、メートル法カメラ幾何学、キャプション、品質メタデータ、選択決定、証明を含む統一されたフレーム整列契約に変換し、混合構成からソース処理を分離する。
Wan2.2、LTX-2.5、MiniMax-H3の4つの5B-33Bモデルをカメラコンディショニング、トレーニング、推論インタフェースでインスタンス化する。
統合された3段階のレシピは、双方向適応、教師による自己回帰初期化、および分配マッチング蒸留を組み合わせたものである。
結果として生じる因果モデルにより、わずか5秒のシーケンスでトレーニングされた数分から数時間のロールアウトをリアルタイムに対話することができる。
得られたデータ、パイプライン、レシピ、ウェイト、およびフレームワークをリリースすることによって、SolarWMはインタラクティブな世界モデル研究のための再現可能で拡張可能な基盤を提供する。
関連論文リスト
- EchoWM: Open and Enterable Omnimodal World Models [71.49148067556887]
EchoWMは、入力可能な生成メディアのための一様世界モデルである。
720pのビデオ、環境音、音楽、音声を共同生成しながら、継続的なナビゲーションに反応する。
論文 参考訳(メタデータ) (2026-08-24T12:39:59Z) - Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory [53.39687409541093]
Matrix-Game 3.0は、720pのリアルタイムビデオ生成用に設計されたメモリ拡張型インタラクティブワールドモデルである。
データ、モデル、推論にまたがる体系的な改善を導入する。
実験結果から, Matrix-Game 3.0は最大40FPSのリアルタイム生成を実現し, 5Bモデルで720pの解像度を実現した。
論文 参考訳(メタデータ) (2026-04-10T06:00:09Z) - Using Vision Language Foundation Models to Generate Plant Simulation Configurations via In-Context Learning [6.254251081017878]
本稿では,デジタル双生児の植物シミュレーションにおける視覚言語モデル(VLM)の性能を評価するためのベンチマークを提案する。
本稿では,最先端のオープンソースVLMを利用して,ドローンによるリモートセンシング画像からシミュレーションパラメータを直接生成する手法を提案する。
論文 参考訳(メタデータ) (2026-03-09T20:58:43Z) - Latent Particle World Models: Self-supervised Object-centric Stochastic Dynamics Modeling [51.40150411616207]
実世界のマルチオブジェクトデータセットに拡張された自己教師型オブジェクト中心の世界モデルであるLatent Particle World Model (LPWM)を紹介する。
LPWMは、ビデオデータから直接キーポイント、バウンディングボックス、オブジェクトマスクを自律的に発見する。
私たちのアーキテクチャは、純粋にビデオからエンドツーエンドにトレーニングされ、アクション、言語、イメージ目標に対するフレキシブルな条件付けをサポートします。
論文 参考訳(メタデータ) (2026-03-04T19:36:08Z) - Disentanglement Beyond Static vs. Dynamic: A Benchmark and Evaluation Framework for Multi-Factor Sequential Representations [14.972702558607557]
6つの異なるデータセット間での複数要素の逐次的絡み合いを評価するための、最初の標準ベンチマークを導入する。
本研究では,潜伏次元を意味因子と自動的に整列するポストホック潜伏探索段階を提案し,最先端の成果を達成できるクープマンモデルを提案する。
私たちのコードはGitHubで、データセットとトレーニングされたモデルはHugging Faceで利用可能です。
論文 参考訳(メタデータ) (2025-10-20T08:58:23Z) - MORPH: Shape-agnostic PDE Foundation Models [37.26306668589026]
MORPHは偏微分方程式(PDE)の形状に依存しない自己回帰基底モデルである
様々なデータ次元(1D--3D)の不均一な評価をシームレスに処理する畳み込み視覚バックボーン上に構築されている。
広範なデータセット全体にわたって、MORPHは強力なベースラインと最近の最先端モデルにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-25T22:38:36Z) - Matrix-Game 2.0: An Open-Source, Real-Time, and Streaming Interactive World Model [15.16063778402193]
Matrix-Game 2.0はインタラクティブな世界モデルで、数ステップの自己回帰拡散を通じて長時間の動画をオンザフライで生成する。
超高速25FPSで、さまざまなシーンで高品質のミニレベルビデオを生成することができる。
論文 参考訳(メタデータ) (2025-08-18T15:28:53Z) - HuggingGraph: Understanding the Supply Chain of LLM Ecosystem [6.131279654327215]
大規模言語モデル(LLM)は、単語のシーケンスを処理および予測するためにディープラーニングアーキテクチャを活用する。
LLMは、以前のモデルやデータセットに存在する脆弱性やバイアス、悪意のあるコンポーネントを継承することができる。
このプロジェクトの目的は、モデルとデータセットの関係を研究することである。
論文 参考訳(メタデータ) (2025-07-17T17:34:13Z) - Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency [32.16082566679126]
本稿では、駆動ビデオとLiDARシーケンスの合同生成のための統一的なフレームワークを提案する。
我々は,3D-VAEモダリティにDiTベースのビデオ拡散モデルを統合する2段階アーキテクチャと,NeRFベースのレンダリングと適応サンプリングを備えたBEV対応LiDARジェネレータを用いる。
構造化セマンティクスで生成をガイドするために,シーンレベルとインスタンス言語を統括する視覚レベルモデル上に構築されたキャプションモジュールであるDataCrafterを紹介する。
論文 参考訳(メタデータ) (2025-06-09T07:20:49Z) - VideoMolmo: Spatio-Temporal Grounding Meets Pointing [66.19964563104385]
VideoMolmoは、ビデオシーケンスのきめ細かいポインティングに適したモデルだ。
新しい仮面融合はSAM2を双方向の点伝播に用いている。
The generalization of VideoMolmo, we introduced VPoMolS-temporal, a challenge out-of-distribution benchmark across two real-world scenarios。
論文 参考訳(メタデータ) (2025-06-05T17:59:29Z) - Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models [83.65386456026441]
Data-Juicer 2.0は、テキスト、画像、ビデオ、オーディオのモダリティにまたがる100以上のデータ処理オペレータがバックアップするデータ処理システムである。
データ分析、合成、アノテーション、基礎モデルのポストトレーニングなど、より重要なタスクをサポートする。
このシステムは公開されており、さまざまな研究分野やAlibaba Cloud PAIのような現実世界の製品で広く採用されている。
論文 参考訳(メタデータ) (2024-12-23T08:29:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。