論文の概要: Kairos: A Native World Model Stack for Physical AI
- arxiv url: http://arxiv.org/abs/2606.16533v2
- Date: Tue, 16 Jun 2026 11:06:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-17 15:01:46.828362
- Title: Kairos: A Native World Model Stack for Physical AI
- Title(参考訳): Kairos: 物理AIのためのネイティブワールドモデルスタック
- Abstract要約: これらの要件に基づいて設計されたネイティブなワールドモデルスタックであるKairosを紹介します。
カイロスは、クロス・エボディメント・パラダイム・データ・カリキュラムが支配するネイティブ・プレトレーニングの先駆者として世界を学ぶ。
Kairosは、ハイブリッド線形時間アテンションを備えたネイティブ統一アーキテクチャにおいて、統一された世界理解、生成、予測によって世界を維持している。
- 参考スコア(独自算出の注目度): 66.80630645291795
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: World models are transitioning from passive visual generators to foundational, operational infrastructure for Physical AI: they must natively acquire world knowledge from heterogeneous experience, maintain persistent states over long horizons, and execute efficiently within real deployment constraints. We introduce Kairos, a native world model stack designed around these requirements. (1) Kairos learns the world by pioneering a Native Pre-training Paradigm governed by a Cross-Embodiment Data Curriculum, which organizes open-world videos, human behavioral data, and robot interactions into a progressive developmental pathway. (2) Kairos maintains the world by unified world understanding, generation, and prediction within a Native Unified Architecture equipped with Hybrid Linear Temporal Attention, where sliding-window attention captures local dynamics, dilated sliding windows capture mid-range dependencies, and gated linear attention maintains persistent global memory. We establish formal theoretical bounds demonstrating that this temporal factorization strictly limits error accumulation, mathematically guaranteeing state propagation across extended horizons. (3) Kairos runs the world by incorporating a Deployment-Aware System Co-Design to support low-latency rollout generation on server and consumer-grade hardware for real-world observation-action-feedback loops. Experiments on embodied world-model, long-horizon, and action-policy benchmarks show that Kairos achieves top level performance while offering a strong efficiency-capability trade-off. Together, these results position Kairos as a cohesive operational foundation for future self-evolving physical intelligence.
- Abstract(参考訳): 世界モデルは、受動的ビジュアルジェネレータから、物理AIのための基本的な運用インフラストラクチャへと移行している。
これらの要件に基づいて設計されたネイティブなワールドモデルスタックであるKairosを紹介します。
1)カイロスは,オープンワールドビデオ,人間の行動データ,ロボットのインタラクションを段階的な発達経路に整理するクロス・エボディメント・データ・カリキュラムによって管理されるネイティブ・プレトレーニング・パラダイムを開拓し,世界を学ぶ。
2) ハイブリット線形時間アテンション(Hybrid Linear Temporal Attention)を備えたネイティブ統一アーキテクチャでは,スライディングウインドウが局所的ダイナミクスを捉え,拡張スライディングウインドウが中距離依存を捉え,ゲート線形アテンションが永続的なグローバルメモリを維持する。
我々は、この時間的分解がエラーの蓄積を厳密に制限し、数学的に地平線を横切る状態の伝播を保証していることを示す公式な理論的境界を確立する。
3)Kairosは,サーバ上での低レイテンシなロールアウト生成をサポートするDeployment-Aware System Co-Designと,実世界の観察-アクション-フィードバックループのためのコンシューマグレードハードウェアを組み込むことで,世界を運営している。
エンボディドワールドモデル、ロングホライズン、アクション・ポリティクスのベンチマークの実験は、カイロスが高い効率と能力のトレードオフを提供しながら、最高レベルのパフォーマンスを達成したことを示している。
これらの結果は、カイロスを将来の自己進化的物理的知性のための密接な運用基盤と位置づけた。
関連論文リスト
- Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent [41.433447721854144]
我々は、世界モデル中心の自律レースエージェントが、結合された限界を探索するための具体的なステップを提供することを示した。
このフレームワークは、ほとんど限界に近い成功と失敗から予測的世界モデルを学び、相互作用の進化、エゴダイナミクス、実現可能なモーション境界を捉えます。
フルスケールのシミュレートレースでは、よく訓練されたワールドモデル中心のエージェントが88.3%の相互作用の成功率を達成する。
論文 参考訳(メタデータ) (2026-08-11T08:01:35Z) - CG-World: A Large-Scale World-State Dataset and Protocol for World Models [13.423809800311984]
本稿では,産業用コンピュータグラフィックス製造パイプラインから派生した大規模ワールドステートデータセットとプロトコルであるCG-Worldを紹介する。
CG-Worldは、マルチモーダルセマンティクス、空間構造、骨格とコントローラの状態、モーションカーブ、カメラと照明パラメータ、物理キャッシュ、コンタクトイベント、マルチパスレンダリングなど、中間状態を明示的に記録している。
論文 参考訳(メタデータ) (2026-07-29T04:06:28Z) - GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving [56.50032398571235]
GraphWorldはE2E-ADフレームワークで、潜在世界モデリングを通じて長期計画を明確に強化する。
本研究では,エゴ車と周辺エージェントの相互作用をモデル化することで,エゴ中心の潜在世界表現を学習する世界国家計画を提案する。
この潜在世界状態は、重要な相互作用のダイナミクスと安全関連セマンティクスを捉え、長距離で安全を意識した軌道計画の指針となる条件付け信号として機能する。
論文 参考訳(メタデータ) (2026-06-15T06:26:46Z) - AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization [79.26935895370191]
AnchorWorldは、対話の整合性を強化することで、エゴセントリックなシミュレーションを促進するフレームワークである。
補助訓練監督は、エージェントのファーストパーソンセンタリウムから切り離された視点を取り入れている。
我々は、自己進化する世界をカスタマイズするためのシンプルで効果的なメカニズムを提案する。
論文 参考訳(メタデータ) (2026-06-05T14:43:13Z) - Xiaomi Auto World Model: A Joint World Model Integrating Reconstruction and Generation for Autonomous Driving [51.90209659403234]
本報告では,世界モデルの自律運転における2つのコア機能に対処する統合技術システムを提案する。
世界表現のために,スパースシーンクエリによって駆動されるフィードフォワード再構築アーキテクチャであるWorldRecを提案する。
次世代に向けて,両方向性事前学習のための2段階のトレーニングフレームワークWorldGenを提案し,それに続いて因果微調整を行う。
論文 参考訳(メタデータ) (2026-05-18T09:46:16Z) - CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving [4.4380564455353975]
CoWorld-VLAは、自動運転のための多専門家の世界推論フレームワークである。
世界表現は行動計画を導くための明確な条件として機能する。
実験によると、CoWorld-VLAは将来のシーン生成と計画の両方で競争力を発揮する。
論文 参考訳(メタデータ) (2026-05-11T12:01:13Z) - Causal World Modeling for Robot Control [56.31803788587547]
ビデオワールドモデルは、アクションと視覚力学の因果関係を理解することによって、近い将来に想像できる能力を提供する。
本稿では,フレーム予測とポリシ実行を同時に学習する自動回帰拡散フレームワークLingBot-VAを紹介する。
シミュレーションベンチマークと実世界のシナリオの両方でモデルを評価したところ、長距離操作、ポストトレーニングにおけるデータ効率、新しい構成への強力な一般化性などに大きな可能性を示唆している。
論文 参考訳(メタデータ) (2026-01-29T17:07:43Z) - WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World [100.68103378427567]
エージェントは現実的な4D駆動環境を合成し、説得力があるように見えるが、物理的または行動的に失敗することが多い。
モデルがどのように構築され、理解され、その生成された世界の中でどのように振る舞うかを評価するフルスペクトルベンチマークであるWorldLensを紹介します。
さらに、数値的なスコアとテキストの合理性を備えた人間の注釈付きビデオの大規模データセット WorldLens-26K を構築し、WorldLens-Agent を開発した。
論文 参考訳(メタデータ) (2025-12-11T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。