論文の概要: Population-Scalable Multi-Agent World Modeling
- arxiv url: http://arxiv.org/abs/2608.08600v1
- Date: Sun, 09 Aug 2026 09:26:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.879511
- Title: Population-Scalable Multi-Agent World Modeling
- Title(参考訳): 人口スケーラブルなマルチエージェント世界モデリング
- Authors: Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jianyi Zhu, Yong-Lu Li,
- Abstract要約: Khoraはスケーラブルなマルチエージェントの世界モデルであり、再トレーニングせずに任意の数のエージェントへの推論時間拡張をサポートする。
我々のフレームワークは、視覚的レンダリングから世界状態の進化を分離し、他のエージェント情報を組み込むための集団に依存しないレンダリング機構を導入する。
- 参考スコア(独自算出の注目度): 27.087757709788974
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models have recently achieved impressive progress in visual prediction and interactive generation, but extending them to multi-agent environments introduces a fundamental scalability challenge. Existing methods generally assume a fixed number of agents during training and inference, which ties the model to a pre-determined agent population and limits inference-time scalability. Our key insight is that cross-view consistency should arise from a shared world state whose evolution does not assume a predefined number of agents, while agent-specific observations should be generated by querying this state through a unified rendering interface. Based on this insight, we propose Khora, a scalable multi-agent world model that supports inference-time expansion to arbitrary numbers of agents without retraining. Our framework decouples world-state evolution from visual rendering and introduces a population-agnostic rendering mechanism for incorporating other agent information. This design maintains cross-view consistency through the shared world state rather than through dense interactions among observation streams inside the expensive video generator, enabling approximately linear practical scaling with the number of queried views. Qualitative experiments demonstrate that our approach generalizes to unseen numbers of agents while maintaining visual quality and multi-agent consistency. We further implement a real-time interactive system to demonstrate scalable open-world simulation.
- Abstract(参考訳): 世界モデルは近年、視覚的予測とインタラクティブな生成において驚くべき進歩を遂げていますが、それらをマルチエージェント環境に拡張することは、根本的なスケーラビリティの課題をもたらします。
既存の手法では、トレーニングと推論中に一定数のエージェントを仮定し、モデルが事前に決定されたエージェントの集団に結び付けられ、推論時のスケーラビリティが制限される。
我々の重要な洞察は、クロスビュー整合性は、進化が予め定義された数のエージェントを前提としない共有世界状態から生じるべきであり、一方でエージェント固有の観察は、統一されたレンダリングインターフェースを通じてこの状態に問い合わせることによって生成されるべきだということです。
この知見に基づいて,任意のエージェントへの推論時間拡張をサポートするスケーラブルなマルチエージェントワールドモデルであるKhoraを提案する。
我々のフレームワークは、視覚的レンダリングから世界状態の進化を分離し、他のエージェント情報を組み込むための集団に依存しないレンダリング機構を導入する。
この設計は、高価なビデオジェネレータ内の観測ストリーム間の密接な相互作用ではなく、共有世界状態を通してのクロスビュー整合性を維持し、クエリされたビューの数でほぼ線形な実践的スケーリングを可能にする。
定性的実験により,視覚的品質とマルチエージェントの整合性を保ちながら,本手法が無数のエージェントに一般化されることが実証された。
さらに,スケーラブルなオープンワールドシミュレーションを実演するために,リアルタイム対話システムを実装した。
関連論文リスト
- Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers [50.3000377325823]
We present WorldWeaver, a streaming multi-agent video diffusion model that a rollout with cross-agent world state registers。
これらのレジスタには、個々のエージェントの状態、鳥眼ビューを含むグローバルステートビュー、シーンテキストの監視信号が配置されている。
2エージェントのMinecraftビデオ生成の実験では、明示的な世界状態モデリングが論理的一貫性と生成品質を向上させることが示されている。
論文 参考訳(メタデータ) (2026-07-23T17:59:58Z) - Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players [87.87842088508553]
対話型シミュレーションのための生成的マルチエージェント世界モデルを提案する。
本モデルでは,映像の忠実度,アクション制御性,およびスロットベースおよび高密度アテンションベースライン上でのエージェント間整合性を改善する。
論文 参考訳(メタデータ) (2026-05-27T17:59:31Z) - Current Agents Fail to Leverage World Model as Tool for Foresight [61.82522354207919]
エージェントは、行動する前に結果を予測するためにそれらを使用できます。
本稿では,現在のエージェントがそのような世界モデルを,認知力を高めるツールとして活用できるかどうかを実証的に検討する。
論文 参考訳(メタデータ) (2026-01-07T13:15:23Z) - Diffusion Forcing for Multi-Agent Interaction Sequence Modeling [52.769202433667125]
MAGNetはマルチエージェントモーション生成のための統合された自己回帰拡散フレームワークである。
フレキシブルな条件付けとサンプリングを通じて、幅広いインタラクションタスクをサポートする。
緊密に同期された活動と、ゆるやかに構造化された社会的相互作用の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-12-19T18:59:02Z) - Gen-C: Populating Virtual Worlds with Generative Crowds [2.1716667622896195]
本稿では,エージェントエージェントとエージェント環境の相互作用をキャプチャするクラウドシナリオを生成する生成フレームワークであるGenerative Crowds (Gen-C)を紹介する。
Gen-Cはデュアル変分グラフオートエンコーダ(VGAE)アーキテクチャを採用しており、接続パターンと、テキスト信号と構造信号で条件付けられたノードの特徴を共同で学習する。
我々は、大学キャンパスや駅など多様な行動のシナリオにおけるGen-Cの有効性を実証する。
論文 参考訳(メタデータ) (2025-04-02T17:33:53Z) - Multi-agent Long-term 3D Human Pose Forecasting via Interaction-aware Trajectory Conditioning [41.09061877498741]
本稿では,対話型トラジェクトリ条件付き長期マルチエージェントヒューマンポーズ予測モデルを提案する。
本モデルは,人間の動作の多モード性と長期多エージェント相互作用の複雑さを効果的に扱う。
論文 参考訳(メタデータ) (2024-04-08T06:15:13Z) - Multi-Agent Imitation Learning with Copulas [102.27052968901894]
マルチエージェント模倣学習は、観察と行動のマッピングを学習することで、デモからタスクを実行するために複数のエージェントを訓練することを目的としている。
本稿では,確率変数間の依存を捉える強力な統計ツールである copula を用いて,マルチエージェントシステムにおける相関関係と協調関係を明示的にモデル化する。
提案モデルでは,各エージェントの局所的行動パターンと,エージェント間の依存構造のみをフルにキャプチャするコプラ関数を別々に学習することができる。
論文 参考訳(メタデータ) (2021-07-10T03:49:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。