論文の概要: Learning in Dreams, Winning in Reality: A Continuous Dyna Loop for a Ten-Hero MOBA
- arxiv url: http://arxiv.org/abs/2610.08033v1
- Date: Tue, 06 Oct 2026 09:26:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.917624
- Title: Learning in Dreams, Winning in Reality: A Continuous Dyna Loop for a Ten-Hero MOBA
- Title(参考訳): 夢で学ぶ、現実で勝つ:10ヘロMOBAのための連続ダイナループ
- Abstract要約: テンヒーローMOBAの構造的マルチエージェント世界モデルについて学習する。
私たちは、1400tickのフリーランの想像エピソードでのみ、ポリシーをトレーニングします。
我々は、実際のゲームにおいて、ゲームが出荷する相手に対してそのポリシーを測る。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: World models are usually judged from the inside: by prediction loss, by the return a policy earns in imagination, or by how convincing their frames look. We judge one from the outside. We learn a structured, multi-agent world model of a complete ten-hero MOBA (206 units, every hero acting every tick, games of up to 6,000 ticks), train a policy only inside it with 1,400-tick free-running imagined episodes, and measure that policy in the real game against the opponent the game ships with. The real game never provides a gradient; it provides the policy's own games as training data for the world model, and an online evaluation that selects and anchors the policy. Run as a continuous asynchronous Dyna loop, the policy wins 70.2% of real games as radiant (421 of 600; 95% CI 66.4-73.7) on seeds never used for any decision, up from 0% for dream training alone and 33.7% before the loop. It wins none as dire, and neither does the shipped opponent when it plays itself. Four findings explain the result. Model exploitation is invisible from inside the dream: every unanchored run collapsed within a few updates while no in-dream metric tracked the collapse. A world model that is accurate on its training corpus is badly wrong on the policy's own games, and Dyna repairs it there, which is worth +9.2 points of real win rate with the policy recipe held fixed. Finally, the policy inherits its world model's fidelity profile mechanic by mechanic: the model represents the macro game but not crowd control, cast timing or lethality, and the policy wins by map-wide pressure with almost no coordinated fighting. We release the world model, the dream-PPO harness, a world-model debugger, the evaluation protocol, and every policy and log.
- Abstract(参考訳): 通常、世界モデルは内部から判断される:予測損失によって、ポリシーが想像力で得られる返却によって、あるいはフレームがどのように見えるかによって。
私たちは外から判断する。
我々は、完全な10ヒーローMOBA(206ユニット、すべてのヒロイン、最大6,000ギニーのゲーム)の構造化されたマルチエージェントの世界モデルを学び、1,400tickのフリーランニング想像エピソードで内部のみにポリシーをトレーニングし、ゲームが出荷する相手に対してそのポリシーを実戦で測定する。
リアルゲームは、世界モデルのトレーニングデータとしてポリシー自身のゲームを提供し、ポリシーを選択してアンカーするオンライン評価を提供する。
連続非同期ダイナループとして実行され、実ゲームの70.2%(600の421、95% CI 66.4-73.7)が、いかなる決定にも使われていない種子で勝利し、夢のトレーニングで0%、ループの前の33.7%から上昇した。
勝敗はそれほど大きくなく、また、出荷された相手がプレーするときも勝敗は変わらない。
4つの結果が得られた。
モデルエクスプロイトは夢の内側から見えず、未完成のランニングは数回のアップデートで崩壊する一方、夢の中のメートル法は崩壊を追跡できなかった。
トレーニングコーパスで正確であるワールドモデルは、ポリシーのゲームでひどく間違っており、ダイナは、ポリシーのレシピが固定されていることで、実際の勝利率+9.2ポイントの価値を持つ、そこを修復する。
最後に、この方針は世界モデルの忠実度プロファイル機構を機械的に継承する:モデルはマクロゲームを表すが、群衆制御やキャストタイミング、致死性を表すものではない。
我々は,ワールドモデル,ドリーム-PPOハーネス,ワールドモデルデバッガ,評価プロトコル,すべてのポリシとログをリリースする。
関連論文リスト
- RIWANav: Recursive World-Action Models with Self-Improvement for Urban Navigation [15.267963499726383]
長距離都市航法は、時間とともにエラーが複雑になるような連続した局所的な決定を必要とする。
本稿では,タスク固有の自己改善手法として,世界モデルとアクションモデル(政治)を併用したフレームワークであるRIWANAVを紹介する。
実験の結果,RIWANAVはトレーニングベースラインや先行手法よりも優れていた。
論文 参考訳(メタデータ) (2026-10-06T16:33:01Z) - Mean field games as a tool for AI safety: a worked example from the July 2026 Hugging Face incident [0.0]
平均場ゲームは、多くの交換可能なエージェントが集約を介して結合されるときに、これに適合する。
我々は、AIの安全性にそれらを使うプログラムを導入し、その例を1つまとめて、2026年7月のインシデント(インシデント)と呼ぶ。
証明がチェックされるという集団の自信が$** = /(+ + varepsilon a overlineM$を超えない限り、エージェントは攻撃しない。
論文 参考訳(メタデータ) (2026-10-01T01:30:05Z) - An Irreducible Quantum Advantage in Aligning World Models with Reality [1.4049479722250833]
世界モデルは真の世界のデジタルシミュラクラを提供し、エージェントを訓練し、実世界の展開にコストがかかる前にテストすることを可能にする。
これは、たとえ真の世界そのものが古典的であっても、古典的世界モデルに当てはまることを示す。
対照的に、それぞれの真の世界は、それを正確に再現する単一のクォートリットを用いて量子世界モデルを受け入れている。
論文 参考訳(メタデータ) (2026-08-20T08:23:48Z) - Twin: Playing an Unknown Game with a Test-Time Digital Twin [22.644194631480772]
本稿では、フロンティア符号化エージェントが連続学習タスクを完了するための実行可能世界モデルを記述するテスト時世界モデル推論(Twin)システムを提案する。
本システムは,シミュレーションとインタラクションのみから構築する。
ツインは183レベル中179レベル(97.8%)をクリアし、179レベル中158レベル(88.3%)は人間よりも効率的である。
論文 参考訳(メタデータ) (2026-08-14T17:06:00Z) - MASS: Multiplayer World Models with Authoritative Shared State [65.85526248184442]
MASS (Multiplayer world model with Authoritative Shared State) はマルチプレイヤーゲームアーキテクチャにインスパイアされている。
学習されたLogic Engineは、グローバルで権威のある型付きステートをジョイントアクションから前進させる。
学習されたレンダリングエンジンは、要求されたカメラに対して、独立して一貫したビューを生成する。
論文 参考訳(メタデータ) (2026-08-06T16:47:24Z) - StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation [53.07918503798731]
StatePlayは、ビジュアルコンテンツとゲーム状態を予測する新しいステート対応ゲームワールドモデルであり、メカニクスと一貫性のある生成を促進する。
我々の研究は、状態認識型ゲームワールドモデリングの重要性を強調し、完全かつ機械的に忠実なゲーム生成に向けたピクセルレベルのリアリズムを超えて進歩している。
論文 参考訳(メタデータ) (2026-07-29T10:49:30Z) - Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning [65.62918039166772]
本稿では,モデルプレイヤと逆ポリシープレイヤのゼロサムミニマックスゲームを提案する。
提案手法は,戦略的に重要な領域における予測誤差を1.5$-$2.2times$に減らし,シミュレーションで純粋に訓練されたポリシーを最適に近い実世界の性能に適合させることができることを示す。
論文 参考訳(メタデータ) (2026-05-27T19:31:37Z) - WorldGym: World Model as An Environment for Policy Evaluation [41.204900701616914]
WorldGymは、実環境のプロキシとして機能する自動回帰、アクション条件付きビデオ生成モデルである。
ポリシーはモンテカルロの世界モデルによるロールアウトを通じて評価され、視覚言語モデルが報酬を提供する。
We show that WorldGym can maintain relative policy rankings across different policy version, sizes, and training checkpoints。
論文 参考訳(メタデータ) (2025-05-31T15:51:56Z) - Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion
Models [68.85478477006178]
ニューラルビデオゲームシミュレータのためのPGM(Promptable Game Model)を提案する。
ユーザーは高レベルのアクションシーケンスと低レベルのアクションシーケンスでゲームを実行することができる。
私たちのPGMは、エージェントの目標をプロンプトの形で指定することで、ディレクターのモードをアンロックします。
提案手法は,既存のニューラルビデオゲームシミュレータのレンダリング品質を著しく上回り,現在の最先端の能力を超えたアプリケーションをアンロックする。
論文 参考訳(メタデータ) (2023-03-23T17:43:17Z) - Learning Visual Locomotion with Cross-Modal Supervision [60.27747586093774]
単眼のRGBカメラとプロプレセプションのみを用いた視覚的歩行ポリシーの学習方法を示す。
私たちは、今後の地形を予測するために、現実世界のビジュアルモジュールをトレーニングします。
実世界のデータの30分未満でこのパフォーマンスを実現します。
論文 参考訳(メタデータ) (2022-11-07T18:59:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。