論文の概要: Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
- arxiv url: http://arxiv.org/abs/2605.20577v1
- Date: Wed, 20 May 2026 00:33:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.417493
- Title: Mahjax: A GPU-Accelerated Mahjong Simulator for Reinforcement Learning in JAX
- Title(参考訳): Mahjax: JAXで強化学習を行うGPUアクセラレーションMahjongシミュレータ
- Abstract要約: リイチ・マヒョン(Riichi Mahjong)は、高次元状態空間と高次元状態空間を特徴とする多人数不完全な情報ゲームである。
JAX で実装された完全ベクトル化された Riichi Mahjong 環境である textbfMahjax を導入し,大規模ロールアウト並列化を実現する。
Mahjaxは1秒あたり最大で60万、60万のスループットを実現しています。
- 参考スコア(独自算出の注目度): 38.43966132249977
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Riichi Mahjong is a multi-player, imperfect-information game characterized by stochasticity and high-dimensional state spaces. These attributes present a unique combination of challenges that mirror complex real-world decision-making problems in reinforcement learning. While prior research has heavily relied on supervised learning from human play logs to pre-train the policy, algorithms capable of learning \textit{tabula rasa} (from scratch) offer greater potential for general applicability, as evidenced by the AlphaZero lineage. To facilitate such research, we introduce \textbf{Mahjax}, a fully vectorized Riichi Mahjong environment implemented in JAX to enable large-scale rollout parallelization on Graphics Processing Units (GPUs). We also provide a high-quality visualization tool to streamline debugging and interaction with trained agents. Experimental results demonstrate that Mahjax achieves throughputs of up to \textbf{2 million} and \textbf{1 million steps per second} on eight NVIDIA A100 GPUs under the no-red and red rules, respectively. Furthermore, we validate the environment's utility for reinforcement learning by showing that agents can be trained effectively to improve their rank against baseline policies.
- Abstract(参考訳): リイチ・マヒョン(Riichi Mahjong)は、確率性と高次元状態空間を特徴とする多人数不完全情報ゲームである。
これらの属性は、強化学習における複雑な現実世界の意思決定問題を反映する、ユニークな組み合わせである。
以前の研究では、人間のプレイログからの教師あり学習とポリシーの事前訓練に大きく依存していたが、AlphaZeroの系統によって証明されたように、(スクラッチから)学習可能なアルゴリズムは一般的な適用可能性を高める。
このような研究を容易にするために、JAX で実装された完全にベクトル化された Riichi Mahjong 環境である \textbf{Mahjax} を導入し、グラフィクス処理ユニット(GPU)の大規模ロールアウト並列化を実現する。
また、トレーニングされたエージェントとのデバッグとインタラクションを合理化するための高品質な可視化ツールも提供しています。
実験結果から,Hahjaxは,ノレッドルールとレッドルールの下で,8つのNVIDIA A100 GPU上でそれぞれ最大1秒あたり最大1textbf{200 million} と \textbf{100 million steps} のスループットを達成することが示された。
さらに, エージェントを効果的に訓練し, 基本方針に反するランク向上を図り, 強化学習における環境の有用性を検証した。
関連論文リスト
- Scaling Strategy, Not Compute: A Stand-Alone, Open-Source StarCraft II Benchmark for Accessible Reinforcement Learning Research [2.5959683852997806]
本稿では,StarCraft IIのミニゲームのベンチマークであるTwo-Bridge Map Suiteを紹介する。
経済メカニズムを無効にすることで、環境は長距離ナビゲーションとマイクロコンバットという2つの中核的な戦術スキルを分離する。
予備実験では、エージェントは完全な計算コストを課すことなくコヒーレントな操作とエンゲージメントの振る舞いを学ぶ。
論文 参考訳(メタデータ) (2026-02-19T04:13:14Z) - JaxMARL: Multi-Agent RL Environments and Algorithms in JAX [105.343918678781]
我々は、GPU対応の効率と多くの一般的なMARL環境のサポートを組み合わせた、最初のオープンソースPythonベースのライブラリであるJaxMARLを紹介します。
我々の実験は、壁時計時間の観点から、JAXベースのトレーニングパイプラインが既存のアプローチの約14倍高速であることを示している。
また、人気の高いStarCraft Multi-Agent ChallengeのJAXベースの近似的な再実装であるSMAXを紹介し、ベンチマークする。
論文 参考訳(メタデータ) (2023-11-16T18:58:43Z) - Accelerate Multi-Agent Reinforcement Learning in Zero-Sum Games with
Subgame Curriculum Learning [65.36326734799587]
ゼロサムゲームのための新しいサブゲームカリキュラム学習フレームワークを提案する。
エージェントを以前に訪れた状態にリセットすることで、適応的な初期状態分布を採用する。
我々は,2乗距離をNE値に近似するサブゲーム選択指標を導出する。
論文 参考訳(メタデータ) (2023-10-07T13:09:37Z) - Scaling Laws for Imitation Learning in Single-Agent Games [28.257046559127875]
我々は,モデルとデータサイズを慎重にスケールアップすることで,シングルエージェントゲームにおける模倣学習環境に類似した改善がもたらされるかどうかを検討する。
われわれはまずAtariのさまざまなゲームについて実験を行い、その後NetHackの非常に挑戦的なゲームに焦点を当てた。
IL損失と平均戻り値は計算予算とスムーズに一致し,相関関係が強く,計算最適ILエージェントの訓練には電力法則が適用されることがわかった。
論文 参考訳(メタデータ) (2023-07-18T16:43:03Z) - SPRING: Studying the Paper and Reasoning to Play Games [102.5587155284795]
我々は,ゲーム本来の学術論文を読み取るための新しいアプローチ,SPRINGを提案し,大言語モデル(LLM)を通してゲームの説明とプレイの知識を利用する。
実験では,クラフトオープンワールド環境の設定下で,異なる形態のプロンプトによって引き起こされる文脈内「推論」の品質について検討した。
我々の実験は、LLMが一貫したチェーン・オブ・シークレットによって誘導されると、洗練された高レベル軌道の完成に大きな可能性があることを示唆している。
論文 参考訳(メタデータ) (2023-05-24T18:14:35Z) - JueWu-MC: Playing Minecraft with Sample-efficient Hierarchical
Reinforcement Learning [13.57305458734617]
本稿では,表現学習と模倣学習を併用したサンプル効率の高い階層的RLアプローチであるJueWu-MCを提案する。
具体的には、高レベルのコントローラがオプションを制御するポリシーを学習し、低レベルのワーカーが各サブタスクの解決を学ぶという2つの階層構造を含む。
サブタスクの学習を促進するために,1)行動と表現の基盤となる関係を捉えた行動認識表現学習,2)効率的な探索のための識別器に基づく自己刺激学習,3)一貫性フィルタリングによるアンサンブル行動のクローニングなどを組み合わせた手法を提案する。
論文 参考訳(メタデータ) (2021-12-07T09:24:49Z) - Forgetful Experience Replay in Hierarchical Reinforcement Learning from
Demonstrations [55.41644538483948]
本稿では,複雑な視覚環境において,エージェントが低品質な実演を行えるようにするためのアプローチの組み合わせを提案する。
提案した目標指向のリプレイバッファ構築により,エージェントはデモにおいて複雑な階層的タスクを解くためのサブゴールを自動的に強調することができる。
私たちのアルゴリズムに基づくこのソリューションは、有名なMineRLコンペティションのすべてのソリューションを破り、エージェントがMinecraft環境でダイヤモンドをマイニングすることを可能にする。
論文 参考訳(メタデータ) (2020-06-17T15:38:40Z) - Suphx: Mastering Mahjong with Deep Reinforcement Learning [114.68233321904623]
我々は、新たに導入されたいくつかの技術を用いた深層強化学習に基づいて、Suphxという名のマフジョンのためのAIを設計する。
Suphxは、安定したランクの点で、ほとんどのトップの人間プレイヤーよりも強いパフォーマンスを示している。
コンピュータプログラムがマヒョンで最上位の人間プレイヤーを上回るのは、これが初めてである。
論文 参考訳(メタデータ) (2020-03-30T16:18:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。