論文の概要: IRumAI: Reinforcement Learning for Indian Rummy
- arxiv url: http://arxiv.org/abs/2606.21975v1
- Date: Sat, 20 Jun 2026 10:06:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 21:51:23.074847
- Title: IRumAI: Reinforcement Learning for Indian Rummy
- Title(参考訳): IRUMAI:インドラミーの強化学習
- Authors: Vignesh Mohan,
- Abstract要約: ドメインの最初のRLエージェントIRumAIを提示する。
IRumAIは、PPO(Proximal Policy Optimization)、Meld-Aware Observation encoding、デッドウッド駆動の報酬形成、デュアルブランチの畳み込みアーキテクチャを統合している。
RLトレーニング中、最強のサーチベース対戦相手に対して53.9%の勝利率を含む、ベースライン階層全体を破ることが一般化されている。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite its massive player base and complex hidden-information dynamics, Indian Rummy has received no reinforcement learning attention. Existing agents rely on combinatorial search, which is tactically strong but slow at inference. We present IRumAI, the first RL agent for the domain. IRumAI integrates Proximal Policy Optimization (PPO), meld-aware observation encoding, deadwood-driven reward shaping, and a dual-branch convolutional architecture. IRumAI is RL-trained solely against weak heuristics, after a one-time behaviour-cloning warm-start on stronger demonstration data. It generalises to defeat the entire baseline hierarchy, including a 53.9% win rate against the strongest search-based opponent unseen during RL training. Bypassing explicit search, IRumAI requires just 0.33 ms per action, which is over 7,000x faster than the state-of-the-art heuristic. Ablations validate our architectural choices, and linear probing reveals that the network implicitly models the opponent's hidden hand from public interactions.
- Abstract(参考訳): 巨大なプレイヤー基盤と複雑な隠れ情報力学にもかかわらず、インディアン・ラムミーは強化学習の注意を引いていない。
既存のエージェントは、戦術的に強いが推論が遅い組合せ探索に依存している。
ドメインの最初のRLエージェントIRumAIを提示する。
IRumAIは、PPO(Proximal Policy Optimization)、Meld-Aware Observation encoding、デッドウッド駆動の報酬形成、デュアルブランチの畳み込みアーキテクチャを統合している。
IRUMAIは弱いヒューリスティックに対してのみRLを訓練している。
RLトレーニング中、最強のサーチベース対戦相手に対して53.9%の勝利率を含む、ベースライン階層全体を破ることが一般化されている。
明示的な探索を通すことで、IRumAIは1アクションあたり0.03msしか必要とせず、これは最先端のヒューリスティックよりも7,000倍高速である。
アブレーションはアーキテクチャ上の選択を検証し、線形探索により、ネットワークが公的な相互作用から相手の隠れた手を暗黙的にモデル化することを明らかにする。
関連論文リスト
- Don't throw the baby out with the bathwater: How and why deep learning for ARC [4.354364351426983]
ARC-AGI(Abstraction and Reasoning)は、AIシステムにとって非常に難しい課題である。
本稿では, ARC の事前学習から始まった ARC の学習手法を提案し, ARC の推論を改良する。
AIRVでは最大260%の精度で,TTFTではさらに300%の精度で深層学習を効果的に活用できることを示す。
論文 参考訳(メタデータ) (2025-06-17T07:40:39Z) - RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning [125.96848846966087]
対話型エージェントとしての大規模言語モデル(LLM)のトレーニングには,ユニークな課題がある。
強化学習は静的タスクの進行を可能にする一方で、マルチターンエージェントRLトレーニングは未探索のままである。
本稿では、軌道レベルのエージェントRLのための一般的なフレームワークであるStarPOを提案し、LLMエージェントのトレーニングと評価のためのモジュールシステムであるRAGENを紹介する。
論文 参考訳(メタデータ) (2025-04-24T17:57:08Z) - Mastering the Digital Art of War: Developing Intelligent Combat Simulation Agents for Wargaming Using Hierarchical Reinforcement Learning [0.0]
対象とする観察抽象化、マルチモデル統合、ハイブリッドAIフレームワーク、階層的な強化学習フレームワークなど、包括的なアプローチを提案する。
線形空間減衰を用いた局所的な観測抽象化は,RL問題を単純化し,計算効率を向上し,従来の大域的観測法よりも優れた有効性を示す。
我々のハイブリッドAIフレームワークは、スクリプトエージェントとRLを同期させ、高レベルの決定にRLを、低レベルのタスクにスクリプトエージェントを活用し、適応性、信頼性、パフォーマンスを向上させる。
論文 参考訳(メタデータ) (2024-08-23T18:50:57Z) - Impartial Games: A Challenge for Reinforcement Learning [0.0]
我々は,AlphaZeroスタイルの強化学習アルゴリズムが,公平なゲームに適用した場合,重要かつ基本的な課題に直面することを示す。
その結果,AlphaZeroスタイルのエージェントはチャンピオンレベルのプレーを達成できるが,ボードサイズが大きくなるにつれて学習の進歩は著しく低下することがわかった。
これらの結果は、AlphaZeroスタイルのアルゴリズムの攻撃に対する脆弱性に関するより広範な懸念と一致している。
論文 参考訳(メタデータ) (2022-05-25T14:02:02Z) - Explore and Control with Adversarial Surprise [78.41972292110967]
強化学習(Reinforcement Learning, RL)は、目標指向のポリシーを学習するためのフレームワークである。
本稿では,RLエージェントが経験した驚きの量と競合する2つのポリシーを相殺する対戦ゲームに基づく,新しい教師なしRL手法を提案する。
本手法は, 明確な相転移を示すことによって, 複雑なスキルの出現につながることを示す。
論文 参考訳(メタデータ) (2021-07-12T17:58:40Z) - Disturbing Reinforcement Learning Agents with Corrupted Rewards [62.997667081978825]
強化学習アルゴリズムに対する報酬の摂動に基づく異なる攻撃戦略の効果を分析します。
敵対的な報酬をスムーズに作成することは学習者を誤解させることができ、低探査確率値を使用すると、学習した政策は報酬を腐敗させるのがより堅牢であることを示しています。
論文 参考訳(メタデータ) (2021-02-12T15:53:48Z) - Robust Reinforcement Learning on State Observations with Learned Optimal
Adversary [86.0846119254031]
逆摂動状態観測による強化学習の堅牢性について検討した。
固定されたエージェントポリシーでは、摂動状態の観測に最適な敵を見つけることができる。
DRLの設定では、これは以前のものよりもはるかに強い学習された敵対を介してRLエージェントに新しい経験的敵対攻撃につながります。
論文 参考訳(メタデータ) (2021-01-21T05:38:52Z) - Robust Deep Reinforcement Learning through Adversarial Loss [74.20501663956604]
近年の研究では、深層強化学習剤は、エージェントの入力に対する小さな逆方向の摂動に弱いことが示されている。
敵攻撃に対する堅牢性を向上した強化学習エージェントを訓練するための原則的フレームワークであるRADIAL-RLを提案する。
論文 参考訳(メタデータ) (2020-08-05T07:49:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。