論文の概要: Towards Learning Representations of Policies in Two-Player Zero-Sum Imperfect-Information Games
- arxiv url: http://arxiv.org/abs/2607.01498v1
- Date: Wed, 01 Jul 2026 21:56:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.602561
- Title: Towards Learning Representations of Policies in Two-Player Zero-Sum Imperfect-Information Games
- Title(参考訳): 2プレイヤーゼロサム不完全情報ゲームにおけるポリシーの学習表現に向けて
- Authors: Kevin Wang, Kevin Yang, Arjun Prakash, Amy Greenwald,
- Abstract要約: 本研究では,2プレイヤーゼロサム不完全情報ゲームにおける有用なポリシー表現(埋め込み)の学習問題について検討する。
我々の知る限り、この研究はゲームにおけるポリシー表現を学習するための自己教師あり学習手法を体系的に比較する最初のものである。
- 参考スコア(独自算出の注目度): 15.53109055092681
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We investigate the problem of learning useful policy representations (embeddings) in two-player zero-sum imperfect-information games. We make three contributions: First, we introduce methods of creating datasets of policies for a given game. Second, we propose methods to learn policy representations. Third, we introduce downstream tasks to evaluate the effectiveness of such representations. We evaluate each dataset method, embedding method, and downstream task on Kuhn and Leduc Poker. Although our methods are very basic, we demonstrate that useful behavioral representations are present in the learned embeddings. To our knowledge, this work is among the first to systematically compare self-supervised learning techniques for learning policy representations in games. Our code is available at https://github.com/VitamintK/ssl-project for others to extend.
- Abstract(参考訳): 本研究では,2プレイヤーゼロサム不完全情報ゲームにおける有用なポリシー表現(埋め込み)の学習問題について検討する。
まず、あるゲームのためのポリシーのデータセットを作成する方法を紹介します。
次に,政策表現を学習する手法を提案する。
第三に、そのような表現の有効性を評価するために下流タスクを導入します。
我々は,Kuhn および Leduc Poker 上の各データセット法,埋め込み法,下流タスクを評価する。
提案手法は非常に基本的なものであるが,学習した埋め込みに有用な行動表現が存在することを実証する。
我々の知る限り、この研究はゲームにおけるポリシー表現を学習するための自己教師あり学習手法を体系的に比較する最初のものである。
私たちのコードはhttps://github.com/VitamintK/ssl-projectで公開されています。
関連論文リスト
- FlowRetrieval: Flow-Guided Data Retrieval for Few-Shot Imitation Learning [28.523528119584526]
擬似学習は、与えられた下流タスクに対するポリシーを効率的に適応するために、少数のタスク固有のデモンストレーションにのみ依存する。
本稿では,従来のデータから目標タスクに類似した動作を抽出するために,光フロー表現を利用するFlowRetrievalを提案する。
その結果,FlowRetrievalは,シミュレーションや実世界のドメイン間で,従来の手法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-08-29T23:48:08Z) - ViViDex: Learning Vision-based Dexterous Manipulation from Human Videos [81.99559944822752]
我々は人間のビデオから視覚に基づくポリシー学習を改善するためにViViDexを提案する。
最初は強化学習と軌道誘導報酬を使って、各ビデオに対する州ベースのポリシーを訓練する。
次に、州ベースのポリシーから成功したエピソードをロールアウトし、特権情報を使用しずに統一された視覚ポリシーをトレーニングします。
論文 参考訳(メタデータ) (2024-04-24T07:58:28Z) - Any-point Trajectory Modeling for Policy Learning [64.23861308947852]
我々は、ビデオフレーム内の任意の点の将来の軌跡を予測するために、ATM(Any-point Trajectory Modeling)を導入する。
ATMは、強力なビデオ事前トレーニングベースラインを平均80%上回っている。
本研究では,人間の動画やビデオからの操作スキルを,異なるロボット形態から効果的に伝達する学習方法を示す。
論文 参考訳(メタデータ) (2023-12-28T23:34:43Z) - SpawnNet: Learning Generalizable Visuomotor Skills from Pre-trained
Networks [52.766795949716986]
本稿では,事前学習した視覚表現のカテゴリレベルでの一般化能力について検討する。
本研究では,事前学習した多層表現を独立したネットワークに融合させて,ロバストなポリシーを学習する,新しい2ストリームアーキテクチャSpawnNetを提案する。
論文 参考訳(メタデータ) (2023-07-07T13:01:29Z) - Playful Interactions for Representation Learning [82.59215739257104]
本稿では,下流タスクの視覚的表現を学習するために,遊び心のあるインタラクションを自己指導的に利用することを提案する。
19の多様な環境で2時間の遊び心のあるデータを収集し、自己予測学習を用いて視覚的表現を抽出する。
我々の表現は、標準的な行動クローニングよりも一般化され、必要なデモの半数しか必要とせず、同様の性能を達成できる。
論文 参考訳(メタデータ) (2021-07-19T17:54:48Z) - Synthesising Reinforcement Learning Policies through Set-Valued
Inductive Rule Learning [5.889881421315419]
強化学習アルゴリズムは、人に対する解釈と信頼が難しいブラックボックスポリシーを生成する。
我々は,CN2ルールマイニングアルゴリズムに基づく政策蒸留アルゴリズムを導入し,政策をルールベース決定システムに蒸留する。
最新の強化学習アルゴリズムを必要とする複雑なタスクであるMario AIベンチマークで、我々のアルゴリズムの適用性を実証する。
論文 参考訳(メタデータ) (2021-06-10T19:06:28Z) - Reward-Conditioned Policies [100.64167842905069]
模倣学習には、ほぼ最適の専門家データが必要である。
実演なしで指導的学習を通じて効果的な政策を学べるか?
政策探索の原則的手法として,このようなアプローチを導出する方法を示す。
論文 参考訳(メタデータ) (2019-12-31T18:07:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。