論文の概要: Orchestrating Level-$K$ Policies Against Unknown Opponents in Partially-Observable Dynamic Games
- arxiv url: http://arxiv.org/abs/2610.04937v1
- Date: Sun, 04 Oct 2026 04:32:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 07:48:18.38908
- Title: Orchestrating Level-$K$ Policies Against Unknown Opponents in Partially-Observable Dynamic Games
- Title(参考訳): 部分観察可能なダイナミックゲームにおける未知の反対者に対するレベル-$K$ポリシーのオーケストレーション
- Abstract要約: レベル-$K$推論は、異なる推論レベルを持つ相手に特化したポリシーの階層を生成する。
我々は、この展開問題を、部分的に観察可能なマルコフゲームにおいて、固定された事前訓練されたポリシーライブラリの動的オーケストレーションとして定式化する。
追従回避実験では、オンライン学習は分類と復帰を改善するが、RLBOはオンライン学習やオフライン学習よりも高いリターンを達成する。
- 参考スコア(独自算出の注目度): 1.9964848378974722
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Level-$K$ reasoning generates a hierarchy of policies specialized to opponents with different reasoning levels. When an opponent's level is unknown, a common deployment rule estimates that level and selects the corresponding response. In a dynamic, partially-observed game, this selection is repeated, with each choice shaping subsequent states and observations. The response associated with the most likely opponent level need not maximize expected return from the current history. We formulate this deployment problem as dynamic orchestration of a fixed, pretrained policy library in a partially observable Markov game. We compare classification-based orchestrators (CBOs) trained using offline data or on-policy data aggregation with a reinforcement-learning-based orchestrator (RLBO) trained to maximize expected discounted return. In pursuit-evasion experiments, on-policy training improves classification and return, yet RLBO achieves higher return than the on-policy and offline CBOs. Given a pretrained library, RLBO also reaches performance comparable to a policy trained directly over the pursuers' action space with fewer training timesteps. These findings support treating a hierarchy of level-$K$ policies as a resource for orchestration, not a prescription for deployment.
- Abstract(参考訳): レベル-$K$推論は、異なる推論レベルを持つ相手に特化したポリシーの階層を生成する。
相手のレベルが不明な場合、共通の配置ルールがそのレベルを推定し、対応する応答を選択する。
ダイナミックで部分的に観察されたゲームでは、この選択が繰り返され、それぞれの選択がその後の状態と観察を形作る。
最も可能性の高いレベルに関連する応答は、現在の履歴から期待されるリターンを最大化する必要はない。
我々は、この展開問題を、部分的に観察可能なマルコフゲームにおいて、固定された事前訓練されたポリシーライブラリの動的オーケストレーションとして定式化する。
オフラインデータやオンラインデータアグリゲーションを用いてトレーニングされた分類ベースオーケストレータ(CBO)と、予測割引リターンを最大化するためにトレーニングされた強化学習ベースオーケストレータ(RLBO)を比較した。
追従回避実験では、オンライン学習は分類と復帰を改善するが、RLBOはオンライン学習やオフライン学習よりも高いリターンを達成する。
事前トレーニングされたライブラリが与えられた場合、RLBOは、トレーニングタイムステップの少ないトラッカーのアクション空間上で直接トレーニングされたポリシーに匹敵するパフォーマンスに達する。
これらの発見は、レベルの$K$ポリシーの階層を、デプロイの基準ではなく、オーケストレーションのリソースとして扱うのをサポートする。
関連論文リスト
- Rank-Then-Act: Reward-Free Control from Frame-Order Progress [5.357451930622806]
Rank-Then-Act (RTA) は、環境に配慮せず、専門家によるビデオデモからコントロールポリシーを学ぶためのフレームワークである。
VLM(Vision-Language Model)をオフラインで,プログレッシブベースのオーディショナルスコアラーとしてトレーニングする。
我々は,予測進行ランクと真の時間指標とのスピアマンランク相関を計算し,有界でスケール不変な学習信号を生成する。
論文 参考訳(メタデータ) (2026-07-02T08:50:32Z) - GAPD: Gold-Action Policy Distillation for Agentic Reinforcement Learning in Knowledge Base Question Answering [64.23115520219609]
結果に基づくRLに高密度トークンレベルガイダンスを付加する訓練時間金反応政策蒸留フレームワークを提案する。
GAPDはWebQSP、GrailQA、GraphQの最先端技術に一貫して勝っている。
論文 参考訳(メタデータ) (2026-05-28T08:28:10Z) - SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models [67.41779761651924]
SOUPは、トークンレベルで個々のサンプル内でオフとオンの学習を統合するフレームワークである。
標準のオン・ポリティクス・トレーニングと既存のオフ・ポリティクス・エクステンションを一貫して上回っている。
論文 参考訳(メタデータ) (2026-01-29T09:56:15Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - SR-Reward: Taking The Path More Traveled [8.818066308133108]
オフラインでのデモンストレーションから報酬関数を直接学習する新しい手法を提案する。
従来の逆強化学習(IRL)とは異なり,本手法は学習者の方針から報酬関数を分離する。
textitSR-Rewardと呼ばれる我々の報酬関数は、後継表現(SR)を利用して、実証ポリシーと遷移ダイナミクスの下で期待される将来の状態の訪問に基づいて状態をエンコードする。
論文 参考訳(メタデータ) (2025-01-04T16:21:10Z) - Boosting Offline Reinforcement Learning via Data Rebalancing [104.3767045977716]
オフライン強化学習(RL)は、学習ポリシーとデータセットの分散シフトによって問題となる。
本稿では,データセットの再サンプリングが分散サポートを一定に保っているという観察に基づいて,オフラインRLアルゴリズムをシンプルかつ効果的に向上させる手法を提案する。
ReD(Return-based Data Re Balance)メソッドをダブします。これは10行未満のコード変更で実装でき、無視できる実行時間を追加します。
論文 参考訳(メタデータ) (2022-10-17T16:34:01Z) - Offline Reinforcement Learning with Implicit Q-Learning [85.62618088890787]
現行のオフライン強化学習手法では、トレーニング中に見つからない行動の価値を問い合わせて、ポリシーを改善する必要がある。
本稿では,データセット外の動作を評価する必要のないオフラインRL手法を提案する。
この方法により、学習したポリシーは、一般化によってデータの最良の振る舞いを大幅に改善することができる。
論文 参考訳(メタデータ) (2021-10-12T17:05:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。