論文の概要: Learning under Opponent Unawareness in Linear-Quadratic Stochastic Games
- arxiv url: http://arxiv.org/abs/2608.08268v1
- Date: Sat, 08 Aug 2026 17:59:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.753259
- Title: Learning under Opponent Unawareness in Linear-Quadratic Stochastic Games
- Title(参考訳): リニア・クアドラティック・確率ゲームにおける対向的不注意下での学習
- Abstract要約: 本研究では,無限水平非ゼロサム線形四元数ゲームにおける学習を,非結合な情報構造の下で研究する。
プレイヤーの学習力学は、ほぼ確実に全情報ナッシュ均衡に収束することを示す。
数値実験により理論的結果が検証され、限られた情報の下での学習が、低コストかつ高価格で利益を減少させることを示す。
- 参考スコア(独自算出の注目度): 4.725204306025237
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As firms increasingly deploy machine learning for strategic decision-making, understanding algorithmic interactions has become central to operations research and economics. This paper studies learning in infinite-horizon, nonzero-sum linear-quadratic stochastic games under a radically uncoupled information structure, where players are either unaware of opponents or strategically oblivious, observing only a common state and their own action history. Under this minimal information, we analyze an asynchronous decentralized learning process in which each player independently runs a single-agent $ε$-greedy iterated least-squares algorithm. We prove that, despite being unable to identify the system parameters, players' learning dynamics converge almost surely to the complete-information Nash equilibrium and characterize the convergence rate. We then apply the framework to a dynamic Cournot competition with sticky prices. Numerical experiments validate the theoretical results and show that learning under limited information reduces firm profits under both low and high price stickiness, while total surplus declines and market concentration increases when price stickiness is high. Publicly revealing aggregate market output substantially accelerates convergence and mitigates these welfare losses.
- Abstract(参考訳): 企業が戦略的意思決定のために機械学習をますます導入するにつれて、アルゴリズムによるインタラクションの理解は、オペレーションの研究と経済の中心となっている。
本稿では,非ゼロサム線形四元数確率ゲームにおいて,プレイヤーが相手を知らない,あるいは戦略的に不利な,共通の状態と自身の行動履歴のみを観察する,急激な情報構造下での学習について検討する。
この最小限の情報に基づいて、各プレイヤーが独立して1エージェント$ε$-greedy反復最小二乗アルゴリズムを実行する非同期分散学習プロセスを分析する。
システムパラメータを同定できないにもかかわらず、プレイヤーの学習力学は完全な情報ナッシュ平衡にほぼ確実に収束し、収束率を特徴付けることを証明した。
次に、このフレームワークを粘着価格との動的Cournot競合に適用する。
数値実験により,限定情報に基づく学習は,価格安定度が高い場合に,総剰余金の減少と市場集中度が増大する一方で,低・高価格安定度下でのファーム利益を減少させることが示された。
市場総生産の公表は、これらの福祉損失の収束と緩和を著しく加速させる。
関連論文リスト
- Should Demand Models Incorporate Competitor Prices? Oblivious Learning and Algorithmic Collusion [9.502860427940643]
競争相手の価格を故意に無視する戦略上の曖昧さは、結束的な成果を促進し、利益を向上させる可能性があることを示す。
すべての売り手が不利な時に市場ダイナミクスを特徴付け、十分な探索の下で価格が競争結果に収束することを示す。
この結果から, 衝突パターンは頑健ではなく, 難解なモデリングでは持続できないことが示唆された。
論文 参考訳(メタデータ) (2026-06-03T19:10:55Z) - The Sample Complexity of Online Strategic Decision Making with Information Asymmetry and Knowledge Transportability [93.11220429350278]
情報非対称性はマルチエージェントシステムの普及した特徴である。
本論文は,オンライン学習における基本的課題について考察する。知識伝達を必要とする場合でも,共同設立者について学ぶために,非I.d.アクションを適用できるのか?
本稿では,情報非対称性下でのシステム力学を正確に同定し,強化学習における知識伝達の課題を効果的にナビゲートするために,サンプル効率のよいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-11T17:06:57Z) - On Tractable $Φ$-Equilibria in Non-Concave Games [53.212133025684224]
非コンケーブゲームにおいて、抽出可能な$Phi$-equilibriaについて検討する。
Phi$が有限であるとき、対応する$Phi$-equilibriaに収束する効率的な非結合学習アルゴリズムが存在することを示す。
論文 参考訳(メタデータ) (2024-03-13T01:51:30Z) - Tacit algorithmic collusion in deep reinforcement learning guided price competition: A study using EV charge pricing game [0.0]
複雑な構造を持つゲームの価格設定のプレイヤーは、人工知能(AI)による学習アルゴリズムの採用が増えている。
正準形式のゲームに関する最近の研究は、無から高レベルの暗黙の共謀まで、対照的な主張を示している。
EV充電ハブが価格を動的に変動させることで競争する現実的なゲームを考える。
数値ケーススタディの結果,0.14~0.45の衝突指数値が得られた。
論文 参考訳(メタデータ) (2024-01-25T16:51:52Z) - Finding mixed-strategy equilibria of continuous-action games without
gradients using randomized policy networks [83.28949556413717]
グラデーションへのアクセスを伴わない連続アクションゲームのナッシュ平衡を近似的に計算する問題について検討する。
ニューラルネットワークを用いてプレイヤーの戦略をモデル化する。
本論文は、制約のない混合戦略と勾配情報のない一般的な連続アクションゲームを解決する最初の方法である。
論文 参考訳(メタデータ) (2022-11-29T05:16:41Z) - Towards Multi-Agent Reinforcement Learning driven Over-The-Counter
Market Simulations [16.48389671789281]
オーバー・ザ・カウンタ市場において,流動性提供者と流動性取扱業者が相互作用するゲームについて検討した。
互いに対戦することで、深層強化学習主体のエージェントは創発的な行動を学ぶ。
遷移性仮定の下で,多エージェントポリシー勾配アルゴリズムの収束率を示す。
論文 参考訳(メタデータ) (2022-10-13T17:06:08Z) - Learning in Stackelberg Games with Non-myopic Agents [60.927889817803745]
そこで本研究では,主役が非筋力的な長寿命エージェントと繰り返し対話するスタックルバーグゲームについて,エージェントの支払関数を知らずに検討する。
我々は、非ミオピックエージェントの存在下での学習を、ミオピックエージェントの存在下で堅牢な帯域最適化に還元する一般的なフレームワークを提供する。
論文 参考訳(メタデータ) (2022-08-19T15:49:30Z) - Finding General Equilibria in Many-Agent Economic Simulations Using Deep
Reinforcement Learning [72.23843557783533]
本研究では,エージェント種別のメタゲームに対して,エプシロン・ナッシュ平衡である安定解を求めることができることを示す。
私たちのアプローチはより柔軟で、例えば市場クリア化のような非現実的な仮定は必要ありません。
当社のアプローチは、実際のビジネスサイクルモデル、DGEモデルの代表的なファミリー、100人の労働者消費者、10社の企業、税金と再分配を行う政府で実証しています。
論文 参考訳(メタデータ) (2022-01-03T17:00:17Z) - Provably Efficient Reinforcement Learning in Decentralized General-Sum
Markov Games [5.205867750232226]
本稿では,一般のマルコフゲームにおいて平衡を効率的に学習する問題に対処する。
本稿では,各エージェントが独立して楽観的なV-ラーニングを実行し,未知の環境を効率的に探索するアルゴリズムを提案する。
エージェントは少なくとも$widetildeO(H6S A /epsilon2)$ episodesで$epsilon$-approximate CCEを見つけることができる。
論文 参考訳(メタデータ) (2021-10-12T02:01:22Z) - Decentralized Q-Learning in Zero-sum Markov Games [33.81574774144886]
ゼロサムマルコフゲームにおけるマルチエージェント強化学習(MARL)について検討した。
我々は、合理的かつ収束的な、根本的に非結合なQ-ラーニングダイナミクスを初めて開発する。
この分散環境における鍵となる課題は、エージェントの観点から学習環境の非定常性である。
論文 参考訳(メタデータ) (2021-06-04T22:42:56Z) - Sample-Efficient Learning of Stackelberg Equilibria in General-Sum Games [78.65798135008419]
一般的なゲームでStackelberg平衡を効率的に学習する方法は、サンプルから非常にオープンなままです。
本稿では,2プレーヤターンベース汎用ゲームにおけるStackelberg平衡のサンプル効率学習に関する理論的研究を開始する。
論文 参考訳(メタデータ) (2021-02-23T05:11:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。