論文の概要: Learning in Continuous Games from Pairwise Preference Feedback
- arxiv url: http://arxiv.org/abs/2610.05428v1
- Date: Sun, 04 Oct 2026 18:08:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:50:50.382274
- Title: Learning in Continuous Games from Pairwise Preference Feedback
- Title(参考訳): Pairwise Preference Feedbackによる連続ゲームでの学習
- Abstract要約: プレイヤーがペアの選好フィードバックのみを受ける場合、連続ゲームでの学習を学習する。
この順序情報から、標準的な外部後悔と粗相関平衡(CCE)が特定できないことを示す。
我々は、正規化された一方的な選好方向に基づく一階順序理論を開発する。
- 参考スコア(独自算出の注目度): 5.719432145550113
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study learning in continuous games when players receive only pairwise preference feedback, revealing which of two actions is preferred but neither payoff values nor preference magnitudes. We first show that standard external regret and coarse correlated equilibria (CCE) are not identifiable from this ordinal information: the same sequence of play can incur zero and linear regret in two ordinally equivalent games, while the distributions that remain CCE across all cardinal representations consistent with the same preferences are exactly those supported on pure Nash equilibria. Motivated by this gap, we develop a first-order ordinal theory based on normalized unilateral preference directions, introducing an ordinal directional regret benchmark and corresponding equilibrium notions. We show that block-normalized pseudogradient dynamics achieve sublinear ordinal regret and, under additional structure, Nash-convergence guarantees. We then use a single-comparison estimator to implement these dynamics from finite pairwise comparisons. With one comparison per player and round, the resulting algorithm achieves sublinear finite-resolution ordinal regret against arbitrary opponent behavior and, in ordinal potential games, almost-sure last-iterate convergence to the Nash set. Our results provide regret, dynamics, and equilibrium guarantees directly from preference feedback without reconstructing cardinal utilities.
- Abstract(参考訳): プレイヤーがペアワイズな選好フィードバックのみを受ける場合の連続ゲームにおける学習を学習し、2つのアクションのどちらが望ましいかを明らかにするが、ペイオフ値や選好の程度は明らかにしない。
我々はまず、この順序情報から標準的な外部後悔と粗相関平衡(CCE)が特定できないことを示す:同じ遊びの列は2つの正規等価ゲームにおいてゼロと線形後悔を生じさせるが、CCEが同じ嗜好と整合したすべての基数表現に残る分布は、純粋ナッシュ平衡で完全に支持される。
このギャップを動機として、正規化された一方的な選好方向に基づく一階順序理論を開発し、順序的指向性後悔ベンチマークとそれに対応する平衡概念を導入する。
ブロック正規化擬似階調力学は,次数次的後悔を達成し,付加構造の下ではナッシュ収束を保証する。
次に、有限対比較からこれらのダイナミクスを実装するために、単相推定器を用いる。
プレイヤーとラウンドごとの1つの比較により、結果のアルゴリズムは、任意の相手の行動に対するサブ線形有限解像度の順序的後悔と、順序的ポテンシャルゲームにおいて、ほぼ確実にナッシュ集合への最後の収束を達成する。
本結果は, 基本ユーティリティを再構築することなく, 優先フィードバックから直接, 後悔, ダイナミクス, 均衡を保証するものである。
関連論文リスト
- Robust Nash Alignment under Preference Uncertainty [9.936051338654401]
本稿では,不確実なペアワイズ選好に対応するゲーム理論フレームワークを提案する。
我々の定式化には、敵の競争相手と、名目上の選好に設定されたあいまいさにある任意の選好カーネルの両方に対して、最悪の勝利率の高い政策を求める主要な学習者がいる。
提案手法では, 常に制約された目標を下界させ, プロキシとハードのギャップを定量化し, プロキシが頑健な目標を回復する正当性条件を特徴付ける。
論文 参考訳(メタデータ) (2026-09-30T21:05:43Z) - What preferences can - and cannot - predict in multi-agent online learning [21.642749388029525]
ゲームにおける順序的、選好的ソリューション概念間の相互作用について検討する。
一方向において、すべての動的安定な集合の骨格も優先的に安定でなければならないことを示す。
次に、集合的偏差の下でレジリエンスの概念を通じてギャップを埋めます。
論文 参考訳(メタデータ) (2026-08-13T22:42:53Z) - Last-Iterate Guarantees for Learning in Co-coercive Games [5.7071219882414885]
我々は,ノイズフィードバックの下で,コヒーシブゲームにおけるバニラ降下に対する有限時間最後の保証を確立する。
これは強い単調ゲームよりも一般的である幅広い種類のゲームである。
論文 参考訳(メタデータ) (2026-04-21T04:18:14Z) - Asymmetric Nash Seeking via Best Response Maps: Global Linear Convergence and Robustness to Inexact Reaction Models [0.0]
ナッシュ均衡(Nash equilibria)は、マルチエージェントの意思決定と制御における相互作用をモデル化するための原則的なフレームワークを提供する。
この手紙は、非対称情報 2-プレーヤ制約付きゲームのクラスを分離可能な集合で研究する。
論文 参考訳(メタデータ) (2026-03-17T18:45:56Z) - Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback [50.89125374999765]
NLHFにおける最適乗算重み更新(mathtOMWU$)に対する最初の収束保証を提供する。
本分析では, 稀に発生する行動の確率が指数関数的に小さい値から指数関数的に増大する新たな限界収束挙動を同定する。
論文 参考訳(メタデータ) (2025-12-31T12:08:29Z) - Exploiting hidden structures in non-convex games for convergence to Nash
equilibrium [62.88214569402201]
現代の機械学習アプリケーションは、非協調的なナッシュリリアとして定式化することができる。
決定論的環境と決定論的環境の両方に明確な収束保証を提供する。
論文 参考訳(メタデータ) (2023-12-27T15:21:25Z) - Adaptive, Doubly Optimal No-Regret Learning in Strongly Monotone and Exp-Concave Games with Gradient Feedback [75.29048190099523]
オンライン勾配降下(OGD)は、強い凸性や単調性仮定の下では二重最適であることが知られている。
本稿では,これらのパラメータの事前知識を必要としない完全適応型OGDアルゴリズム,textsfAdaOGDを設計する。
論文 参考訳(メタデータ) (2023-10-21T18:38:13Z) - Adaptive Learning in Continuous Games: Optimal Regret Bounds and
Convergence to Nash Equilibrium [33.9962699667578]
No-regretアルゴリズムはゲーム理論の保証の点で等しく作成されません。
楽観的なミラー降下に基づく非相対的ポリシーを提案する。
論文 参考訳(メタデータ) (2021-04-26T17:52:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。