論文の概要: Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex
- arxiv url: http://arxiv.org/abs/2607.23333v1
- Date: Sat, 25 Jul 2026 19:11:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.064168
- Title: Training with (Swap) Regret Loss in a Single-Layer Self-Attention Model: A Case Study on the Probability Simplex
- Title(参考訳): 単層自己注意モデルにおける(スワップ)レグレット損失の訓練:確率的簡易性に関する事例研究
- Authors: Chanwoo Park, Asuman Ozdaglar,
- Abstract要約: そこで我々は,Park et al. (2025)で導入された後悔の喪失の枠組みを再考し,意思決定理論的後悔をトレーニングモデルにおける直接的な損失関数として利用し,より良い意思決定を行う。
後悔の喪失で訓練された単層自己注意モデルでは,前方通過がスムーズな架空のプレーと正確に一致した静止点が認められている。
また、新たにスワップ-レグレット損失関数を導入し、外部の後悔を超えた後悔-損失フレームワークを拡張した。
- 参考スコア(独自算出の注目度): 11.370865930864541
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We revisit the regret loss framework introduced in Park et al. (2025), which uses decision-theoretic regret as a direct loss function for training models to make better decisions, through the lens of probability-simplex policies. Our first result shows that a single-layer self-attention model trained with regret loss admits a stationary point whose forward-pass exactly matches smoothed fictitious play with the appropriate stepsize that ensures no-regret behavior-i.e., for any given policy input, the model outputs the same update that smoothed fictitious play would produce. In parallel, we also newly introduce a swap-regret loss function, which extends the regret-loss framework beyond external regret and enables models to directly optimize for swap-deviation robustness. We further show that this swap-regret loss admits a stationary point whose forward pass implements the corresponding swap-regret update induced by classical Blum-Mansour no-pass implementation algorithm, with each head implementing an external-regret update via smoothed fictitious play. Together, these results show that regret-trained attention can realize differentiable mechanisms whose deployment induces equilibrium behavior in games: external-regret dynamics lead to coarse correlated equilibrium, while swap-regret dynamics lead to correlated equilibrium. Thus, regret-based objectives steer minimal attention architectures toward online-learning dynamics with game-theoretic guarantees, without supervised traces of those algorithms.
- Abstract(参考訳): そこで我々は,Park et al (2025) で導入された後悔の喪失の枠組みを再考し,決定理論的後悔を学習モデルにおける直接的損失関数として用いて,確率-複雑なポリシーのレンズを通して,より良い意思決定を行う。
最初の結果は、後悔の喪失で訓練された単層自己注意モデルにおいて、前方通過がスムーズな架空の遊びと正確に一致する定常点と、適切なステップサイズ、すなわち、任意のポリシー入力に対して、そのモデルがスムーズな架空の遊びが生み出すのと同じ更新を出力することを示す。
また、新たにスワップ-リグレット損失関数を導入し、余剰フレームワークを外部の後悔を超えて拡張し、スワップ-リグレットのロバスト性に直接最適化できるようにする。
さらに、このスワップ-リグレット損失は、従来のBlum-Mansourノンパス実装アルゴリズムにより、フォワードパスが対応するスワップ-リグレット更新を実装した静止点を許容し、各ヘッドがスムーズな架空のプレイによる外部リグレット更新を実装していることを示す。
これらの結果から,展開がゲーム内の平衡挙動を誘導する微分可能なメカニズムが実現できることが示唆された。
このように、後悔に基づく目的は、これらのアルゴリズムの教師付きトレースを伴わずに、ゲーム理論の保証を伴うオンライン学習のダイナミックスに対して最小限の注意を払っている。
関連論文リスト
- Proximal Regret and Proximal Correlated Equilibria: A New Tractable Solution Concept for Online Learning and Games [60.981847057352695]
近位演算子に基づく新たな後悔の概念である近位後悔を導入し、外部とスワップ後悔の間に厳密に関係する。
古典的オンライングラディエントDescentアルゴリズムは,近位後悔に縛られた最適な$O(sqrtT)を達成している。
これは、オンライン学習とゲームにおける勾配降下の実験的に優れたパフォーマンスについて、新しい説明を提供する。
論文 参考訳(メタデータ) (2025-11-03T18:57:49Z) - Swap Regret and Correlated Equilibria Beyond Normal-Form Games [62.01542145970044]
「我々は、プロファイルスワップ後悔と呼ぶポリトープゲームのスワップ後悔の新しい変種を提示する。」
プロファイルスワップ後悔は、プレイの書き起こしが与えられた場合、NPハードであることが示されるが、少なくとも$O(sqrtT)$プロファイルスワップ後悔を保証する効率的な学習アルゴリズムを設計することは可能である。
論文 参考訳(メタデータ) (2025-02-27T16:16:26Z) - Regret Minimization and Convergence to Equilibria in General-sum Markov Games [61.6869963435955]
汎用マルコフゲームにおいて,全てのエージェントが実行した場合のサブ線形後悔保証を提供する学習アルゴリズムを初めて提示する。
我々のアルゴリズムは分散化され、計算効率が良く、エージェント間の通信は不要である。
論文 参考訳(メタデータ) (2022-07-28T16:27:59Z) - No-Regret Learning in Games with Noisy Feedback: Faster Rates and
Adaptivity via Learning Rate Separation [76.61911795703062]
学習者が他の最適化エージェントと連続したゲームに関わった場合の後悔の問題を考察する。
この場合、全てのプレイヤーが非相対的アルゴリズムに従えば、完全に敵対する環境に対してかなり低い後悔を達成することができる。
本稿では,最悪とベストケースの後悔の保証を円滑に補間する完全適応手法を提案する。
論文 参考訳(メタデータ) (2022-06-13T10:13:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。