論文の概要: The Deceptive Bandit Problem: Exploratory Coupling and the Fragility of Multi-Agent Learning
- arxiv url: http://arxiv.org/abs/2610.09120v1
- Date: Tue, 06 Oct 2026 21:12:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.608344
- Title: The Deceptive Bandit Problem: Exploratory Coupling and the Fragility of Multi-Agent Learning
- Title(参考訳): 知覚的帯域問題:探索的結合とマルチエージェント学習の脆弱性
- Abstract要約: 敵エージェントが他エージェントの探索に関する特権情報を利用する方法を示す。
偏見的バンディット学習のダイナミクスが任意に小さな地区に収束することを証明する。
我々は, 偏見が定常状態に厳密にシフトし, 偏見のコストに影響を及ぼす条件を特徴づける。
- 参考スコア(独自算出の注目度): 2.5329739965085785
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Randomized exploration is central to bandit learning, multi-agent reinforcement learning, and zeroth-order policy search, yet its independence and privacy are usually only treated as technical assumptions. We show that these properties are critical for security purposes and demonstrate how an adversarial agent can exploit privileged information on another agent's exploration. We analyze a deceiver-victim pair in the minimal two-player strongly monotone setting, where a deceptive player obtains leaked signals that are merely correlated with the victim's exploration. We show that, by coupling their own exploratory action with this information, the deceptive player injects an externality that steers the learning dynamics to a new steady state, called the deceptive Nash equilibrium (DNE). We prove that the deceptive bandit learning (DBL) dynamics converge to an arbitrarily small neighborhood of the DNE while retaining optimal convergence rates. Interestingly, our analysis attains these optimal rates while relaxing second-order smoothness conditions from standard bandit optimization literature. We characterize conditions under which deception strictly shifts the steady state and its effect on the deceiver's cost, illustrating the results in a resource-allocation game.
- Abstract(参考訳): ランダム化探索は、盗賊学習、マルチエージェント強化学習、ゼロオーダーポリシーサーチの中心であるが、その独立性とプライバシは通常、技術的な前提としてのみ扱われる。
我々は,これらの特性がセキュリティ上重要なものであることを示し,敵エージェントが他エージェントの探索において特権情報を利用する方法を示す。
最小2人プレイヤの強いモノトーン設定において,デシバー・ビクティム対を解析し,被害者の探索にのみ相関した漏洩信号を得る。
この情報と独自の探索行動を組み合わせることで、学習力学を新たな定常状態(deceptive Nash equilibrium, DNE)に誘導する外部性を示す。
我々は, 最適収束率を維持しつつ, DNEの任意の小さな近傍に, 知覚的帯域学習(DBL)のダイナミクスが収束することを証明した。
興味深いことに、我々の分析は、標準的な帯域最適化文献から2階の滑らかさ条件を緩和しながら、これらの最適な速度を得る。
本研究では, 資源配分ゲームの結果を具体化して, ゆるやかな状態が厳密に変化し, 決定コストに影響を及ぼす条件を特徴付ける。
関連論文リスト
- Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning [2.3096751699592137]
本稿では,複数のエージェントが共通のマルコフ決定プロセスと対話し,中央サーバを介してコミュニケーションを行うフェデレーション強化学習について検討する。
我々のゴールは、少数のエージェントが反対に振る舞うときに、協調のサンプル効率の利点を維持できるかどうかを理解し、任意に破損した情報を伝達することである。
本稿では,エージェントにおけるベルマン最適性演算子の分散推定と,サーバにおける頑健な集約を組み合わせた,エポックベースのフェデレート学習アルゴリズムであるRobust Async-Fed-Qを紹介する。
論文 参考訳(メタデータ) (2026-10-02T20:54:53Z) - Low Variance Trust Region Optimization with Independent Actors and Sequential Updates in Cooperative Multi-agent Reinforcement Learning [5.8010446129208155]
逐次更新における有利な変動の上限を制御するためのクリッピング目的を導入する。
クリッピング目的を用いた2つの新しい実用的なアルゴリズムを導出する。
提案手法は,安定収束特性と所望の低利得分散推定の両方で強調される。
論文 参考訳(メタデータ) (2026-06-24T08:05:11Z) - Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions [89.52532304099522]
フェデレートラーニング(FL)は、クライアントが生データを集中せずに共有モデルを共同でトレーニングすることを可能にし、固有のプライバシーレベルを提供する。
グラデーションとモデル更新は機密情報を漏洩する可能性があるが、悪意のあるサーバはビザンティン操作のような敵攻撃をマウントする可能性がある。
これらの脆弱性は、統合されたフレームワーク内の差分プライバシー(DP)とビザンチンの堅牢性に対処する必要性を強調している。
Byz-Clip21-SGD2Mを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:39:09Z) - Aligning AI Agents via Information-Directed Sampling [20.617552198581024]
バンドアライメントの問題は、環境と人間と相互作用することで、長期にわたる期待される報酬を最大化することである。
本研究では,これらのトレードオフを,Beta-Bernoulli banditに類似した玩具帯状アライメント問題において理論的,実証的に検討する。
我々は、現在の慣行を反映した単純な探索アルゴリズムと、トンプソンサンプリングのような有望なアルゴリズムの両方が、この問題に対する許容できる解決策を提供していないことを実証する。
論文 参考訳(メタデータ) (2024-10-18T18:23:41Z) - Bandit Social Learning: Exploration under Myopic Behavior [54.767961587919075]
オンラインプラットフォーム上でのレビューによって動機付けられた社会学習のダイナミクスについて検討する。
エージェントはまとめて単純なマルチアームのバンディットプロトコルに従うが、各エージェントは探索を伴わずにミオプティカルに振る舞う。
このような振る舞いに対して,スターク学習の失敗を導出し,好意的な結果を提供する。
論文 参考訳(メタデータ) (2023-02-15T01:57:57Z) - Policy Smoothing for Provably Robust Reinforcement Learning [109.90239627115336]
入力のノルム有界対向摂動に対する強化学習の証明可能な堅牢性について検討する。
我々は、スムーズなポリシーによって得られる全報酬が、入力の摂動のノルムバウンドな逆数の下で一定の閾値以下に収まらないことを保証した証明書を生成する。
論文 参考訳(メタデータ) (2021-06-21T21:42:08Z) - Latent Bandits Revisited [55.88616813182679]
潜伏盗賊問題は、学習エージェントが未知の離散潜伏状態に条件付けられた腕の報酬分布を知知する問題である。
本稿では, 上位信頼境界(UCB)とトンプソンサンプリング(Thompson sample)の両方に基づいて, この設定のための一般的なアルゴリズムを提案する。
我々はアルゴリズムの統一的な理論的解析を行い、遅延状態の数がアクションよりも小さい場合、古典的なバンディットポリシーよりも後悔度が低い。
論文 参考訳(メタデータ) (2020-06-15T19:24:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。