論文の概要: Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning
- arxiv url: http://arxiv.org/abs/2610.06918v1
- Date: Fri, 02 Oct 2026 20:54:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.465284
- Title: Learning from Unreliable Trajectories: Adversarially-Robust Federated Q-Learning
- Title(参考訳): 信頼できない軌道からの学習--逆向きにローバストされたQ-ラーニング
- Abstract要約: 本稿では,複数のエージェントが共通のマルコフ決定プロセスと対話し,中央サーバを介してコミュニケーションを行うフェデレーション強化学習について検討する。
我々のゴールは、少数のエージェントが反対に振る舞うときに、協調のサンプル効率の利点を維持できるかどうかを理解し、任意に破損した情報を伝達することである。
本稿では,エージェントにおけるベルマン最適性演算子の分散推定と,サーバにおける頑健な集約を組み合わせた,エポックベースのフェデレート学習アルゴリズムであるRobust Async-Fed-Qを紹介する。
- 参考スコア(独自算出の注目度): 2.3096751699592137
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study federated reinforcement learning in which multiple agents interact with a common Markov decision process and communicate through a central server to collaboratively learn the optimal state-action value function. Our goal is to understand whether the sample-efficiency benefits of collaboration can be retained when a fraction of the agents behave adversarially and transmit arbitrarily corrupted information. To address this problem, we introduce Robust Async-Fed-Q, an epoch-based federated learning algorithm that combines variance-reduced estimation of the Bellman optimality operator at the agents with robust aggregation at the server. We establish high-probability finite-time guarantees showing that the proposed method preserves the statistical gains of collaboration among the honest agents while tolerating adversarial corruption. In particular, the effect of the adversarial agents decreases as the amount of data collected by each honest agent grows and eventually vanishes in the infinite-sample limit. We complement these guarantees with information-theoretic lower bounds that characterize the unavoidable statistical cost of adversarial corruption, leading to the first nearly matching upper and lower bounds for adversarially robust federated reinforcement learning. We further extend our framework to accommodate single-trajectory Markovian sampling and heterogeneous partial coverage, where different agents may explore different regions of the state-action space and learning relies on their collective coverage. Finally, our epoch-based design substantially improves the best known communication complexity for federated Q-learning under asynchronous sampling.
- Abstract(参考訳): 我々は、複数のエージェントが共通のマルコフ決定プロセスと相互作用し、中央サーバを介してコミュニケーションし、最適な状態-作用値関数を協調的に学習するフェデレーション強化学習について研究する。
我々のゴールは、少数のエージェントが反対に振る舞うときに、協調のサンプル効率の利点を維持できるかどうかを理解し、任意に破損した情報を伝達することである。
この問題に対処するために,エージェントにおけるベルマン最適性演算子の分散推定と,サーバにおける頑健な集約を組み合わせたエポックベースのフェデレーション学習アルゴリズムであるRobust Async-Fed-Qを導入する。
提案手法は, 敵の汚職を許容しつつ, 正直なエージェント間の協調の統計的利得を保っていることを示す, 高確率有限時間保証を確立する。
特に、真正なエージェントによって収集されるデータの量が増加し、最終的には無限サンプル限界で消滅するにつれて、敵エージェントの効果は減少する。
我々はこれらの保証を、敵の汚職の避けられない統計的コストを特徴付ける情報理論の下限と補完し、敵の頑健な連邦強化学習において、最初のほぼ一致する上限と下限を導いた。
さらに我々は,各エージェントが状態-行動空間の異なる領域を探索し,学習が包括的カバレッジに依存するような,単軌道マルコフサンプリングと異種部分カバレッジに対応するために,我々のフレームワークをさらに拡張する。
最後に,我々のエポック設計は,非同期サンプリング下でのフェデレーションQ-ラーニングにおいて,最もよく知られた通信の複雑さを大幅に改善する。
関連論文リスト
- Robust Federated Q-Learning with Almost No Communication [2.3096751699592137]
我々は、共通のマルコフ決定プロセス(MDP)と相互作用するM$エージェントを含む連合強化学習環境を考える。
本稿では,モデルベースとモデルフリーのRLの両方からアイデアをブレンドする,フェデレートされたQ-ラーニングアルゴリズムであるRobust Fed-Qを提案する。
高確率の汚職にもかかわらず、Robust Fed-Q (i) は無限サンプルの極限における最適値関数への正確な収束を保証する。
論文 参考訳(メタデータ) (2026-08-24T21:59:48Z) - The Sum Leaks More Than Its Parts: Compositional Privacy Risks and Mitigations in Multi-Agent Collaboration [72.33801123508145]
大規模言語モデル(LLM)はマルチエージェントシステムに不可欠なものである。
プライバシーリスクは、暗記、直接推論、シングルターン評価を超えて現れる。
特に、相互作用によって構成される一見無害な反応は、敵が機密情報の回復を累積的に行うことができる。
論文 参考訳(メタデータ) (2025-09-16T16:57:25Z) - Corruption-Tolerant Asynchronous Q-Learning with Near-Optimal Rates [2.3096751699592137]
そこで本研究では,Q-ラーニングアルゴリズムの頑健な新しい変種を提案する。
我々のコントリビューションは、非同期Q-ラーニングのための最初の有限時間ロバスト性保証を提供し、ロバストなRLにおいて大きなギャップを埋めています。
論文 参考訳(メタデータ) (2025-09-10T18:56:39Z) - Collaborative Value Function Estimation Under Model Mismatch: A Federated Temporal Difference Analysis [55.13545823385091]
フェデレーション強化学習(FedRL)は、エージェント間のデータ交換を防止し、データのプライバシを維持しながら協調学習を可能にする。
現実世界のアプリケーションでは、各エージェントは若干異なる遷移ダイナミクスを経験し、固有のモデルミスマッチを引き起こす。
情報共有の適度なレベルでさえ、環境固有のエラーを著しく軽減することを示す。
論文 参考訳(メタデータ) (2025-03-21T18:06:28Z) - FedVCK: Non-IID Robust and Communication-Efficient Federated Learning via Valuable Condensed Knowledge for Medical Image Analysis [27.843757290938925]
textbfValuable textbfCondensed textbfKnowledge (FedVCK)による新しいフェデレーション学習法を提案する。
我々は、限られた通信予算の中で、非IID問題に効果的に取り組むために、凝縮知識の品質を高め、モデルによって導かれる最も必要な知識を選択する。
論文 参考訳(メタデータ) (2024-12-24T17:20:43Z) - VALID: a Validated Algorithm for Learning in Decentralized Networks with Possible Adversarial Presence [13.612214163974459]
不均一なデータを持つ非方向性ネットワークに対して、検証された分散学習のパラダイムを導入する。
VALIDプロトコルは、検証された学習保証を達成した最初のプロトコルである。
興味深いことに、VALIDは敵のない環境での最適なパフォーマンス指標を維持している。
論文 参考訳(メタデータ) (2024-05-12T15:55:43Z) - Pure Exploration in Asynchronous Federated Bandits [57.02106627533004]
マルチアームバンディットとリニアバンディットのフェデレートされた純粋な探索問題について検討し、M$エージェントが中央サーバとの通信を通じて最適なアームを協調的に識別する方法について検討した。
信頼度を固定した純粋探索のための非同期マルチアームバンディットおよび線形バンディットアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-17T06:04:00Z) - Combating Exacerbated Heterogeneity for Robust Models in Federated
Learning [91.88122934924435]
対人訓練と連合学習の組み合わせは、望ましくない頑丈さの劣化につながる可能性がある。
我々は、Slack Federated Adversarial Training (SFAT)と呼ばれる新しいフレームワークを提案する。
各種ベンチマークおよび実世界のデータセットに対するSFATの合理性と有効性を検証する。
論文 参考訳(メタデータ) (2023-03-01T06:16:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。