論文の概要: Efficient Federated RLHF via Zeroth-Order Policy Optimization
- arxiv url: http://arxiv.org/abs/2604.17747v1
- Date: Mon, 20 Apr 2026 03:04:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.670263
- Title: Efficient Federated RLHF via Zeroth-Order Policy Optimization
- Title(参考訳): ゼロ次最適化による効率的なフェデレーションRLHF
- Authors: Deyi Wang, Qining Zhang, Lei Ying,
- Abstract要約: Par-S$2$ZPO) と呼ばれる効率的な連合RLHFアルゴリズムを提案する。
我々の理論解析は、Par-S$2$ZPOの収束率の上限を定め、サンプルの複雑さの点では集中的な値と同等に効率的であるが、ポリシー更新の繰り返しの点ではより高速に収束することを示した。
実験の結果,MuJoCo RLの4つのタスクにおいて,FedAvgベースのRLHFよりも優れていた。
- 参考スコア(独自算出の注目度): 13.20526811256771
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper considers reinforcement learning from human feedback in a federated learning setting with resource-constrained agents, such as edge devices. We propose an efficient federated RLHF algorithm, named Partitioned, Sign-based Stochastic Zeroth-order Policy Optimization (Par-S$^2$ZPO). The algorithm is built on zeroth-order optimization with binary perturbation, resulting in low communication, computation, and memory complexity by design. Our theoretical analysis establishes an upper bound on the convergence rate of Par-S$^2$ZPO, revealing that it is as efficient as its centralized counterpart in terms of sample complexity but converges faster in terms of policy update iterations. Our experimental results show that it outperforms a FedAvg-based RLHF on four MuJoCo RL tasks.
- Abstract(参考訳): 本稿では,エッジデバイスなどの資源制約のあるエージェントを用いた連合学習環境において,人間のフィードバックからの強化学習について考察する。
本稿では,Par-S$^2$ZPO (Stochastic Zeroth-order Policy Optimization) と呼ばれる,効率的な連合RLHFアルゴリズムを提案する。
このアルゴリズムは、二分摂動によるゼロ階最適化に基づいて構築され、結果として、設計による通信、計算、メモリの複雑さが低くなる。
我々の理論解析は、Par-S$^2$ZPOの収束速度の上限を定め、サンプルの複雑さの点では集中的な値と同等に効率的であるが、ポリシー更新反復の点ではより高速に収束することを示した。
実験の結果,MuJoCo RLの4つのタスクにおいて,FedAvgベースのRLHFよりも優れていた。
関連論文リスト
- ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking [84.07076200941474]
ArenaRLは、ポイントワイドスカラースコアからグループ内相対ランクにシフトする強化学習パラダイムである。
我々は,グループ内対角アリーナを構築し,安定した有利な信号を得るためのトーナメントベースのランキングスキームを考案する。
実験により、ArenaRLは標準のRLベースラインを大幅に上回っていることが示された。
論文 参考訳(メタデータ) (2026-01-10T08:43:07Z) - Closing the Approximation Gap of Partial AUC Optimization: A Tale of Two Formulations [121.39938773554523]
ROC曲線の下の領域(AUC)は、クラス不均衡と決定制約の両方を持つ実世界のシナリオにおける重要な評価指標である。
PAUC最適化の近似ギャップを埋めるために,2つの簡単なインスタンス単位のミニマックス修正を提案する。
得られたアルゴリズムは、サンプルサイズと典型的な一方方向と双方向のPAUCに対して$O(-2/3)$の収束率の線形パーイテレーション計算複雑性を享受する。
論文 参考訳(メタデータ) (2025-12-01T02:52:33Z) - Federated Stochastic Minimax Optimization under Heavy-Tailed Noises [23.850171320924574]
局所的な更新のために有界勾配を統合した:-NSGDA と Mu-DA の2つのアルゴリズムを提案する。
両方のアルゴリズムは、より穏やかな条件下で、ミニマックスフェデレーションの重み付きノイズに効果的に対処するように設計されている。
我々の知る限りでは、これらは厳密な理論的保証が与えられた最初のミニマックス最適化アルゴリズムである。
論文 参考訳(メタデータ) (2025-11-06T15:27:29Z) - Stochastic Primal-Dual Double Block-Coordinate for Two-way Partial AUC Maximization [45.99743804547533]
2方向部分AUCAUCは、不均衡なデータを持つバイナリ分類における重要な性能指標である。
TPAUC最適化のための既存のアルゴリズムは未探索のままである。
TPAUC最適化のための2つの革新的な二重座標ブロック座標アルゴリズムを導入する。
論文 参考訳(メタデータ) (2025-05-28T03:55:05Z) - Asymmetrically Decentralized Federated Learning [22.21977974314497]
分散フェデレーションラーニング(DFL)が出現し、ピアツーピア(P2P)通信フレームワークでサーバを破棄する。
本稿では,非対称トポロジに基づくPush-Awareプロトコルを用いたDFedSGPSMアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-10-08T09:46:26Z) - Symmetric Replay Training: Enhancing Sample Efficiency in Deep Reinforcement Learning for Combinatorial Optimization [42.92248233465095]
本稿では,SRT (symmetric replay training) と呼ばれる簡易かつ効果的な手法を提案する。
提案手法は,オンラインインタラクションを伴わない対称領域の探索を促進するために,高解像度サンプルを活用する。
実世界のタスクに適用した多種多様なDRL法に対して,本手法を一貫したサンプル効率向上効果を示す実験結果を得た。
論文 参考訳(メタデータ) (2023-06-02T05:34:01Z) - Stochastic Unrolled Federated Learning [85.6993263983062]
本稿では,UnRolled Federated Learning (SURF)を導入する。
提案手法は,この拡張における2つの課題,すなわち,非学習者へのデータセット全体の供給の必要性と,フェデレート学習の分散的性質に対処する。
論文 参考訳(メタデータ) (2023-05-24T17:26:22Z) - Matching Pursuit Based Scheduling for Over-the-Air Federated Learning [67.59503935237676]
本稿では,フェデレートラーニング手法を用いて,オーバー・ザ・エアラーニングのための低複雑さデバイススケジューリングアルゴリズムのクラスを開発する。
最先端の提案方式と比較すると,提案方式は極めて低効率なシステムである。
提案手法の有効性は,CIFARデータセットを用いた実験により確認した。
論文 参考訳(メタデータ) (2022-06-14T08:14:14Z) - Communication-Efficient Stochastic Zeroth-Order Optimization for
Federated Learning [28.65635956111857]
フェデレートラーニング(FL)は、エッジデバイスがプライベートデータを共有せずに、グローバルモデルを協調的にトレーニングすることを可能にする。
FLの訓練効率を向上させるため,一階計算から一階法まで,様々なアルゴリズムが提案されている。
論文 参考訳(メタデータ) (2022-01-24T08:56:06Z) - Adaptive Stochastic ADMM for Decentralized Reinforcement Learning in
Edge Industrial IoT [106.83952081124195]
強化学習 (Reinforcement Learning, RL) は, 意思決定および最適制御プロセスのための有望な解法として広く研究されている。
本稿では,Adaptive ADMM (asI-ADMM)アルゴリズムを提案する。
実験の結果,提案アルゴリズムは通信コストやスケーラビリティの観点から技術状況よりも優れており,複雑なIoT環境に適応できることがわかった。
論文 参考訳(メタデータ) (2021-06-30T16:49:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。