論文の概要: Scalar Federated Learning for Linear Quadratic Regulator
- arxiv url: http://arxiv.org/abs/2604.05088v1
- Date: Mon, 06 Apr 2026 18:42:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.444605
- Title: Scalar Federated Learning for Linear Quadratic Regulator
- Title(参考訳): 線形二次レギュレータにおけるスカラーフェデレーション学習
- Authors: Mohammadreza Rostami, Shahriar Talebi, Solmaz S. Kia,
- Abstract要約: 共通ポリシーのモデルフリー学習のための通信効率の高いフェデレーションアルゴリズムであるScalarFedLQRを提案する。
この手法は、各エージェントが局所ゼロ階勾配推定のスカラープロジェクションのみを伝達する分解された勾配メカニズムに基づいて構築される。
- 参考スコア(独自算出の注目度): 2.2940141855172036
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We propose ScalarFedLQR, a communication-efficient federated algorithm for model-free learning of a common policy in linear quadratic regulator (LQR) control of heterogeneous agents. The method builds on a decomposed projected gradient mechanism, in which each agent communicates only a scalar projection of a local zeroth-order gradient estimate. The server aggregates these scalar messages to reconstruct a global descent direction, reducing per-agent uplink communication from O(d) to O(1), independent of the policy dimension. Crucially, the projection-induced approximation error diminishes as the number of participating agents increases, yielding a favorable scaling law: larger fleets enable more accurate gradient recovery, admit larger stepsizes, and achieve faster linear convergence despite high dimensionality. Under standard regularity conditions, all iterates remain stabilizing and the average LQR cost decreases linearly fast. Numerical results demonstrate performance comparable to full-gradient federated LQR with substantially reduced communication.
- Abstract(参考訳): 異種エージェントの線形二次規制(LQR)制御における共通ポリシーのモデルなし学習のための通信効率の高いフェデレーションアルゴリズムであるScalarFedLQRを提案する。
この手法は、各エージェントが局所ゼロ階勾配推定のスカラープロジェクションのみを伝達する分解された勾配メカニズムに基づいて構築される。
サーバはこれらのスカラーメッセージを集約してグローバルな降下方向を再構築し、ポリシー次元に依存しないO(d)からO(1)へのエージェントごとのアップリンク通信を減らす。
重要なことに、プロジェクション誘起近似誤差は、参加エージェントの数が増加するにつれて減少し、好ましいスケーリング法則が得られる: より大きな艦隊はより正確な勾配回復を可能にし、より大きなステップサイズを許容し、高次元性にもかかわらずより高速な線形収束を達成する。
標準正則条件下では、全ての繰り返しは安定し続け、平均的なLQRコストは線形的に減少する。
数値計算の結果, 通信性能が大幅に低下した完全段階のフェデレーションLQRに匹敵する性能を示した。
関連論文リスト
- A Muon-Accelerated Algorithm for Low Separation Rank Tensor Generalized Linear Models [9.341971485553428]
低分離ランク(LSR)分解は、低ランク多線形係数テンソルテンソルを付与することにより、モデルの複雑さを低減する。
LSRベースのテンソルGLM (LSR-TGLMs) を推定するための代表的なアプローチは、ブロック座標の降下を導入し、繰り返しQRベースの投影によって因子の直感性を強制する低分離ランク回帰 (LSRTR) アルゴリズムである。
本稿では,LSRTR フレームワークに Muon の更新を組み込んだ LSRTR-M を提案する。
論文 参考訳(メタデータ) (2026-04-06T14:47:46Z) - λ-GELU: Learning Gating Hardness for Controlled ReLU-ization in Deep Networks [1.1145952934885128]
Gaussian Error Linear Unit (GELU) はRectifier Linear Unit (ReLU) のスムーズな代替品として広く使われている。
-GELUは、ゲーティングの硬さをプロファイルし制御するための最小限の解釈可能なノブを提供する。
全体として、 -GELUは、ゲーティングの硬さをプロファイルし制御するための最小限の、解釈可能なノブを提供し、ReLU中心の下流パイプラインによるスムーズなトレーニングをブリッジする。
論文 参考訳(メタデータ) (2026-03-23T13:58:19Z) - FLRQ: Faster LLM Quantization with Flexible Low-Rank Matrix Sketching [4.01326804806241]
Rank1-Sketch-based Flexible Rank Selection (R1-FLR) と Best Low-rank Approximation under Clipping (BLC) を導入する。
R1-FLRは高速な低ランク近似のためにガウス射影を持つR1-Sketchを適用し、各層に対して外向きのランク抽出を可能にする。
BLCは、スケーリングとクリッピング戦略の下での低ランク量子化誤差の最小化を目的としている。
論文 参考訳(メタデータ) (2026-01-09T10:06:45Z) - Efficient Penalty-Based Bilevel Methods: Improved Analysis, Novel Updates, and Flatness Condition [51.22672287601796]
ペナルティに基づく手法は、双レベル最適化(BLO)問題を解くのに人気がある。
それらはしばしば、大きなペナルティ項によって引き起こされる滑らかさの増加に対応するために、低レベル(LL)問題と小さな外ループステップサイズを解決するためにインナーループ反復を必要とする。
この研究は、結合制約(CC)を伴う一般的なBLO問題を考察し、上位変数と下位変数を分離する新しいペナルティ改革を活用する。
論文 参考訳(メタデータ) (2025-11-20T20:48:14Z) - FedLoDrop: Federated LoRA with Dropout for Generalized LLM Fine-tuning [65.26899091946417]
大規模言語モデル(LLM)は、特定のタスクに汎用モデルを適用するために不可欠である。
本稿では,FedLoDropを用いたFederated LoRAを提案する。FedLoDropは,Federated LoRAのトレーニング可能な行列の行と列にドロップアウトを適用する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-14T02:40:45Z) - Reconciling Hessian-Informed Acceleration and Scalar-Only Communication for Efficient Federated Zeroth-Order Fine-Tuning [15.73877955614998]
HiSo は Hessian-informed zeroth-order Optimization と Scalar-only communication による高速なファインチューニング手法である。
HiSoはコンバージェンス速度と通信効率の両方で既存のZO法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-06-03T02:13:31Z) - Fed-ZOE: Communication-Efficient Over-the-Air Federated Learning via Zeroth-Order Estimation [15.026407830543086]
Fed-ZOEは、ゼロ階最適化(ZOO)で一般的に使用されるランダム化勾配推定器(RGE)にインスパイアされた効率的なフレームワークである。
Fed-ZOEは、通信コストを大幅に削減しながら、Fed-OtAに匹敵するパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-21T21:24:58Z) - Stable Nonconvex-Nonconcave Training via Linear Interpolation [51.668052890249726]
本稿では,ニューラルネットワークトレーニングを安定化(大規模)するための原理的手法として,線形アヘッドの理論解析を提案する。
最適化過程の不安定性は、しばしば損失ランドスケープの非単調性によって引き起こされるものであり、非拡張作用素の理論を活用することによって線型性がいかに役立つかを示す。
論文 参考訳(メタデータ) (2023-10-20T12:45:12Z) - Provably Accelerating Ill-Conditioned Low-rank Estimation via Scaled
Gradient Descent, Even with Overparameterization [48.65416821017865]
この章では、スケールドグラデーション(ScaledGD)と呼ばれる新しいアルゴリズムアプローチを紹介します。
低ランク物体の条件数に依存しない定数速度で直線的に収束する。
様々なタスクに対して、勾配降下の低い摂動コストを維持できる。
論文 参考訳(メタデータ) (2023-10-09T21:16:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。