論文の概要: Adaptive Data Admission and Retention for Streaming Federated Learning
- arxiv url: http://arxiv.org/abs/2607.23987v1
- Date: Mon, 27 Jul 2026 04:31:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.308346
- Title: Adaptive Data Admission and Retention for Streaming Federated Learning
- Title(参考訳): フェデレーション学習のストリーミングにおける適応的データ受入と保持
- Abstract要約: 本稿では,クライアントメモリに制限のあるストリーミングフェデレーション学習について検討する。
我々は,累積余剰人口リスクを最小限に抑えるため,サーバ側の受け入れとクライアント側のメモリ管理の枠組みを共同で検討する。
- 参考スコア(独自算出の注目度): 13.683303503020383
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study streaming federated learning with limited client memory, where newly generated training data incur time-varying sampling costs and must be selectively admitted and retained over time. We consider a joint server-side admission and client-side memory-management framework with the objective of minimizing the cumulative excess population risk under a sampling-cost budget and buffer constraints. We first derive a learning-error bound that explicitly captures the effects of instantaneous training sample size, distinct-sample growth, and reuse imbalance through a characterization of the effective sample size. Through a surrogate penalty obtained from this bound, we develop an Active-Constraint Drift-Plus-Penalty (ACDPP) policy that combines a structured client-side $K$-step retention rule with a server-side online admission rule and a time-varying rectangular admission region. We further present a sequence of comparison arguments, via an auxiliary constant-admission policy, that connects the ACDPP learning bound to a costless oracle benchmark. This yields explicit guarantees in terms of sublinear regret and sampling-cost violation, while the buffer-occupancy violation is controlled through offline selection of the retention horizon. Experiments on multiple datasets demonstrate that the proposed policy remains close to the oracle benchmark while satisfying the sampling-cost and buffer constraints.
- Abstract(参考訳): クライアントメモリに制限のあるストリーミングフェデレーション学習について検討し、新たに生成されたトレーニングデータに時間変動のサンプリングコストがかかり、時間とともに選択的に承認され、保持されなければならないことを示す。
我々は,サンプリングコストとバッファ制約の下での累積余剰人口リスクを最小限に抑えるため,サーバ側の入室とクライアント側のメモリ管理を共同で行う枠組みを検討する。
まず, 即時トレーニングサンプルサイズ, 個別サンプル成長, 再利用不均衡の影響を, 有効サンプルサイズを特徴付けることによって明確に把握する学習エラー境界を導出する。
この境界から得られる代理的ペナルティを通じて、構造化クライアント側$K$-step保持規則とサーバ側オンライン入場規則と時間変化長方形入場規則を組み合わせたアクティブ制約ドリフト・プルス・ペナルティ(ACDPP)ポリシーを開発する。
さらに、ACDPP学習をコストのかかるオラクルのベンチマークに結び付ける補助的定値化ポリシを介して、比較引数のシーケンスを提示する。
これにより、サブ線形後悔とサンプリングコスト違反の点で明確な保証が得られ、バッファ占有違反は保持地平線のオフライン選択によって制御される。
複数のデータセットの実験では、提案されたポリシーがサンプリングコストとバッファ制約を満たしながら、オラクルベンチマークに近く残っていることが示されている。
関連論文リスト
- Federated Continual Learning as a Distributed Drift-Plus-Penalty Control Problem [12.498691027665332]
FCL(Federated Continual Learning)は、現実世界の分散学習システムの基本である。
FCLは、破滅的な忘れとクライアントのドリフトを緩和しながら、クライアント間のシーケンシャルで非IIDデータに適応するモデルを必要とします。
我々は,Lynov drift-plus-penalty (DPP)最適化に基づくフレームワークであるFederated Queue-regulated Continual Learning (FedQCL)を提案する。
論文 参考訳(メタデータ) (2026-08-21T18:21:19Z) - PAC-Bayesian Certificates for Quadratic Closed-Loop Control [0.0]
PAC-ベイズ境界は、データ依存予測器に対する有限サンプル保証を提供する。
学習に基づく制御にそれらを適用することは、自然な目的が二次的な軌道コストであるため困難である。
PAC-Bayes-Chernoff 証明書の集合を,実現可能な閉ループ応答に対する後部分布として提供する。
論文 参考訳(メタデータ) (2026-06-26T17:24:21Z) - PAC-Bayesian Reward-Certified Outcome Weighted Learning [0.0]
結果重み付け学習(OWL)による最適個別化処理規則(ITR)の推定は、しばしば真に潜伏したユーティリティに対してうるさいあるいは楽観的なプロキシである観察された報酬に依存する。
PAC-Bayesian Reward-Certified Outcome Weighted Learning (PROWL)を提案する。
一方的な不確実性証明が与えられた場合、PROWLは真の期待値に基づいて、保守的な報酬と厳密なポリシーに依存した下限を構築する。
論文 参考訳(メタデータ) (2026-04-02T12:08:56Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Coverage Improvement and Fast Convergence of On-policy Preference Learning [67.36750525893514]
言語モデルアライメントのためのオンラインのオンラインプライオリティ学習アルゴリズムは、オフラインのアルゴリズムよりも大幅に優れている。
我々は,サンプリング政策の包括的範囲が政治訓練を通じてどのように進展するかを分析する。
一般機能クラス設定における報奨蒸留のための原則的オンライン方式を開発した。
論文 参考訳(メタデータ) (2026-01-13T10:46:06Z) - Adaptive Sample Sharing for Linear Regression [1.8898307337832196]
隆起回帰における試料共有について検討した。
我々は、ターゲットのトレーニングセットに追加する補助データセットのサンプル数を決定する、原則付きデータ駆動ルールを導入する。
合成および実データセットのアプローチを検証し、強いベースラインと単一タスクのトレーニングよりも一貫した利得を観察する。
論文 参考訳(メタデータ) (2025-10-19T20:03:48Z) - Early Stopping in Contextual Bandits and Inferences [0.5439020425819]
過剰なサンプリングはコストがかかり、早期停止法と信頼性のある実験後の推論の破壊を動機付ける。
本稿では, サンプリングコストを考慮しつつ, 実験中の後悔を最小限に抑えるために, 事前決定およびオンライン停止ルールを含む, 線形文脈帯域の早期停止法について検討する。
論文 参考訳(メタデータ) (2025-02-05T00:40:10Z) - Reshaping the Online Data Buffering and Organizing Mechanism for Continual Test-Time Adaptation [49.53202761595912]
継続的なテスト時間適応は、訓練済みのソースモデルを適用して、教師なしのターゲットドメインを継続的に変更する。
我々は、オンライン環境、教師なしの自然、エラー蓄積や破滅的な忘れのリスクなど、このタスクの課題を分析する。
教師なしシングルパスデータストリームから重要サンプルを高い確実性で識別・集約する不確実性を考慮したバッファリング手法を提案する。
論文 参考訳(メタデータ) (2024-07-12T15:48:40Z) - COptiDICE: Offline Constrained Reinforcement Learning via Stationary
Distribution Correction Estimation [73.17078343706909]
オフラインの制約付き強化学習(RL)問題。エージェントは、所定のコスト制約を満たしながら期待されるリターンを最大化するポリシーを計算し、事前に収集されたデータセットからのみ学習する。
定常分布空間におけるポリシーを最適化するオフライン制約付きRLアルゴリズムを提案する。
我々のアルゴリズムであるCOptiDICEは、コスト上限を制約しながら、利益に対する最適政策の定常分布補正を直接見積もる。
論文 参考訳(メタデータ) (2022-04-19T15:55:47Z) - BRAC+: Improved Behavior Regularized Actor Critic for Offline
Reinforcement Learning [14.432131909590824]
オフライン強化学習は、以前に収集したデータセットを使用して効果的なポリシーをトレーニングすることを目的としている。
標準的なオフ・ポリティクスRLアルゴリズムは、アウト・オブ・ディストリビューション(探索されていない)アクションの値を過大評価する傾向がある。
動作の規則化によるオフライン強化学習を改善し,BRAC+を提案する。
論文 参考訳(メタデータ) (2021-10-02T23:55:49Z) - Shortest-Path Constrained Reinforcement Learning for Sparse Reward Tasks [59.419152768018506]
最適ポリシーは必ずk-SP制約を満たすことを示す。
本研究では,SP制約に違反するポリシーを完全に排除する代わりに,新たなコスト関数を提案する。
また,MiniGrid,DeepMind Lab,Atari,Fetchを用いた実験の結果,提案手法はPPOを著しく改善することが示された。
論文 参考訳(メタデータ) (2021-07-13T21:39:21Z) - Sparse Feature Selection Makes Batch Reinforcement Learning More Sample
Efficient [62.24615324523435]
本稿では,スパース線形関数近似を用いた高次元バッチ強化学習(RL)の統計的解析を行う。
候補となる機能が多数存在する場合,提案手法がバッチRLをより効率的にサンプリングできるという事実に光を当てる。
論文 参考訳(メタデータ) (2020-11-08T16:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。