論文の概要: Scalable Cross-Facility Federated Learning for Scientific Foundation Models on Multiple Supercomputers
- arxiv url: http://arxiv.org/abs/2603.19544v1
- Date: Fri, 20 Mar 2026 00:57:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.928552
- Title: Scalable Cross-Facility Federated Learning for Scientific Foundation Models on Multiple Supercomputers
- Title(参考訳): 複数のスーパーコンピュータ上での科学基礎モデルのためのスケーラブルなクロスファシリティフェデレーション学習
- Authors: Yijiang Li, Zilinghan Li, Kyle Chard, Ian Foster, Todd Munson, Ravi Madduri, Kibaek Kim,
- Abstract要約: 異種HPC環境のためのクロスファクティリティー・フェデレーション・ラーニング・フレームワークを提案する。
我々は、米国エネルギー省(DOE)のリーダーシップ階級のスーパーコンピュータ4台にまたがって評価を行った。
化学命令データセット上で,大規模言語モデルを微調整することにより,科学的適用性を検証する。
- 参考スコア(独自算出の注目度): 10.377831886929803
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Artificial Intelligence for scientific applications increasingly requires training large models on data that cannot be centralized due to privacy constraints, data sovereignty, or the sheer volume of data generated. Federated learning (FL) addresses this by enabling collaborative training without centralizing raw data, but scientific applications demand model scales that requires extensive computing resources, typically offered at High Performance Computing (HPC) facilities. Deploying FL experiments across HPC facilities introduces challenges beyond cloud or enterprise settings. We present a comprehensive cross-facility FL framework for heterogeneous HPC environments, built on Advanced Privacy-Preserving Federated Learning (APPFL) framework with Globus Compute and Transfer orchestration, and evaluate it across four U.S. Department of Energy (DOE) leadership-class supercomputers. We demonstrate that FL experiments across HPC facilities are practically achievable, characterize key sources of heterogeneity impacting the training performance, and show that algorithmic choices matter significantly under realistic HPC scheduling conditions. We validate the scientific applicability by fine-tuning a large language model on a chemistry instruction dataset, and identify scheduler-aware algorithm design as a critical open challenge for future deployments.
- Abstract(参考訳): 科学応用のための人工知能は、プライバシーの制約やデータの主権、あるいは生成される大量のデータのために集中できないデータに対して、大規模なモデルをトレーニングする必要がある。
フェデレーテッド・ラーニング(FL)は、生データを集中化せずに協調的なトレーニングを可能にすることでこの問題に対処するが、科学応用では、一般的にハイパフォーマンス・コンピューティング(HPC)の施設で提供される、広範なコンピューティングリソースを必要とするモデルスケールを必要とする。
HPCファシリティにFL実験をデプロイすることは、クラウドやエンタープライズ設定を超えた課題をもたらす。
本稿では,Globus Compute and Transferによる高度なプライバシー保護フェデレート学習(APPFL)フレームワーク上に構築された異種HPC環境のための総合的クロスファシリティFLフレームワークについて述べる。
我々は,HPC施設間のFL実験が現実的に達成可能であることを実証し,訓練性能に影響を及ぼす不均一性の鍵となる要因を特徴付けるとともに,現実的なHPCスケジューリング条件下でのアルゴリズム選択が著しく重要であることを示す。
化学命令データセット上で大きな言語モデルを微調整し,スケジューラを意識したアルゴリズム設計を今後の展開における重要なオープンチャレンジとして同定することで,科学的適用性を検証する。
関連論文リスト
- QFed: Parameter-Compact Quantum-Classical Federated Learning [7.031234391152914]
エッジデバイスネットワーク間の計算効率向上を目的とした,量子対応のフェデレーション学習フレームワークであるQFedを紹介する。
実験結果から,スケーラブルな環境での古典的アプローチに匹敵する精度を維持しつつ,VGG様モデルのパラメータカウントを77.6%削減できることがわかった。
論文 参考訳(メタデータ) (2026-01-14T19:16:20Z) - Federated Learning Framework for Scalable AI in Heterogeneous HPC and Cloud Environments [0.1805840413757548]
我々は、HPCとクラウドの混在する環境を効率的に動かすために構築された連合学習フレームワークを提案する。
本システムは,モデル精度とデータプライバシを維持しつつ,システムヘット・エロジニティ,通信オーバーヘッド,リソーススケジューリングといった重要な課題に対処する。
論文 参考訳(メタデータ) (2025-11-22T18:39:25Z) - Physics-Learning AI Datamodel (PLAID) datasets: a collection of physics simulations for machine learning [0.15469999759898032]
PLAIDは物理シミュレーションのデータセットを表現および共有するためのフレームワークである。
PLAIDはシミュレーションデータを記述するための統一標準を定義する。
PLAID標準の下で,構造力学と計算流体力学を網羅した6つのデータセットをリリースする。
論文 参考訳(メタデータ) (2025-05-05T18:59:17Z) - Enabling High Data Throughput Reinforcement Learning on GPUs: A Domain Agnostic Framework for Data-Driven Scientific Research [90.91438597133211]
我々は、強化学習の適用において重要なシステムのボトルネックを克服するために設計されたフレームワークであるWarpSciを紹介する。
我々は、CPUとGPU間のデータ転送の必要性を排除し、数千のシミュレーションを同時実行可能にする。
論文 参考訳(メタデータ) (2024-08-01T21:38:09Z) - Federated Fine-Tuning of LLMs on the Very Edge: The Good, the Bad, the Ugly [62.473245910234304]
本稿では,最新のエッジコンピューティングシステムにおいて,Large Language Modelsをどのように導入できるかを,ハードウェア中心のアプローチで検討する。
マイクロレベルのハードウェアベンチマークを行い、FLOPモデルと最先端のデータセンターGPUを比較し、現実的な条件下でのネットワーク利用について検討する。
論文 参考訳(メタデータ) (2023-10-04T20:27:20Z) - Semi-Federated Learning: Convergence Analysis and Optimization of A
Hybrid Learning Framework [70.83511997272457]
本稿では,ベースステーション(BS)とデバイスの両方を活用するセミフェデレーション学習(SemiFL)パラダイムを提案し,中央集権学習(CL)とFLのハイブリッド実装を提案する。
我々はこの難解な問題を解くための2段階のアルゴリズムを提案し、ビームフォーマに閉形式解を提供する。
論文 参考訳(メタデータ) (2023-10-04T03:32:39Z) - Analysis and Optimization of Wireless Federated Learning with Data
Heterogeneity [72.85248553787538]
本稿では、データの不均一性を考慮した無線FLの性能解析と最適化と、無線リソース割り当てについて述べる。
ロス関数の最小化問題を、長期エネルギー消費と遅延の制約の下で定式化し、クライアントスケジューリング、リソース割り当て、ローカルトレーニングエポック数(CRE)を共同で最適化する。
実世界のデータセットの実験により、提案アルゴリズムは学習精度とエネルギー消費の点で他のベンチマークよりも優れていることが示された。
論文 参考訳(メタデータ) (2023-08-04T04:18:01Z) - SOLIS -- The MLOps journey from data acquisition to actionable insights [62.997667081978825]
本稿では,基本的なクロスプラットフォームテンソルフレームワークとスクリプト言語エンジンを使用しながら,すべての要件をサポートする統合デプロイメントパイプラインとフリー・ツー・オペレートアプローチを提案する。
しかし、このアプローチは、実際のプロダクショングレードシステムに機械学習機能を実際にデプロイするために必要な手順やパイプラインを提供していない。
論文 参考訳(メタデータ) (2021-12-22T14:45:37Z) - Federated Ensemble Model-based Reinforcement Learning in Edge Computing [21.840086997141498]
フェデレートラーニング(Federated Learning、FL)は、プライバシ保護のための分散機械学習パラダイムである。
モデルベースRLとアンサンブル知識蒸留をFLに効果的に組み込む新しいFRLアルゴリズムを提案する。
具体的には、FLと知識蒸留を利用して、クライアント向けの動的モデルのアンサンブルを作成し、環境と相互作用することなく、単にアンサンブルモデルを使用することでポリシーを訓練する。
論文 参考訳(メタデータ) (2021-09-12T16:19:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。