論文の概要: Scalable Multi-GPU Simulation of 3D Multicellular Growth with RNN-Based Workload Balancing
- arxiv url: http://arxiv.org/abs/2608.25890v1
- Date: Wed, 26 Aug 2026 15:06:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.875176
- Title: Scalable Multi-GPU Simulation of 3D Multicellular Growth with RNN-Based Workload Balancing
- Title(参考訳): RNNに基づくワークロードバランシングによる3次元マルチセル成長のスケーラブルマルチGPUシミュレーション
- Abstract要約: 本研究では,3次元マルチセル成長シミュレーションのためのスケーラブルなマルチGPUフレームワークを提案する。
GPUアクセラレーション、空間的バイナリ化、ドメイン分解、ワークロード対応パーティショニングを組み合わせたものだ。
空間結合によるGPU加速はシリアルCPUベースライン上で約3桁の速度で相互作用を加速することを示す。
- 参考スコア(独自算出の注目度): 7.474685909400541
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Detailed multicellular growth simulations based on subcellular element models (SEMs) can capture complex tissue development, but their element-level interactions impose substantial computational cost. This work presents a scalable multi-GPU framework for 3D multicellular growth simulation that combines GPU acceleration, spatial binning, domain decomposition, and workload-aware partitioning. Cell movement, growth, and division continuously reshape the spatial workload distribution, causing initially balanced partitions to become inefficient over time. To address this, we introduce an RNN-based load-balancing controller that observes recent per-rank execution times and partition states and learns residual corrections to a reactive boundary-adjustment rule. The controller is trained offline in a differentiable surrogate of the load-balancing loop with randomized workload dynamics, requiring no measured execution traces for training. We evaluate the framework in terms of single-GPU acceleration, multi-GPU computation scaling, controller-level load-balancing behavior, and end-to-end simulation performance, with comparisons against static partitioning, reactive load balancing, and conventional time-series prediction baselines. A representative embryonic epidermal development use case further demonstrates the type of spatially and temporally evolving workload targeted by the framework. In our evaluation, GPU acceleration with spatial binning accelerates the interaction computation by roughly three orders of magnitude over a serial CPU baseline. RNN-guided load balancing reduces the mean global imbalance from 11.3% under static partitioning to 3.5%, lowers end-to-end runtime by 9.0% relative to static partitioning, and reduces slice migration by 7.7x compared with the reactive baseline, showing that history-aware control can improve workload balance while avoiding unnecessary repartitioning.
- Abstract(参考訳): 細胞内要素モデル(SEM)に基づく詳細な多細胞成長シミュレーションは複雑な組織の発生を捉えることができるが、それらの要素レベルの相互作用は計算コストを大幅に上回る。
本稿では,GPUアクセラレーション,空間的バイナリ化,ドメイン分解,ワークロード対応パーティショニングを組み合わせた3次元マルチセル成長シミュレーションのためのスケーラブルなマルチGPUフレームワークを提案する。
細胞の動き、成長、分裂は、空間的ワークロードの分布を継続的に再形成し、初期バランスの取れた分割は時間の経過とともに非効率になる。
この問題に対処するために、RNNベースの負荷分散コントローラを導入し、近年のランク毎の実行時間とパーティション状態を観察し、反応性境界調整規則に対する残差補正を学習する。
コントローラは、ランダムなワークロードダイナミクスを備えたロードバランシングループの差別化可能なサロゲートでオフラインでトレーニングされ、トレーニングのために測定された実行トレースを必要としない。
我々は,このフレームワークを,静的パーティショニング,リアクティブロードバランシング,従来の時系列予測ベースラインと比較し,シングルGPUアクセラレーション,マルチGPU計算スケーリング,コントローラレベルロードバランシング動作,エンドツーエンドシミュレーション性能の観点から評価した。
代表的胚性表皮発生用ユースケースは、さらに、このフレームワークがターゲットとする空間的および時間的に進化するワークロードの種類を示す。
評価では,空間結合によるGPU加速度は,シリアルCPUベースライン上で約3桁の相互作用計算を高速化する。
RNN誘導型ロードバランシングは、静的パーティショニング中の平均グローバル不均衡を11.3%から3.5%に下げ、静的パーティショニングと比較してエンドツーエンドランタイムを9.0%削減し、リアクティブベースラインと比較してスライスマイグレーションを7.7倍削減する。
関連論文リスト
- Comparative Study of Neural Surrogate Architectures for Autoregressive Prediction of Internal Battery States [1.37013665345905]
ドイル・フラー・ニューマンモデル(DFN)はリチウムイオン電池の内部電気化学状態を高忠実度で解決する。
その支配方程式の数値解は、リアルタイムな展開には計算的に禁じられている。
この研究は、4つのニューラルネットワークアーキテクチャ(MLP、ResNet、U-Net、FNO)を体系的に比較する。
その結果、U-Netのマルチスケール機能階層は、300ステップの自己回帰ロールアウトの後、すべての内部状態変数の平均3%の平均的な最終段階のnRMSEを達成することが示された。
論文 参考訳(メタデータ) (2026-06-18T10:27:36Z) - Complexity-Balanced Diffusion Splitting [20.558008394592097]
Complexity-Balanced Splitting (CBS)は、時間的キャパシティ割り当てのための原則的なフレームワークである。
CBSは拡散時間軸を等近似重みのセグメントに分割する。
CBSは、ステップごとの推論コストを増大させることなく、継続的に品質を向上する。
論文 参考訳(メタデータ) (2026-06-04T17:57:15Z) - Frontier: Towards Comprehensive and Accurate LLM Inference Simulation [15.58999342618182]
本稿では,現代のLLM推論サービスのための離散イベントシミュレータであるFrontierを紹介する。
これは、コロケーション、プリフィル・デコード・デアグリゲーション(PDD)、アテンション・FFN・デアグリゲーション(AFD)をモデル化することで、現代のサービスシステムの構造ダイナミクスを捉える。
16-H800 GPUテストベッドでは、Frontierは4%未満の平均エラーを達成した。最先端のシミュレータと比較すると、コロケーション時のエンドツーエンドのレイテンシエラーは44.9%から6.4%に減少し、デアグリゲーション時の52.6%に低下する。
論文 参考訳(メタデータ) (2026-05-20T15:40:18Z) - Adaptive Visual Autoregressive Acceleration via Dual-Linkage Entropy Analysis [50.48301331112126]
我々は,Visual AutoRegressive モデリングのためのトレーニング不要なトークン削減促進フレームワーク NOVA を提案する。
NOVAは、スケールエントロピー成長の屈折点をオンライン同定することにより、推論中のアクティベーションアクティベーションスケールを適応的に決定する。
実験と解析により、NOVAはシンプルで効果的なトレーニングフリー加速フレームワークとして評価される。
論文 参考訳(メタデータ) (2026-02-01T17:29:42Z) - Eliminating Multi-GPU Performance Taxes: A Systems Approach to Efficient Distributed LLMs [61.953548065938385]
分析フレームワークとして'3つの税'(バルク同期、カーネル間データローカリティ、カーネルローンチオーバーヘッド)を紹介した。
我々は、分散GPU実行におけるキー非効率に対処するために、厳密なBSPモデルを超えて移動することを提案する。
BSPベースのアプローチによるエンドツーエンドのレイテンシの10-20%の高速化を観察する。
論文 参考訳(メタデータ) (2025-11-04T01:15:44Z) - CollaPipe: Adaptive Segment-Optimized Pipeline Parallelism for Collaborative LLM Training in Heterogeneous Edge Networks [57.95170323315603]
CollaPipeは、コラボレーティブパイプライン並列性とフェデレーションアグリゲーションを統合し、自己進化型ネットワークをサポートする分散学習フレームワークである。
CollaPipeでは、エンコーダ部分は可変サイズのセグメントに適応的に分割され、パイプライン並列トレーニングのためにモバイルデバイスにデプロイされ、デコーダは生成タスクを処理するためにエッジサーバにデプロイされる。
トレーニング効率を向上させるために,モデルセグメント,マイクロバッチ,帯域幅,送信電力を適応的に割り当てる共同最適化問題を定式化する。
論文 参考訳(メタデータ) (2025-09-24T07:54:01Z) - STADI: Fine-Grained Step-Patch Diffusion Parallelism for Heterogeneous GPUs [14.137795556562686]
本稿では,拡散モデル推論を高速化する新しいフレームワークであるspatio-Temporal Adaptive Diffusion Inference (STADI)を紹介する。
コアとなるハイブリッドスケジューラは、時間次元と空間次元の両方にわたってきめ細かい並列性をオーケストレーションする。
提案手法は,エンド・ツー・エンドの推論遅延を最大45%削減し,異種GPUの資源利用を著しく改善する。
論文 参考訳(メタデータ) (2025-09-05T00:25:40Z) - CompGS++: Compressed Gaussian Splatting for Static and Dynamic Scene Representation [60.712165339762116]
CompGS++はコンパクトガウスプリミティブを活用して正確な3Dモデリングを実現する新しいフレームワークである。
私たちの設計は、プリミティブ間の冗長性をなくすという原則に基づいている。
私たちの実装は、さらなる研究を促進するためにGitHubで公開されます。
論文 参考訳(メタデータ) (2025-04-17T15:33:01Z) - Balanced 3DGS: Gaussian-wise Parallelism Rendering with Fine-Grained Tiling [8.748586633362446]
本稿では,3DGS トレーニングプロセスにおける微細なタイリングによるガウスワイド並列化レンダリングである Balanced 3DGS を紹介する。
本稿では,ひとつのGPU内のストリームマルチプロセッサ(SM)リソースにワークロードをマッピングするブロック間動的ワークロード分散手法を提案する。
我々は、すべてのSMに対してワークロードを均一に分散する、きめ細かい結合ロードバランシング手法を提唱し、RDBカーネルのパフォーマンスを最大7.52倍に向上させた。
論文 参考訳(メタデータ) (2024-12-23T08:26:30Z) - OmniBal: Towards Fast Instruction-Tuning for Vision-Language Models via Omniverse Computation Balance [67.37017498784748]
視覚言語命令チューニングモデルにおける大規模3D並列トレーニングは、異なるデバイス間で不均衡な計算負荷をもたらす。
我々は、データ、モデル、メモリの観点から計算負荷を再均衡させ、デバイス間でよりバランスのとれた計算を実現する。
提案手法の有効性と一般化性は,様々なモデルやデータセットにまたがってさらに検証される。
論文 参考訳(メタデータ) (2024-07-30T12:02:58Z) - Large Batch Simulation for Deep Reinforcement Learning [101.01408262583378]
我々は,視覚複雑な3次元環境における深層強化学習に基づく学習を,事前作業よりも2桁高速化する。
単一のGPUマシンで1秒間に19,000フレーム以上の経験と最大72,000フレーム/秒のエンドツーエンドのトレーニング速度を実現します。
バッチシミュレーションと性能最適化を組み合わせることで、1つのGPU上の複雑な3D環境において、従来の最先端システムでトレーニングされたエージェントの精度の97%から97%まで、ポイントナビゲーションエージェントをトレーニングできることを実証する。
論文 参考訳(メタデータ) (2021-03-12T00:22:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。