論文の概要: FAST: A Holistic Framework for Optimizing Memory-I/O, Computation, and Sampling in Temporal GNN Training
- arxiv url: http://arxiv.org/abs/2607.05095v1
- Date: Mon, 06 Jul 2026 13:54:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.168872
- Title: FAST: A Holistic Framework for Optimizing Memory-I/O, Computation, and Sampling in Temporal GNN Training
- Title(参考訳): FAST: 時間的GNNトレーニングにおけるメモリI/O,計算,サンプリングの最適化のための全体的フレームワーク
- Abstract要約: 時間グラフニューラルネットワーク(TGNN)は、リコメンデーション、ソーシャルネットワーク分析、トラフィック予測といったアプリケーションにおける動的グラフから学習するために広く利用されている。
我々は、サンプリング、メモリI/O、計算を共同最適化することで、エンドツーエンドのTGNNトレーニングを加速する総合的なフレームワークであるFASTを提案する。
FASTは、モデル精度を犠牲にすることなく、最先端システムの平均2.1倍(最大4.7倍)のスピードアップを達成する。
- 参考スコア(独自算出の注目度): 13.505374557741169
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Temporal Graph Neural Networks (TGNNs) are widely used for learning from dynamic graphs in applications such as recommendation, social network analysis, and traffic forecasting. However, scaling TGNN training to large dynamic graphs remains challenging due to three intertwined bottlenecks: memory I/O, irregular computation, and temporal neighbor sampling. Existing systems often optimize these stages in isolation, leaving substantial performance headroom on the table. We present FAST, a holistic framework that accelerates end-to-end TGNN training by jointly optimizing sampling, memory I/O, and computation. FAST introduces SlimCache, which exploits within-batch compression and cross-batch caching to reduce host-device data movement under limited GPU memory budgets. It further designs thread-efficient graph operators tailored to sparse temporal subgraphs, improving GPU cache locality and reducing the latency of aggregation and edge softmax. In addition, FAST employs a topology-aware sampling strategy that improves CPU cache locality and accelerates temporal neighbor sampling. Extensive experiments on real-world large dynamic graphs show that FAST achieves an average of 2.1x (up to 4.7x) speedup over state-of-the-art systems without sacrificing model accuracy.
- Abstract(参考訳): 時間グラフニューラルネットワーク(TGNN)は、リコメンデーション、ソーシャルネットワーク分析、トラフィック予測といったアプリケーションにおける動的グラフから学習するために広く利用されている。
しかし、メモリI/O、不規則計算、時間近傍サンプリングの3つのボトルネックのため、TGNNトレーニングを大規模動的グラフにスケールすることは依然として困難である。
既存のシステムは、しばしばこれらのステージを分離して最適化する。
我々は、サンプリング、メモリI/O、計算を共同で最適化することで、エンドツーエンドのTGNNトレーニングを加速する総合的なフレームワークであるFASTを提案する。
FASTでは、内部バッチ圧縮とクロスバッチキャッシュを活用するSlimCacheを導入し、GPUメモリ予算の制限下でのホストデバイスデータの移動を削減している。
さらに、スパース時間グラフに適したスレッド効率のグラフ演算子を設計し、GPUキャッシュの局所性を改善し、アグリゲーションとエッジソフトマックスのレイテンシを低減する。
さらに、FASTは、CPUキャッシュの局所性を改善し、時間的隣のサンプリングを加速するトポロジ対応サンプリング戦略を採用している。
実世界の大規模動的グラフに関する大規模な実験により、FASTはモデル精度を犠牲にすることなく、最先端システムの平均2.1倍(最大4.7倍)のスピードアップを達成することが示された。
関連論文リスト
- Predictive Feature Caching for Training-free Acceleration of Molecular Geometry Generation [67.20779609022108]
フローマッチングモデルは、高忠実度分子ジオメトリを生成するが、推論中にかなりの計算コストを発生させる。
本研究は,分子幾何生成を加速する学習自由キャッシング戦略について論じる。
GEOM-Drugsデータセットの実験は、キャッシングがウォールクロックの推測時間の2倍の削減を実現することを示した。
論文 参考訳(メタデータ) (2025-10-06T09:49:14Z) - PGT-I: Scaling Spatiotemporal GNNs with Memory-Efficient Distributed Training [9.433611717050942]
我々は、PyTorch Geometric Temporaltemporal Network(STG-NN)の拡張である、PyTorch Temporal Geometric Index(GTP-I)を提案する。
GTP-Iは分散データ並列トレーニングとインデックスバッチと分散インデックスバッチという2つの戦略を統合している。
本手法により,グラフを使わずに,PeMSデータセット全体のSTG-NNを初めてトレーニングすることが可能となる。
論文 参考訳(メタデータ) (2025-07-15T19:38:16Z) - FastGL: A GPU-Efficient Framework for Accelerating Sampling-Based GNN Training at Large Scale [29.272368697268433]
グラフニューラルネットワーク(GNN)は、非ユークリッドグラフデータに対して大きな優位性を示している。
我々は,大規模なGNNのサンプリングベーストレーニングを高速化するGPU効率のフレームワークであるFastGLを提案する。
FastGLは、最先端フレームワークであるPyG、DGL、GNNLabに対して平均11.8x、2.2x、1.5xのスピードアップを達成することができる。
論文 参考訳(メタデータ) (2024-09-23T11:45:47Z) - GNNFlow: A Distributed Framework for Continuous Temporal GNN Learning on
Dynamic Graphs [11.302970701867844]
本稿では,効率的な時間的グラフ表現学習のための分散フレームワークであるGNNFlowを紹介する。
GNNFlowは、負荷バランスを確保するために、静的スケジューリングを備えた複数のマシンでの分散トレーニングをサポートする。
実験の結果,GNNFlowは既存のシステムに比べて最大21.1倍高速な継続的学習を実現することがわかった。
論文 参考訳(メタデータ) (2023-11-29T07:30:32Z) - Latency-aware Unified Dynamic Networks for Efficient Image Recognition [72.8951331472913]
LAUDNetは動的ネットワークの理論的および実用的な効率ギャップを橋渡しするフレームワークである。
3つの主要な動的パラダイム - 適応型計算、動的層スキップ、動的チャネルスキップ - を統合している。
これにより、V100,3090やTX2 GPUのようなプラットフォーム上で、ResNetのようなモデルの遅延を50%以上削減できる。
論文 参考訳(メタデータ) (2023-08-30T10:57:41Z) - DistTGL: Distributed Memory-Based Temporal Graph Neural Network Training [18.52206409432894]
DistTGLは、分散GPUクラスタ上でメモリベースのTGNNをトレーニングするための、効率的でスケーラブルなソリューションである。
実験では、DistTGLはほぼ直線収束のスピードアップを実現し、最先端のシングルマシン法を14.5%、トレーニングスループットは10.17倍に向上した。
論文 参考訳(メタデータ) (2023-07-14T22:52:27Z) - Communication-Efficient Graph Neural Networks with Probabilistic
Neighborhood Expansion Analysis and Caching [59.8522166385372]
大規模グラフ上でのグラフニューラルネットワーク(GNN)のトレーニングと推論は、GNNの登場以来活発に研究されている。
本稿では,分散環境におけるノードワイドサンプリングを用いたGNNによるミニバッチ学習と推論について述べる。
分割された特徴データを扱うために,従来のSALIENTシステムを拡張したSALIENT++を提案する。
論文 参考訳(メタデータ) (2023-05-04T21:04:01Z) - NumS: Scalable Array Programming for the Cloud [82.827921577004]
タスクベース分散システム上でNumPyのような表現を最適化する配列プログラミングライブラリであるNumSを提案する。
これはLoad Simulated Hierarchical Scheduling (LSHS)と呼ばれる新しいスケジューラによって実現される。
LSHSは、ネットワーク負荷を2倍減らし、メモリを4倍減らし、ロジスティック回帰問題において実行時間を10倍減らし、Rayの性能を向上させる。
論文 参考訳(メタデータ) (2022-06-28T20:13:40Z) - Accelerating Training and Inference of Graph Neural Networks with Fast
Sampling and Pipelining [58.10436813430554]
グラフニューラルネットワーク(GNN)のミニバッチトレーニングには、多くの計算とデータ移動が必要である。
我々は,分散マルチGPU環境において,近傍サンプリングを用いたミニバッチトレーニングを行うことを支持する。
本稿では,これらのボトルネックを緩和する一連の改良点について述べる。
また,サンプリングによる推論を支援する実験分析を行い,試験精度が実質的に損なわれていないことを示す。
論文 参考訳(メタデータ) (2021-10-16T02:41:35Z) - Fast Graph Attention Networks Using Effective Resistance Based Graph
Sparsification [70.50751397870972]
FastGATは、スペクトルスペーシフィケーションを用いて、注目に基づくGNNを軽量にし、入力グラフの最適プルーニングを生成する手法である。
我々は,ノード分類タスクのための大規模実世界のグラフデータセット上でFastGATを実験的に評価した。
論文 参考訳(メタデータ) (2020-06-15T22:07:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。