論文の概要: Hyperparameter Transfer in Graph Neural Networks
- arxiv url: http://arxiv.org/abs/2607.05017v1
- Date: Mon, 06 Jul 2026 12:59:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.155247
- Title: Hyperparameter Transfer in Graph Neural Networks
- Title(参考訳): グラフニューラルネットワークにおけるハイパーパラメータ転送
- Authors: Gage DeZoort, Boris Hanin,
- Abstract要約: 我々は、SGD、Adam、AdamWで訓練されたグラフニューラルネットワーク(GNN)の転送パラメータ化を開発し、検証する。
提案手法のパラメータ化により,安定な特徴更新,学習率の伝達,幅と深さの増大による性能向上が期待できる。
これらの結果は、さまざまな学習タスクやトレーニングシナリオにわたってGNNをスケールするための実践的なレシピを提供する。
- 参考スコア(独自算出の注目度): 8.584932159968
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The performance of deep learning models crucially depends on the settings of hyperparameters like learning rate, initialization scale, and weight decay. Hyperparameter transfer aims to make near-optimal hyperparameter settings consistent across model scale, so that large models can be optimized by proxy tuning their smaller, cheaper-to-optimize counterparts. While transfer principles are well-studied in the context of dense neural networks in language and vision tasks, they remain comparatively under-explored for graph neural networks (GNNs). We develop and validate a transfer parameterization for GNNs trained with SGD, Adam, and AdamW. Through theoretical scaling analyses and controlled experiments, we show that the proposed parameterization yields stable feature updates, learning rate transfer, and improved performance as width and depth increase. For SGD, we identify graph-dependent first-layer correction factors and show that their use can accelerate early training in graphs with sparse bag-of-words inputs. For Adam, we explore how different message passing normalizations affect early- and late-training transfer behavior, illustrating the importance of message passing normalization and advocating for an associated hyperparameter. For AdamW, we adapt a parameterization that allows for the joint transfer of weight decay and learning rate. Together, these results provide a practical recipe for scaling GNNs across a variety of learning tasks and training scenarios.
- Abstract(参考訳): ディープラーニングモデルの性能は、学習率、初期化スケール、体重減少といったハイパーパラメータの設定に大きく依存する。
ハイパーパラメータ転送は、モデルスケール全体でほぼ最適に近いハイパーパラメータ設定を一貫性を持たせることを目的としている。
伝達原理は、言語や視覚タスクにおける高密度ニューラルネットワークの文脈でよく研究されているが、グラフニューラルネットワーク(GNN)については、比較的調査が過小評価されている。
我々は、SGD、Adam、AdamWで訓練されたGNNの転送パラメータ化を開発し、検証する。
理論的スケーリング解析と制御実験により,提案手法のパラメータ化により,安定な特徴更新,学習率の伝達,幅と深さの増大による性能向上が得られた。
SGDでは,グラフに依存した第1層補正因子を同定し,単語入力の少ないグラフにおける早期学習を促進できることを示す。
Adam氏は、異なるメッセージパッシング正規化が早期および後期のトランスファー行動にどのように影響するかを考察し、メッセージパッシング正規化の重要性と、関連するハイパーパラメーターの提唱について説明する。
AdamW にとって、重量減衰と学習率の連成移動を可能にするパラメータ化を適応させる。
これらの結果は、さまざまな学習タスクやトレーニングシナリオにまたがってGNNをスケールするための実践的なレシピを提供する。
関連論文リスト
- GQA-μP: The maximal parameterization update for grouped query attention [64.99972873396649]
グループクエリアテンション(GQA)のためのPスケールの導出方法を示す。
また,GQA繰り返しハイパーパラメータ間での学習速度の伝達を示すことによって,理論的導出の有効性を示す。
論文 参考訳(メタデータ) (2026-05-14T18:03:16Z) - Function-Space Learning Rates [23.09717258810923]
任意のニューラルネットワークにおける関数空間学習率を計測・設定する効率的な手法を開発した。
1) パラメータ空間ではなく関数空間における標準ニューラルネットワークオプティマイザのダイナミクスを分析する。
論文 参考訳(メタデータ) (2025-02-24T18:31:58Z) - Efficient Hyperparameter Importance Assessment for CNNs [1.7778609937758323]
本稿では,畳み込みニューラルネットワーク(CNN)におけるハイパーパラメータの重み付けを,N-RReliefFというアルゴリズムを用いて定量化する。
我々は10の人気のある画像分類データセットから1万以上のCNNモデルをトレーニングし、広範囲にわたる研究を行う。
論文 参考訳(メタデータ) (2024-10-11T15:47:46Z) - Diffusion-Based Neural Network Weights Generation [80.89706112736353]
D2NWGは拡散に基づくニューラルネットワーク重み生成技術であり、転送学習のために高性能な重みを効率よく生成する。
本稿では,ニューラルネットワーク重み生成のための遅延拡散パラダイムを再放送するために,生成的ハイパー表現学習を拡張した。
我々のアプローチは大規模言語モデル(LLM)のような大規模アーキテクチャにスケーラブルであり、現在のパラメータ生成技術の限界を克服しています。
論文 参考訳(メタデータ) (2024-02-28T08:34:23Z) - Label Deconvolution for Node Representation Learning on Large-scale Attributed Graphs against Learning Bias [72.33336385797944]
本稿では,学習バイアスを軽減するため,ラベルの効率的な正規化手法であるラベルデコンボリューション(LD)を提案する。
LDはOpen Graph Benchmarkデータセット上で最先端の手法よりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2023-09-26T13:09:43Z) - Learning to Learn with Generative Models of Neural Network Checkpoints [71.06722933442956]
ニューラルネットワークのチェックポイントのデータセットを構築し,パラメータの生成モデルをトレーニングする。
提案手法は,幅広い損失プロンプトに対するパラメータの生成に成功している。
我々は、教師付きおよび強化学習における異なるニューラルネットワークアーキテクチャとタスクに本手法を適用した。
論文 参考訳(メタデータ) (2022-09-26T17:59:58Z) - Transfer Learning with Convolutional Networks for Atmospheric Parameter
Retrieval [14.131127382785973]
MetOp衛星シリーズに搭載された赤外線音波干渉計(IASI)は、数値気象予測(NWP)に重要な測定値を提供する
IASIが提供する生データから正確な大気パラメータを取得することは大きな課題であるが、NWPモデルでデータを使用するには必要である。
本研究では,iasiデータから抽出した特徴を,低い高度で異なる物理変数を予測するように設計された別の統計手法への入力として使用できることを示す。
論文 参考訳(メタデータ) (2020-12-09T09:28:42Z) - Adaptive Gradient Method with Resilience and Momentum [120.83046824742455]
レジリエンスとモメンタム(AdaRem)を用いた適応勾配法を提案する。
AdaRemは、過去の1つのパラメータの変化方向が現在の勾配の方向と一致しているかどうかに応じてパラメータワイズ学習率を調整する。
本手法は,学習速度とテスト誤差の観点から,従来の適応学習率に基づくアルゴリズムよりも優れていた。
論文 参考訳(メタデータ) (2020-10-21T14:49:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。