論文の概要: Hyperparameter Transfer for Dense Associative Memories
- arxiv url: http://arxiv.org/abs/2605.10164v1
- Date: Mon, 11 May 2026 08:15:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.630988
- Title: Hyperparameter Transfer for Dense Associative Memories
- Title(参考訳): 重度連想記憶のためのハイパーパラメーター転送
- Authors: Roi Holtzman, Dmitry Krotov, Boris Hanin,
- Abstract要約: Dense Associative Memory(DenseAM)は、エネルギーランドスケープで時間的ダイナミクスを実行するニューラルネットワークによって表現される、有望なAIアーキテクチャのファミリーである。
本研究は,このモデルのハイパーパラメータ転送手法の開発に着手する。
我々は、小さなモデルで調整されたハイパーパラメータが、スケールで訓練されたモデルにどのように移行できるかについて、明示的な処方則を導出する。
- 参考スコア(独自算出の注目度): 12.017660610017806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Dense Associative Memory (DenseAM) is a promising family of AI architectures that is represented by a neural network performing temporal dynamics on an energy landscape. While hyperparameter transfer methods are well-studied for feed-forward networks, these methods have not been developed for settings in which weights are shared across layers and within the layer, which is common in DenseAMs. Additionally, DenseAMs utilize rapidly peaking activation functions that are rarely used in feed-forward architectures. The confluence of these aspects makes DenseAM a challenging framework for using existing methods for hyperparameter transfer. Our work initiates the development of hyperparameter transfer methods for this class of models. We derive explicit prescriptions for how the hyperparameters tuned on small models can be transferred to models trained at scale. We demonstrate excellent agreement between these theoretical findings and empirical results.
- Abstract(参考訳): Dense Associative Memory(DenseAM)は、エネルギーランドスケープで時間的ダイナミクスを実行するニューラルネットワークによって表現される、有望なAIアーキテクチャのファミリーである。
フィードフォワードネットワークではハイパーパラメータ転送手法がよく研究されているが,これらの手法は層間および層内において重みが共有されるような設定では開発されていない。
さらに、DenseAMはフィードフォワードアーキテクチャではめったに使われない急激なピークアクティベーション機能を利用する。
これらの側面の相違により、DenseAMは既存のハイパーパラメータ転送手法を使用する上で難しいフレームワークとなっている。
本研究は,このモデルのハイパーパラメータ転送手法の開発に着手する。
我々は、小さなモデルで調整されたハイパーパラメータが、スケールで訓練されたモデルにどのように移行できるかについて、明示的な処方則を導出する。
これらの理論的結果と経験的結果との間には,優れた一致を示す。
関連論文リスト
- Hyperparameter Trajectory Inference with Conditional Lagrangian Optimal Transport [51.56484100374058]
デプロイ後、ユーザの好みが進化し、初期設定が望ましくないようになる。
我々は、観測データから、NNの条件付き出力分布がハイパーパラメータでどのように変化するかを学ぶ。
我々は、NNを観測されていないハイパーパラメータで近似する代理モデルを構築した。
論文 参考訳(メタデータ) (2026-03-02T11:55:02Z) - On Approaches to Building Surrogate ODE Models for Diffusion Bridges [39.92969675794945]
拡散とシュルディンガーブリッジモデルは、生成モデリングにおける最先端の性能を確立している。
これらのモデルは、しばしば計算コストと複雑な訓練手順によって妨げられる。
この研究は、代理モデルを使用してよりシンプルで、より速く、より柔軟なこれらのダイナミクスの近似を作成する新しいパラダイムを導入している。
論文 参考訳(メタデータ) (2025-12-14T12:49:38Z) - Instruction-Guided Autoregressive Neural Network Parameter Generation [49.800239140036496]
本稿では,多種多様なタスクやアーキテクチャにまたがるパラメータ合成を統一する自動回帰フレームワークIGPGを提案する。
ニューラルネットワーク重みのトークンを自動回帰的に生成することにより、IGPGは層間コヒーレンスを確保し、モデルとデータセット間の効率的な適応を可能にする。
複数のデータセットの実験により、IGPGは様々な事前訓練されたモデルを単一の柔軟な生成フレームワークに統合することを示した。
論文 参考訳(メタデータ) (2025-04-02T05:50:19Z) - Efficient Hyperparameter Importance Assessment for CNNs [1.7778609937758323]
本稿では,畳み込みニューラルネットワーク(CNN)におけるハイパーパラメータの重み付けを,N-RReliefFというアルゴリズムを用いて定量化する。
我々は10の人気のある画像分類データセットから1万以上のCNNモデルをトレーニングし、広範囲にわたる研究を行う。
論文 参考訳(メタデータ) (2024-10-11T15:47:46Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z) - MergeNet: Knowledge Migration across Heterogeneous Models, Tasks, and Modalities [72.05167902805405]
異種モデルのパラメータ空間のギャップを埋めることを学ぶMergeNetを提案する。
MergeNetの中核となるメカニズムはパラメータアダプタにあり、ソースモデルの低ランクパラメータをクエリすることで動作する。
MergeNetは両方のモデルと共に学習され、我々のフレームワークは、現在のステージに関する知識を動的に転送し、適応することができます。
論文 参考訳(メタデータ) (2024-04-20T08:34:39Z) - The Underlying Correlated Dynamics in Neural Training [6.385006149689549]
ニューラルネットワークのトレーニングは、計算集約的なタスクである。
本稿では,パラメータのダイナミクスの相関に基づくモデルを提案する。
この表現は、基礎となるトレーニングダイナミクスの理解を深め、より良い加速技術を設計するための道を開くことができる。
論文 参考訳(メタデータ) (2022-12-18T08:34:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。