論文の概要: How Much Memory Do We Need? Adaptive Memory Gate for Neural Operators
- arxiv url: http://arxiv.org/abs/2606.13443v1
- Date: Thu, 11 Jun 2026 15:05:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.868035
- Title: How Much Memory Do We Need? Adaptive Memory Gate for Neural Operators
- Title(参考訳): どれくらいのメモリが必要か? ニューラル演算子のための適応メモリゲート
- Authors: Jihyeon Hur, Yongseok Kwon, Min-Gi Jo, Jeongwhan Choi, Noseong Park,
- Abstract要約: 学習可能なゲートを介してメモリ重量を動的に変調するAMGFNOを提案する。
倉本-シヴァシンスキー方程式とバーガースの方程式では、AMGFNOは55-79%のnRMSE還元を低分解能で達成している。
- 参考スコア(独自算出の注目度): 28.91653730181699
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Neural operators have emerged as a powerful data-driven approach for solving time-dependent PDEs. Among recent advances, memory-augmented neural operators explicitly incorporate past states and have achieved remarkable performance under low-resolution observation settings. However, existing approaches apply a fixed memory weight regardless of observation conditions, such as resolution or physical parameters, limiting their adaptability. Our preliminary experiments reveal that optimal memory weight varies with resolution and viscosity, implying that a fixed memory weight cannot simultaneously optimize performance across diverse settings. We propose AMGFNO, which dynamically modulates memory weight through a learnable gate. On the Kuramoto-Sivashinsky and Burgers' equations, AMGFNO achieves 55-79% nRMSE reduction over at low resolution, with the learned gate value automatically decreasing from $\bar{g} \approx 0.7$ to near-zero as resolution increases.
- Abstract(参考訳): 時間依存PDEを解決するための強力なデータ駆動アプローチとして、ニューラルネットワークが登場した。
最近の進歩の中で、メモリ拡張されたニューラル演算子は、過去の状態を明示的に取り入れ、低解像度の観測環境下では顕著なパフォーマンスを実現している。
しかし、既存のアプローチでは、解像度や物理パラメータなどの観測条件にかかわらず、メモリの重みを固定し、適応性を制限している。
予備実験の結果, 最適メモリ重量は解像度と粘度によって変化し, 固定メモリ重量は様々な設定で同時に性能を最適化できないことが示唆された。
学習可能なゲートを介してメモリ重量を動的に変調するAMGFNOを提案する。
倉本・シヴァシンスキー方程式とバーガースの方程式では、AMGFNOは低分解能で55-79%のnRMSE還元を達成し、学習されたゲート値は、解像度が増加するにつれて自動的に$\bar{g} \approx 0.7$から準ゼロに減少する。
関連論文リスト
- ECO: Quantized Training without Full-Precision Master Weights [58.97082407934466]
Error-Compensating (ECO)は、量子化されたパラメータに直接更新を適用することで、マスターウェイトを除去する。
ECO は最適値の定数半径近傍に収束するが、素早いマスターウェイト除去は学習率に逆比例する誤差を生じさせる。
論文 参考訳(メタデータ) (2026-01-29T18:35:01Z) - FOAM: Blocked State Folding for Memory-Efficient LLM Training [41.8909496809588]
大規模言語モデル (LLM) は, パラメータ数と広範囲なトレーニングデータにより, 顕著な性能を示した。
しかしながら、これらのスケールは、特にAdamのようなメモリ集約型を使用する場合、トレーニング中に大きなメモリボトルネックを引き起こす。
本稿では,ブロックワイズ方式で状態を圧縮し,勾配補正を組み込んで損失情報を復元するFolded with Approximate Moment (FOAM)を提案する。
論文 参考訳(メタデータ) (2025-12-08T02:48:27Z) - Pushing the Limits of Low-Bit Optimizers: A Focus on EMA Dynamics [64.62231094774211]
ステートフル(例えばアダム)は、最適収束を達成するために、モデルサイズを2倍も補助情報を維持する。
SOLOにより、アダムスタイルは3ビットまたは2ビットの精度で量子化された状態を維持することができる。
したがって、SOLOはAdamスタイルにシームレスに適用でき、精度の低下を最小限に抑えることができる。
論文 参考訳(メタデータ) (2025-05-01T06:47:45Z) - TensorGRaD: Tensor Gradient Robust Decomposition for Memory-Efficient Neural Operator Training [91.8932638236073]
textbfTensorGRaDは,重み付けに伴うメモリ問題に直接対処する新しい手法である。
SparseGRaD は総メモリ使用量を 50% 以上削減し,同時に精度も向上することを示した。
論文 参考訳(メタデータ) (2025-01-04T20:51:51Z) - Estimation of Energy-dissipation Lower-bounds for Neuromorphic Learning-in-memory [5.073292775065559]
理想的なニューロモルフィック・ニューラル-インスパイアされた神経平衡は局所的だがパラレルなパラメータの更新に頼り、2次プログラミングからイジングマシンまで幅広い問題を解決する。
本稿では,学習の内外熱力学を解析し,その結果のエネルギー効率の推定値がモデルに依存しないことを示す。
結果の実用性を示すため,我々は,大規模AIワークロードにおけるエネルギー対ソリューションの指標値の低バウンドを推定するために,分析を適用した。
論文 参考訳(メタデータ) (2024-02-21T21:02:11Z) - AdaLomo: Low-memory Optimization with Adaptive Learning Rate [59.64965955386855]
大規模言語モデルに対する適応学習率(AdaLomo)を用いた低メモリ最適化を提案する。
AdaLomoはAdamWと同等の結果を得ると同時に、メモリ要件を大幅に削減し、大きな言語モデルをトレーニングするためのハードウェア障壁を低くする。
論文 参考訳(メタデータ) (2023-10-16T09:04:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。