論文の概要: PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark
- arxiv url: http://arxiv.org/abs/2607.16268v1
- Date: Sun, 05 Jul 2026 14:56:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:38.910991
- Title: PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark
- Title(参考訳): PsiLogic: 公正なクロスドメインベンチマークを備えたAdamのカオス対応アクティブキャンセラ
- Abstract要約: PsiLogicは、デュアル指数移動平均によって公転される動的アクティブキャンセラレーション項でアダムを安定化させる。
フェアベンチを用いたAdam,AdamW,Lionに対するPsiLogicの評価を行った。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Adaptive optimizers such as Adam and AdamW apply the same update rule regardless of whether training is in a chaotic early phase or near convergence. We introduce PsiLogic, an optimizer that augments Adam with a dynamic Active Cancellation Term gated by a dual exponential moving average (EMA) of scale-normalized gradient norms. The resulting chaos detector strengthens damping when gradient statistics are unstable and fades to zero as training stabilizes, providing an implicit warmup without a hand-tuned schedule. We evaluate PsiLogic against Adam, AdamW, and Lion using FairBench -- a reproducible benchmark protocol with per-optimizer learning-rate sweeps, identical initialization per seed, and Welch t-tests. On an NVIDIA H100 80GB reference run (4 arenas, 3 seeds, 2000 steps, bf16 AMP), PsiLogic achieves the best validation metric in three of four arenas: NLP perplexity 7.79 +/- 0.18 vs. 8.17 +/- 0.08 (AdamW, p = 0.049), ViT top-1 accuracy 0.244 +/- 0.006 vs. 0.223 +/- 0.002 (AdamW, p = 0.015), and ResNet top-1 accuracy 0.222 +/- 0.001 vs. 0.172 +/- 0.004 (Adam, p = 0.001). On diffusion, validation MSE is statistically tied with Adam/AdamW (p = 0.49). ResNet accuracy vs. AdamW is a numerical tie without significance at three seeds (p = 0.44). Peak GPU memory is comparable across optimizers; PsiLogic incurs 1.2--1.8x wall-clock overhead on transformer-heavy arenas (implementation-bound). We release an open-source PyTorch implementation, the full FairBench harness, and all raw CSV outputs to support independent verification.
- Abstract(参考訳): AdamやAdamWといった適応型オプティマイザは、トレーニングがカオス的な初期段階にあるか、あるいはほぼ収束しているかに関わらず、同じ更新ルールを適用している。
PsiLogicは、スケール正規化勾配ノルムの双対指数移動平均(EMA)で表される動的アクティブキャンセレーション項をアダムに拡張するオプティマイザである。
結果として生じるカオス検出器は、勾配統計が不安定で、トレーニングが安定するにつれてゼロに消えるときの減衰を強化し、手動のスケジュールなしで暗黙のウォームアップを提供する。
PsiLogicをAdam、AdamW、Lionに対して評価する。FairBenchは、最適化者毎の学習率のスイープ、シードごとの同一初期化、およびWelch t-testを備えた再現可能なベンチマークプロトコルである。
NLP perplexity 7.79 +/- 0.18 vs. 8.17 +/- 0.08 (AdamW, p = 0.049)、ViT top-1 accuracy 0.244 +/- 0.006 vs. 0.223 +/- 0.002 (AdamW, p = 0.015)、ResNet top-1 accuracy 0.222 +/- 0.001 vs. 0.172 +/- 0.004 (AdamW, p = 0.001)である。
拡散において、検証 MSE はAdam/AdamW (p = 0.49) と統計的に結びついている。
ResNetの精度対AdamWは3つの種で意味のない数値的な結び目である(p = 0.44)。
ピークGPUメモリはオプティマイザ間で同等であり、PsiLogicはトランスフォーマ重アリーナ(実装バウンダリ)で1.2-1.8倍のウォールクロックオーバーヘッドを発生させる。
オープンソースのPyTorch実装、フルFairBenchハーネス、および独立した検証をサポートするためのすべての生のCSV出力をリリースする。
関連論文リスト
- Adaptive Runge-Kutta Step Control Buys Training Loss, Not Generalization: An Honest Compute-Matched Study of RK-Adam Optimizers [0.0]
我々は代表的アダム変種(Bogacki-Shampine 3(2) RKペア、FSAL再利用、ローカルエラーステップ制御)を構築する。
我々は、全てのメソッドに同じ勾配評価予算を与える厳密な計算整合プロトコルで評価する。
論文 参考訳(メタデータ) (2026-07-16T03:12:58Z) - LLM Features Can Hurt GNNs: Concatenation Interference on Homophilous Graph Benchmarks [10.283803346813047]
グラフニューラルネットワーク(GNN)にLLM生成ノード機能を追加することで、標準ベンチマークの精度が向上することが広く報告されている。
LLMの特徴が純粋に入力結合によって導入された場合、エンド・ツー・エンドのパイプラインが成功するホモフレンドリーなベンチマークにおいて、その精度を体系的に低下させることができる。
論文 参考訳(メタデータ) (2026-06-16T06:30:30Z) - THEIA: Learning Complete Kleene Three-Valued Logic in a Pure-Neural Modular Architecture [0.0]
THEIAは2.75Mのモジュラー・ニューラルアーキテクチャで、外部のシンボル推論や手書きのK3ゲートプリミティブを使わずにタスクデータから完全Kleene 3値論理(K3)真理表を学習する。
トランスフォーマーのベースラインは39の規則すべてで99%に到達し、フラットは0.04pp以内のフェーズ1の精度でTheIAと一致している。
論文 参考訳(メタデータ) (2026-04-13T10:44:15Z) - Combining Adam and its Inverse Counterpart to Enhance Generalization of Deep Learning Optimizers [57.049014152026864]
ニューラルネットワークのトレーニングでは、適応モーメント推定(Adam)は通常、高速に収束するが、最適以下の一般化性能を示す。
平らなミニマを見つける能力を高めるため、逆アダム(InvAdam)という新しい変種を提案する。
InvAdamは1階と2階のモーメントの要素ワイド乗算を計算し、Adamは2つのモーメントの要素ワイド除算を計算する。
論文 参考訳(メタデータ) (2026-03-07T09:15:30Z) - Fast Compute for ML Optimization [0.0]
分散平均スケール-混合表現を含む損失に対する最適化について検討する。
その結果、SM-EM(Scale Mixture EM)アルゴリズムは、ユーザが指定した学習率と運動量スケジュールを除去する。
基底(非加速)アルゴリズムでは、EM単調性は非増加目標値を保証する。
論文 参考訳(メタデータ) (2026-02-15T19:09:58Z) - Kourkoutas-Beta: A Sunspike-Driven Adam Optimizer with Desert Flair [0.0]
トランスフォーマーニューラルネットワークは、物理学に基づく問題にますます利用されている。
データ駆動型PDEサロゲートでは、異なる境界と初期条件からのトレーニングサンプルが不規則な損失とスパイク勾配を引き起こす可能性がある。
固定された第2モーメントベータ2がレイヤワイドな値に置き換えられるAdamスタイルの割引であるKourkoutas-Betaを紹介します。
論文 参考訳(メタデータ) (2025-08-18T15:16:54Z) - Maximizing Communication Efficiency for Large-scale Training via 0/1
Adam [49.426602335460295]
1ビット通信はモデルトレーニングのスケールアップに有効な手法であり、SGDで広く研究されている。
我々は2つの新しい手法により最先端の1ビットAdamを改善する0/1Adamを提案する。
論文 参考訳(メタデータ) (2022-02-12T08:02:23Z) - High performing ensemble of convolutional neural networks for insect
pest image detection [124.23179560022761]
害虫の寄生は作物の被害の主な原因であり、世界中の収入を失った。
我々は異なるトポロジに基づいてCNNのアンサンブルを生成する。
ディープネットワーク最適化のための2つの新しいAdamアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-08-28T00:49:11Z) - Adam$^+$: A Stochastic Method with Adaptive Variance Reduction [56.051001950733315]
Adamはディープラーニングアプリケーションに広く使われている最適化手法である。
我々はAdam$+$(Adam-plusと発音する)という新しい方法を提案する。
画像分類,言語モデリング,自動音声認識など,さまざまなディープラーニングタスクに関する実証研究により,Adam$+$がAdamを著しく上回ることを示した。
論文 参考訳(メタデータ) (2020-11-24T09:28:53Z) - ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning [91.13797346047984]
本稿では,2次最適化アルゴリズムであるADAHESSIANを紹介する。
ADAHESSIANは、他の適応最適化手法と比較して、新しい最先端の成果を大きなマージンで達成することを示す。
論文 参考訳(メタデータ) (2020-06-01T05:00:51Z) - A Simple Convergence Proof of Adam and Adagrad [74.24716715922759]
我々はAdam Adagradと$O(d(N)/st)$アルゴリズムの収束の証明を示す。
Adamはデフォルトパラメータで使用する場合と同じ収束$O(d(N)/st)$で収束する。
論文 参考訳(メタデータ) (2020-03-05T01:56:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。