論文の概要: How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks
- arxiv url: http://arxiv.org/abs/2605.27662v1
- Date: Tue, 26 May 2026 20:25:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.508649
- Title: How the Optimizer Shapes Learned Solutions in Equivariant Neural Networks
- Title(参考訳): 同変ニューラルネットワークにおける最適解の形状
- Authors: Teodor-Mihai Stupariu, Andrei Manolache,
- Abstract要約: 等変ニューラルネットワークは、構成によって幾何対称性を符号化するが、最適化が困難であり、制約の少ないアーキテクチャを過小評価することがしばしばある。
我々は, この方向を, ポイントクラウドおよび分子学習環境下で, 複数の等変および幾何学的アーキテクチャで比較することにより検討する。
次に、ヘッセン推定、損失表面の可視化、学習重量と中間表現のスペクトル特性を用いて、訓練されたModelNet40チェックポイントを解析する。
- 参考スコア(独自算出の注目度): 3.449933410012168
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Equivariant neural networks encode geometric symmetries by construction, yet they are often difficult to optimize and can underperform less constrained architectures. A growing body of work addresses this through architectural modifications such as constraint relaxation or approximate equivariance, while the role of the optimizer remains comparatively underexplored. We study this direction by comparing Muon and Adam across several equivariant and geometric architectures under pointcloud and molecular learning settings. On ModelNet40, where the comparison is clearest, Muon consistently improves over Adam across all architectures considered. We then analyze the trained ModelNet40 checkpoints through Hessian estimates, loss surface visualizations, and spectral properties of learned weights and intermediate representations. The checkpoints reached by Muon have larger Hessian curvature summaries but more regular loss surfaces, and their learned weights and representations have higher stable and effective ranks. These observations suggest that the interaction between optimizer design and geometric inductive bias deserves further attention from the community.
- Abstract(参考訳): 等変ニューラルネットワークは、構成によって幾何対称性を符号化するが、最適化が困難であり、制約の少ないアーキテクチャを過小評価することがしばしばある。
増大する研究機関は、制約緩和や近似同値のようなアーキテクチャ上の修正によってこの問題に対処する一方、オプティマイザの役割は比較的過小評価されている。
我々は, この方向を, ポイントクラウドおよび分子学習環境下で, 複数の等変および幾何学的アーキテクチャで比較することにより検討する。
比較がもっとも明確であるModelNet40では、Muonは検討されたすべてのアーキテクチャでAdamよりも一貫して改善されている。
次に、ヘッセン推定、損失表面の可視化、学習重量と中間表現のスペクトル特性を用いて、訓練されたModelNet40チェックポイントを解析する。
ムオンが到達したチェックポイントは、より大きいヘッセン曲率の和を持つが、より規則的な損失面を持ち、その学習された重みと表現はより安定で効果的なランクを持つ。
これらの観察から、オプティマイザ設計と幾何学的帰納バイアスの相互作用は、コミュニティからさらに注目に値することが示唆された。
関連論文リスト
- On the Geometric Structure of Layer Updates in Deep Language Models [0.0]
深層言語モデルにおける階層更新の幾何学的構造について検討する。
階層的な更新は、支配的なトークンワイズコンポーネントと制限されたトークンワイズ関数クラスによってキャプチャされない残基への分解を許容することを示す。
論文 参考訳(メタデータ) (2026-04-02T18:44:34Z) - The Effect of Architecture During Continual Learning [2.1485350418225244]
本稿では,ソボレフ空間のアーキテクチャと重みを共同でモデル化する数学的枠組みを提案する。
モデル重みのみの学習は、分布シフト下での破滅的な忘れを緩和するには不十分であることを示す。
フィードフォワード、畳み込み、グラフニューラルネットワークを含む回帰と分類に関する実証的研究は、最適なアーキテクチャと重みの学習が同時に性能を大幅に向上させることを示した。
論文 参考訳(メタデータ) (2026-01-27T16:29:42Z) - Soft Geometric Inductive Bias for Object Centric Dynamics [36.337338384532636]
幾何学的代数的ニューラルネットワークを用いたオブジェクト中心の世界モデルを提案する。
モデルのソフトインダクティブバイアスは、物理的忠実度の観点から、より良いパフォーマンスをもたらすことを示す。
論文 参考訳(メタデータ) (2025-12-17T14:40:37Z) - Symmetry-Aware Fully-Amortized Optimization with Scale Equivariant Graph Metanetworks [39.69046654861533]
ここでは,Scale Equivariant Graph Metanetworks (ScaleGMNs) が既存モデルの単一ショット微調整を可能にすることを示す。
畳み込み型ニューラルネットワークでは,マルチ層パーセプトロンよりもゲージ自由度が厳密に小さいことを示す。
我々の研究は、対称性を意識したメタネットワークが、効率的で一般化可能なニューラルネットワーク最適化のための強力なアプローチであることを示す。
論文 参考訳(メタデータ) (2025-10-09T14:51:15Z) - Rao-Blackwell Gradient Estimators for Equivariant Denoising Diffusion [55.95767828747407]
分子やタンパク質の生成のようなドメインでは、物理系はモデルにとって重要な固有の対称性を示す。
学習のばらつきを低減し、確率的に低い分散勾配推定器を提供するフレームワークを提案する。
また,軌道拡散法(Orbit Diffusion)と呼ばれる手法を用いて,損失とサンプリングの手順を取り入れた推定器の実用的実装を提案する。
論文 参考訳(メタデータ) (2025-02-14T03:26:57Z) - Task-Oriented Real-time Visual Inference for IoVT Systems: A Co-design Framework of Neural Networks and Edge Deployment [61.20689382879937]
タスク指向エッジコンピューティングは、データ分析をエッジにシフトすることで、この問題に対処する。
既存の手法は、高いモデル性能と低いリソース消費のバランスをとるのに苦労している。
ニューラルネットワークアーキテクチャを最適化する新しい協調設計フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-29T19:02:54Z) - Exploring the design space of deep-learning-based weather forecasting systems [56.129148006412855]
本稿では,異なる設計選択がディープラーニングに基づく天気予報システムに与える影響を系統的に分析する。
UNet、完全畳み込みアーキテクチャ、トランスフォーマーベースモデルなどの固定グリッドアーキテクチャについて検討する。
固定グリッドモデルの強靭な性能とグリッド不変アーキテクチャの柔軟性を組み合わせたハイブリッドシステムを提案する。
論文 参考訳(メタデータ) (2024-10-09T22:25:50Z) - Enhancing lattice kinetic schemes for fluid dynamics with Lattice-Equivariant Neural Networks [79.16635054977068]
我々はLattice-Equivariant Neural Networks (LENNs)と呼ばれる新しい同変ニューラルネットワークのクラスを提案する。
我々の手法は、ニューラルネットワークに基づく代理モデルLattice Boltzmann衝突作用素の学習を目的とした、最近導入されたフレームワーク内で開発されている。
本研究は,実世界のシミュレーションにおける機械学習強化Lattice Boltzmann CFDの実用化に向けて展開する。
論文 参考訳(メタデータ) (2024-05-22T17:23:15Z) - The Lie Derivative for Measuring Learned Equivariance [84.29366874540217]
我々は、CNN、トランスフォーマー、ミキサーアーキテクチャにまたがる数百の事前訓練されたモデルの同値性について検討する。
その結果,不等式違反の多くは,不等式などのユビキタスネットワーク層における空間エイリアスに関連付けられることがわかった。
例えば、トランスはトレーニング後の畳み込みニューラルネットワークよりも同種である。
論文 参考訳(メタデータ) (2022-10-06T15:20:55Z) - Disentangling Neural Architectures and Weights: A Case Study in
Supervised Classification [8.976788958300766]
本研究は、神経構造とそのエッジウェイトの役割を解消する問題について考察する。
十分に訓練されたアーキテクチャでは、重み付けのリンク固有の微調整は不要である。
我々は、ハードアーキテクチャ探索問題を実現可能な最適化問題に変換する、新しい計算効率のよい手法を用いる。
論文 参考訳(メタデータ) (2020-09-11T11:22:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。