論文の概要: Information Allocation Dynamics in Neural Network Optimization
- arxiv url: http://arxiv.org/abs/2607.07156v1
- Date: Wed, 08 Jul 2026 08:49:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.32494
- Title: Information Allocation Dynamics in Neural Network Optimization
- Title(参考訳): ニューラルネットワーク最適化における情報割当ダイナミクス
- Abstract要約: 異なる更新バイアスには異なる更新バイアスがあるが、これらのバイアスは通常暗黙的である。既存の研究は主に最終解の幾何学からそのようなバイアスを分析し、制御している。
本稿では,情報アロケーション・ダイナミックスの観点から考察する。
これは暗黙のバイアスを、重みのようなパラメータ経路と偏りのようなパラメータ経路の間の訓練信号の相対的な割り当てとして解釈する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Different optimizers have different update biases, but these biases are usually implicit. Existing studies mainly analyze or control such biases from the geometry of the final solution. However, how optimizer bias forms during training still lacks a clear internal mechanism. This paper proposes an information allocation dynamics perspective. It interprets optimizer implicit bias as the relative allocation of training signals between weight-like and bias-like parameter pathways. This allocation can be described and adjusted by a continuous preconditioning exponent \(p\). To characterize this mechanism, we first analyze the update contributions of weight and bias to the same residual signal in a minimal linear model. The weight correction term preserves input-dependent residual signals, while the bias correction term preserves the residual mean direction. They therefore correspond to different projection pathways of the residual signal. After substituting the preconditioned update into the residual update equation, the optimizer can change the relative strength of the weight correction term and the bias correction term through different preconditioning factors. Therefore, optimizer implicit bias is not only reflected in the final solution or the global training trajectory. It is also reflected in the relative write-in ratio of training signals across different parameter pathways. Overall, this paper moves the analysis of optimizer implicit bias from solution-space geometry to update dynamics during training. It reveals that the relative update allocation between weight and bias-like parameters is an important dynamical mechanism that affects parameter trajectories and generalization behavior.
- Abstract(参考訳): 異なるオプティマイザの更新バイアスは異なるが、これらのバイアスは通常暗黙的である。
既存の研究は主に最終解の幾何学からそのようなバイアスを分析または制御している。
しかしながら、トレーニング中に最適化バイアスがどのように形成されるかは、依然として明確な内部メカニズムを欠いている。
本稿では,情報アロケーション・ダイナミックスの観点から考察する。
これは、オプティマイザの暗黙バイアスを、ウェイトライクとバイアスライクなパラメータパス間のトレーニング信号の相対的な割り当てとして解釈する。
この割り当ては、連続プレコンディショニング指数 \(p\) によって記述し、調整することができる。
このメカニズムを特徴づけるために、我々はまず、最小線形モデルにおいて、同じ残留信号に対する重みとバイアスの更新寄与を分析する。
重み補正項は入力依存残差信号を保持し、バイアス補正項は残差平均方向を保存する。
したがって、これらは残留信号の異なる投射経路に対応する。
予備条件更新を残留更新方程式に置換した後、オプティマイザは、異なる事前条件因子を介して重み補正項とバイアス補正項の相対強度を変更することができる。
したがって、オプティマイザの暗黙バイアスは最終解や大域的な訓練軌道にのみ反映されるわけではない。
また、異なるパラメータ経路にわたるトレーニング信号の相対的な書き込み比にも反映される。
全体として、本論文は、最適化の暗黙バイアスの分析を、学習中の力学を更新するために、解空間幾何学から移行する。
重みと偏りのようなパラメータ間の相対的な更新割り当ては、パラメータの軌跡や一般化挙動に影響を与える重要な動的メカニズムであることが明らかになった。
関連論文リスト
- Compute-Optimal Pretrain--Fine-tune in Ridge Gradient Descent [18.338094508559468]
一定のトレーニング予算の下では、上流目標の改善に費やされた計算は、下流適応に利用可能な計算を減らす。
我々は,この割り当てを,固定された全最適化予算を持つ2段階のプレトレイン・ファインチューン手順の下で計算分割問題とみなした。
以上の結果から,事前学習方向が微調整予測にどのように影響するか,下流データ幾何による微調整シフトがどのように影響するかが示唆された。
論文 参考訳(メタデータ) (2026-09-14T19:23:59Z) - Gradient-Flow Optimization as Dynamic Random-Effects Inference: Testing and Early Stopping with Applications to Deep Learning [16.158545640309438]
我々は勾配流学習のための統計的推論フレームワークを開発した。
トレーニング時間は、分散が再配置される方法を決定する分散成分パラメータになる。
固定勾配系における深層学習モデルは、理論の現代AIインスタンス化を提供する。
論文 参考訳(メタデータ) (2026-05-27T05:32:24Z) - Aligning Network Equivariance with Data Symmetry: A Theoretical Framework and Adaptive Approach for Image Restoration [71.51826063983434]
画像復元は本質的に逆問題である。
非厳密対称性を制約として、復元逆問題を定式化する。
最適復元演算子の等値誤差はデータ対称性誤差と離散化メッシュサイズによって厳密に制限されていることを示す。
論文 参考訳(メタデータ) (2026-05-13T16:22:19Z) - Symmetry in the Wild: The Role of Equivariance in Neural Fluid Surrogates [1.5465701096936584]
ニューラルサロゲートは計算流体力学(CFD)シミュレーションのオーダー・オブ・マグニチュード・アクセラレーションを可能にする。
群同変アーキテクチャはそのようなバイアスを導入するための原則化された方法であるが、学習問題自体が対称性を破るときに有害となることがある。
本稿では,拡張性と対称性の保存を両立させるニューラルネットワークであるAnchored-Branched Geometric Algebra Transformer (AB-GATr)を紹介する。
論文 参考訳(メタデータ) (2026-05-12T10:47:33Z) - Curvature-Guided LoRA: Steering in the pretrained NTK subspace [60.35296431630704]
本稿では,PEFTを用いて得られた予測器と,出力レベルにおける完全微調整の予測器との整合性を考慮した予測アライメント問題を提案する。
我々は、この目的が自然に、ニュートンのような、曲率ホワイトの勾配に対応する最適な低ランク更新を行う、曲率対応の2階定式化につながることを示した。
この知見に基づいて、局所曲率情報を用いて適応方向を選択し、スケールする曲率誘導LoRA(CG-LoRA)を提案する。
論文 参考訳(メタデータ) (2026-03-31T14:46:39Z) - Refinement Provenance Inference: Detecting LLM-Refined Training Prompts from Model Behavior [58.751981587234916]
本稿では,Refinement Provenance Inference (RPI)監査タスクをRefinement Provenance Inference (RPI)として定式化する。
本稿では,ロジットレベルの信号で教師が強制する可能性機能を融合させるロジットベースのフレームワークであるReProを提案する。
トレーニング中、ReProはシャドウファインチューニングを通じて転送可能な表現を学び、訓練データアクセスなしで、見えない犠牲者の証明を推測するために軽量のリニアヘッドを使用する。
論文 参考訳(メタデータ) (2026-01-05T10:16:41Z) - Adapt, But Don't Forget: Fine-Tuning and Contrastive Routing for Lane Detection under Distribution Shift [3.394257279821418]
データセット間の分散シフトは、微調整中に破滅的な忘れ物を引き起こす可能性がある。
本フレームワークは,分布毎に異なるモデルをトレーニングするよりも,パラメータをはるかに少なくしながら,ほぼ最適F1スコアを実現する。
論文 参考訳(メタデータ) (2025-07-22T18:39:15Z) - Understanding Optimization in Deep Learning with Central Flows [95.5647720254338]
複雑な状態における最適化のダイナミクスを記述できる理論を開発する。
この結果から,ディープラーニングの最適化を推論する上で,中央フローが重要な理論ツールとなる可能性が示唆された。
論文 参考訳(メタデータ) (2024-10-31T17:58:13Z) - Revisiting Essential and Nonessential Settings of Evidential Deep Learning [70.82728812001807]
Evidential Deep Learning (EDL) は不確実性推定の新しい手法である。
本報告では,EDLの簡易かつ効果的な拡張型であるRe-EDLを提案する。
論文 参考訳(メタデータ) (2024-10-01T04:27:07Z) - Rejection via Learning Density Ratios [50.91522897152437]
拒絶による分類は、モデルを予測しないことを許容する学習パラダイムとして現れます。
そこで我々は,事前学習したモデルの性能を最大化する理想的なデータ分布を求める。
私たちのフレームワークは、クリーンでノイズの多いデータセットで実証的にテストされます。
論文 参考訳(メタデータ) (2024-05-29T01:32:17Z) - Understanding Optimal Feature Transfer via a Fine-Grained Bias-Variance Analysis [10.79615566320291]
転送学習パラダイムでは、データ豊富な事前学習段階で有用な表現(または特徴)を学習し、事前訓練された表現を使用して、データスカース下流タスクのモデルパフォーマンスを改善する。
そこで本研究では,下流性能の最適化を目的としたトランスファーラーニングについて検討する。
論文 参考訳(メタデータ) (2024-04-18T19:33:55Z) - Machine learning in and out of equilibrium [58.88325379746631]
我々の研究は、統計物理学から適応したフォッカー・プランク法を用いて、これらの平行線を探索する。
我々は特に、従来のSGDでは平衡が切れている長期的限界におけるシステムの定常状態に焦点を当てる。
本稿では,ミニバッチの置き換えを伴わない新しいランゲヴィンダイナミクス(SGLD)を提案する。
論文 参考訳(メタデータ) (2023-06-06T09:12:49Z) - Robust Implicit Regularization via Weight Normalization [5.37610807422229]
重み正規化は、重みが実質的に大規模であっても持続する頑健なバイアスを可能にすることを示す。
実験により, 暗黙バイアスの収束速度とロバスト性の両方の利得は, 重み正規化を用いて劇的に改善されることが示唆された。
論文 参考訳(メタデータ) (2023-05-09T13:38:55Z) - Implicit Bias of MSE Gradient Optimization in Underparameterized Neural
Networks [0.0]
勾配流による平均二乗誤差の最適化において,関数空間におけるニューラルネットワークのダイナミクスについて検討する。
ニューラルタンジェントカーネル(NTK)により決定された積分作用素$T_Kinfty$の固有関数をネットワークが学習することを示す。
減衰偏差は2乗誤差を最適化する際の力学の単純かつ統一的な視点を与えると結論付けている。
論文 参考訳(メタデータ) (2022-01-12T23:28:41Z) - Relieving Long-tailed Instance Segmentation via Pairwise Class Balance [85.53585498649252]
長い尾のインスタンスセグメンテーションは、クラス間のトレーニングサンプルの極端な不均衡のために難しいタスクである。
尾のついたものに対して、(大多数のサンプルを含む)ヘッドクラスの深刻なバイアスを引き起こす。
そこで本研究では,学習中の予測嗜好を蓄積するために,学習中に更新される混乱行列上に構築された新しいPairwise Class Balance(PCB)手法を提案する。
論文 参考訳(メタデータ) (2022-01-08T07:48:36Z) - Distribution Mismatch Correction for Improved Robustness in Deep Neural
Networks [86.42889611784855]
正規化法は ノイズや入力の腐敗に関して 脆弱性を増大させる
本稿では,各層の活性化分布に適応する非教師なし非パラメトリック分布補正法を提案する。
実験により,提案手法は画像劣化の激しい影響を効果的に低減することを示した。
論文 参考訳(メタデータ) (2021-10-05T11:36:25Z) - Learning Neural Models for Natural Language Processing in the Face of
Distributional Shift [10.990447273771592]
特定のデータセットでひとつのタスクを実行するための強力な神経予測器をトレーニングするNLPのパラダイムが、さまざまなアプリケーションで最先端のパフォーマンスを実現している。
データ分布が定常である、すなわち、トレーニングとテストの時間の両方で、データは固定された分布からサンプリングされる、という仮定に基づいて構築される。
この方法でのトレーニングは、人間が絶えず変化する情報の流れの中で学習し、操作できる方法と矛盾する。
データ分散がモデル寿命の経過とともにシフトすることが期待される実世界のユースケースに不適応である。
論文 参考訳(メタデータ) (2021-09-03T14:29:20Z) - Bayesian analysis of the prevalence bias: learning and predicting from
imbalanced data [10.659348599372944]
本稿では,モデル学習のための理論的および計算的枠組みと,有病率バイアスの存在下での予測について述べる。
原則的なトレーニング損失の代替として,要約曲線から操作点を選択することで,テスト時の手順を補完するものだ。
バックプロパゲーションを用いた(深い)学習の現在のパラダイムにシームレスに統合され、ベイズモデルと自然に結合する。
論文 参考訳(メタデータ) (2021-07-31T14:36:33Z) - KL Guided Domain Adaptation [88.19298405363452]
ドメイン適応は重要な問題であり、現実世界のアプリケーションにしばしば必要である。
ドメイン適応文学における一般的なアプローチは、ソースとターゲットドメインに同じ分布を持つ入力の表現を学ぶことである。
確率的表現ネットワークにより、KL項はミニバッチサンプルにより効率的に推定できることを示す。
論文 参考訳(メタデータ) (2021-06-14T22:24:23Z) - What training reveals about neural network complexity [80.87515604428346]
この研究は、ディープニューラルネットワーク(NN)が学習している関数の複雑さは、トレーニング中にその重みがどれほど速く変化するかによって推定できるという仮説を探求する。
我々の結果は、優れた訓練行動が良い一般化への有用なバイアスとなるという仮説を支持している。
論文 参考訳(メタデータ) (2021-06-08T08:58:00Z) - Why resampling outperforms reweighting for correcting sampling bias with
stochastic gradients [10.860844636412862]
バイアスデータセット上で機械学習モデルをトレーニングするには、バイアスを補うための補正テクニックが必要である。
我々は、目的関数を維持するためにサブグループの比率を再均衡させる2つの一般的な手法、再サンプリングと再重み付けについて検討する。
論文 参考訳(メタデータ) (2020-09-28T16:12:38Z) - When Does Preconditioning Help or Hurt Generalization? [74.25170084614098]
本稿では,第1次および第2次手法のテキスト単純バイアスが一般化特性の比較にどのように影響するかを示す。
本稿では、バイアス分散トレードオフを管理するためのいくつかのアプローチと、GDとNGDを補間する可能性について論じる。
論文 参考訳(メタデータ) (2020-06-18T17:57:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。