論文の概要: Teacher Forcing as Generalized Bayes: Optimization Geometry Mismatch in Switching Surrogates for Chaotic Dynamics
- arxiv url: http://arxiv.org/abs/2604.25904v1
- Date: Tue, 28 Apr 2026 17:50:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.984105
- Title: Teacher Forcing as Generalized Bayes: Optimization Geometry Mismatch in Switching Surrogates for Chaotic Dynamics
- Title(参考訳): 一般ベイズとしての教師の強制:カオスダイナミクスのためのサロゲートスイッチングにおける最適化幾何学ミスマッチ
- Authors: Andre Herz, Daniel Durstewitz, Georgia Koppe,
- Abstract要約: アイデンティティ教師強制(ITF)は,カオス力学系に対する決定論的再帰的サロゲートの安定した訓練を可能にする。
AL-RNNの確率的スイッチング増強における客観的なIFFの曲率と限界率の比較を行った。
- 参考スコア(独自算出の注目度): 13.429086216170552
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Identity teacher forcing (ITF) enables stable training of deterministic recurrent surrogates for chaotic dynamical systems and has been highly effective for dynamical systems reconstruction (DSR) with recurrent neural networks (RNNs), including interpretable almost-linear RNNs (AL-RNNs). However, as an intervention-based prediction loss (and thus a generalized Bayes update), teacher forcing need not match the free-running model's marginal likelihood geometry. We compare the objective-induced curvatures of ITF and marginal likelihood in a probabilistic switching augmentation of AL-RNNs, estimating ambiguity-aware observed information via Louis' identity. In the switching setting studied here, conditioning on a single forced regime path (as ITF does) inflates curvature, while marginal likelihood curvature is reduced by a missing-information correction when multiple switching explanations remain plausible. In Lorenz-63 experiments, windowed evidence fine-tuning improves held-out evidence but can degrade dynamical quantities of interest (QoIs) relative to ITF-pretrained models.
- Abstract(参考訳): アイデンティティ教師強制(ITF)は、カオス力学系に対する決定論的再帰的サロゲートの安定したトレーニングを可能にし、解釈可能なニアニアRNN(AL-RNN)を含むリカレントニューラルネットワーク(RNN)を用いた動的システム再構築(DSR)に非常に効果的である。
しかし、介入に基づく予測損失(従ってベイズのアップデート)として、教師の強制はフリーランニングモデルの余剰確率幾何と一致しない。
我々は, AL-RNNの確率的スイッチング拡張において, ITFの客観的な曲率と限界的可能性を比較し, ルイのアイデンティティによる曖昧性を考慮した観測情報の推定を行った。
ここで研究したスイッチング設定では、複数のスイッチング説明が実証可能な場合、(IFFのように)1つの強制的レジームパスの条件付けは曲率を膨らませる一方、周率曲率を不足情報補正により減少させる。
Lorenz-63実験では、窓付きエビデンスによる微調整により、ホールドアウトのエビデンスが改善されるが、IFFに制約されたモデルと比較して、動的な興味量(QoIs)が低下する可能性がある。
関連論文リスト
- ODELoRA: Training Low-Rank Adaptation by Solving Ordinary Differential Equations [54.886931928255564]
低ランク適応(LoRA)は、深層移動学習においてパラメータ効率の高い微調整法として広く採用されている。
常微分方程式(ODE)の形でLoRA因子行列に対する新しい連続時間最適化ダイナミクスを提案する。
ODELoRAは,問題次元の異なるスケールのディープニューラルネットワークのトレーニングに不可欠な特性である,安定した特徴学習を実現する。
論文 参考訳(メタデータ) (2026-02-07T10:19:36Z) - The Butterfly Effect: Neural Network Training Trajectories Are Highly Sensitive to Initial Conditions [51.68215326304272]
たとえ小さな摂動であっても、同じ訓練軌跡を確実に引き起こすことで、トレーニング時間とともに急速に減少する効果が発散することを示します。
この結果から,ニューラルネットワークのトレーニング安定性,微調整,モデルマージ,モデルアンサンブルの多様性の実践的意味が示唆された。
論文 参考訳(メタデータ) (2025-06-16T08:35:16Z) - Variational Adaptive Noise and Dropout towards Stable Recurrent Neural Networks [6.454374656250522]
本稿では、リカレントニューラルネットワーク(RNN)のための新しい安定学習理論を提案する。
明示的な正規化項を暗黙的な正規化に変換することで、ノイズとドロップアウトを同時に引き出すことができることを示す。
また、RNNの主目的を最適化するために、それぞれのスケールと比率を適切に調整することもできる。
論文 参考訳(メタデータ) (2025-06-02T06:13:22Z) - Certified Neural Approximations of Nonlinear Dynamics [51.01318247729693]
安全クリティカルな文脈では、神経近似の使用は、基礎となるシステムとの密接性に公式な境界を必要とする。
本稿では,認証された一階述語モデルに基づく新しい,適応的で並列化可能な検証手法を提案する。
論文 参考訳(メタデータ) (2025-05-21T13:22:20Z) - Muti-Fidelity Prediction and Uncertainty Quantification with Laplace Neural Operators for Parametric Partial Differential Equations [6.03891813540831]
Laplace Neural Operators (LNOs) は、科学機械学習において有望なアプローチとして登場した。
低忠実度ベースモデルと並列線形/非線形HF補正と動的相互重み付けを組み合わせた多忠実Laplace Neural Operator (MF-LNOs)を提案する。
これにより、LFデータセットとHFデータセットの相関を利用して、興味のある量の正確な推測を行うことができる。
論文 参考訳(メタデータ) (2025-02-01T20:38:50Z) - On the Dynamics Under the Unhinged Loss and Beyond [104.49565602940699]
我々は、閉形式力学を解析するための数学的機会を提供する、簡潔な損失関数であるアンヒンジド・ロスを導入する。
アンヒンジされた損失は、時間変化学習率や特徴正規化など、より実践的なテクニックを検討することができる。
論文 参考訳(メタデータ) (2023-12-13T02:11:07Z) - Efficient and Flexible Neural Network Training through Layer-wise Feedback Propagation [49.44309457870649]
レイヤワイドフィードバックフィードバック(LFP)は、ニューラルネットワークのような予測器のための新しいトレーニング原則である。
LFPはそれぞれの貢献に基づいて個々のニューロンに報酬を分解する。
提案手法は,ネットワークの有用な部分と有害な部分の弱体化を両立させる手法である。
論文 参考訳(メタデータ) (2023-08-23T10:48:28Z) - Identifying Equivalent Training Dynamics [3.793387630509845]
共役および非共役のトレーニングダイナミクスを識別するフレームワークを開発する。
クープマン作用素理論の進歩を利用して、クープマン固有値を比較することで、オンラインミラー降下とオンライン勾配降下の既知同値を正しく同定できることを実証する。
a)浅層ニューラルネットワークと広層ニューラルネットワークの間の非共役トレーニングダイナミクスの同定、(b)畳み込みニューラルネットワークにおけるトレーニングダイナミクスの初期段階の特徴付け、(c)グルーキングを行わないトランスフォーマーにおける非共役トレーニングダイナミクスの発見。
論文 参考訳(メタデータ) (2023-02-17T22:15:20Z) - Tractable Dendritic RNNs for Reconstructing Nonlinear Dynamical Systems [7.045072177165241]
線形スプラインベース展開により、片方向線形リカレントニューラルネットワーク(RNN)を増強する。
このアプローチは単純な PLRNN の理論的に魅力的な性質を全て保持するが、相対的に低次元の任意の非線形力学系を近似する能力は向上する。
論文 参考訳(メタデータ) (2022-07-06T09:43:03Z) - Gradient Starvation: A Learning Proclivity in Neural Networks [97.02382916372594]
グラディエント・スターベーションは、タスクに関連する機能のサブセットのみをキャプチャすることで、クロスエントロピー損失を最小化するときに発生する。
この研究は、ニューラルネットワークにおけるそのような特徴不均衡の出現に関する理論的説明を提供する。
論文 参考訳(メタデータ) (2020-11-18T18:52:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。