論文の概要: Delayed Optimizer-State Transport Shapes Short-Horizon Training Decisions
- arxiv url: http://arxiv.org/abs/2608.24593v1
- Date: Tue, 25 Aug 2026 14:18:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:35.024558
- Title: Delayed Optimizer-State Transport Shapes Short-Horizon Training Decisions
- Title(参考訳): 遅延最適化器-状態輸送形状と短距離訓練決定
- Abstract要約: 遅延輸送が短期的決定を変えるのに十分な大きさであるかどうかを検討する。
提案手法では,全モデル最適化状態から8ステップのAdamWを区別する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adaptive optimizers retain gradient history in moment variables, allowing a local change in loss weighting to alter later updates. We examine whether this delayed transport is large enough to change prospective short-horizon decisions. On committed future-minibatch sequences, we differentiate eight-step AdamW trajectories through the complete model--optimizer state and select exposure-matched Math--Code loss schedules before independent evaluation. Across 12 unused 0.3M Transformer histories, full transport lowers token-disjoint loss relative to an optimizer-aware immediate derivative in 10/12 histories (mean benefit $4.71\times10^{-4}$; exact one-sided sign test, $p=0.0193$). The two controllers act equally often but select different schedules in 60/96 windows. Crossed checkpoint--future-path tests attribute this reordering to the interaction between optimizer state and near-future data, while an independent Ising--CNN experiment shows that deleting moment-state transport destroys accurate response prediction. Full-transport scores also concentrate exact-rollout winners in larger candidate libraries, focusing finite-amplitude evaluation on a shortlist. On these committed short paths, optimizer memory and near-future data order are therefore actionable components of the training state, providing a mechanism-based criterion for when finite-horizon rather than one-step intervention is required.
- Abstract(参考訳): アダプティブ・オプティマイザはモーメント変数の勾配履歴を保持し、損失重み付けの局所的な変化を後続の更新を変更することができる。
この遅延輸送が、短期的決定を変えるのに十分な大きさであるかどうかを検討する。
提案手法では,完全モデル最適化状態から8段階のAdamWトラジェクトリを区別し,個別評価の前に露出マッチングしたMath-Code損失スケジュールを選択する。
12個の未使用の0.3Mトランスフォーマーヒストリーのうち、フルトランスポートは10/12ヒストリーのオプティマイザ対応の即時微分に対してトークン非結合損失を下げる(利点は4.71\times10^{-4}$、正確な片面符号テスト、$p=0.0193$)。
2つのコントローラーは同様に動作するが、60/96ウィンドウで異なるスケジュールを選択する。
クロスチェックポイント-フューチャーパステストは、これはオプティマイザ状態とニアフューチャーデータとの相互作用によるものであり、独立したIsing-CNN実験は、モーメントステートトランスポートの削除が正確な応答予測を損なうことを示している。
フルトランスポートスコアは、より大きな候補ライブラリにおける正確なロールアウトの勝者に集中し、ショートリストに対する有限振幅評価に集中する。
これらのコミットされたショートパスでは、オプティマイザメモリとニアフューチャーデータオーダーがトレーニング状態の実行可能なコンポーネントであり、1ステップの介入ではなく、有限ホライゾンが必要な場合のメカニズムベースの基準を提供する。
関連論文リスト
- Finite-Horizon Input-Output Dynamics of Minibatch Perturbations in AdamW [8.328108675535562]
ミニバッチは、AdamWが過去の情報をその州に保存しているため、更新以上のトレーニングに影響を与える可能性がある。
本研究では、この遅延効果を1つの勾配更新でのみ異なるペア軌道を用いて検討し、その後のトレーニングシーケンスを共有する。
論文 参考訳(メタデータ) (2026-08-20T08:07:01Z) - SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models [0.0]
ヘテロジニアスな感覚予測,セマンティクス,画像テキストバインディング,動作条件付きダイナミクスを共同で訓練した1.45MスパーススパイキングモデルであるSpikeWorldを紹介する。
共同最適化により、アクション次世代MSEは17.10%改善され、マルチモーダル予測、セマンティック精度、画像テキスト検索が改善された。
論文 参考訳(メタデータ) (2026-08-07T18:57:06Z) - Learning Not to Optimize: Physics-Informed Action-Space Reshaping for Intent-Based Network Control [50.46501177871741]
LNOQRD は小物候補を75.9% で削減し、90.8% でニアオラクルのカバレッジを維持している。
実験の結果、LNOQRDは実用性と意図の満足度が最も高く、かつ、法律違反が最低で、世代後レイテンシが低いことがわかった。
論文 参考訳(メタデータ) (2026-08-02T00:27:01Z) - Adapt Only When It Pays: Budgeted Decision-Loss Priority for Delayed Online Time-Series Adaptation [0.0]
封印された遅延キュー、正確な予算会計、監査可能な更新テレメトリを備えた残差適応フレームワークであるADOWIPを紹介する。
そのメインスケジューラは、フィードバックが公表された後にのみ更新される、観察された決定余分な優先度ゲートである。
コンベックス線形受け入れ更新サブプロブレムに対して, ハード予算の実現性, 提案したOGD後悔, 安定性, 条件付き有限サンプルゲート選択文を検証した。
論文 参考訳(メタデータ) (2026-06-23T18:22:22Z) - The Long-Term Effects of Data Selection in LLM Fine-Tuning [1.9054869116450563]
短時間のセレクタは、後続の学習を遅くし、忘れることの増大を抑えながら、ランク逆転を示すことができることを示す。
本稿では,この動作をエフェミクティック選択として形式化し,その原因を簡易に解析し,LHAS(Long-Horizon Aware Selection)の目的を提案する。
この研究は、データ選択は、局所的なデータ効率のメカニズムとしてだけでなく、モデルの学習軌道を形成する訓練の介入として評価されるべきである、と論じている。
論文 参考訳(メタデータ) (2026-05-28T20:12:45Z) - IGT-OMD: Implicit Gradient Transport for Decision-Focused Learning under Delayed Feedback [0.0]
意思決定にフォーカスした学習トレインは、下流の意思決定損失に対してエンドツーエンドでモデルをモデル化するが、オンライン設定は遅延したフィードバックに悩まされる。
遅延下での2レベル最適化に特有の障害モードであるエンフスタレンス増幅を同定する。
ブラックボックス遅延勾配が内部解法近似誤差から既約後悔コストを生じることを証明した。
論文 参考訳(メタデータ) (2026-05-12T19:43:49Z) - Learning Shortest Paths When Data is Scarce [3.3012620893449465]
本研究では,プランナーが豊富な合成サンプルにアクセス可能な最短経路問題,限られた実世界の観測,およびリンク間の振る舞いの類似性を推定するエッジ類似性について検討する。
シミュレーションと現実の相違を、類似性グラフ上で滑らかに変化するエッジ固有のバイアスとしてモデル化し、ラプラシアン正規化最小二乗を用いて推定する。
初期実データを持たないコールドスタート設定のために、所定の精度が満たされるまでエッジを適応的に選択するバイアス対応能動学習アルゴリズムを開発した。
論文 参考訳(メタデータ) (2026-01-07T06:19:04Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Truncating Trajectories in Monte Carlo Policy Evaluation: an Adaptive Approach [51.76826149868971]
モンテカルロシミュレーションによる政策評価は多くのMC強化学習(RL)アルゴリズムの中核にある。
本研究では,異なる長さの軌跡を用いた回帰推定器の平均二乗誤差のサロゲートとして品質指標を提案する。
本稿では,Robust and Iterative Data Collection Strategy Optimization (RIDO) という適応アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-17T11:47:56Z) - Non-stationary Delayed Online Convex Optimization: From Full-information to Bandit Setting [71.82716109461967]
遅延勾配が利用できる全情報ケースに対して Mild-OGD というアルゴリズムを提案する。
ミルド-OGDのダイナミックな後悔は、順番の仮定の下で$O(sqrtbardT(P_T+1))$で自動的に束縛されることを示す。
Mild-OGDのバンディット版も開発し,損失値の遅れのみを考慮に入れた,より困難なケースについて検討した。
論文 参考訳(メタデータ) (2023-05-20T07:54:07Z) - Stochastic Trajectory Prediction via Motion Indeterminacy Diffusion [88.45326906116165]
運動不確定性拡散(MID)の逆過程として軌道予測タスクを定式化する新しい枠組みを提案する。
我々は,履歴行動情報と社会的相互作用を状態埋め込みとしてエンコードし,トランジトリの時間的依存性を捉えるためにトランスフォーマーに基づく拡散モデルを考案する。
スタンフォード・ドローンやETH/UCYデータセットなど,人間の軌道予測ベンチマーク実験により,本手法の優位性を実証した。
論文 参考訳(メタデータ) (2022-03-25T16:59:08Z) - Bandit Linear Optimization for Sequential Decision Making and
Extensive-Form Games [102.23975166536326]
tree-form sequential decision making (tfsdm) は、エージェントと潜在的に敵対的な環境の間のツリー形式の相互作用をモデル化することで、古典的なワンショット意思決定を拡張する。
これは、各プレイヤーが幅広い形式のゲームで直面するオンライン意思決定問題、およびマルコフ決定プロセス、およびエージェントが観測された履歴を条件とする部分観察可能なマルコフ決定プロセスをキャプチャする。
本稿では, (i) 線形時間損失と (ii) $o(sqrtt)$ cumulative regret の両方を提供する拡張dmのバンディット線形最適化問題に対する最初のアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-08T05:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。