論文の概要: QAM: Quadratic-Accurate Checkpoint Merging via Sequential Consistency
- arxiv url: http://arxiv.org/abs/2609.35168v1
- Date: Mon, 28 Sep 2026 13:39:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 16:25:54.549665
- Title: QAM: Quadratic-Accurate Checkpoint Merging via Sequential Consistency
- Title(参考訳): QAM: シーケンス整合性による疑似精度チェックポイントマージ
- Abstract要約: 保存されたチェックポイントはトレーニングの軌道に沿って状態を記録しますが、通常、異なるスケジュールで訪問される状態の更新を判断しません。
これらのチェックポイントが、所定の更新強度でシーケンシャル参照のエンドポイントをいかに正確に再構築できるかを検討する。
- 参考スコア(独自算出の注目度): 44.9106079497003
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Saved checkpoints record states along a training trajectory, but generally do not determine the updates at states that would be visited under a different schedule. We study how accurately these checkpoints can reconstruct the endpoint of a sequential reference with prescribed update strengths. Under a common local transition model, two checkpoint-index moment conditions characterize all convex merges that agree with this reference through second order. We then prove an information limit that for nondegenerate profiles, no algorithm using only a fixed-length gradient-descent (GD) history with step size $h$ can achieve $o(h^3)$ endpoint error uniformly over a fixed class of smooth, strongly convex losses. The lower bound follows from two losses with identical GD checkpoint histories but sequential reference endpoints separated by $Ω(h^3)$. \textbf{Quadratic-Accurate Merging} (QAM) achieves a matching uniform $O(h^3)$ endpoint error bound. Its explicit coefficients also define the unique profile-dependent merge that exactly matches the sequential GD reference across all fixed quadratic objectives. Across two public Adam checkpoint trajectories (SmolLM3-3B and OpenEuroLLM-Prelude-9B), three windows and three profiles per model, and 15 tasks, QAM shows mixed results for short windows and broader advantages over \textbf{Warmup-Stable and Merge} (WSM) for longer windows. Matched-moment GSM8K diagnostics further show that local consistency alone does not fully determine downstream scores. These results characterize the reconstruction limits of saved histories, provide a coefficient rule that attains the optimal rate, and assess its practical utility.
- Abstract(参考訳): 保存されたチェックポイントはトレーニングの軌道に沿って状態を記録しますが、通常、異なるスケジュールで訪問される状態の更新を判断しません。
これらのチェックポイントが、所定の更新強度でシーケンシャル参照のエンドポイントをいかに正確に再構築できるかを検討する。
共通局所遷移モデルの下では、2つのチェックポイント-インデックスモーメント条件は、この参照に2階で一致するすべての凸マージを特徴付ける。
そして、非退化プロファイルに対して、ステップサイズが$h$の固定長勾配(GD)履歴のみを用いたアルゴリズムが、滑らかで凸な損失の固定クラスに対して$o(h^3)$エンドポイントエラーを均一に達成できるという情報制限を証明した。
下限は、同一のGDチェックポイント履歴を持つ2つの損失から従うが、シーケンシャル参照エンドポイントは$Ω(h^3)$で分離される。
textbf{Quadratic-Accurate Merging} (QAM) は、一致した$O(h^3)$エンドポイントエラー境界を達成する。
その明示的な係数はまた、固定された二次目的物全体のシーケンシャルなGD参照と正確に一致するユニークなプロファイル依存のマージを定義する。
2つのパブリックなAdamチェックポイントトラジェクトリ(SmolLM3-3BとOpenEuroLLM-Prelude-9B)、3つのウィンドウと3つのプロファイル、1つのモデル、15のタスク、QAMは短いウィンドウに対する混合結果と長いウィンドウに対するtextbf{Warmup-Stable and Merge} (WSM)よりも広い利点を示している。
一致したモーメントGSM8K診断は、局所的な一貫性だけで下流のスコアを完全に決定しないことを示している。
これらの結果は保存された歴史の復元限界を特徴づけ、最適な速度を達成する係数ルールを提供し、その実用性を評価する。
関連論文リスト
- Equivariant Neural Primal-Dual Assignment for Maximum Common Edge Subgraphs [16.0495191098223]
分子類似性探索には多くのグラフ対をマッチングする必要がある。
Equivariant Neural Primal-Dual Assignment (ENPDA)を紹介する。
ENPDAは共有マッチングポリシーを学び、さらなるトレーニングなしに新しいペアに適用する。
論文 参考訳(メタデータ) (2026-09-26T14:19:12Z) - World Models with Predictable Long-Horizon Marginals [6.02574242789382]
固定ガウス参照の復号器を学習することにより,世界モデルの定式化法則を明示する。
制御システムでは、ジョイントトランジションは条件付きアクションチャートを使用して行動占有を維持する。
論文 参考訳(メタデータ) (2026-09-26T14:16:49Z) - The Cost of Adaptivity: Matching Lower Bounds Across Learning Problems [1.0742675209112622]
我々はスライス正規化ミニマックス比を用いてニュアンス適応を定式化する。
また、事前発表された1つのガウスクエリから任意のポストホックインスペクションへ拡張するコストを定義する。
論文 参考訳(メタデータ) (2026-08-09T17:19:11Z) - Sub-Quadratic Bisimulation Metrics via Approximate Nearest Neighbors: Coverage-Augmented Guarantees and Computable Two-Sided Certificates [1.2891210250935148]
我々は,境界遷移をサポートするMPPに対して,証明書を搬送するサブクワッドラティックな方法を提案する。
近似アレスト近傍指数は、正確に制限された演算子によって更新されたペアを選択する。
ローカルインデックスの品質だけでは、グローバルエラーを制御できない。
論文 参考訳(メタデータ) (2026-08-07T03:32:40Z) - Three-Objective Integral R2 Subset Selection: NP-Hardness and Submodular Approximation [0.0]
本稿では3つの目的において積分R2インジケータの問題点を考察する。
任意の固定基底線に対する積分 R2 の改善は単調部分モジュラー集合函数であることを示す。
また, 完全積分 R2 値を部分分割で評価するグリージーな実装も提案する。
論文 参考訳(メタデータ) (2026-06-25T04:25:20Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z) - If You Can't Use Them, Recycle Them: Optimizing Merging at Scale Mitigates Performance Tradeoffs [48.95875673503714]
多くのタスクで訓練された"ジェネラリスト"モデルをマージすることを研究する。
提案アルゴリズムは,各チェックポイントの重みを線形結合で調整し,最適モデルを生成する。
良いマージは、ほとんどすべてのチェックポイントとゼロでない重みを含む傾向があり、一見して悪い初期チェックポイントでさえ、良い最終マージに寄与することを示している。
論文 参考訳(メタデータ) (2024-12-05T13:12:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。