論文の概要: Backpropagated Output Momentum: Relocating Optimizer History from Parameters to Task Space
- arxiv url: http://arxiv.org/abs/2609.36738v1
- Date: Tue, 29 Sep 2026 05:11:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.203446
- Title: Backpropagated Output Momentum: Relocating Optimizer History from Parameters to Task Space
- Title(参考訳): バックプロパゲーション出力モーメント:パラメータからタスク空間への最適化履歴の移動
- Abstract要約: バックプロパゲーション・アウトプット・モメンタム(BOM)について紹介する。
BOMはモデル出力にコンパクトな移動平均予測誤差を格納し、その履歴を現在のネットワークを通じて各ステップで再生成する。
言語と視覚の微調整における平均バリデーション性能を、最初の5タスク比較で1.42ポイント改善する。
- 参考スコア(独自算出の注目度): 2.264254347332081
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Optimizer momentum is usually stored as a parameter-sized moving average of past gradients, which makes history costly and fixes each past signal in the coordinates in which it was computed. We introduce Backpropagated Output Momentum (BOM), which instead stores a compact moving average of prediction errors at the model output and reprojects that history through the current network at every step. A batch-level analysis characterizes the information retained and omitted by this relocation, while the implementation preserves the current supervised gradient and can replace the first-moment component of several adaptive optimizers. As a plug-in for momentum-based optimizers, including ones that already compress their state, BOM reduces parameter-shaped optimizer state by 49.7-99.8% in three compositions and, averaged over three language backbones, paired step time by 4.0%. It also improves mean validation performance across language and vision fine-tuning, by 1.42 points in the primary five-task comparison. Language and vision pretraining studies, together with matched mechanism controls, further test the construction across output spaces and model scales.
- Abstract(参考訳): 最適化器の運動量は、通常、過去の勾配のパラメータサイズの移動平均として格納される。
本稿では,モデル出力における予測誤差のコンパクトな移動平均を格納し,その履歴を現在のネットワークを通じて各ステップで再生成するBackpropagated Output Momentum(BOM)を紹介する。
バッチレベルの分析では、このリロケーションによって保持および省略された情報を特徴付ける一方、実装は現在の教師付き勾配を保ち、複数の適応オプティマイザの第1モーメントコンポーネントを置き換えることができる。
運動量ベースのオプティマイザ用のプラグインとして、既に状態が圧縮されているものを含め、BOMはパラメータ型のオプティマイザ状態を3つのコンポジションで49.7-99.8%削減し、3つの言語バックボーンで平均してステップタイムを4.0%短縮した。
また、言語と視覚の微調整における平均バリデーション性能を、最初の5タスク比較で1.42ポイント改善する。
言語と視覚の事前学習は、一致したメカニズム制御とともに、出力空間とモデルスケールをまたいだ構築を更にテストする。
関連論文リスト
- Blog: Survey of Optimizers [0.0]
サーベイは、時間的推定、更新幾何、地平線管理、表現とシステムという4つの軸に沿った最近のおよび訓練最適化手法を編成する。
これは、ムオンのスペクトル正規化、シャンプーとSOAPの歴史的行列統計、適応的およびハイブリッド行列法、メモリ効率、スケジュールなしトレーニング、小さなバッチ補正、量子化された状態とを結びつける。
論文 参考訳(メタデータ) (2026-08-28T17:35:11Z) - Learn2Splat: Extending the Horizon of Learned 3DGS Optimization [53.913063313338874]
補助機構を使わずに地平線上における劣化を回避できる3DGSの学習手法を提案する。
その結果、長い地平線上で安定しながら、新しいビュークオリティを向上し、ゼロショットの一般化により、見当たらないリコンストラクション設定を実現した。
論文 参考訳(メタデータ) (2026-05-15T09:21:29Z) - LeapTS: Rethinking Time Series Forecasting as Adaptive Multi-Horizon Scheduling [74.94985663101906]
本稿では,予測地平線上での動的スケジューリングプロセスとして時系列予測を再構成する新しいフレームワーク LeapTSを提案する。
LeapTSは、Transformerベースのモデルよりも2.6$times$から5.3$times$推論スピードアップを実現しつつ、全体的な予測性能を少なくとも7.4%向上させる。
論文 参考訳(メタデータ) (2026-05-11T09:54:02Z) - Diff3R: Feed-forward 3D Gaussian Splatting with Uncertainty-aware Differentiable Optimization [76.38917994186733]
Diff3Rはフィードフォワード予測とテストタイム最適化をブリッジする新しいフレームワークである。
フィードフォワード3DGSアーキテクチャにシームレスに統合でき、ポーズギヴン法とポーズフリー法の両方に対応できることを示す。
論文 参考訳(メタデータ) (2026-04-01T15:40:20Z) - QuickSplat: Fast 3D Surface Reconstruction via Learned Gaussian Initialization [69.50126552763157]
表面再構成はコンピュータビジョンとグラフィックスの基本であり、3Dモデリング、混合現実、ロボット工学などの応用を可能にする。
レンダリングに基づく既存のアプローチは有望な結果を得るが、シーンごとに最適化されるため、テクスチャレスな領域をモデル化するのに苦労する可能性がある。
大規模屋内シーンの2次元ガウススプラッティング最適化のための高密度初期化を生成するために,データ駆動の先行処理を学習するQuickSplatを紹介する。
論文 参考訳(メタデータ) (2025-05-08T18:43:26Z) - Mitigating Trade-off: Stream and Query-guided Aggregation for Efficient and Effective 3D Occupancy Prediction [12.064509280163502]
3Dの占有率予測は、自動運転の重要な認識課題として浮上している。
近年の研究では、過去の観測から得られた情報の統合に焦点が当てられ、予測精度が向上している。
本稿では,過去の情報をストリームベースで集約するフレームワークStreamOccを提案する。
Occ3D-nusデータセットの実験によると、StreamOccはリアルタイム設定で最先端のパフォーマンスを実現し、メモリ使用量を従来の方法に比べて50%以上削減している。
論文 参考訳(メタデータ) (2025-03-28T02:05:53Z) - SubTrack++ : Gradient Subspace Tracking for Scalable LLM Training [4.804685266333252]
大規模言語モデル(LLM)のトレーニングは、大量のパラメータと状態のオーバーヘッドのため、リソース集約性が高い。
本稿では,Grassmann的部分空間追跡とプロジェクション対応勾配を併用したSubTrack++を提案する。
提案手法はグラスマン幾何学を利用してSOTAの収束を実証し,既存のSOTA法と比較して,事前学習壁時間を最大65%,微調整時間を36%削減する。
論文 参考訳(メタデータ) (2025-02-03T18:13:52Z) - OPUS: Occupancy Prediction Using a Sparse Set [64.60854562502523]
学習可能なクエリの集合を用いて、占有された場所とクラスを同時に予測するフレームワークを提案する。
OPUSには、モデルパフォーマンスを高めるための非自明な戦略が組み込まれている。
最も軽量なモデルではOcc3D-nuScenesデータセットの2倍 FPS に優れたRayIoUが得られる一方、最も重いモデルは6.1 RayIoUを上回ります。
論文 参考訳(メタデータ) (2024-09-14T07:44:22Z) - Towards physically consistent data-driven weather forecasting:
Integrating data assimilation with equivariance-preserving deep spatial
transformers [2.7998963147546148]
一般的なデータ駆動天気予報モデルと統合する3つのコンポーネントを提案する。
これらのコンポーネントは,1) 等価性を維持するためにU-NETの潜伏空間に付加された深部空間トランスフォーマー,2) ノイズ観測を取り込み,次の予測に対する初期条件を改善するデータ同化アルゴリズム,3) 複数段階のアルゴリズムにより,短時間で予測の精度が向上する。
論文 参考訳(メタデータ) (2021-03-16T23:15:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。