論文の概要: Efficient Long-Horizon Learning for Learned Optimization
- arxiv url: http://arxiv.org/abs/2607.06772v2
- Date: Thu, 09 Jul 2026 04:08:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.269499
- Title: Efficient Long-Horizon Learning for Learned Optimization
- Title(参考訳): 学習最適化のための効率的な長軸学習
- Abstract要約: 本稿では,効率的なメタトレーニングアルゴリズムであるELO学習を提案する。
ELOは冗長なメタトレーニング計算を長い失敗に再配置し、効率的な長距離学習を実現する。
すべてのELOベースラインは、メタトレーニングに7 H100 GPU-hoursを必要としない。
- 参考スコア(独自算出の注目度): 28.899550384307545
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Learned optimization aims to improve upon hand-designed optimizers (e.g., Adam and Muon) by meta-learning small neural network optimizers over a distribution of tasks. While recent work has greatly advanced the architectural design and inductive biases of learned optimizers (LOs), current meta-training approaches still suffer from two main difficulties: (1) they cannot efficiently scale meta-training to long-horizon inner problems and (2) they often fail to compete with strong hand-designed optimizers. To address these limitations, we propose Efficient Long-hOrizon (ELO) learning, an efficient meta-training algorithm that (1) reallocates redundant meta-training compute to longer failure regimes, achieving efficient long-horizon learning, and (2) enforces decoupled progressive expert supervision, providing stable meta-learning signals that additionally improve the generalization of LOs. Our empirical study evaluates ELO for meta-training both element-wise and matrix-based LOs. Across downstream language modeling (GPT-2-124M/350M on FineWeb) and image classification (ViT-B/16, ResNet-50 on ImageNet-1K) tasks, ELO substantially improves the long-unroll performance and out-of-distribution generalization of the base LOs. In particular, ELO-Celo2 consistently outperforms well-tuned AdamW across all evaluated tasks, while remaining competitive with Muon on language modeling. \textit{Notably, all ELO baselines require less than 7 H100 GPU-hours for meta-training.}
- Abstract(参考訳): 学習された最適化は、タスクの分散よりも小さなニューラルネットワークオプティマイザをメタ学習することで、手設計のオプティマイザ(AdamやMuonなど)を改善することを目的としている。
最近の研究は、学習オプティマイザ(LO)のアーキテクチャ設計と帰納的バイアスを大幅に改善しているが、現在のメタトレーニングアプローチは、(1)メタトレーニングを長期の内的問題に効率的にスケールできないこと、(2)強力なハンドデザインオプティマイザと競合することができないこと、の2つの大きな困難に悩まされている。
これらの制約に対処するために,1)冗長なメタトレーニング計算を長い障害状態に再配置し,効率的なロングホライズン学習を実現し,(2)非結合なプログレッシブな専門家監督を強制し,LOの一般化をさらに向上する安定したメタ学習信号を提供する,効率的なメタトレーニングアルゴリズムであるELO(Efficient Long-hOrizon)学習を提案する。
実験により,ELOは要素レベルでも行列ベースでもメタトレーニング可能であることがわかった。
下流言語モデリング (GPT-2-124M/350M on FineWeb) および画像分類 (ViT-B/16, ResNet-50 on ImageNet-1K) タスクを通して、ELOはベースLOの長期性能とアウト・オブ・ディストリビューションの一般化を大幅に改善する。
特に、ELO-Celo2は、言語モデリングにおけるMuonとの競争を保ちながら、評価されたすべてのタスクで、よく調整されたAdamWを一貫して上回っている。
ただし、すべてのELOベースラインは、メタトレーニングに7 H100 GPU-hours未満である。
※
関連論文リスト
- Celo2: Towards Learned Optimization Free Lunch [18.43722869300503]
単純な正規化アーキテクチャの構築とメタトレーニングの強化により、パフォーマンスの高い汎用的な学習更新ルールをメタトレーニングすることは可能になった。
我々の学習した更新規則は、そのメタトレーニング分布よりも6桁大きい10億規模の事前訓練タスク(GPT-3 XL 1.3B 1.3)に安定してスケールする。
論文 参考訳(メタデータ) (2026-02-22T12:15:43Z) - MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization [103.74675519953898]
ロングチェーンのリフレクティブ推論は、複雑な現実世界の問題を解決するための前提条件である。
我々は42の難解な合成タスクの1,260のサンプルからなるベンチマークを構築した。
トレーニング後のデータを生成し、そのようなデータを活用するための学習パラダイムを探索する。
論文 参考訳(メタデータ) (2025-10-09T17:53:58Z) - Iterative Pretraining Framework for Interatomic Potentials [46.53683458224917]
MLIPモデルの予測性能を向上させるために, 原子間ポテンシャルの反復事前学習(IPIP)を提案する。
IPIPは、反復訓練が最適な局所最小値に収束するのを防ぐための、忘れるメカニズムを組み込んでいる。
汎用力場と比較すると,Mo-S-Oシステムでは予測誤差が80%以上減少し,最大4倍の高速化を実現している。
論文 参考訳(メタデータ) (2025-07-27T03:59:41Z) - BLUR: A Bi-Level Optimization Approach for LLM Unlearning [100.90394814817965]
未学習問題の階層構造をモデル化することが重要であると論じる。
本稿では,より優れた性能を実現する新しいアルゴリズムであるBi-Level UnleaRning(textttBLUR)を提案する。
論文 参考訳(メタデータ) (2025-06-09T19:23:05Z) - Celo: Training Versatile Learned Optimizers on a Compute Diet [20.69804303768643]
学習アーキテクチャやメタトレーニングの手順における重要な要素は、強力なメタ一般化につながる可能性がある。
そこで本稿では,評価課題のセットに基づいて,大規模システムの定量的性能を確実に評価するための評価指標を提案する。
提案手法であるCeloは,学習者のメタ一般化性能向上に大きく貢献する。
論文 参考訳(メタデータ) (2025-01-22T06:10:27Z) - $μ$LO: Compute-Efficient Meta-Generalization of Learned Optimizers [31.59984079626214]
学習者(LO)は、ニューラルネットワークのウォールタイムトレーニング時間を著しく短縮する可能性がある。
彼らはメタトレーニングで見られるものよりも広いネットワークをトレーニングする場合、目に見えないタスクを最適化するのに苦労する。
我々は,$mu$-parameterized LOsのための簡単なメタトレーニングレシピを提案する。
論文 参考訳(メタデータ) (2024-05-31T19:28:47Z) - BiERL: A Meta Evolutionary Reinforcement Learning Framework via Bilevel
Optimization [34.24884427152513]
双レベル最適化(BiERL)による一般的なメタERLフレームワークを提案する。
我々は、内部レベルの進化した経験を情報的人口表現に組み込むエレガントなメタレベルアーキテクチャを設計する。
我々は MuJoCo と Box2D タスクの広範な実験を行い、一般的なフレームワークとして BiERL が様々なベースラインを上回り、ERL アルゴリズムの多様性の学習性能を一貫して向上することを検証する。
論文 参考訳(メタデータ) (2023-08-01T09:31:51Z) - Learning to Generalize Provably in Learning to Optimize [185.71326306329678]
最適化学習(L2O)は、データ駆動アプローチによる最適化設計を自動化することで、人気が高まっている。
現在のL2O法は、少なくとも2回は一般化性能の低下に悩まされることが多い。
我々はこの2つのメトリクスを平坦性を考慮した正規化器としてL2Oフレームワークに組み込むことを提案する。
論文 参考訳(メタデータ) (2023-02-22T01:17:31Z) - Learning to Optimize for Reinforcement Learning [58.01132862590378]
強化学習(Reinforcement Learning, RL)は、教師付き学習とは本質的に異なり、実際、これらの学習は単純なRLタスクでもうまく機能しない。
エージェント勾配分布は非独立で同一分布であり、非効率なメタトレーニングをもたらす。
おもちゃのタスクでしか訓練されていないが、我々の学習はブラックスの目に見えない複雑なタスクを一般化できることを示した。
論文 参考訳(メタデータ) (2023-02-03T00:11:02Z) - Meta-Learning with Self-Improving Momentum Target [72.98879709228981]
メタラーナーの性能を向上させるために,SiMT(Self-improving Momentum Target)を提案する。
SiMTはメタラーナーの時間アンサンブルから適応してターゲットモデルを生成する。
我々は、SiMTが幅広いメタ学習手法と組み合わせることで、大きなパフォーマンス向上をもたらすことを示す。
論文 参考訳(メタデータ) (2022-10-11T06:45:15Z) - Symbolic Learning to Optimize: Towards Interpretability and Scalability [113.23813868412954]
近年のL2O(Learning to Optimize)研究は,複雑なタスクに対する最適化手順の自動化と高速化に期待できる道のりを示唆している。
既存のL2Oモデルは、ニューラルネットワークによる最適化ルールをパラメータ化し、メタトレーニングを通じてそれらの数値ルールを学ぶ。
本稿では,L2Oの総合的な記号表現と解析の枠組みを確立する。
そこで本稿では,大規模問題にメタトレーニングを施す軽量なL2Oモデルを提案する。
論文 参考訳(メタデータ) (2022-03-13T06:04:25Z) - Meta-Learning with Neural Tangent Kernels [58.06951624702086]
メタモデルのニューラルタンジェントカーネル(NTK)によって誘導される再生カーネルヒルベルト空間(RKHS)における最初のメタラーニングパラダイムを提案する。
このパラダイムでは,MAMLフレームワークのように,最適な反復内ループ適応を必要としない2つのメタ学習アルゴリズムを導入する。
本研究の目的は,1) 適応をRKHSの高速適応正則化器に置き換えること,2) NTK理論に基づいて解析的に適応を解くことである。
論文 参考訳(メタデータ) (2021-02-07T20:53:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。