論文の概要: Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
- arxiv url: http://arxiv.org/abs/2606.29082v1
- Date: Sat, 27 Jun 2026 20:48:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.780803
- Title: Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks
- Title(参考訳): Evolution Fine-Tuning: 371の最適化タスクの発見を学ぶ
- Abstract要約: 進化的微調整(Evolution Fine-Tuning, EFT)は、大規模言語モデルにタスク間でのソリューションの進化を教える中間訓練パラダイムである。
10のドメインと371の最適化タスクにまたがる156KトラジェクトリデータセットであるFinch Collectionを構築した。
私たちのモデルは、22のタスクで平均10.22%のベースモデルを上回っています。
- 参考スコア(独自算出の注目度): 36.58007538375195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Would experience designing faster GPU kernels also help close in on a long-standing open mathematical conjecture? Large Language Models (LLMs) integrated into evolutionary search have recently produced state-of-the-art solutions on optimization tasks, including open mathematical conjectures, GPU kernel design, scientific law discovery, and combinatorial puzzles. To achieve this, prior work applied search scaffolds to one target task at a time, so every new problem is approached from scratch and the experience accumulated during search is discarded once the model finishes its attempt. This leaves the capability of iteratively evolving a solution (e.g., knowing which part to mutate and how, deciding when to backtrack) entirely in the scaffold rather than in the model itself. Whether the model itself could acquire this capability and reuse it across different tasks has been largely unexamined. To address this, we introduce Evolution Fine-Tuning (EFT), a mid-training paradigm that teaches LLMs to evolve solutions across tasks by converting evolutionary search trajectories into supervision. We construct Finch Collection, a 156K-trajectory dataset spanning 10 domains and 371 optimization tasks, and fine-tune open-source LLMs from 2B to 9B parameters. Empirically, EFT confers cross-task generalization: across 22 held-out tasks, our models surpass their base counterparts by 10.22% on average. Furthermore, when paired with test-time RL, our model matches state-of-the-art performance on two circle-packing tasks and outperforms its base-model counterpart on the Erdős minimum-overlap problem. EFT thus serves as a "practice phase" for general-purpose discovery agents that do not solve new problems from scratch.
- Abstract(参考訳): より高速なGPUカーネルを設計した経験は、長年のオープンな数学的推測にも役立ちますか?
進化的探索に組み込まれた大規模言語モデル(LLM)は、最近、オープンな数学的予想、GPUカーネル設計、科学的法則発見、組合せパズルなど、最適化タスクに関する最先端のソリューションを生み出した。
これを実現するために、事前の作業では、1つの目標タスクに検索スキャフォールドを一度に適用するため、新しい問題はすべてスクラッチからアプローチされ、モデルが試行を完了すると、検索中に蓄積された経験は破棄される。
これにより、ソリューションを反復的に進化させる能力(例えば、どの部分を変更すべきかを知っていて、いつバックトラックするかを判断する)は、モデル自体ではなく、完全に足場に残されます。
モデル自身がこの能力を獲得し、異なるタスクで再利用できるかどうかは、ほとんど検討されていない。
これを解決するために、進化的探索軌跡を監督に変換することで、LLMにタスク間でのソリューションの進化を教える中級訓練パラダイムであるEvolution Fine-Tuning(EFT)を紹介した。
10のドメインと371の最適化タスクにまたがる156KトラジェクトリデータセットであるFinch Collectionを構築し、2Bから9BパラメータのオープンソースLLMを微調整する。
実証的に、EFTはクロスタスクの一般化を提唱しており、22のタスクにおいて、我々のモデルはベースタスクを平均10.22%上回っている。
さらに,テスト時間RLと組み合わせた場合,本モデルは2つの円包装タスクにおける最先端性能と一致し,エルデシュの最小オーバーラップ問題におけるベースモデルよりも優れる。
EFTは、新しい問題をゼロから解決しない汎用発見エージェントの「実践段階」として機能する。
関連論文リスト
- Model Merging: Foundations and Algorithms [4.528573838858818]
この論文はモデルマージを研究し、独立に訓練されたニューラルネットワークを直接重み空間で組み合わせる。
C$2$M$3$は、Frank-Wolfe最適化に基づくサイクル一貫性のマージアルゴリズムである。
マルチタスク設定では、まずタスクベクトルを近似勾配として理論的に記述する。
次に,TSV幾何を用いた入力適応型ルーティング手法であるMASSを提案し,推定時にタスク関連部分空間を選択する。
論文 参考訳(メタデータ) (2026-05-02T19:06:35Z) - ThetaEvolve: Test-time Learning on Open Problems [110.5756538358217]
In-context LearningとReinforcement Learning(RL)の両方をテスト時に効率的にスケールするために、AlphaEvolveを単純化し拡張するオープンソースのフレームワークであるThetaEvolveを紹介します。
テスト時にRLを使用するThetaEvolveは、推論のみのベースラインよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-11-28T18:58:14Z) - MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization [103.74675519953898]
ロングチェーンのリフレクティブ推論は、複雑な現実世界の問題を解決するための前提条件である。
我々は42の難解な合成タスクの1,260のサンプルからなるベンチマークを構築した。
トレーニング後のデータを生成し、そのようなデータを活用するための学習パラダイムを探索する。
論文 参考訳(メタデータ) (2025-10-09T17:53:58Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z) - Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI [22.148355836548365]
多くのプログラム合成タスクは、最先端の言語モデルでさえ単一の試みで解決するには難しすぎることを証明している。
本稿では,言語モデルを自己改善進化ループに統合することで,プログラム合成を学ぶ方法であるSOARを提案する。
論文 参考訳(メタデータ) (2025-07-10T15:42:03Z) - Modeling Multi-Task Model Merging as Adaptive Projective Gradient Descent [72.10987117380584]
複数のエキスパートモデルをマージすることは、元のデータにアクセスせずにマルチタスク学習を実行するための有望なアプローチを提供する。
既存のメソッドは、競合を引き起こす一方で、パフォーマンスにとって重要なタスク固有の情報を捨てている。
我々の手法は従来の手法より一貫して優れており、視覚領域とNLP領域の両方において様々なアーキテクチャやタスクにまたがって最先端の結果が得られます。
論文 参考訳(メタデータ) (2025-01-02T12:45:21Z) - Probing the Robustness of Theory of Mind in Large Language Models [6.7932860553262415]
LLMにおけるToM探索のための68タスクの新しいデータセットを提案する。
データセットとデータセットを用いた4つのSotAオープンソースLLMのToM性能の評価(Kosinski, 2023)。
エージェントが環境における自動状態変化の知識を持っているという認識を必要とするタスクにおいて、全てのLLMが不整合性を示す傾向がみられた。
論文 参考訳(メタデータ) (2024-10-08T18:13:27Z) - NEVIS'22: A Stream of 100 Tasks Sampled from 30 Years of Computer Vision
Research [96.53307645791179]
我々は,100以上の視覚的分類タスクのストリームからなるベンチマークであるNever-Ending VIsual-classification Stream (NEVIS'22)を紹介する。
分類に制限されているにもかかわらず、OCR、テクスチャ分析、シーン認識など、様々なタスクが生成される。
NEVIS'22は、タスクの規模と多様性のために、現在のシーケンシャルな学習アプローチに対して前例のない課題を提起している。
論文 参考訳(メタデータ) (2022-11-15T18:57:46Z) - An Automated Question-Answering Framework Based on Evolution Algorithm [19.054115603616513]
複数のデータセットに対してネットワークアーキテクチャを調整可能な自動質問応答フレームワークを提案する。
本フレームワークはSQuAD 1.1では78.9 EM,86.1 F1,SQuAD 2.0では69.9 EM,72.5 F1を実現している。
論文 参考訳(メタデータ) (2022-01-26T08:13:24Z) - Lifelong Learning with Searchable Extension Units [21.17631355880764]
本稿では,検索可能拡張ユニット(SEU)という生涯学習フレームワークを提案する。
これは、事前に定義されたオリジナルのモデルの必要性を断ち切り、異なるタスクのための特定の拡張ユニットを検索する。
我々のアプローチは、破滅的な忘れることなく、はるかにコンパクトなモデルを得ることができる。
論文 参考訳(メタデータ) (2020-03-19T03:45:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。