論文の概要: Discovered, Not Designed: Population Evolution for Collaborative and Compute-Intensive Model Discovery
- arxiv url: http://arxiv.org/abs/2610.05950v1
- Date: Mon, 05 Oct 2026 08:05:26 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:52:24.640949
- Title: Discovered, Not Designed: Population Evolution for Collaborative and Compute-Intensive Model Discovery
- Title(参考訳): 発見され、設計されていない: 協力的および計算集約的なモデル発見のための人口進化
- Abstract要約: Population Evolutionは、実験的な証拠を共有することによって、現在進行中の地域検索を結びつける。
高価なターゲットに対して、PEはピアおよび中間評価を通じて、小さなトレーニングサブセットとスクリーン候補を検索する。
- 参考スコア(独自算出の注目度): 24.59342768521802
- License:
- Abstract: LLM-driven evolution enables iterative model development, but two practical goals remain underexplored: finding model designs that transfer across related tasks and sustaining improvement when training is expensive. We introduce Population Evolution (PE), a collaborative, hierarchical framework that connects ongoing local searches through shared experimental evidence. PE evaluates code changes across related training instances and shares the results to guide subsequent proposals and promotion to larger training scales. For expensive targets, PE searches small training subsets and screens candidates through peer and intermediate evaluations before full-target training. We introduce RMD-Bench to evaluate both settings across ranking, watch-time prediction, RL algorithm discovery, and LLM/VLM pretraining. Compared with standalone evolution at matched source iterations, PE raises mean best local gains from 7.01% to 8.97% in ranking and from 2.84% to 3.85% in watch-time, while improving the best larger-scale outcome in all three joint-discovery families. In watch-time discovery, PE improves best larger-scale gains with four of five harnesses and all four proposers. On new recommendation datasets under shared target-side calibration, every evaluated PE design improves over the reference in mean performance. Under matched total GPU compute, completed LLM discovery runs yield a best relative accuracy gain of 2.48% and 13 successful candidates for PE, versus 0.92% and none for direct evolution. VLM loss reduction reaches 8.78% versus 5.05% under matched total GPU compute.
- Abstract(参考訳): LLM駆動の進化は反復的なモデル開発を可能にするが、関連するタスクをまたいで移行するモデル設計を見つけること、トレーニングが高価である場合に改善を維持すること、という2つの実践的な目標がまだ未定である。
我々は,共同で階層的なフレームワークであるPopulation Evolution (PE)を紹介した。
PEは関連するトレーニングインスタンス間でコード変更を評価し、その結果を共有して、その後の提案をガイドし、より大きなトレーニングスケールに昇格させる。
高価なターゲットに対しては、PEは小規模なトレーニングサブセットを検索し、フルターゲットトレーニングの前にピアおよび中間評価を通じて候補をスクリーニングする。
RMD-Benchを導入し、ランキング、時計時間予測、RLアルゴリズム発見、LLM/VLM事前学習の両方の評価を行う。
一致するソースイテレーションにおけるスタンドアローンの進化と比較すると、PEは3つの共同発見ファミリーで最も大きな成果を上げながら、ランキングが7.01%から8.97%、ウォッチタイムが2.84%から3.85%に上昇する。
ウォッチタイムディスカバリでは、PEは5つのハーネスのうち4つと4つのプロポータで、より大規模なゲインを改善する。
共有目標側キャリブレーションに基づく新しいレコメンデーションデータセットでは、評価されたPE設計はすべて平均性能の基準よりも改善される。
一致した全GPU計算では、LLM発見の実行は、PEの相対精度が2.48%、成功候補が13であるのに対して、0.92%であり、直接進化するものではない。
VLM損失の減少率は8.78%に達するが、全GPU計算では5.05%に達する。
関連論文リスト
- Evolutionary Discovery of Developmental Reward Schedules in Deep Reinforcement Learning [0.0]
本稿では,開発報酬スケジュールの発見のための進化的枠組みを提案する。
エージェンシー、ノベルティ、および反応性は、時間によって異なる重みによって結合される。
本研究は,進化的最適化を開発報酬スケジュール発見のための有望なアプローチとして位置づけた。
論文 参考訳(メタデータ) (2026-06-18T18:47:26Z) - OPERA: Online Data Pruning for Efficient Retrieval Model Adaptation [39.548179971747906]
ドメイン固有の微調整は、高密度レトリバーにとって不可欠であるが、すべてのトレーニングペアが学習プロセスに等しく貢献するわけではない。
我々は、この不均一性を利用して、検索モデル適応の有効性と効率を両立させるデータプルーニングフレームワークであるOPERAを紹介する。
論文 参考訳(メタデータ) (2026-03-17T23:11:45Z) - Mashup Learning: Faster Finetuning by Remixing Past Checkpoints [11.36221733394798]
マッシュアップ学習は、新しいタスクへのモデル適応を強化するために、事前トレーニングの実行のアウトプットを活用する単純な方法である。
トレーニングをスクラッチから行うよりも、平均下流の精度を0.5~5ポイント向上させる。
また、コンバージェンスを加速し、トレーニングステップを41-46%削減し、スクラッチの精度に合わせるために壁時計全体の時間を最大37%短縮する。
論文 参考訳(メタデータ) (2026-03-10T18:46:26Z) - Breaking Training Bottlenecks: Effective and Stable Reinforcement Learning for Coding Models [104.26904744478884]
現代のコード生成モデルは、より長い出力を示し、能力の成長を加速し、トレーニングのダイナミクスを変更します。
グループ相対政策最適化を改良したMicroCoder-GRPOを提案する。
MicroCoder-GRPOは、LiveCodeBench v6の強力なベースラインよりも17.6%の相対的な改善を実現している。
私たちは、300のトレーニングステップで、LiveCodeBench v6の主流データセットよりも3倍大きなパフォーマンス向上を達成する、より困難なトレーニングコーパスであるMicroCoder-Datasetをリリースした。
論文 参考訳(メタデータ) (2026-03-08T19:40:12Z) - MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting [18.222130019294852]
本稿では,MMR-GRPOを提案する。
MMR-GRPOは、平均47.9%のトレーニングステップと70.2%のウォールクロック時間を必要とする一方で、同等のピークパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-01-14T02:35:19Z) - Forward versus Backward: Comparing Reasoning Objectives in Direct Preference Optimization [0.12891210250935145]
大きな言語モデルは印象的な推論能力を示すが、しばしば妥当だが間違ったソリューションを生成する。
本稿では,直接選好最適化による学習目標構成が推論信頼性に及ぼす影響について検討する。
論文 参考訳(メタデータ) (2026-01-12T04:46:27Z) - CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models [77.16976971950785]
本稿では、推論モデルの学習を高速化するために、CPPO(Completion Pruning Policy Optimization)を提案する。
CPPOは絶対的なアドバンテージを低く保ち、勾配計算や更新に必要な数を大幅に削減する。
実験の結果、CPPOはGSM8Kで最大7.98タイム、Mathで3.48タイムで最大7.48タイム、オリジナルのGRPOと比較して精度を保っている。
論文 参考訳(メタデータ) (2025-03-28T11:30:05Z) - SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks [110.20297293596005]
大規模言語モデル(LLM)エージェントは、実世界のタスクでマルチターンインタラクションを実行する必要がある。
LLMエージェントを最適化するための既存のマルチターンRLアルゴリズムは、LLMの一般化能力を活用しながら、複数回にわたって効果的なクレジット割り当てを行うことができない。
本稿では,新たなRLアルゴリズムであるSWEET-RLを提案する。
我々の実験は、SWEET-RLがコルベンチにおける成功率と勝利率を、他の最先端マルチターンRLアルゴリズムと比較して6%向上することを示した。
論文 参考訳(メタデータ) (2025-03-19T17:55:08Z) - VinePPO: Refining Credit Assignment in RL Training of LLMs [66.80143024475635]
我々は,言語環境の柔軟性を利用してモンテカルロをベースとした推定値を計算する,簡単なアプローチであるVinePPOを提案する。
本手法は,MATHおよびGSM8Kデータセット間のPPOおよび他のベースラインをウォールクロック時間以下で連続的に上回る。
論文 参考訳(メタデータ) (2024-10-02T15:49:30Z) - Efficient Continual Pre-training by Mitigating the Stability Gap [68.49269649759005]
本研究では,Large Language Models (LLM) の継続事前学習における挙動について検討する。
固定された計算予算内でのLLM性能を向上させるための3つの効果的な戦略を提案する。
当社の戦略は,OpenLlama-3Bモデルの平均医療タスク性能を36.2%から40.7%に改善し,当初のトレーニング予算の40%に過ぎなかった。
論文 参考訳(メタデータ) (2024-06-21T02:28:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。