論文の概要: FrugalEvo: Towards Cost-Aware LLM-Guided Program Evolution
- arxiv url: http://arxiv.org/abs/2610.03675v1
- Date: Fri, 02 Oct 2026 17:44:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.536722
- Title: FrugalEvo: Towards Cost-Aware LLM-Guided Program Evolution
- Title(参考訳): FrugalEvo:LLMガイドプログラムの進化に向けて
- Abstract要約: より強力で高コストなLLMがソリューション戦略を探求し、より安価なLLMがそれらを実装し、結果のコードを反復的に洗練する、コスト対応の進化的フレームワークを提案する。
また、キャッシュ効率のよい進化プロセスも設計し、キャッシュ再利用を改善するために、さまざまな進化ステップ間でプレフィックスの共有を最大限に活用し、促進します。
10の数学的およびシステム最適化タスクで、FrugalEvoは、OpenEvolve、ShinkaEvolve、AdaEvolve、EvoXといった最先端のベースラインを最終的なソリューション品質でマッチまたは超え、9つのタスクでより高いBA-AUCを達成する。
- 参考スコア(独自算出の注目度): 68.1865367663937
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-guided evolutionary methods, such as AlphaEvolve, have emerged as powerful approaches for challenging computational optimization problems, such as circle packing. However, prior work typically optimizes performance gain over a fixed number of iterations. We argue that practical optimization should maximize gain per unit cost. To this end, we propose FrugalEvo, a cost-aware evolutionary framework where a stronger, higher-cost LLM explores solution strategies, and a cheaper LLM implements them and iteratively refines the resulting code. We also design a cache-efficient evolution process, where our harness and prompts maximize the sharing of prefixes across different evolution steps, to improve cache reuse. To measure solution quality throughout a fixed cost budget, we introduce Budget-Aware Area Under the Curve (BA-AUC), defined as the area under the best-so-far evaluation score curve over cumulative LLM cost, up to the budget. Across 10 mathematical and systems optimization tasks, FrugalEvo matches or surpasses state-of-the-art baselines, including OpenEvolve, ShinkaEvolve, AdaEvolve, and EvoX, in final solution quality and achieves higher BA-AUC on 9 tasks. It also achieves higher average performance than these baselines on 10 algorithmic optimization tasks from ALE-Bench-Lite. Notably, on circle packing, FrugalEvo achieves new state-of-the-art performance with GPT-5.6 Terra and Luna for only 1.68 USD and with GLM-5.3 and its Flash variant for only 0.55 USD, matching or surpassing all baselines, including multi-agent methods such as CORAL and SwarmResearch, which cost approximately 50 USD on average.
- Abstract(参考訳): AlphaEvolveのようなLLM誘導の進化的手法は、円のパッキングのような計算最適化問題に挑戦する強力なアプローチとして登場した。
しかしながら、以前の作業は通常、一定回数のイテレーションよりもパフォーマンスの向上を最適化します。
実用的最適化は単価当たりの利得を最大化するべきだと我々は主張する。
この目的のために、FrugalEvoを提案する。FrugalEvoは、より強力で高コストなLLMがソリューション戦略を探求し、より安価なLLMがそれらを実装し、結果のコードを反復的に洗練する、コスト対応進化フレームワークである。
また、キャッシュ効率のよい進化プロセスも設計し、キャッシュ再利用を改善するために、さまざまな進化ステップ間でプレフィックスの共有を最大限に活用し、促進します。
固定コスト予算全体を通してソリューションの質を評価するため, 累積LCMコストよりも最良評価スコア曲線の下で定義された予算意識エリア(BA-AUC)を予算まで導入する。
10の数学的およびシステム最適化タスクで、FrugalEvoは、OpenEvolve、ShinkaEvolve、AdaEvolve、EvoXといった最先端のベースラインを最終的なソリューション品質でマッチまたは超え、9つのタスクでより高いBA-AUCを達成する。
また、ALE-Bench-Liteのアルゴリズム最適化タスク10のベースラインよりも高い平均性能を実現している。
特に、FrugalEvoは、GPT-5.6 TerraとLunaをわずか1.68 USDで、GLM-5.3とFlashの派生版をわずか0.55 USDで、CORALやSwarmResearchなどのマルチエージェントメソッドを含む全てのベースラインをマッチングまたは超える性能を実現している。
関連論文リスト
- ZEBRA: Zero-shot Budgeted Resource Allocation for LLM Orchestration [8.226365534099399]
連続非線形クナップサック問題に対する多相予算割当を低減するフレームワークであるZEBRAを提案する。
150ドルのAPPS符号化ベンチマークでは、ZEBRAの2つの変種は全ての集計基準においてLLM-directよりも優れていた。
我々は,自律型マルチエージェントシステムの経済行動を改善するために,推論時の軽量なアルゴリズムガイダンスを提案する。
論文 参考訳(メタデータ) (2026-05-19T20:50:05Z) - Efficient Data Selection for Multimodal Models via Incremental Optimization Utility [6.698411108146732]
本稿では,データ選択をインクリメンタルな最適化ユーティリティランキング問題として再定義するフレームワークであるOne-Step-Train(OST)を提案する。
トップ50サブセットを選択することで、OSTはトレーニングコストを43%削減し(トータルタイム消費は17)、強力なLCM-as-a-Judgeベースラインを1.8ポイント上回る。
論文 参考訳(メタデータ) (2026-05-08T09:28:26Z) - Cost-Aware Learning [72.31444819326795]
本稿では,異なるコンポーネント関数をサンプリングするコスト認識学習の問題点について考察する。
凸関数に対するコスト・アウェア・Descentアルゴリズムを提案し、そのコスト複雑性を導出し誤差を$$$とする。
本稿では,性能を保ちつつポリシー最適化のコストを削減するアルゴリズムであるCost-Aware GRPOを紹介する。
論文 参考訳(メタデータ) (2026-04-30T15:39:09Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Rethinking LLM-Driven Heuristic Design: Generating Efficient and Specialized Solvers via Dynamics-Aware Optimization [21.449921296295884]
本研究では,コンバージェンス・アウェア・ヒューリスティックス(DASH, Dynamics-Aware Heuristics)を提案する。
DASHは、さまざまな問題スケールにわたる最先端のベースラインのソリューション品質を越えながら、ランタイム効率を3倍以上改善します。
論文 参考訳(メタデータ) (2026-01-14T05:06:42Z) - Conformal Constrained Policy Optimization for Cost-Effective LLM Agents [27.37909142846675]
大規模言語モデル(LLM)は最近、AI問題の解決に向けて大きな進歩を遂げた。
本稿では,複数のLLMモデルとコスト/精度のトレードオフをエージェント方式で組み合わせた新しい戦略を提案する。
当社のアプローチは,信頼性を維持しつつ,よりコスト効率のよいLCMエージェントをデプロイするための,原則的かつ実用的なフレームワークを提供する。
論文 参考訳(メタデータ) (2025-11-14T19:39:28Z) - Accelerating RL for LLM Reasoning with Optimal Advantage Regression [52.0792918455501]
本稿では,最適優位関数を直接近似する新しい2段階ポリシー最適化フレームワークを提案する。
A$*-POは、幅広い数学的推論ベンチマークで競合性能を達成する。
PPO、GRPO、REBELと比較して、トレーニング時間を最大2$times$、ピークメモリ使用率を30%以上削減する。
論文 参考訳(メタデータ) (2025-05-27T03:58:50Z) - A Problem-Oriented Perspective and Anchor Verification for Code Optimization [43.28045750932116]
大規模言語モデル(LLM)は、様々なプログラミングタスクを解く際、顕著な能力を示している。
本稿では,LLMが最小実行時間に最適化する能力について検討する。
論文 参考訳(メタデータ) (2024-06-17T16:10:10Z) - Learning Performance-Improving Code Edits [107.21538852090208]
本稿では,大規模言語モデル(LLM)を高レベルプログラム最適化に適用するためのフレームワークを提案する。
まず、競争力のある77,000以上のC++プログラミングサブミッションペアによる、人間のプログラマによるパフォーマンス改善編集のデータセットをキュレートする。
提案手法は,検索をベースとした少数ショットプロンプトとチェーン・オブ・シンクレットを提案し,その微調整には,自己再生に基づく性能条件付き生成と合成データ拡張が含まれる。
論文 参考訳(メタデータ) (2023-02-15T18:59:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。