論文の概要: Which Optimizer, At What Budget? A Tournament of Optimizers for Search-Based SE
- arxiv url: http://arxiv.org/abs/2607.11705v1
- Date: Mon, 13 Jul 2026 15:33:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.536566
- Title: Which Optimizer, At What Budget? A Tournament of Optimizers for Search-Based SE
- Title(参考訳): どの最適化ツール、どの予算で? 検索ベースのSEのための最適化ツールのコース
- Abstract要約: 最新のソフトウェアの設定とチューニングは避けられず、高価で、エラーを起こしやすい。
標準応答は自動最適化であるが、利用可能な最適化の数は増え続けている。
- 参考スコア(独自算出の注目度): 4.282746516699565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Configuring and tuning modern software is unavoidable, expensive, and error-prone: a single system can expose hundreds of interacting options, and scoring one setting can mean a full build or test run. The standard response is automated optimization, but the number of available optimizers is large and growing. And some of the guidance for selecting among them is misleading: NSGA-II, for example, is widely recommended, yet other algorithms reach the same results using only 1/20th as many evaluations. To help practitioners make better choices about tools to configure their systems, we cluster 20 optimizers, based on six assumptions about the data. Next, we run a tournament across those optimizers, using 106 SE optimization tasks at four labeling budgets (taking 14,000+ CPU hours). We find that no optimizer wins outright. The best one migrates with the budget (from a geometric active learner when labels are scarce to differential evolution when labels are plentiful) so a winner "crowned" at one budget is wrong at another on up to half our tasks. Running such a tournament for every new domain is impractical due to its CPU cost. Fortunately, we find that those 14,000 hours can be replaced by a table lookup over two cheap-to-obtain task attributes (plus the labeling budget). Predictions from this table tie or beat a hindsight oracle on $\approx 75%$ of held-out tasks. To support open science, our tournament and replication package are open-sourced for SBSE researchers and practitioners at https://github.com/KKGanguly/OptimizerTournament.
- Abstract(参考訳): 最新のソフトウェアの設定とチューニングは避けられず、コストがかかり、エラーが発生しやすい:単一のシステムは数百の対話型オプションを公開でき、1つの設定を評価することは、完全なビルドまたはテスト実行を意味する。
標準応答は自動最適化だが、利用可能なオプティマイザの数は増え続けている。
例えば、NSGA-IIは広く推奨されているが、他のアルゴリズムは、多くの評価の1/20だけを使用して同じ結果を得る。
データに関する6つの仮定に基づいて20の最適化をクラスタ化する。
次に、4つのラベル付け予算(14,000時間以上)で106 SE最適化タスクを使用して、それらのオプティマイザ間でトーナメントを実行します。
私たちはオプティマイザが完全に勝つことはないことに気付きました。
ベストなものは予算で移行する(ラベルが豊富で差分進化が少ないような幾何学的アクティブな学習者から)ので、ある予算での勝者の“共有”は、最大半分のタスクで別の予算で間違っています。
新しいドメインごとにそのようなトーナメントを実行するのはCPUコストのため現実的ではありません。
幸いなことに、これらの14,000時間は、2つの安価なタスク属性(ラベル付け予算に加えて)に対するテーブルルックアップに置き換えられる可能性がある。
このテーブルからの予測は、ホールドアウトタスクの$\approx 75%$で、後見の託宣を結び付けるか、打ち負かす。
オープンサイエンスをサポートするため、当社のトーナメントとレプリケーションパッケージは、SBSEの研究者や実践者のためにhttps://github.com/KKGanguly/OptimizerTournament.comでオープンソース化されています。
関連論文リスト
- AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds [58.529749203758634]
ツール使用ベンチマークは一般的に、適切なツールと有効な引数を使用して、エージェントがワークフローを完了するかどうかを評価する。
アルゴワールドス(AlgoWorlds)は、公式に指定された最適化問題を部分的に観察された決定環境に変換するベンチマークである。
AlgoWorldsには、10の最適化ファミリーと4つのワークロードレベルをカバーする240の環境が含まれている。
論文 参考訳(メタデータ) (2026-08-29T18:37:41Z) - AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement [4.962568775070268]
再帰的自己改善(RSI)は、AIシステムがAIシステムを生成するプロセスを改善することができるかどうかを問うものである。
AI4AImbox-Benchは、10のトレーニングアルゴリズムファミリにまたがる10のフリーズ研究レポジトリである。
論文 参考訳(メタデータ) (2026-08-20T17:56:59Z) - When to Use Which? Benchmarking Optimisers for Configurable Systems under Varying Budgets [13.971439283271152]
予算レベルを考えると、SE実践者にとって最適な選択肢は何でしょう?
予算レベルの異なる22システムに対して,確立された8オプティマイザを系統的に評価した。
1つのオプティマイザであるFLASHは、予算に関わらず、ほとんどのシステムで一貫して機能する。
論文 参考訳(メタデータ) (2026-07-17T19:48:58Z) - InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents [15.892896819368751]
InferenceBenchでは、エージェントがOpenAI互換の推論サーバをデプロイし、LLM推論の速度を最適化する必要がある。
3つの最適化シナリオは、推論のボトルネックを区別する。
エージェントは、単純なPyTorchベースラインよりも確実に改善する。
全体としてInferenceBenchは、エージェントがオープンなAIエンジニアリング環境で操作できることを反映している。
論文 参考訳(メタデータ) (2026-05-20T15:55:21Z) - optimize_anything: A Universal API for Optimizing any Text Parameter [98.42497715725356]
単一タスク検索をサポートする1つのAIベースの最適化システム、クロスプロブレム転送によるマルチタスク検索、および目に見えない入力への一般化を示す。
LLMに基づく検索によるテキストの最適化は汎用的な問題解決パラダイムであることを示す。
論文 参考訳(メタデータ) (2026-05-19T10:18:12Z) - Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems [9.989306175511238]
複合AIシステムにおける迅速な最適化は、コインフリップと統計的に区別できないことを示す。
18,000のグリッド評価と144の最適化を実行し、エンドツーエンドの最適化ツールの背後にある2つの仮定をテストする。
エージェントカップリングのための80ドルのANOVAプリテストと10分間のヘッドルームテストである。
論文 参考訳(メタデータ) (2026-04-16T03:23:46Z) - BLITZRANK: Principled Zero-shot Ranking Agents with Tournament Graphs [14.085089126904101]
我々は、$k$-wiseランキングの原則となる基盤を提供するトーナメントグラフフレームワークを導入する。
それぞれ$k$-item比較すると、$binomk2$の完全なトーナメントがペアワイズで表示される。
我々は、アイテムのランクが確実に決定されたときを形式化し、情報ゲインを最大化する欲求クエリスケジュールを設計する。
論文 参考訳(メタデータ) (2026-02-05T08:41:00Z) - How Low Can You Go? The Data-Light SE Challenge [4.282746516699565]
ソフトウェアエンジニアリング(SE)の研究の多くは、進歩は大量のデータセットとCPU集約に依存すると仮定している。
本稿では、ソフトウェア構成とパフォーマンスチューニング、クラウドとシステム最適化、プロジェクトとプロセスレベルの意思決定モデリング、行動分析、金融リスクモデリング、プロジェクトヘルス予測、強化学習タスク、セールス予測、ソフトウェアテストなど、他の方法も提案する。
我々の結果によると、いくつかのSEタスクは、ラベルが少なく、計算量がはるかに少ない軽量なアプローチによってよりうまく機能する可能性がある。
論文 参考訳(メタデータ) (2025-12-15T16:49:50Z) - BINGO! Simple Optimizers Win Big if Problems Collapse to a Few Buckets [12.069139819456861]
ソフトウェアエンジニアリング(SE)は遅くて複雑です。
本稿では,SEデータを少数の解"バケット"に分解する新たな現象であるBINGO効果を紹介する。
39のSE問題の最適化におけるBINGO効果の有意性を示す。
これを実行することで、最先端のメソッドよりも1万倍高速に最適化できます。
論文 参考訳(メタデータ) (2025-06-04T23:13:58Z) - MADA: Meta-Adaptive Optimizers through hyper-gradient Descent [73.1383658672682]
メタ適応(MADA)は、複数の既知の収束を一般化し、トレーニング中に最も適した収束を動的に学習できる統合フレームワークである。
私たちは、MADAを視覚や言語タスクに関する他の人気と経験的に比較し、MADAがAdamや他の人気を一貫して上回っていることに気付きました。
AVGradは最大演算子を平均演算子に置き換えたもので、高次最適化に適している。
論文 参考訳(メタデータ) (2024-01-17T00:16:46Z) - JoinGym: An Efficient Query Optimization Environment for Reinforcement
Learning [58.71541261221863]
結合順序選択(JOS)は、クエリの実行コストを最小化するために結合操作を順序付けする問題である。
木質強化学習(RL)のためのクエリ最適化環境JoinGymを提案する。
JoinGymは内部で、事前計算されたデータセットから中間結果の濃度を調べることで、クエリプランのコストをシミュレートする。
論文 参考訳(メタデータ) (2023-07-21T17:00:06Z) - VeLO: Training Versatile Learned Optimizers by Scaling Up [67.90237498659397]
私たちは、ディープラーニングの成功の背後にある同じスケーリングアプローチを活用して、汎用性を学びます。
私たちは、パラメータの更新を取り込み出力する小さなニューラルネットワークであるディープラーニングのためのインジェクションをトレーニングします。
学習したメタトレーニングコード、関連するトレインテストデータ、およびvelo-code.ioのベースラインを備えた広範なベンチマークスイートをオープンソースとして公開しています。
論文 参考訳(メタデータ) (2022-11-17T18:39:07Z) - How to distribute data across tasks for meta-learning? [59.608652082495624]
タスクごとのデータポイントの最適な数は予算に依存しますが、それは大きな予算のためのユニークな一定の値に収束します。
この結果から,データ収集の簡便かつ効率的な手順が示唆された。
論文 参考訳(メタデータ) (2021-03-15T15:38:47Z) - Tasks, stability, architecture, and compute: Training more effective
learned optimizers, and using them to train themselves [53.37905268850274]
我々は、自動正規化を実現するために、バリデーション損失などの追加機能にアクセス可能な、階層的で階層的なニューラルネットワークパラメータ化を導入した。
ほとんどの学習は単一のタスク、あるいは少数のタスクでトレーニングされています。
何千ものタスクをトレーニングし、桁違いに計算量を増やし、その結果、目に見えないタスクよりも優れたパフォーマンスの一般化を実現します。
論文 参考訳(メタデータ) (2020-09-23T16:35:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。