論文の概要: Automated Discovery Has No Universally Superior Harness
- arxiv url: http://arxiv.org/abs/2607.18235v1
- Date: Mon, 20 Jul 2026 17:59:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.734003
- Title: Automated Discovery Has No Universally Superior Harness
- Title(参考訳): オートマチック・ディスカバリーには、超過酷さがない
- Authors: Akshat Gupta, Jermaine Lei, Alexander Lu, Gopala Anumanchipalli, Leshem Choshen,
- Abstract要約: 我々はOpenEvolveスタイルの進化的探索とTT-Discoverサーチハーネスを構成成分に分解する。
12組のモデルプロブレムペアで30個の予算整合ハーネスを評価した。
- 参考スコア(独自算出の注目度): 63.53666712024897
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autonomous discovery systems such as OpenEvolve and TTT-Discover are often used as general-purpose harnesses. However, in practice these are composite systems combining several design choices about archives, parent selection, exploration, and budget allocation into a single recipe. Because discovery runs are expensive and inherently stochastic, existing harnesses are often compared using too few independent trials to distinguish key methodological improvements from run-to-run variance. We systematically decompose OpenEvolve-style evolutionary search and the TTT-Discover search harness into its constituent components and systematically evaluate 30 budget-matched harnesses across 12 model-problem pairs using more than 3.1 million LLM rollouts and repeated-trial statistical analysis. Our results show that discovery harnesses have a generalization problem: No fixed harness is reliably superior across the evaluated model-problem pairs, and variants of OpenEvolve generally underperform simpler alternatives. Thus, harness choice is better viewed as a hyperparameter rather than as a universal recipe, and should be tailored to the specific problem and underlying model. We also find that early discovery progress predicts final performance, and use this property to present a budget-matched adaptive-allocation experiment that starts multiple harnesses, prunes weak partial runs, and reallocates compute to stronger survivors, outperforming both commitment to a randomly sampled fixed harness and a non-adaptive harness ensemble. Together, these results motivate shifting from fixed harness selection to online adaptation guided by early performance. We release all run pools including baseline null distributions for every model-problem pair as reusable statistical infrastructure against for future harness proposals.
- Abstract(参考訳): OpenEvolveやTTT-Discoverのような自律的な発見システムは汎用ハーネスとしてよく用いられる。
しかし、実際にはこれらは、アーカイブ、親の選択、探索、予算配分に関するいくつかの設計選択を1つのレシピに組み合わせた複合システムである。
ディスカバリーランは高価で本質的に確率的であるため、既存のハーネスは独立トライアルが少なすぎるため、主要な方法論的改善とラン・ツー・ランの分散を区別するために比較されることが多い。
我々はOpenEvolveスタイルの進化探索とTTT-Discoverサーチハーネスを構成成分に体系的に分解し,3100万 LLMロールアウトと反復的心房統計分析を用いて,12のモデルプロブレム対にわたる30の予算適合ハーネスを体系的に評価した。
評価されたモデルとプロブレムのペアに対して固定ハーネスが確実に優れていることはなく、OpenEvolveの変種は一般的により単純な代替手段を過小評価する。
したがって、ハーネスの選択は普遍的なレシピとしてではなく、ハイパーパラメータとして見なされ、特定の問題や基礎となるモデルに合わせて調整されるべきである。
また,早期発見の進行によって最終性能が予測され,この特性を用いて,複数のハーネスを起動し,プーンを弱くし,より強いサバイバルに計算を再配置し,ランダムにサンプリングされた固定ハーネスと非適応ハーネスアンサンブルへのコミットメントを両立させる。
これらの結果は、固定ハーネスの選択から、初期のパフォーマンスによって導かれるオンライン適応へのシフトを動機付けている。
将来のハーネス提案に対する再利用可能な統計インフラとして,モデルとプロブレムのペア毎に,ベースラインのnull分布を含むすべての実行プールをリリースする。
関連論文リスト
- Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference [51.55077364626896]
本稿では,過去の軌道のみを用いたエージェント・ハーネスを最適化する自己教師型手法であるRetrospective Harness Optimization (RHO)を紹介する。
RHOは、過去の軌跡から様々な課題のコアセットを選択し、それらを並列に解決する。
1回の最適化ラウンドでは、SWE-Bench Proのパスレートが59%から78%に向上する。
論文 参考訳(メタデータ) (2026-06-04T09:26:00Z) - Squeeze Evolve: Unified Multi-Model Orchestration for Verifier-Free Evolution [81.46210789228296]
検証不要な進化推論のための統合型マルチモデルオーケストレーションフレームワークであるSqueeze Evolveを紹介する。
われわれのアプローチは単純な原則で導かれており、最良効能を有するモデル能力を割り当てる。
論文 参考訳(メタデータ) (2026-04-09T02:14:45Z) - Distributionally Robust Feature Selection [14.493253907785473]
本研究では,複数のサブポピュレーションにまたがって,訓練されたモデルが同時に動作するように,限られた特徴を選択するという課題について検討する。
提案手法は,ノイズ発生機構を用いて従来の変数選択を連続的に緩和する手法である。
我々は、下流予測の全体的性能を集団間でバランスさせるモデルに依存しない枠組みを開発する。
論文 参考訳(メタデータ) (2025-10-24T03:03:30Z) - Noise or Signal? Deconstructing Contradictions and An Adaptive Remedy for Reversible Normalization in Time Series Forecasting [4.212879006865343]
RevINは、単純な線形モデルで時系列予測における最先端のパフォーマンスを実現するための重要な技術である。
本稿では,4つの基礎となる理論的矛盾を同定することにより,様々な正規化戦略の難解化性能を分解する。
論文 参考訳(メタデータ) (2025-10-06T10:22:20Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding [59.60915947702282]
検証可能な報酬(RLVR)による強化学習は,大規模言語モデル(LLM)の推論能力の向上に成功している。
既存のRLVR手法は、訓練データの困難さとモデルの能力のミスマッチにより、探索の非効率に悩まされることが多い。
本稿では,高効率領域に留まることの難易度を動的に調整する新しい監視支援RLVRフレームワークであるSEELEを提案する。
論文 参考訳(メタデータ) (2025-09-08T17:36:21Z) - Benign Overfitting in Out-of-Distribution Generalization of Linear Models [19.203753135860016]
我々は、アウト・オブ・ディストリビューション(OOD)体制における良心過剰の理解に向けて、最初の一歩を踏み出した。
我々は、標準的な隆起回帰において良性過剰適合が生じることを証明する非漸近保証を提供する。
また、より一般的な目標共分散行列の族についても理論的結果を示す。
論文 参考訳(メタデータ) (2024-12-19T02:47:39Z) - Multiple Robust Learning for Recommendation [13.06593469196849]
推薦システムでは、収集されたデータに様々なバイアスが存在することが一般的な問題である。
本稿では,不偏性を実現するために,複数の候補計算モデルと確率モデルを利用するマルチロバスト (MR) 推定器を提案する。
論文 参考訳(メタデータ) (2022-07-09T13:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。