論文の概要: Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- arxiv url: http://arxiv.org/abs/2608.20169v2
- Date: Mon, 24 Aug 2026 02:04:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:42.989902
- Title: Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- Title(参考訳): Task-CoEvolve:Adaptive Validation Task Selectionによる高効率なハーネス最適化
- Abstract要約: 本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
$textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTaskは、情報的タスクの選択と、部分的な評価からフルセットのパフォーマンスの推定という2つの課題に対処することで、ハーネスでバリデーションタスクを共進化させる。
- 参考スコア(独自算出の注目度): 51.39973047614183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a novel approach to efficient LLM harness optimization through adaptive validation task selection. Harness optimization iteratively rewrites the harness code based on validation performance, enabling substantial performance gains without updating the underlying model weights. Existing approaches, however, evaluate a fixed validation set in full at every iteration, incurring substantial evaluation costs even on tasks that become less discriminative as the harness evolves. We propose $\textbf{Task-CoEvolve}$, which co-evolves the validation tasks with the harness by addressing two challenges: selecting informative tasks and estimating full-set performance from partial evaluations. Task-CoEvolve builds on the observation that tasks on which candidate harnesses disagree are more informative for distinguishing among them than tasks that are consistently solved or failed. It uses variance-weighted sampling based on past outcomes to focus evaluation on tasks near the capability frontier, with the sampling distribution adapting as the harness evolves. It then estimates full-set scores from the sampled tasks by accounting for their sampling probabilities, enabling consistent comparisons across iterations despite evaluating different subsets. Experiments on online text classification and Terminal-Bench 2.1 show that Task-CoEvolve consistently outperforms subset-based baselines and matches the final performance of full-set search while reducing the number of evaluations during optimization by 80%. Code will be released at https://github.com/Agent4Science-UTokyo/Task-CoEvolve.
- Abstract(参考訳): 本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
Harness最適化は、バリデーションパフォーマンスに基づいたハーネスコードを反復的に書き直し、基礎となるモデルの重みを更新することなく、大幅なパフォーマンス向上を可能にする。
しかし、既存のアプローチでは、各イテレーションで固定された検証セットをフルに評価し、ハーネスが進化するにつれて差別的でないタスクでもかなりの評価コストがかかる。
そこで我々は,情報的タスクの選択と,部分的な評価から完全セット性能を推定する2つの課題に対処することで,検証タスクをハーネスで共進化させる$\textbf{Task-CoEvolve}$を提案する。
Task-CoEvolveは、候補が利用するタスクは、一貫して解決されるか、失敗したタスクよりも、両者を区別するタスクの方が有益である、という観察に基づいて構築されている。
過去の結果に基づく分散重み付きサンプリングを用いて、ハーネスが進化するにつれてサンプリング分布が適応し、能力フロンティア近くのタスクに焦点をあてる。
そして、サンプリング確率を考慮し、サンプリングされたタスクから完全なスコアを推定し、異なるサブセットを評価しながらイテレーション間で一貫した比較を可能にする。
オンラインテキスト分類とTerminal-Bench 2.1の実験では、Task-CoEvolveはサブセットベースのベースラインを一貫して上回り、フルセット検索の最終性能と一致し、最適化中の評価回数を80%削減している。
コードはhttps://github.com/Agent4Science-UTokyo/Task-CoEvolveでリリースされる。
関連論文リスト
- HarnessOpt-Bench: Evaluating LLMs at Harness Optimization [3.846854817984248]
高価な評価体制下でのエンド・ツー・エンドのハーネス最適化のためのベンチマークを導入する。
信頼された実行環境は、評価境界、ターゲットエージェントリソースの使用を強制し、監査のための候補バージョンを保存する。
実験結果から、モデルはコードハーネスよりも分離され、ネイティブハーネスは一貫して優れておらず、タスク間で利得が大きく異なることがわかった。
論文 参考訳(メタデータ) (2026-08-06T17:21:05Z) - Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning [82.925106913459]
強化微調整(Reinforcement Finetuning, RFT)は、大規模言語モデル(LLM)を人間の嗜好と整合させ、推論を強化するための重要な手法である。
RFT強化微調整におけるベイズオンラインタスク選択のための統合フレームワークBOTSを紹介する。
論文 参考訳(メタデータ) (2025-10-30T11:15:23Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks [40.91931801667421]
本稿では, ベイズ最適化を用いたデータ選択手法として, 影響関数をインターリーブし, 特定の未確認評価タスクからのフィードバックによるデータ混合を最適化する, グローバル・ローカルなアルゴリズムを提案する。
DUETの累積的後悔を解析することにより、DUETはタスクに関するデータ知識がなくても、見えないタスクに対して最適なトレーニングデータ混合に収束することを示す。
論文 参考訳(メタデータ) (2025-02-01T01:52:32Z) - Model Predictive Task Sampling for Efficient and Robust Adaptation [57.414812940406996]
本稿では,タスク空間と適応リスク分布をブリッジするフレームワークであるモデル予測タスクサンプリング(MPTS)を紹介する。
MPTSは、エピソード最適化プロセスの特徴付けに生成モデルを使用し、後部推論によりタスク固有の適応リスクを予測する。
MPTSはゼロショット、少数ショット、教師付き微調整設定にシームレスに統合される。
論文 参考訳(メタデータ) (2025-01-19T13:14:53Z) - SureMap: Simultaneous Mean Estimation for Single-Task and Multi-Task Disaggregated Evaluation [75.56845750400116]
分散評価(disaggregated evaluation) -- 異なるサブポピュレーション上での機械学習モデルのパフォーマンスの推定 - は、AIシステムのパフォーマンスとグループフェアネスを評価する上で、中核的なタスクである。
ブラックボックスモデルの評価において,マルチタスクとシングルタスクの双方に対して高い推定精度を持つSureMapを開発した。
提案手法は, ウェル・チョーゼンを用いた最大後部推定と, スタインの非バイアスリスク推定(SURE)によるクロスバリデーションフリーチューニングを併用する。
論文 参考訳(メタデータ) (2024-11-14T17:53:35Z) - Scalable Fine-tuning from Multiple Data Sources: A First-Order Approximation Approach [17.79010397902909]
目的タスクに対する言語モデル(LM)の微調整の問題について,$n$補助タスクの情報を用いて最適に検討する。
この問題には、NLPにおけるターゲット命令チューニングや、チェーン・オブ・ファインタニングにおけるデータ選択など、幅広い応用がある。
繰り返しトレーニングを必要とせずにモデル微調整性能を推定する新しいアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-09-28T21:26:50Z) - Bayesian Estimate of Mean Proper Scores for Diversity-Enhanced Active
Learning [6.704927458661697]
期待されている損失削減(ELR)は、分類誤差の低減と、同じフレームワークに適合するより一般的なコストのベイズ推定に焦点を当てている。
本研究では,平均値スコア(BEMPS)のベイズ推定を行い,厳密なスコアの増加を推定する。
我々は,BEMPSが頑健な獲得関数とよく校正された分類器を出力し,他の試験よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2023-12-15T11:02:17Z) - Composite Learning for Robust and Effective Dense Predictions [81.2055761433725]
マルチタスク学習は、目標タスクを補助タスクと協調的に最適化することで、より優れたモデル一般化を約束する。
自己監督型(補助的)タスクと密接な予測(目標)タスクを共同でトレーニングすることで、目標タスクの性能を継続的に向上し、補助タスクのラベル付けの必要性を排除できることが判明した。
論文 参考訳(メタデータ) (2022-10-13T17:59:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。