論文の概要: Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- arxiv url: http://arxiv.org/abs/2608.20169v2
- Date: Mon, 24 Aug 2026 02:04:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:42.989902
- Title: Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
- Title(参考訳): Task-CoEvolve:Adaptive Validation Task Selectionによる高効率なハーネス最適化
- Authors: Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki,
- Abstract要約: 本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
$textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTaskは、情報的タスクの選択と、部分的な評価からフルセットのパフォーマンスの推定という2つの課題に対処することで、ハーネスでバリデーションタスクを共進化させる。
- 参考スコア(独自算出の注目度): 51.39973047614183
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present a novel approach to efficient LLM harness optimization through adaptive validation task selection. Harness optimization iteratively rewrites the harness code based on validation performance, enabling substantial performance gains without updating the underlying model weights. Existing approaches, however, evaluate a fixed validation set in full at every iteration, incurring substantial evaluation costs even on tasks that become less discriminative as the harness evolves. We propose $\textbf{Task-CoEvolve}$, which co-evolves the validation tasks with the harness by addressing two challenges: selecting informative tasks and estimating full-set performance from partial evaluations. Task-CoEvolve builds on the observation that tasks on which candidate harnesses disagree are more informative for distinguishing among them than tasks that are consistently solved or failed. It uses variance-weighted sampling based on past outcomes to focus evaluation on tasks near the capability frontier, with the sampling distribution adapting as the harness evolves. It then estimates full-set scores from the sampled tasks by accounting for their sampling probabilities, enabling consistent comparisons across iterations despite evaluating different subsets. Experiments on online text classification and Terminal-Bench 2.1 show that Task-CoEvolve consistently outperforms subset-based baselines and matches the final performance of full-set search while reducing the number of evaluations during optimization by 80%. Code will be released at https://github.com/Agent4Science-UTokyo/Task-CoEvolve.
- Abstract(参考訳): 本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
Harness最適化は、バリデーションパフォーマンスに基づいたハーネスコードを反復的に書き直し、基礎となるモデルの重みを更新することなく、大幅なパフォーマンス向上を可能にする。
しかし、既存のアプローチでは、各イテレーションで固定された検証セットをフルに評価し、ハーネスが進化するにつれて差別的でないタスクでもかなりの評価コストがかかる。
そこで我々は,情報的タスクの選択と,部分的な評価から完全セット性能を推定する2つの課題に対処することで,検証タスクをハーネスで共進化させる$\textbf{Task-CoEvolve}$を提案する。
Task-CoEvolveは、候補が利用するタスクは、一貫して解決されるか、失敗したタスクよりも、両者を区別するタスクの方が有益である、という観察に基づいて構築されている。
過去の結果に基づく分散重み付きサンプリングを用いて、ハーネスが進化するにつれてサンプリング分布が適応し、能力フロンティア近くのタスクに焦点をあてる。
そして、サンプリング確率を考慮し、サンプリングされたタスクから完全なスコアを推定し、異なるサブセットを評価しながらイテレーション間で一貫した比較を可能にする。
オンラインテキスト分類とTerminal-Bench 2.1の実験では、Task-CoEvolveはサブセットベースのベースラインを一貫して上回り、フルセット検索の最終性能と一致し、最適化中の評価回数を80%削減している。
コードはhttps://github.com/Agent4Science-UTokyo/Task-CoEvolveでリリースされる。
関連論文リスト
- BOTS: A Unified Framework for Bayesian Online Task Selection in LLM Reinforcement Finetuning [82.925106913459]
強化微調整(Reinforcement Finetuning, RFT)は、大規模言語モデル(LLM)を人間の嗜好と整合させ、推論を強化するための重要な手法である。
RFT強化微調整におけるベイズオンラインタスク選択のための統合フレームワークBOTSを紹介する。
論文 参考訳(メタデータ) (2025-10-30T11:15:23Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks [40.91931801667421]
本稿では, ベイズ最適化を用いたデータ選択手法として, 影響関数をインターリーブし, 特定の未確認評価タスクからのフィードバックによるデータ混合を最適化する, グローバル・ローカルなアルゴリズムを提案する。
DUETの累積的後悔を解析することにより、DUETはタスクに関するデータ知識がなくても、見えないタスクに対して最適なトレーニングデータ混合に収束することを示す。
論文 参考訳(メタデータ) (2025-02-01T01:52:32Z) - Model Predictive Task Sampling for Efficient and Robust Adaptation [57.414812940406996]
本稿では,タスク空間と適応リスク分布をブリッジするフレームワークであるモデル予測タスクサンプリング(MPTS)を紹介する。
MPTSは、エピソード最適化プロセスの特徴付けに生成モデルを使用し、後部推論によりタスク固有の適応リスクを予測する。
MPTSはゼロショット、少数ショット、教師付き微調整設定にシームレスに統合される。
論文 参考訳(メタデータ) (2025-01-19T13:14:53Z) - SureMap: Simultaneous Mean Estimation for Single-Task and Multi-Task Disaggregated Evaluation [75.56845750400116]
分散評価(disaggregated evaluation) -- 異なるサブポピュレーション上での機械学習モデルのパフォーマンスの推定 - は、AIシステムのパフォーマンスとグループフェアネスを評価する上で、中核的なタスクである。
ブラックボックスモデルの評価において,マルチタスクとシングルタスクの双方に対して高い推定精度を持つSureMapを開発した。
提案手法は, ウェル・チョーゼンを用いた最大後部推定と, スタインの非バイアスリスク推定(SURE)によるクロスバリデーションフリーチューニングを併用する。
論文 参考訳(メタデータ) (2024-11-14T17:53:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。