論文の概要: HELIX: Model-Harness Co-evolution for Recursive Self-Improvement
- arxiv url: http://arxiv.org/abs/2608.13951v1
- Date: Fri, 14 Aug 2026 04:44:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.269313
- Title: HELIX: Model-Harness Co-evolution for Recursive Self-Improvement
- Title(参考訳): HELIX: 再帰的自己改善のためのモデルハーネス共進化
- Abstract要約: 我々は,HELIXを資源追跡可能なHELIX基板として提案する。
提案手法は,現在の能力向上と,次のモデルに対する学習信号の生成方法を示す。
- 参考スコア(独自算出の注目度): 8.484282837156933
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scaling agent capability has largely focused on improving the model, yet an interactive agent acts through a runtime harness that mediates context, tools, control flow, and stopping. The harness shapes both what a model can accomplish and the trajectories from which it learns. This coupling motivates model-harness co-evolution for recursive self-improvement: build harnesses for a fixed model, update the model from verified sibling trajectories, and rebuild the harnesses as model capabilities change. Realizing this loop requires a controlled way to evolve harnesses while preserving intervention identity and effect. We present HELIX, a source-traceable substrate for harness evolution. HELIX decomposes agent systems into typed ports, reusable atoms, recipes, product shells, and runtime policies. It makes interventions explicit and auditable while retaining trajectories, test outcomes, and provenance. Harness evolution thus serves two linked roles: improving fixed-model execution and producing matched successes, regressions, near misses, and alternative solutions as data for subsequent model improvement. We evaluate HELIX in one evolution round on code repair. A 65-candidate portfolio discovers a fixed harness that improves task coverage by 4.0% over Pi, while the full portfolio exposes up to 58.0% more verified coverage through complementary sibling behavior. Selected candidates are assessed with repeated runs and the SWE-bench evaluator. A 200-slot sibling slice yields 438 verified SFT, critic, filter, and preference records. These results show how harness, model, and data form a feedback system: harness evolution expands current capability and creates learning signal for the next model; model updates motivate the next round of harness evolution. HELIX provides an auditable interface for studying this recursive process. Code is available at https://github.com/HKUDS/HELIX.
- Abstract(参考訳): エージェントのスケーリング機能は、主にモデルの改善に重点を置いているが、対話型エージェントは、コンテキスト、ツール、制御フロー、停止を仲介するランタイムハーネスを介して機能する。
ハーネスは、モデルが達成できることと、学習する軌道の両方を形作る。
この結合は、再帰的な自己改善のためのモデルハーネスの共同進化を動機付けます: 固定モデルのためのビルドハーネス、検証された兄弟軌道からモデルを更新し、モデル能力の変更としてハーネスを再構築します。
このループを実現するには、介入のアイデンティティと効果を維持しながら、ハーネスを進化させる制御された方法が必要である。
我々は,HELIXを資源追跡可能なHELIX基板として提案する。
HELIXはエージェントシステムをタイプされたポート、再利用可能な原子、レシピ、製品シェル、実行時ポリシーに分解する。
トラジェクトリ、テスト結果、証明を維持しながら、介入を明確かつ監査可能にする。
したがって、ハーネスの進化は、固定モデルの実行を改善し、一致した成功、回帰、ほぼミス、そしてその後のモデル改善のためのデータとして代替ソリューションを生成する2つの関連した役割を果たす。
コード修復において,HELIXを1回の進化ラウンドで評価した。
65の候補ポートフォリオは、Pi上でタスクカバレッジを4.0%改善する固定ハーネスを発見し、完全なポートフォリオは相補的な兄弟姉妹動作によって58.0%以上の検証されたカバレッジを公開する。
選択された候補を繰り返し実行し、SWEベンチ評価器で評価する。
200スロットの兄弟スライスにより、SFT、批評家、フィルター、好みの記録が438個確認される。
ハーネス進化は現在の能力を拡大し、次のモデルの学習信号を生成する; モデル更新は次のハーネス進化のラウンドを動機付ける。
HELIXはこの再帰過程を研究するための監査可能なインタフェースを提供する。
コードはhttps://github.com/HKUDS/HELIX.comで入手できる。
関連論文リスト
- Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails [23.287109132562403]
自動化されたハーネス進化により、より小さなモデルは、フロンティアモデルコストのごく一部で、ドメイン固有のタスクでうまく機能することができる。
模倣は知識を伝達し,足場の使用量を増加させるが,モデルハーネスの適合性を阻害することを示す。
我々は、メタレベルのMLEエージェントによって自動化され、弱いモデル自身のロールアウトにおいて失敗するターンをローカライズし、専門家にそのターンのみを書き直すよう依頼する、オンデマンドの専門家補正パイプラインを開発する。
論文 参考訳(メタデータ) (2026-09-08T17:53:49Z) - HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - Harness Continual Learning: Continual Adaptation Beyond Model Parameters [9.54786133734043]
我々は、凍結基盤モデルを中心にハーネスが進化する新しい連続学習パラダイムを定式化する。
候補者は、現在の改善、履歴保持、有効性を確認した後にのみハーネスをコミットする。
実験では、複数の設定で対応するベースラインに対して、相対的なゲインが10%を超える能力の蓄積と障害回復が示されている。
論文 参考訳(メタデータ) (2026-08-19T15:12:31Z) - One Recipe, Many Harnesses: What Self-Evolution Encodes Across Languages and Models [46.83445434865936]
自己進化型ハーネスは、エージェントが自身のロールアウトを検査し、プロンプト、ツール、メモリを編集するクローズドループシステムである。
ベンチマーク固有の適応、言語固有のエンジニアリング知識、あるいは基礎となるモデルの制限に対する補償をエンコードしているかどうかは不明だ。
論文 参考訳(メタデータ) (2026-08-10T19:45:45Z) - EvolveNet: Collaborative Harness Evolution for Agent Self-Improvement [70.68218215070745]
既存のアプローチでは、すべての実行エクスペリエンスを単一のハーネスにルーティングできると仮定している。
EvolveNetは、経験抽出をデータに移動させるハーネス進化のパラダイムである。
論文 参考訳(メタデータ) (2026-08-05T15:37:18Z) - Automated Discovery Has No Universally Superior Harness [63.53666712024897]
我々はOpenEvolveスタイルの進化的探索とTT-Discoverサーチハーネスを構成成分に分解する。
12組のモデルプロブレムペアで30個の予算整合ハーネスを評価した。
論文 参考訳(メタデータ) (2026-07-20T17:59:37Z) - Rethinking the Evaluation of Harness Evolution for Agents [83.07258924910069]
既存のハーネス進化法では、単体テストケースを使用してハーネス構成を検索し、同じ公開ベンチマークで最終的なパフォーマンスを報告している。
このプロトコルは2つの基本的な懸念を提起する。
エージェントによるテスト時間スケーリングと同様に、一致したフィードバックと推論予算の下で単純なタスクレベルの検索ベースラインと比較すべきである。
論文 参考訳(メタデータ) (2026-07-14T00:18:42Z) - HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry [35.87794858139959]
HarnessXは、構成可能、適応可能、進化可能なエージェントハーネス用のファウンダリーである。
型付きハーネスプリミティブを置換代数学で組み立て、AIGISを介して適応する。
軌道をハーネス更新とモデルトレーニング信号の両方に変換することでハーネスモデルループを閉じる。
論文 参考訳(メタデータ) (2026-06-12T08:27:11Z) - Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents [82.27610290890475]
i) ハーネス更新、(i) 実行証拠から有用な永続的ハーネス更新を生成する能力、(ii) ハーネスベネフィット、タスク解決時に更新されたハーネスの恩恵を受ける能力の2つのハーネス自己進化能力を分析した。
まず、ハーネス更新は基本能力において平坦である:異なる能力階層のモデルがハーネス更新を生成し、驚くほど類似したゲインをもたらす。
第二に、ハーネスベネフィットは基本能力において単調ではない:弱い層モデルは更新されたハーネスからほとんど恩恵を受けず、中層モデルは最も恩恵を受け、強い層モデルは中層より利益が低い。
論文 参考訳(メタデータ) (2026-05-28T22:16:14Z) - DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations [12.048713464721665]
DemoEvolveは、進化を活用するためのデモブートストラップ付きのアプローチである。
我々はこのパラダイムを標本効率の速い適応の一形態として研究する。
DemoEvolveは、より効果的で監査可能なハーネス編集を生成する。
論文 参考訳(メタデータ) (2026-05-23T12:10:52Z) - Provably Efficient Online RLHF with One-Pass Reward Modeling [70.82499103200402]
人間のフィードバックからの強化学習は、大規模言語モデルと人間の好みを合わせることに顕著な成功を収めた。
オンラインRLHFは有望な方向性として現れ、反復的なデータ収集と改善を可能にしている。
本稿では,過去のデータを保存する必要をなくし,反復毎に一定時間更新を行うワンパス報酬モデリング手法を提案する。
論文 参考訳(メタデータ) (2025-02-11T02:36:01Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。