論文の概要: Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents
- arxiv url: http://arxiv.org/abs/2607.22688v1
- Date: Fri, 17 Jul 2026 02:39:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.027011
- Title: Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents
- Title(参考訳): 共調和:LLM剤のハーネスとモデルウェイトを共進化させる
- Authors: Zhengyu Chen, Teng Xiao, Huaisheng Zhu, Yige Yuan, Luan Zhang, Jingang Wang,
- Abstract要約: Co-Harnessは、ポストトレーニング中にエージェントハーネスとモデルパラメータを共同で最適化するフレームワークである。
自律的なケーススタディによると、Co-Harnessはシステムのクラッシュから回復し、推論効率を改善し、人間の介入なしにアンサンブル戦略を発見することができる。
- 参考スコア(独自算出の注目度): 37.91666123749406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training agents for automated AI research requires optimizing not only model parameters, but also the runtime harness that shapes how research trajectories are generated, evaluated, and learned from. Existing pipelines typically train models under a fixed harness, including prompts, tools, skills, middleware, and memory, while leaving the data-generating process outside the optimization objective. This creates a mismatch between model updates and the static scaffolding that determines trajectory quality. We introduce Co-Harness, a framework that jointly optimizes the agent harness and model parameters during post-training. Co-Harness alternates between harness optimization and model optimization. An LLM-based HarnessCritic analyzes failed trajectories, identifies harness-level failure modes, and proposes validated local updates. The model is then fine-tuned on high-quality trajectories generated by the improved harness, distilling effective scaffolding into model parameters. A 200+ hour autonomous case study further shows that Co-Harness can recover from system crashes, improve inference efficiency, and discover ensemble strategies without human intervention. These results suggest that joint harness and model optimization is an effective way to improve agents beyond fixed-harness post-training.
- Abstract(参考訳): 自動AI研究のためのポストトレーニングエージェントは、モデルパラメータだけでなく、研究軌跡の生成、評価、学習方法を形成するランタイムハーネスも最適化する必要がある。
既存のパイプラインは通常、プロンプト、ツール、スキル、ミドルウェア、メモリを含む固定ハーネスの下でモデルをトレーニングします。
これにより、モデル更新と軌道品質を決定する静的なスキャフォールディングのミスマッチが生成される。
ポストトレーニング中にエージェントハーネスとモデルパラメータを協調的に最適化するフレームワークであるCo-Harnessを紹介する。
Co-Harnessは、ハーネス最適化とモデル最適化を交互に行う。
LLMベースのHarnessCriticは、障害トラジェクトリを分析し、ハーネスレベルの障害モードを特定し、検証されたローカル更新を提案する。
その後、改良されたハーネスによって生成された高品質な軌道を微調整し、有効な足場をモデルパラメータに蒸留する。
200時間以上の自律的なケーススタディは、Co-Harnessがシステムのクラッシュから回復し、推論効率を改善し、人間の介入なしにアンサンブル戦略を発見することをさらに示している。
これらの結果から,ジョイントハーネスとモデル最適化は,固定ハーネス後トレーニング以上のエージェント改善に有効な方法であることが示唆された。
関連論文リスト
- Recursive Harness Self-Improvement [28.432258880153125]
モデル-ハーネス共進化の下では、ハーネスはデータ生成コンポーネントであり、実行トレースは将来の基礎モデルを形成することができる。
本稿では,エージェントループのプロンプトレベル仕様としてハーネスを表現したRecursive Harness Self-Improvement (RHI)を紹介する。
RHIは、自身のリビジョン履歴に対してペアのフィードバックを使って、反復的にそれを洗練します。
論文 参考訳(メタデータ) (2026-07-17T00:21:19Z) - Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference [51.55077364626896]
本稿では,過去の軌道のみを用いたエージェント・ハーネスを最適化する自己教師型手法であるRetrospective Harness Optimization (RHO)を紹介する。
RHOは、過去の軌跡から様々な課題のコアセットを選択し、それらを並列に解決する。
1回の最適化ラウンドでは、SWE-Bench Proのパスレートが59%から78%に向上する。
論文 参考訳(メタデータ) (2026-06-04T09:26:00Z) - SMILE: Zero-Shot Sparse Mixture of Low-Rank Experts Construction From Pre-Trained Foundation Models [85.67096251281191]
我々は、ゼロショットスパースミクチャー(SMILE)と呼ばれるモデル融合に対する革新的なアプローチを提案する。
SMILEは、余分なデータやさらなるトレーニングなしに、ソースモデルをMoEモデルにアップスケーリングできる。
画像分類やテキスト生成タスクなど,さまざまなシナリオに対して,フル微調整とLoRA微調整を用いて広範な実験を行う。
論文 参考訳(メタデータ) (2024-08-19T17:32:15Z) - Towards Stable Machine Learning Model Retraining via Slowly Varying Sequences [6.067007470552307]
そこで本研究では,リトレーニングを繰り返して安定なモデル列を見つけるためのモデルに依存しないフレームワークを提案する。
最適モデルの復元が保証される混合整数最適化の定式化を開発する。
平均的に、予測力の2%の低下は、安定性の30%の改善につながることが判明した。
論文 参考訳(メタデータ) (2024-03-28T22:45:38Z) - Deep autoregressive density nets vs neural ensembles for model-based
offline reinforcement learning [2.9158689853305693]
本稿では、利用可能なデータからシステムダイナミクスを推定し、仮想モデルロールアウトにおけるポリシー最適化を行うモデルベース強化学習アルゴリズムについて考察する。
このアプローチは、実際のシステムで破滅的な失敗を引き起こす可能性のあるモデルエラーを悪用することに対して脆弱である。
D4RLベンチマークの1つのよく校正された自己回帰モデルにより、より良い性能が得られることを示す。
論文 参考訳(メタデータ) (2024-02-05T10:18:15Z) - When to Update Your Model: Constrained Model-based Reinforcement
Learning [50.74369835934703]
モデルベースRL(MBRL)の非遅延性能保証のための新規で一般的な理論スキームを提案する。
続いて導いた境界は、モデルシフトとパフォーマンス改善の関係を明らかにします。
さらなる例では、動的に変化する探索からの学習モデルが、最終的なリターンの恩恵をもたらすことが示されている。
論文 参考訳(メタデータ) (2022-10-15T17:57:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。