論文の概要: MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution
- arxiv url: http://arxiv.org/abs/2610.05300v1
- Date: Sun, 04 Oct 2026 15:22:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 21:50:01.526776
- Title: MESH-Harness: Self-Improving Agent Harnesses via Bandit-Guided Compositional Evolution
- Title(参考訳): MESH-Harness: Bandit-Guided compositional Evolutionによる自己改善剤Harnesses
- Abstract要約: MESH-Harnessは、各ハーネスを明示的なロール固有のインターフェイスを持つ機能モジュールにまとめる。
Mixed-start coordinate ascentは、空間を列挙することなく、評価のための完全な構成を選択する。
繰り返しハーネス最適化はMESH-Harnessを5.63-7.79ポイント改善した。
- 参考スコア(独自算出の注目度): 51.00839146188019
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An agent harness is the code that organizes context, maintains state, and coordinates tool calls for a language model. We study how to improve the harness under a limited evaluation budget while keeping model weights fixed. Our method, MESH-Harness, organizes each harness into functional modules with explicit role-specific interfaces, allowing alternative implementations of each module to be substituted and recombined. It uses shared module representations and full-covariance LinUCB to score candidate combinations based on predicted performance and exploration value. Mixed-start coordinate ascent selects complete configurations for evaluation without enumerating the combinatorial space. Validation traces then guide local code edits, and the resulting candidates are incorporated into fixed-capacity role-specific pools for subsequent recombination. On text tasks, retrieval-augmented mathematical reasoning, code generation, and interactive scientific tasks, MESH-Harness outperforms Meta-Harness by 5.70, 7.01, 2.00, and 5.00 points, respectively, under matched candidate-evaluation budgets. Iterative harness optimization improves MESH-Harness by 5.63-7.79 points over its first-round configurations. For the reported configurations, aggregate test-time cost is 44.2% lower than that of Meta-Harness, while total cost including search is 14.6% lower. These results show that combining module-level design reuse with feedback-driven compositional search can systematically improve agent harnesses while keeping overall optimization cost under control.
- Abstract(参考訳): エージェントハーネスは、コンテキストを整理し、状態を維持し、言語モデルのためのツール呼び出しをコーディネートするコードである。
モデル重量を一定に保ちながら、限られた評価予算の下でハーネスを改善する方法について検討する。
提案手法であるMESH-Harnessは,各ハーネスを明示的なロール固有のインターフェースで機能モジュールに整理し,各モジュールの代替実装を代用し,再結合する。
共有モジュール表現と全共分散LinUCBを使用して、予測性能と探索値に基づいて候補組合せをスコアする。
Mixed-start coordinate ascentは、組合せ空間を列挙することなく、評価のための完全な構成を選択する。
検証トレースは、ローカルコード編集をガイドし、その結果の候補は、その後の再結合のために固定容量ロール固有のプールに組み込まれる。
テキストタスク、検索強化された数学的推論、コード生成、インタラクティブな科学タスクにおいて、MESH-Harnessは、一致した候補評価予算の下で、Meta-Harnessを5.70、7.01、2.00、および5.00ポイントで上回っている。
繰り返しハーネス最適化はMESH-Harnessを5.63-7.79ポイント改善した。
報告された構成では、テスト時間の総コストはMeta-Harnessよりも44.2%低く、検索を含む総コストは14.6%低い。
これらの結果から,モジュールレベルの設計再利用とフィードバック駆動型構成探索を組み合わせることで,全体の最適化コストを制御下に保ちながら,エージェントハーネスを体系的に改善できることが示唆された。
関連論文リスト
- SHarP: Saliency-based Pruning of Agent Harnesses [55.076331468597594]
Agentは、モデル呼び出し、ツールの使用、タスクの実行を調整することで、大規模な言語モデルが複雑なタスクを完了するのを助ける。
結果として、いくつかのハーネスモジュールが冗長であるかどうかは不明である。
ニューラルネットワークのプルーニングにインスパイアされた我々は、タスクパフォーマンスとトークンコストのバランスを改善する手段として、ハーネスプルーニングを研究した。
論文 参考訳(メタデータ) (2026-10-03T00:41:14Z) - Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification [30.941867057615223]
既存の提案と検証のメソッドは、固定されたタスクセットですべての候補をスコアします。
私たちは、自動化ハーネス進化のための予算対応フレームワークであるHarnessLensを紹介します。
論文 参考訳(メタデータ) (2026-08-27T16:12:23Z) - Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection [51.39973047614183]
本稿では,適応型検証タスク選択によるLLMの効率向上のための新しい手法を提案する。
$textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTask-CoEvolve$.textbfTaskは、情報的タスクの選択と、部分的な評価からフルセットのパフォーマンスの推定という2つの課題に対処することで、ハーネスでバリデーションタスクを共進化させる。
論文 参考訳(メタデータ) (2026-08-20T15:24:54Z) - HarnessOpt-Bench: Evaluating LLMs at Harness Optimization [3.846854817984248]
高価な評価体制下でのエンド・ツー・エンドのハーネス最適化のためのベンチマークを導入する。
信頼された実行環境は、評価境界、ターゲットエージェントリソースの使用を強制し、監査のための候補バージョンを保存する。
実験結果から、モデルはコードハーネスよりも分離され、ネイティブハーネスは一貫して優れておらず、タスク間で利得が大きく異なることがわかった。
論文 参考訳(メタデータ) (2026-08-06T17:21:05Z) - COMPAS: Difficulty-Aware Joint Search for Optimizing Code Generation [16.33065582566179]
低コストモデル選択と共同プロンプトデコード検索により,グループ固有の品質・コスト面を学習する難易度認識手法であるCompASを導入する。
LiveCodeBenchの検索予算で、CompASはパス@1を最高のベースラインで45.9%から52.8%に改善し、コストは36.57ドルから4.92ドルに削減した。
論文 参考訳(メタデータ) (2026-08-05T01:28:43Z) - Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness [11.231092673447735]
本稿では,木に応用したエージェントベースのコスト・アウェア・アッパー・バウンドを提案する。これは,2部目のプレフィックス・リユース・グラフから得られた再利用・アウェア・レギュラー化項を用いて,UCTを拡張した木探索アルゴリズムである。
Agent-UCTは、以前実体化された設定プレフィックスを利用したブランチに対する選択をバイアスし、効果的な探索を維持しながら冗長な実行を減らす。
WTB(Workflow Test Bench)は、決定論的リプレイ、コンテンツ適応可能なキャッシング、トランザクション一貫性を提供し、中間状態が一度実体化され、検索計算全体で再利用されることを保証する。
論文 参考訳(メタデータ) (2026-07-27T08:41:18Z) - Meta-Harness: End-to-End Optimization of Model Harnesses [52.31507076660471]
本稿では,大規模言語モデル(LLM)アプリケーションのためのコード検索を行う外部ループシステムであるMeta-Harnessを紹介する。
オンラインテキスト分類では、Meta-Harnessは4倍少ないコンテキストトークンを使用しながら、最先端のコンテキスト管理システムを7.7ポイント改善する。
検索強化数学推論では、200 IMOレベルの問題の精度を5つの保留モデルの平均4.7ポイント向上する。
論文 参考訳(メタデータ) (2026-03-30T05:33:50Z) - Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning [88.55095746156428]
Retrieval-augmented Generation (RAG) は、外部知識を大規模言語モデルに組み込むために広く利用されている。
標準的なRAGパイプラインは、クエリ書き換え、文書検索、文書フィルタリング、回答生成など、いくつかのコンポーネントで構成されている。
本稿では,複数コンポーネントからなる複雑なRAGパイプラインを多エージェント協調作業として扱うことを提案する。
論文 参考訳(メタデータ) (2025-01-25T14:24:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。