論文の概要: TTHE: Test-Time Harness Evolution
- arxiv url: http://arxiv.org/abs/2607.08124v1
- Date: Thu, 09 Jul 2026 05:53:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.419444
- Title: TTHE: Test-Time Harness Evolution
- Title(参考訳): TTHE: テストタイムのハーネス進化
- Authors: Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han,
- Abstract要約: 既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
- 参考スコア(独自算出の注目度): 50.26245555541721
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The behavior of an LLM agent is determined not only by the underlying model, but also by its harness: the executable program that constructs context, invokes tools, verifies intermediate results, and recovers from failures. Existing approaches optimize such harnesses before deployment, searching training or development data for a fixed agent workflow that is then frozen at test time. This limits adaptation when the test distribution, failure modes, or tool interactions differ from those seen during development. We ask whether the harness can instead be optimized during evaluation itself, using only the unlabeled execution traces the agent produces on the test inputs. We introduce Test-Time Harness Evolution (TTHE), which treats the executable harness as the state of test-time adaptation. During evaluation, TTHE maintains a population of candidate harnesses and refines them through an agentic proposer that reasons over their execution traces, without gold labels or task-specific supervision; a judge then commits an improved harness from execution-derived proxy signals, and the selected program persists to govern subsequent inputs. Crucially, TTHE does not update model weights, require gold labels, or train a separate adaptation model: solver, proposers, and judge are different roles and harnesses around the same frozen LLM, so all adaptation occurs through changes to the surrounding program. Across text-to-SQL, competitive programming, software engineering, data-science coding, and agentic tool-use tasks, TTHE improves fixed ReAct-style baseline harnesses, yielding persistent, inspectable improvements rather than a pre-searched workflow or per-query retries. These results recast test-time adaptation for LLM agents as evolution over executable control programs and identify execution-derived proxy reliability as a central challenge for robust unsupervised agent improvement.
- Abstract(参考訳): LLMエージェントの振る舞いは、基盤となるモデルだけでなく、その利用法によっても決定される:コンテキストを構築し、ツールを呼び出し、中間結果を検証し、失敗から回復する実行可能なプログラム。
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
これにより、テストの配布、障害モード、ツールのインタラクションが開発中に見られるものと異なる場合、適応が制限される。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
テスト時間適応の状態として実行可能なハーネスを扱うテスト時ハーネス進化(TTHE)を導入する。
評価中、TTHEは候補ハーネスの人口を維持し、エージェントプロジェクタを通じて、ゴールドラベルやタスク固有の監督なしに、実行トレースの理由を判断し、その後、審査員は実行由来のプロキシ信号から改善されたハーネスをコミットし、選択されたプログラムは後続の入力の制御に継続する。
重要なことは、TTHEはモデルの重みを更新したり、金のラベルを要求したり、別の適応モデルを訓練したりしない。
テキストからSQLへの変換、競合プログラミング、ソフトウェアエンジニアリング、データサイエンスコーディング、エージェントツールの使用タスクを含むTTHEは、修正されたReActスタイルのベースラインハーネスを改善し、事前に検索されたワークフローやクエリごとのリトライよりも永続的で検査可能な改善をもたらす。
これらの結果から, LLMエージェントの試験時間適応を実行可能制御プログラムの進化として再放送し, 実行元プロキシ信頼性を堅牢な教師なしエージェント改善のための中心的課題として同定した。
関連論文リスト
- GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science [39.146761527401424]
GRACE-DSは、LSMを用いたオートMLエージェントの事前デプロイ評価のための、データサイエンスにおけるリワード誘導エージェント補正環境である。
エージェントをリアルなワークフローステージに公開し、計画やデータインスペクションから機能エンジニアリング、モデル開発、バリデーション、コード修正まで、最終提出まで。
これらの結果から、GRACE-DSはLLMベースのAutoMLエージェントが実運用環境下で機械学習を実行する能力を評価するための堅牢なプラットフォームとして確立された。
論文 参考訳(メタデータ) (2026-06-14T19:58:06Z) - From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws [12.757205456771295]
本稿では,エージェント故障の診断と修復を行うためのトレースガイドフレームワークであるHarnessFixを提案する。
HarnessFixは生の実行トレースをコンパイルし、コードをHarness対応のトレース中間表現に変換する。
障害の原因は、責任ある軌道ステップとレイヤの活用、繰り返し診断を実行可能な欠陥レコードに集約し、スコープ化された修復オペレータにマップすることにある。
論文 参考訳(メタデータ) (2026-06-04T15:58:30Z) - Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference [51.55077364626896]
本稿では,過去の軌道のみを用いたエージェント・ハーネスを最適化する自己教師型手法であるRetrospective Harness Optimization (RHO)を紹介する。
RHOは、過去の軌跡から様々な課題のコアセットを選択し、それらを並列に解決する。
1回の最適化ラウンドでは、SWE-Bench Proのパスレートが59%から78%に向上する。
論文 参考訳(メタデータ) (2026-06-04T09:26:00Z) - Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows [18.6534256358905]
本稿では,リアルエージェントシステムにおける構成レベルのハーネス効果を評価するための診断ベンチマークであるHarness-Benchを紹介する。
ベンチマークには、実用的なエージェント使用パターンから構築された106のサンドボックス化されたオフラインタスクが含まれている。
5,194個の実行軌道にまたがって、完了、プロセス品質、効率、障害挙動のかなりの変化を観察する。
論文 参考訳(メタデータ) (2026-05-27T03:47:35Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z) - AgentDevel: Reframing Self-Evolving LLM Agents as Release Engineering [8.201374511929538]
AgentDevelは、現行のエージェントを反復的に実行するリリースエンジニアリングパイプラインである。
実行トレースから実装盲の症状レベルの品質信号を生成する。
主要な症状パターンを集約し、監査可能なエンジニアリング仕様を生成する。
論文 参考訳(メタデータ) (2026-01-08T05:49:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。