論文の概要: Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
- arxiv url: http://arxiv.org/abs/2609.26760v2
- Date: Thu, 24 Sep 2026 08:15:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.327391
- Title: Grow the Harness, Not the Context: From Strategy-Free Scaffolds to Reusable Specialist Agents
- Title(参考訳): 悪さを育む, コンテキストではなく - 戦略のないスカフォードから再利用可能なスペシャリストエージェントへ
- Abstract要約: 大きな言語モデル(LLM)エージェントは、しばしば関連するタスクのストリームを処理するが、標準的なハーネスは、各タスクのコンテキスト内で同じ制御決定を再構築するようモデルに繰り返し要求する。
タスク固有のセマンティック推論のためのLCMコールを保存しながら、繰り返し制御を再利用可能なコードに変換することができるかどうかを検討する。
我々は,障害誘導型トレーニングパラダイムであるGrowing Harnessを紹介し,エージェント自身を戦略のない足場から学習する。
- 参考スコア(独自算出の注目度): 40.22528682803753
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language model (LLM) agents often handle streams of related tasks, yet standard harnesses repeatedly ask the model to reconstruct the same control decisions inside each task's context. We study whether task feedback can instead turn recurring control into reusable executable code, while reserving LLM calls for task-specific semantic reasoning. We introduce Growing Harness, a failure-guided training paradigm that learns the agent harness itself from a strategy-free scaffold that exposes fixed model and tool interfaces but encodes no task-solving controller. Function-level execution traces localize each failure to a bounded code surface, an optimizer repairs a window of failures jointly, and a success-first held-out gate rolls back repair sequences that harm prior capability. Accepted edits accumulate in one shared harness, allowing its control structure to emerge from task feedback. Across BrowseComp-Plus and WebArena-Verified with three deployment models from 4B to 120B parameters, Growing Harness achieves the highest mean success in five of six benchmark-model settings and trails the best mean by 0.7 pp. in the sixth. Relative to a Tool-Calling agent, it reduces LLM calls by 76.0-91.8% and deployed-agent inference cost by 74.4-98.6%. On WebArena-Verified, its success remains 44.7-45.3% across model scales, whereas Tool-Calling falls to 6.7% with the 4B model. Ablations show that trace-local edits, joint repair, and gate-based rollback each improve final success. These results show that persistent program growth can move recurring control out of model context and into low-cost code, yielding reusable specialist agents that remain effective with smaller deployment models.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、しばしば関連するタスクのストリームを処理するが、標準的なハーネスは、各タスクのコンテキスト内で同じ制御決定を再構築するようモデルに繰り返し要求する。
タスク固有のセマンティック推論のためのLCMコールを保存しながら、繰り返し制御を再利用可能なコードに変換することができるかどうかを検討する。
我々はGrowing Harnessを紹介した。Growing Harnessは、エージェント自身を、固定モデルとツールインターフェースを公開するが、タスク解決コントローラをエンコードしない戦略のない足場から学習する、障害誘導型トレーニングパラダイムである。
関数レベルの実行トレースは、各障害をバウンダリされたコード表面にローカライズし、オプティマイザは、障害のウィンドウを共同で修復し、成功第一のホールトアウトゲートは、事前の能力を損なう修復シーケンスをロールバックする。
承認された編集は1つの共有ハーネスに蓄積され、その制御構造がタスクフィードバックから出現する。
BrowseComp-PlusとWebArena-Verifiedには、4Bから120Bパラメータの3つのデプロイメントモデルがある。
6番目です
Tool-Callingエージェントとは対照的に、LLMコールを76.0-91.8%削減し、デプロイエージェント推論コストを74.4-98.6%削減する。
WebArena-Verifiedでは、その成功率はモデルスケールで44.7-45.3%であり、Tool-Callingは4Bモデルで6.7%に落ちている。
アブレーションは、トレースローカルな編集、共同修復、ゲートベースのロールバックがそれぞれ最終成功を改善することを示している。
これらの結果から、持続的なプログラム成長は、モデルコンテキストから繰り返し制御を移動し、より小さなデプロイメントモデルで有効である再利用可能な専門家エージェントを生み出すことが示される。
関連論文リスト
- When Not to Imitate: Boundary-Aware Skill Memory for Reliable Tool-Use LLM Agents [62.10623192614306]
過去の成功からスキルを抽出することは、Large Language Model (LLM)エージェントの効率的な進化に不可欠である。
textbfBoundary-Aware Skill Memory (BASM)を提案する。
BASMは、成功度の高いスキルメモリベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-08-23T10:16:06Z) - Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents [80.03824805228719]
コンピュータ利用エージェントを開発する上での大きな課題は、大規模で高品質な軌道を収集することである。
我々は、失敗した軌道をエージェント改善に変換するデータ中心のパラダイムを提案する。
この手法をOSWorldベンチマーク上で,最先端のOpenCUA-72Bモデルを用いて検証する。
論文 参考訳(メタデータ) (2026-06-30T07:44:37Z) - Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems [0.10210859604701106]
セルフヒーリングエージェントオーケストレータは、信頼性をランタイム境界制御問題として扱う。
セルフヒーリングは98.8%のタスク成功を達成し、リトライオンリーでは94.5%、フルリプランでは93.8%を達成している。
論文 参考訳(メタデータ) (2026-05-31T19:27:22Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation [7.355373109826612]
本稿ではMAPDL自動化のための軽量エージェントハーネスであるCAX-Agentのアーキテクチャについて述べる。
我々は50の標準構造ベンチマークで3つのリカバリ戦略(no_recovery, rule_only, model_only)を評価した。
Model_onlyは、最大完了率(0.9267)、タスクスコア(3.59/4)、総得点(9.16/10)、ゼロ介入率(0.84)、0.7733, 3.17/4, 7.03/10, 0.00)、no_recovery(0.6933, 2.74/4, 5.60/10, 0.00)を大きな効果サイズで達成する。
論文 参考訳(メタデータ) (2026-05-12T14:46:34Z) - VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation [98.38575149237442]
VLAA-GUIは3つの統合コンポーネントを中心に構築されたモジュラーGUIフレームワークである。
必須完全性検証は、UIで観測可能な成功基準と検証を、各完了ステップで実施する。
強制的なループブレーカは、繰り返し失敗した後、多層切替インタラクションモードを提供する。
論文 参考訳(メタデータ) (2026-04-23T07:42:37Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling [16.396204092947496]
ツール拡張言語モデル(TaLM)を合成多段階タスクによって評価する,汚染のないフレームワークであるFuncBenchGenを提案する。
推論最適化モデルはGPT-5で汎用モデルより一貫して優れており、他のモデルよりも大幅に優れていることを示す。
強いモデルはしばしば構文的に有効な関数呼び出しを行うが、ステップ間で誤ったあるいは古い引数値を伝搬し、マルチターンツールの使用においてLLMによる不安定な状態追跡を明らかにする。
論文 参考訳(メタデータ) (2025-09-30T17:21:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。