論文の概要: Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
- arxiv url: http://arxiv.org/abs/2608.08466v1
- Date: Sun, 09 Aug 2026 04:17:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.836262
- Title: Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses
- Title(参考訳): 階層的自己改善: タスク固有の進化可能なエージェントハーネスのためのフレームワーク
- Authors: Tailin Zhou,
- Abstract要約: この研究は、ハーネスがエンフタスク特有のもので連続的に進化可能な代替手段を研究する:各タスクファミリーは独自のハーネスを維持している。
思考/オフ設計は、タスク実行中に推論を無効にすることで、ハーネス進化の寄与を分離する。
HSIは、中等微分タスクの初期ハーネスよりも一貫した利得を達成する。
- 参考スコア(独自算出の注目度): 1.238646251639847
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern LLM agents are often improved by modifying prompts, tools, or workflows manually, while the executable scaffold surrounding the model---the \emph{harness}---is typically treated as a fixed artifact after deployment. This work studies an alternative where the harness is \emph{task-specific and continuously evolvable}: each task family maintains its own harness, which is hot-swapped across iterations through a fixed task-injection seam and rewritten using environment feedback. We introduce \textbf{Hierarchical Self-Improvement (HSI)}, a framework in which a single frozen LLM $M$ operates across three hierarchical scopes: a task harness $H$ that executes tasks, an evolver that rewrites $H$, and a meta-evolver that rewrites the evolver's strategy code under a frozen outer anchor. A thinking-on/off design isolates the contribution of harness evolution by disabling reasoning during task execution while enabling it during self-modification. HSI is bounded by two factors: a \emph{feedback-fidelity bound}, since evolution requires informative reward signals to guide selection, and a \emph{backbone capability bound}, since harness redesign cannot overcome limitations of the frozen model. On BALROG with DeepSeek-V4-Flash-Preview as the frozen backbone, HSI achieves consistent gains over the initial harness on moderate-difficulty tasks ($+39.3$ on BabyAI, $+33.0$ on Crafter, $+25.0$ on TextWorld, and $+15.0$ on MiniHack, all in raw \% Progress), while obtaining strong held-out generalization on BabaIsAI sub-suites ($0.98$ best-test on BreakStop and $1.00$ on GoTo from a $20\%$ unseen split). On tasks beyond the backbone's capability (NLE), harness evolution provides no improvement. These results demonstrate task-specific harness evolution as a viable axis for improving frozen LLM agents under clear empirical limits. Code is available at https://github.com/TailinZhou/hsi.
- Abstract(参考訳): 現代のLLMエージェントは、手動でプロンプトやツール、ワークフローを変更することで改善されることが多いが、モデルを取り巻く実行可能な足場である--the \emph{harness}--は通常、デプロイ後に固定アーティファクトとして扱われる。
この研究は、ハーネスがemph{task-specific and continuous evolvable} である別の方法を研究する。各タスクファミリーは、固定されたタスクインジェクションのシームを通じてイテレーション間でホットスワップされ、環境フィードバックを使って書き換えられる独自のハーネスを維持している。
これは、単一の凍結LDM$M$が、タスクを実行するタスクハーネス$H$、$H$を書き換える進化論者、凍結した外部アンカーの下で進化論者の戦略コードを書き換えるメタ進化論者という、3つの階層的なスコープで機能するフレームワークである。
思考/オフ設計は、タスク実行中に推論を無効にし、自己修正時にそれを可能にすることで、ハーネス進化の寄与を分離する。
HSIには2つの要素がある: 進化は選択を導くために情報的な報酬信号を必要とするため、再設計は凍結モデルの制限を克服できないため、HSIは2つの要素に縛られている。
DeepSeek-V4-Flash-Preview を冷凍バックボーンとして使用した BALROG では、HSI は中等微分タスクの初期ハーネス (+39.3$ on BabyAI, $+33.0$ on Crafter, $+25.0$ on TextWorld, $+15.0$ on MiniHack, all in raw \% Progress) を達成しつつ、BabaIsAI サブスーツ (0.98$ best-test on BreakStop, $1.00$ on GoTo from a 20\% $ unseen split) を強く保留した。
バックボーンの能力(NLE)を超えたタスクでは、ハーネスの進化は改善しない。
これらの結果から, 凍結型LCM剤を明確な経験的限界下で改良するための軸として, タスク特異的ハーネスの進化が示唆された。
コードはhttps://github.com/TailinZhou/hsi.comで入手できる。
関連論文リスト
- Living-Harness Is an Interactive-Agent Evolver [15.081919387954578]
大規模言語モデル(LLM)エージェントは、エピソード内の障害や再試行後に回復する可能性があるが、同じ実行失敗は後続のタスクで再帰する可能性がある。
我々は,各軌道とその評価器信号を有界なハーネス更新のための後続証拠に変換する自己進化型エージェントハーネスである$textbfLiving-Harnessを提案する。
論文 参考訳(メタデータ) (2026-07-29T08:20:11Z) - Scaling Self-Evolving Agents via Parametric Memory [69.96398842169002]
既存のメモリ拡張LDMエージェントは、過去の経験をプロンプト空間にのみ保存する。
自己進化型パラメトリックメモリフレームワークである textttTMEM を導入する。
textttTMEMは、様々なモデルスケールで要約ベースのベースラインと検索ベースのベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-03T07:18:31Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - AEL: Agent Evolving Learning for Open-Ended Environments [43.56685432981852]
本稿では,この障害に対処する2段階のフレームワークであるemphAgent Evolving Learning (ael)を紹介する。
ael はシャープ比 2.13$pm$0.47 を達成し、5つの自己改善法を上回ります。
これは、エージェントの自己改善におけるボトルネックが、アーキテクチャの複雑さを追加するのではなく、経験の使い方を自覚していることを示している。
論文 参考訳(メタデータ) (2026-04-23T14:29:25Z) - The Last Harness You'll Ever Build [9.741938550862034]
AIエージェントは、複雑でドメイン固有のアプリケーションにますますデプロイされる。
我々は、ハーネスエンジニアリングプロセスを自動化する2段階のフレームワークを提案する。
メタラーニングへの対応を形式化し、両方のアルゴリズムを提示する。
論文 参考訳(メタデータ) (2026-04-22T18:51:48Z) - Label-Free Cross-Task LoRA Merging with Null-Space Compression [50.63908869296697]
我々は,ラベルフリーで出力に依存しない手法であるNull-Space Compression (NSC) Mergingを紹介した。
NSCは、従来のメソッドがタスクのサブセットに収まるバランスの取れたゲインを持つ20の異種視覚タスクに対して、最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-03-27T11:34:41Z) - SABER: Small Actions, Big Errors -- Safeguarding Mutating Steps in LLM Agents [52.20768003832476]
我々は$$-Bench (Airline/Retail) および SWE-Bench Verified 上での実行トレースを分析する。
成功を失敗に戻すための、先進的な逸脱、最初期の行動、レベル分岐を形式化する。
モデルに依存しない,勾配のない,テスト時のセーフガードである cm を導入します。
論文 参考訳(メタデータ) (2025-11-26T01:28:22Z) - Automated Rewards via LLM-Generated Progress Functions [47.50772243693897]
大きな言語モデル(LLM)は、様々なタスクにまたがる広いドメイン知識を活用することで、報酬工学を自動化する可能性がある。
本稿では,挑戦的なBi-DexHandsベンチマーク上で,最先端のポリシーを生成可能なLLM駆動の報酬生成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-11T18:41:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。