論文の概要: Living-Harness Is an Interactive-Agent Evolver
- arxiv url: http://arxiv.org/abs/2607.26598v1
- Date: Wed, 29 Jul 2026 08:20:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.580575
- Title: Living-Harness Is an Interactive-Agent Evolver
- Title(参考訳): Living-Harnessはインタラクティブ・エージェント・エボルバー
- Abstract要約: 大規模言語モデル(LLM)エージェントは、エピソード内の障害や再試行後に回復する可能性があるが、同じ実行失敗は後続のタスクで再帰する可能性がある。
我々は,各軌道とその評価器信号を有界なハーネス更新のための後続証拠に変換する自己進化型エージェントハーネスである$textbfLiving-Harnessを提案する。
- 参考スコア(独自算出の注目度): 15.081919387954578
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents may recover from a failure within an episode or after a retry, yet the same execution failure can recur in later tasks because post-episode feedback rarely revises the persistent harness that guides future interactions. Static harnesses improve reliability through fixed tools, context, memory, and workflow structures, but remain unchanged after deployment. We propose $\textbf{Living-Harness}$, a self-evolving agent harness that converts each completed trajectory and its evaluator signals into posterior evidence for bounded harness updates. Guided by a domain-level $\textbf{Evolution-SOP}$ ($\textbf{S}$tandard $\textbf{O}$perating $\textbf{P}$rocedure), Living-Harness extracts an episode abstraction and structured update evidence, and writes two complementary forms of procedural knowledge: episodic memory that records trigger conditions, failure patterns, and recovery actions, and a state graph that records state nodes, repair edges, and transition rules. The updated harness state is retrieved to guide future interactions, while tools and base context remain frozen, allowing procedural repairs to accumulate across evolution cycles. On eight interactive environments derived from $τ^2$-Bench and MultiWOZ-2.4, Living-Harness improves average Pass@1 over the strongest interactive baseline by 10.07 and 9.91 percentage points, respectively, and supports retrieval-only reuse of the evolved harness state across model backbones.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、エピソード内の障害から回復したり、再試行した後でも、同じ実行障害が後続のタスクで再帰する可能性がある。
静的ハーネスは、固定されたツール、コンテキスト、メモリ、ワークフロー構造を通じて信頼性を向上させるが、デプロイ後も変わらない。
我々は,各軌道とその評価器信号を有界なハーネス更新のための後続の証拠に変換する自己進化型エージェントハーネスである$\textbf{Living-Harness}$を提案する。
ドメインレベルの$\textbf{Evolution-SOP}$$$$\textbf{S}$tandard $\textbf{O}$perating $\textbf{P}$rocedureによってガイドされたLiving-Harnessは、エピソード抽象化と構造化された更新証拠を抽出し、2つの補完的な手続き的知識を記述している。
更新されたハーネス状態は将来のインタラクションをガイドするために検索され、ツールとベースコンテキストは凍結され、進化サイクル全体にわたって手続き的な修復が蓄積される。
τ^2$-BenchとMultiWOZ-2.4から派生した8つのインタラクティブ環境において、Living-Harnessは10.07と9.91のパーセンテージで平均的なPass@1を改善し、モデルバックボーン間の進化したハーネス状態の検索のみの再利用をサポートする。
関連論文リスト
- From Interaction Traces to Persistent Skills: Online Evolution for Computer-Use Agents [48.50635499112162]
本稿では,インタラクショントラジェクトリと評価器フィードバックを再利用手順の永続的でバージョン管理されたライブラリに変換するオンラインスキル進化フレームワークを提案する。
我々は、OSWorldの4つのアプリケーションドメインにまたがって、完全に進化するライブラリシステムと、設定にマッチした空のライブラリ制御を比較した。
GIMPでは、プロファイランス・アウェア・アナリティクスにより、タスク・オブ・オリジンの境界を越えた検索とリビジョンが示され、繰り返し受け入れられた編集が元のタスクの回復に失敗する。
論文 参考訳(メタデータ) (2026-09-04T08:29:45Z) - REER-PT: Reverse-Engineered Reasoning for Perplexity-Guided Pre-training Data Augmentation [64.84437332310516]
我々は,Reverse-Engineered Reasoning (REER) を生の事前学習データに拡張するスケーラブルなフレームワークである textbfREER-PT を紹介する。
REER-PTは予測が難しいが、それ以前のコンテキストから推論できる継続を識別し、コンテキストと継続の間の欠落した接続を再構築する簡潔な推論アノテーションを挿入する。
このスパース変換は、ソーステキストを保存し、トレーニング前のオンライン推論ロールアウトを避けることで、標準的な次世代の予測と互換性を維持します。
論文 参考訳(メタデータ) (2026-08-31T11:34:19Z) - Harness Continual Learning: Continual Adaptation Beyond Model Parameters [9.54786133734043]
我々は、凍結基盤モデルを中心にハーネスが進化する新しい連続学習パラダイムを定式化する。
候補者は、現在の改善、履歴保持、有効性を確認した後にのみハーネスをコミットする。
実験では、複数の設定で対応するベースラインに対して、相対的なゲインが10%を超える能力の蓄積と障害回復が示されている。
論文 参考訳(メタデータ) (2026-08-19T15:12:31Z) - Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution [13.491535879221901]
PMCoderは、階層的なフェーズプランナーとエピソードメモリを結合する問題解決エージェントである。
SWE-bench Verifiedでは、PMCoderはハーネスマッチングベースラインよりも平均25ドル高いケースを解決している。
論文 参考訳(メタデータ) (2026-08-07T05:05:05Z) - Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents [0.0]
AIエージェントは、実行している各エピソードで学習機会に遭遇し、ほとんどすべてのエピソードを破棄する。
このフィードバックは, 凍結モデルと外部メモリとのペアリングにおいて, 連続学習に十分な信号であることを示す。
1ビットの判定結果から得られた学習は、単一審理成功を1.6$times$ベースラインに引き上げ、修正から2.6$times$に学習し、84のタスクのうち22をベースラインが解決しなかったタスクに変換する。
論文 参考訳(メタデータ) (2026-07-24T10:01:00Z) - Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift [0.0]
永続的な命令成分を型付きセマンティックグラフとして維持するためのグラフ正規化エージェントコンテキスト進化(GRACE)を提案する。
制御された分散シフトプロトコルの下で,2ドルベンチから導出される固定通信エージェントのGRACEを評価する。
論文 参考訳(メタデータ) (2026-07-10T08:10:37Z) - SEAGym: An Evaluation Environment for Self-Evolving LLM Agents [30.362414820430402]
SEAGymは、トレーニング、検証、テスト、リプレイ、コストレコードにわたるエージェントの更新を測定するための評価環境である。
これはHarbor互換のベンチマークを、列車のバッチ、凍結された更新バリデーション、ホールドアウトIDとOOD転送ビュー、診断の再生、保存されたスナップショットとメトリックレコードを備えた動的自己進化タスクソースに変換する。
論文 参考訳(メタデータ) (2026-06-16T05:50:55Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z) - Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses [57.20181537213498]
Agentic Harness Engineering (AHE)は、ハーネスエンジニアリングを自動化するクローズドループである。
AHEは3つの一致した可観測性柱を通じて課題に対処する。
10 AHE lift pass@1 on Terminal-Bench 2 from 69.7% to 77.0%。
SWE-bench-verifiedでは、種子よりも12%少ないトークンで合計成功率を上回り、ターミナルベンチ2では+5.1から+10.1ppのクロスファミリーゲインを得る。
論文 参考訳(メタデータ) (2026-04-28T16:55:02Z) - All-Mem: Agentic Lifelong Memory via Dynamic Topology Evolution [20.68235182577703]
All-Memは明示的で非破壊的な統合を通じて構造化されたメモリバンクを維持している。
LLM診断器は定期的にオフラインで、SPLIT、MERGE、UPDATEの3つの演算子で実行される信頼性スコアトポロジ編集を提案する。
クエリ時には、タイプドリンクはホップバウンドで、アクティブアンカーから必要に応じてアーカイブされたエビデンスへの予算付き拡張を可能にする。
論文 参考訳(メタデータ) (2026-03-20T03:14:40Z) - OMG-Agent: Toward Robust Missing Modality Generation with Decoupled Coarse-to-Fine Agentic Workflows [9.617220633655716]
textbfunderlineOmni-textbfunderlineModality textbfunderlineGeneration Agent (textbfOMG-Agent)について述べる。
論文 参考訳(メタデータ) (2026-02-04T02:25:40Z) - Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution [52.76038908826961]
我々は静的ストレージと動的推論のギャップを埋めるため、$textbfReMe$ ($textitRemember Me, Refine Me$)を提案する。
ReMeは3つのメカニズムを通じてメモリライフサイクルを革新する: $textitmulti-faceted distillation$, きめ細かい経験を抽出する。
BFCL-V3とAppWorldの実験では、ReMeが新しい最先端のエージェントメモリシステムを確立している。
論文 参考訳(メタデータ) (2025-12-11T14:40:01Z) - Boot and Switch: Alternating Distillation for Zero-Shot Dense Retrieval [50.47192086219752]
$texttABEL$は、ゼロショット設定でのパス検索を強化するための、シンプルだが効果的な教師なしのメソッドである。
ラベル付きデータに対して$texttABEL$を微調整するか、既存の教師付き高密度検索と統合することにより、最先端の結果が得られる。
論文 参考訳(メタデータ) (2023-11-27T06:22:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。