論文の概要: Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
- arxiv url: http://arxiv.org/abs/2607.13285v1
- Date: Tue, 14 Jul 2026 21:39:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.594071
- Title: Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
- Title(参考訳): Harness Handbook:Evolving Agent Harnesss Readable,Navigable, Editable
- Authors: Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang,
- Abstract要約: 本稿ではハーネスから自動的に合成された行動コンテキスト中心の表現であるHarness Handbookを紹介する。
また,BGPD(Behaviment-Guided Progressive Disclosure)についても紹介する。
2つのオープンソースハーネスからの多様な修正要求に対して、ハンドブック支援プランニングは、振る舞いのローカライゼーションと編集計画の品質を改善している。
- 参考スコア(独自算出の注目度): 46.2784020602283
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The capability of a modern AI agent depends not only on its foundation model but also on its harness, which constructs prompts, manages state, invokes tools, and coordinates execution. As models, APIs, environments, and requirements evolve, the harness must be continually modified. Before such a change can be made, a developer or coding agent must identify all code locations that implement the target behavior. This is difficult because production harnesses are large, tightly coupled, and behaviorally distributed, while modification requests describe what the system should do and repositories are organized by files and modules. Code search, repository indexing, and long-context processing ease inspection, but still leave this behavior-to-code mapping to be recovered by hand. Behavior localization is therefore a central bottleneck in harness evolution. We introduce the Harness Handbook, a behavior-centric representation synthesized automatically from a harness codebase via static analysis and LLM-assisted structuring, linking each behavior to its corresponding source. We also introduce Behavior-Guided Progressive Disclosure (BGPD), which guides agents from high-level behaviors to relevant implementation details and verifies candidate locations against the current source. On diverse modification requests from two open-source harnesses, Handbook-Assisted planning improves behavior localization and edit-plan quality while using fewer planner tokens, with the largest gains on scattered sites, rarely executed paths, and cross-module interactions. Evolving complex agentic systems thus depends not only on generating edits, but also on determining where those edits should be made.
- Abstract(参考訳): 現代のAIエージェントの能力は、基礎モデルだけでなく、状態のプロンプト、管理、ツールの呼び出し、実行のコーディネートを行うハーネスにも依存する。
モデル、API、環境、要求が進化するにつれて、ハーネスは継続的に修正されなければならない。
このような変更が行われる前に、開発者またはコーディングエージェントは、ターゲットの振る舞いを実装するすべてのコード場所を特定する必要がある。
運用ハーネスが大きく、密結合され、振る舞いに分散しているのに対して、変更要求ではシステムがすべきことを記述し、リポジトリはファイルやモジュールによって整理されるため、これは難しい。
コード検索、リポジトリインデックス、長期コンテキスト処理は検査が容易だが、この振る舞いとコードのマッピングは手作業で復元される。
したがって、行動ローカライゼーションはハーネス進化における中心的なボトルネックである。
本稿では,静的解析とLCM支援による構造解析により,各動作を対応するソースにリンクする動作中心の表現であるHarness Handbookを紹介する。
また,BGPD(Behaviment-Guided Progressive Disclosure)を導入し,エージェントを高レベルな動作から関連する実装の詳細まで誘導し,現在のソースに対する候補位置の検証を行う。
2つのオープンソースハーネスの多様な修正要求に対して、ハンドブック支援プランニングは、より少ないプランナートークンを使用しながら、振る舞いのローカライズと編集-プラン品質を改善し、分散サイト、まれに実行されるパス、およびモジュール間相互作用に最大の利益をもたらす。
したがって、複雑なエージェントシステムの進化は、編集の生成だけでなく、編集すべき場所の決定にも依存する。
関連論文リスト
- TTHE: Test-Time Harness Evolution [50.26245555541721]
既存のアプローチでは、デプロイ前、トレーニング前、あるいはテスト時に凍結される固定されたエージェントワークフローの開発データを最適化する。
我々は、エージェントがテスト入力で生成するラベルのない実行トレースのみを使用して、評価自体にハーネスを最適化できるかどうかを問う。
評価中、TTHEは候補ハーネスの人口を維持し、それらの実行トレースの理由をエージェントプロジェクタを通じてそれらを洗練する。
その後、審査員は実行元プロキシ信号から改善されたハーネスをコミットし、選択したプログラムは継続してその後の入力を統治する。
論文 参考訳(メタデータ) (2026-07-09T05:53:39Z) - Code as Agent Harness [107.31925305395957]
新興のエージェントシステムでは、コードはもはや単なる目標出力ではない。
コードはエージェントの推論、行動、環境モデリング、実行ベースの検証のための運用上の基盤としてますます役立っている。
この調査は、実行可能、検証可能、ステートフルなAIエージェントシステムに向けた統一されたロードマップを提供する。
論文 参考訳(メタデータ) (2026-05-18T17:59:03Z) - AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents [1.4323566945483497]
ファンデーションモデルは、自動コード生成を変革しましたが、現実的な開発環境では、自律的なソフトウェアエンジニアリングエージェントは信頼できないままです。
本稿では,基盤モデルエージェントがプロジェクトを観察し,それを処理し,フィードバックを受信し,変更が完了したことを確定する,モデルハーネス環境システムを提案する。
このフレームワークは、ファンデーションモデルがパッチを作成できるかどうかから、モデルハーネス環境システムが検証可能な正確さ、属性、メンテナンス可能な変更を生成できるかどうかという、自律的なソフトウェアエンジニアリングの中心的な疑問を再考する。
論文 参考訳(メタデータ) (2026-05-13T11:14:59Z) - Agent Mentor: Framing Agent Knowledge through Semantic Trajectory Analysis [4.365760422569902]
我々は、Agent Mentorオープンソースライブラリの一部として実装された分析パイプラインを紹介する。
システムの監視と漸進的な適応によって、他のエージェントの振る舞いを定義する。
パイプラインは、エージェントの知識に修正命令を体系的に注入することで、パフォーマンスを向上させる。
論文 参考訳(メタデータ) (2026-04-12T08:02:54Z) - ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration [68.89572566071575]
ETAgentはエージェントのツール使用行動を調整するためのトレーニングフレームワークである。
過誤行動パターンを最適行動に段階的に校正するように設計されている。
論文 参考訳(メタデータ) (2026-01-11T11:05:26Z) - Data-Model Co-Evolution: Growing Test Sets to Refine LLM Behavior [10.041741229516141]
大きな言語モデル(LLM)により、開発者はプロンプト命令を編集することでモデルの振る舞いを制御できる。
我々はこのパラダイムを対話型システムで運用し、微妙でドメイン固有のポリシーをインシデントインストラクションにエンコードするという課題に対処する。
論文 参考訳(メタデータ) (2025-10-14T17:07:37Z) - Every Step Counts: Decoding Trajectories as Authorship Fingerprints of dLLMs [63.82840470917859]
本稿では,dLLMの復号化機構をモデル属性の強力なツールとして利用できることを示す。
本稿では、デコードステップ間の構造的関係を捉え、モデル固有の振る舞いをよりよく明らかにする、DDM(Directed Decoding Map)と呼ばれる新しい情報抽出手法を提案する。
論文 参考訳(メタデータ) (2025-10-02T06:25:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。