AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
Abstractの概要
本論文では、長期にわたるタスクにおいてLLMエージェントの外部ハーネスを自動的に改善するフレームワークであるAutoSaddlerを提案する。本手法は、ハーネスの最適化を実行トレースに対するオフラインのミニバッチ学習問題として定式化し、失敗を診断して更新候補へと変換する。根拠に基づく診断、プロンプト・ツール・ミドルウェアにわたる構造化されたパッチ生成、および過去の更新履歴を保持するEvoDAGを用いた検証ベースの選択を組み合わせている。単発の修正ではなく、単一の軌跡を超えて汎化する持続的なハーネス変更の生成を目的とする。
新規性
特徴的な貢献は、手動チューニングやプロンプトのみの最適化に依存するのではなく、ハーネス最適化を失敗トレースによって駆動されるオフライン学習プロセスとして扱った点にある。AutoSaddlerは、プロンプト、ツール、ミドルウェア層にまたがる構造化された介入空間と段階的パッチスケジューリングを導入し、省察履歴を用いて候補提案を誘導するEvoDAGベースの進化メカニズムを備えている。
成果
GAIA2、SWE-Bench Pro、Terminal-Bench 2.0において、AutoSaddlerはベースハーネスを改善してそれぞれ62.0%、46.9%、50.0%のPass@1を達成し、各ベンチマークの最強の自動ベースラインを上回った。GAIA2では約1,000回のタスク実行で72.3%の開発精度に達した一方、GEPAとMeta-Harnessは約2,800回実行しても64.6%と61.5%で頭打ちとなった。アブレーション実験により、詳細な診断、構造化された介入、汎化を意識した選択のすべてがリグレッションの防止と性能向上維持に不可欠であることが確認された。
論文の注目点
- AutoSaddlerは、失敗トレースを診断して的を絞ったコードレベルのパッチを生成するオフラインのミニバッチ学習ループを通じてエージェントハーネスを最適化する。
- 修正をプロンプト、ツール、ミドルウェアの構造化カテゴリに整理して段階的スケジューリングを行い、EvoDAGメモリ構造を用いて更新履歴を追跡する。
- 3つのベンチマークにおいてPass@1の大幅な向上、優れた最適化効率、および未知タスクにおける低いリグレッション率を実証した。