FuguReport

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces

著者 Sungho Park, Wonjoong Kim, Rongyuan Tan, Jue Zhang, Wook-Shin Han, Pengfei Gao, Chanyoung Park, Yongqiang Yao, Rao Fu, Elsie Nallipogu, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang
所属 Korea Advanced Institute of Science and Technology / Microsoft / Southern University of Science and Technology / Pohang University of Science and Technology
カテゴリ Method / Optimization / Iterative harness updates from failures, Application / Agent Performance / Improving agent behavior, Evaluation / Benchmarking / Experimental validation on multiple benchmarks
ライセンス CC BY 4.0

Abstractの概要

本論文では、長期にわたるタスクにおいてLLMエージェントの外部ハーネスを自動的に改善するフレームワークであるAutoSaddlerを提案する。本手法は、ハーネスの最適化を実行トレースに対するオフラインのミニバッチ学習問題として定式化し、失敗を診断して更新候補へと変換する。根拠に基づく診断、プロンプト・ツール・ミドルウェアにわたる構造化されたパッチ生成、および過去の更新履歴を保持するEvoDAGを用いた検証ベースの選択を組み合わせている。単発の修正ではなく、単一の軌跡を超えて汎化する持続的なハーネス変更の生成を目的とする。

新規性

特徴的な貢献は、手動チューニングやプロンプトのみの最適化に依存するのではなく、ハーネス最適化を失敗トレースによって駆動されるオフライン学習プロセスとして扱った点にある。AutoSaddlerは、プロンプト、ツール、ミドルウェア層にまたがる構造化された介入空間と段階的パッチスケジューリングを導入し、省察履歴を用いて候補提案を誘導するEvoDAGベースの進化メカニズムを備えている。

成果

GAIA2、SWE-Bench Pro、Terminal-Bench 2.0において、AutoSaddlerはベースハーネスを改善してそれぞれ62.0%、46.9%、50.0%のPass@1を達成し、各ベンチマークの最強の自動ベースラインを上回った。GAIA2では約1,000回のタスク実行で72.3%の開発精度に達した一方、GEPAとMeta-Harnessは約2,800回実行しても64.6%と61.5%で頭打ちとなった。アブレーション実験により、詳細な診断、構造化された介入、汎化を意識した選択のすべてがリグレッションの防止と性能向上維持に不可欠であることが確認された。

論文の注目点

  1. AutoSaddlerは、失敗トレースを診断して的を絞ったコードレベルのパッチを生成するオフラインのミニバッチ学習ループを通じてエージェントハーネスを最適化する。
  2. 修正をプロンプト、ツール、ミドルウェアの構造化カテゴリに整理して段階的スケジューリングを行い、EvoDAGメモリ構造を用いて更新履歴を追跡する。
  3. 3つのベンチマークにおいてPass@1の大幅な向上、優れた最適化効率、および未知タスクにおける低いリグレッション率を実証した。

参考リンク

このページはGPT-5、Claude Opus 4、Gemini 3、Gemini 3.1 Flash Image 及びその上位バージョンなどの生成AIを用いて作成されています。内容の保証は一切できません。