JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
Abstractの概要
本論文では、固定された手動設計のスキャフォールドに依存するのではなく、タスク適応的なエージェントハーネスをオンデマンドで生成するように訓練されたモデルであるJIT-Agentを提案します。著者らはエージェントハーネスをメモリ、計画、行動、能力オーケストレーションという4つの実行可能モジュールとして定式化し、訓練と評価を支援する統一コードベース「HarnessFactory」を構築しました。JIT-Agentは、タスク条件付きカスタマイズ、失敗したハーネス生成からの修復、そして報酬・レイテンシ・コスト信号を用いたオンライン進化という3つの段階で訓練されます。ディープリサーチ、日常業務、計画、ワークスペースのベンチマークにわたる実験により、ハーネスを変更することで同一の基盤バックボーンモデルの性能を大幅に向上させられることが示されています。
新規性
独自の特徴的な貢献は、学習に基づくジャストインタイムのハーネス生成パラダイムです。永続的なハーネスを事前に最適化するのではなく、JIT-Agentは推論時にインスタンス固有の実行可能ハーネスを合成し、フィードバックからより優れたハーネスのアーカイブを更新できます。また本論文ではこれを「ハーネスインテリジェンス」と位置づけ、固定された4モジュールプロトコルと、学習による修復および進化的最適化を含む3段階の訓練パイプラインによって具現化しています。
成果
GLM-5.2とDeepSeek-V4-Flashで報告された18の直接対応するバックボーンとベンチマークの組み合わせすべてにおいて、JIT生成ハーネスはデフォルトのスキャフォールドを上回り、9つのベンチマーク平均をGLM-5.2で74.1から81.8へ、DeepSeek-V4-Flashで66.7から75.5へと向上させました。主要ベンチマーク表においてJIT搭載システムは9列中8列で最高スコアを達成し、対照比較ではOpenCodeやClaude Codeなどの強力な固定ハーネスに匹敵する性能を示しています。また対照研究では、テストされた6つの設定すべてでJIT-Agentが最も低いトークン消費量とAPIコストを記録しており、性能向上が単により長い、あるいは高コストな軌跡によるものではないことが示されています。
論文の注目点
- JIT-Agentはエージェントハーネスを構成可能な4モジュールの実行可能成果物としてモデル化し、任意の市販エージェントLLM向けにタスク固有のハーネスを生成する。
- 訓練パイプラインは、教師ありハーネスカスタマイズ、実行失敗からの有界な修復、および報酬・レイテンシ・コスト信号を用いたEvo-GDPOに基づくオンライン進化を組み合わせている。
- 実証的に、JIT生成ハーネスはベンチマーク全体で固定バックボーンの性能を一貫して向上させ、再利用可能な固定ハーネスよりも優れたコストパフォーマンスのトレードオフを提供することが多い。
参考リンク
- arXiv: https://arxiv.org/abs/2608.25593v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.25593v1
- Hugging Face Papers: https://huggingface.co/papers/2608.25593
- GitHub: https://github.com/bingreeky/JIT
- Project: https://bingreeky.github.io/JIT-site