論文の概要: JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- arxiv url: http://arxiv.org/abs/2608.25593v2
- Date: Thu, 03 Sep 2026 15:46:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 16:10:20.193327
- Title: JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
- Title(参考訳): JIT-Agent:ジャスト・イン・タイム・ハーネス進化によるハーネスインテリジェンスの拡張
- Abstract要約: JIT-Agentは、タスク適応エージェントハーネスをオンザフライで合成するために訓練されたハーネスインテリジェンスモデルである。
JIT-Agentは、ジャスト・イン・タイムのハーネス生成のために構築された最初のモデルである。
- 参考スコア(独自算出の注目度): 74.58840188662151
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent capability is not determined by the model alone. The agent harness, encompassing memory management, planning strategy, action protocol, and tool/skill orchestration, can dominate the contribution of the underlying foundation model. Yet harness design remains manual, task-specific, and fundamentally unscalable. We present JIT-Agent, a harness intelligence model trained to synthesize task-adaptive agent harnesses on the fly for arbitrary off-the-shelf agentic LLMs. We formalize the agent harness as a composable, machine-generatable artifact governed by a fixed four-module protocol, and train JIT-Agent to customize harnesses for a given task at hand, repair harnesses for stable and reliable execution, and self-evolve by distilling performance signals from an expanding archive of prior harness configurations. Equipped with JIT-Agent as a harness helper, DeepSeek-V4-Flash surpasses GPT-5.6 on DeepSearchQA (+9.1) and OdysseyBench (+4.3), while the already strong GLM-5.2 gains up to +20.2 points. Across controlled evaluations, JIT-Agent-generated harnesses are performance-competitive with mature agent runtimes such as OpenCode and Claude Code and consistently improve multi-scale model families of DeepSeek V4, Mimo-V2.5, and Qwen3.6. To our knowledge, JIT-Agent is the first model purpose-built for just-in-time harness generation, establishing harness intelligence as a trainable, transferable, and compounding dimension of agent capability orthogonal to model scaling.
- Abstract(参考訳): エージェント能力はモデルだけでは決定されない。
エージェントハーネスは、メモリ管理、計画戦略、アクションプロトコル、ツール/スキルオーケストレーションを含み、基礎となる基盤モデルの貢献を支配できる。
しかし、ハーネス設計は手作業で、タスク固有で、基本的にはスケールできないままである。
JIT-Agentは、任意のオフザシェルフエージェントLLMのために、タスク適応エージェントハーネスをフライで合成するために訓練されたハーネスインテリジェンスモデルである。
固定された4つのモジュールプロトコルで管理される構成可能な機械生成可能なアーティファクトとしてエージェントハーネスを形式化し、JIT-Agentをトレーニングして、与えられたタスクのハーネスをカスタマイズし、安定かつ信頼性の高い実行のためのハーネスを修復し、事前ハーネス構成の拡張アーカイブからパフォーマンス信号を蒸留することで自己進化させる。
JIT-Agentをハーネスヘルパーとして装備したDeepSeek-V4-Flashは、DeepSearchQA (+9.1)とOdysseyBench (+4.3)でGPT-5.6を超え、すでに強力なGLM-5.2は+20.2ポイントまで上昇した。
制御された評価全体において、JIT-Agent生成のハーネスは、OpenCodeやClaude Codeのような成熟したエージェントランタイムと性能的に競合し、DeepSeek V4、Mimo-V2.5、Qwen3.6のマルチスケールモデルファミリを一貫して改善している。
我々の知る限り、JIT-Agentは、ジャスト・イン・タイムのハーネス生成のために構築された最初のモデルであり、モデルスケーリングに直交するエージェント能力のトレーニング可能、転送可能、複合的な次元として、ハーネスインテリジェンスを確立する。
関連論文リスト
- Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails [23.287109132562403]
自動化されたハーネス進化により、より小さなモデルは、フロンティアモデルコストのごく一部で、ドメイン固有のタスクでうまく機能することができる。
模倣は知識を伝達し,足場の使用量を増加させるが,モデルハーネスの適合性を阻害することを示す。
我々は、メタレベルのMLEエージェントによって自動化され、弱いモデル自身のロールアウトにおいて失敗するターンをローカライズし、専門家にそのターンのみを書き直すよう依頼する、オンデマンドの専門家補正パイプラインを開発する。
論文 参考訳(メタデータ) (2026-09-08T17:53:49Z) - Prime Agent: A Self-Improving RLM Harness [5.540645425386541]
Prime Agentは、長期評価とコーディングエージェントのためのオープンソースのハーネスである。
ストラテジ構築をモデルに残しながら、実行、リカバリ、検証、リソース会計を標準化する。
Prime AgentはARC-AGI-3 RHAE Best@1を30%から95.5%に引き上げ、ネイティブやポピュラーなハーネスを超えている。
論文 参考訳(メタデータ) (2026-08-24T17:54:19Z) - Agent Lightning v1.0: Towards Harnessed Agentic RL [28.087691629023038]
本稿では,エージェントRLを利用する軽量フレームワークであるAgens Lightning v1.0を紹介する。
任意のエージェントハーネスをサポートし、これらの課題を研究するための実践的なテストベッドとして機能する。
我々は、命令追従、探索、符号化エージェントについて評価し、符号化エージェントRLのための完全な再現可能なパイプラインを提供する。
論文 参考訳(メタデータ) (2026-08-18T08:50:13Z) - HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry [35.87794858139959]
HarnessXは、構成可能、適応可能、進化可能なエージェントハーネス用のファウンダリーである。
型付きハーネスプリミティブを置換代数学で組み立て、AIGISを介して適応する。
軌道をハーネス更新とモデルトレーニング信号の両方に変換することでハーネスモデルループを閉じる。
論文 参考訳(メタデータ) (2026-06-12T08:27:11Z) - AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent [57.10083973844841]
AgentArkは、マルチエージェントダイナミクスを単一のモデルの重みに蒸留する新しいフレームワークである。
各種モデル,タスク,スケーリング,シナリオの3つの階層的蒸留戦略について検討する。
シミュレーションからトレーニングへ計算の負担をシフトさせることで、蒸留されたモデルは、複数のエージェントの強い推論と自己補正性能を示しながら、一つのエージェントの効率を保ちます。
論文 参考訳(メタデータ) (2026-02-03T19:18:28Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems? [71.21547572568655]
AgenTracer-8Bは、マルチグラニュラ強化学習で訓練された軽量障害トレーサである。
Who&Whenベンチマークでは、AgenTracer-8BはGemini-2.5-ProやClaude-4-Sonnetのような巨大なLLMを最大18.18%上回っている。
AgenTracer-8BはMetaGPTやMAASのような市販のマルチエージェントシステムに4.8-14.2%の性能向上をもたらす。
論文 参考訳(メタデータ) (2025-09-03T13:42:14Z) - R&D-Agent: An LLM-Agent Framework Towards Autonomous Data Science [70.1638335489284]
高レベルの機械学習エンジニアリングタスクは、労働集約的で反復的である。
機械学習プロセスを形式化する包括的で分離されたフレームワークであるR&D-Agentを紹介します。
R&D-AgentはMLEを2つのフェーズと6つのコンポーネントに定義し、MLEのエージェント設計を原則としてテスト可能なプロセスに変える。
論文 参考訳(メタデータ) (2025-05-20T06:07:00Z) - DrunkAgent: Stealthy Memory Corruption in LLM-Powered Recommender Agents [31.542621203252295]
大規模言語モデル (LLM) を利用したエージェントは、リコメンデータシステム (RS) でますます使われている。
本稿では,LSMを用いたリコメンデータエージェントにおけるメモリベースの脆弱性について,初めて体系的に検討する。
我々はDrunkAgentという新しいブラックボックス攻撃フレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-31T07:35:40Z) - xLAM: A Family of Large Action Models to Empower AI Agent Systems [111.5719694445345]
AIエージェントタスク用に設計された大規模なアクションモデルであるxLAMをリリースする。
xLAMは、複数のエージェント能力ベンチマークで例外的なパフォーマンスを提供する。
論文 参考訳(メタデータ) (2024-09-05T03:22:22Z) - DS-Agent: Automated Data Science by Empowering Large Language Models with Case-Based Reasoning [56.887047551101574]
大規模言語モデル(LLM)エージェントとケースベース推論(CBR)を利用した新しいフレームワークであるDS-Agentを提案する。
開発段階では、DS-AgentはCBRフレームワークに従い、自動イテレーションパイプラインを構築する。
デプロイメントの段階では、DS-Agentは、シンプルなCBRパラダイムで低リソースのデプロイメントステージを実装し、LCMの基本能力に対する需要を大幅に削減する。
論文 参考訳(メタデータ) (2024-02-27T12:26:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。