論文の概要: Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation
- arxiv url: http://arxiv.org/abs/2607.08938v1
- Date: Thu, 09 Jul 2026 21:08:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.738658
- Title: Better Harnesses, Smaller Models: Building 90% Cheaper Agents via Automated Harness Adaptation
- Title(参考訳): より良いハーネス、より小さなモデル:自動化ハーネス適応による90%チーパーエージェントの構築
- Abstract要約: 多くの業務タスクにおいて、SLMエージェントは適応型ハーネスと組み合わせることで、LLMの性能を90%の低コストで一致させることができることを示す。
主要な洞察は、タスクの難易度の多くはインスタンス間で共有され、モデルからハーネスに持ち上げることができることである。
また,SLM-LLM性能ギャップを解消し,最高のSLMエージェントの89.7%をコストの4%で回収した。
- 参考スコア(独自算出の注目度): 37.00653292057391
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Frontier LLM agents are automating many business tasks, but their high inference cost makes large-scale deployment unsustainable. Small language models (SLMs) offer a cheaper alternative, yet they typically fall short when swapped into a harness designed for a frontier LLM. We show that for many routine business tasks, SLM agents can match LLM performance at 90% lower cost, when paired with an adapted harness that can be automatically discovered by a meta agent. The key insight is that much of the task difficulty is shared across instances and can be lifted from the model into the harness via tailored instructions, tools, and orchestration loops. To study this systematically, we create a framework that maps agent failure modes to harness adaptation strategies, and build a harness optimizer that automatically discovers effective adaptations from failure trajectories. Across seven business-oriented agentic tasks and three SLM families, we found optimized harnesses significantly improve performance on 16 of 21 task-SLM pairs, with seven pairs closing the SLM-LLM performance gap and the best SLM agent recovering 89.7% of LLM performance at 4% of the cost. Our analysis further shows that adaptation works best for tasks with more repetitive workflows and for SLMs with sufficient base capabilities. Together, these results suggest that harness adaptation can expand the practical deployment range of SLM agents in routine business tasks.
- Abstract(参考訳): 最前線のLLMエージェントは多くのビジネスタスクを自動化していますが、その高い推論コストは大規模なデプロイメントを持続不可能にします。
小型言語モデル(SLM)は安価な代替手段を提供するが、フロンティアLSM用に設計されたハーネスに交換すると、通常は不足する。
多くの業務タスクにおいて、SLMエージェントは、メタエージェントによって自動的に検出できる適応型ハーネスと組み合わせることで、LCMのパフォーマンスを90%低いコストで一致させることができることを示す。
重要な洞察は、タスクの難しさの大部分はインスタンス間で共有され、カスタマイズされた命令、ツール、オーケストレーションループを通じてモデルからハーネスに持ち上げることができるということだ。
これを体系的に研究するために、エージェントの障害モードをマッピングして適応戦略を活用するフレームワークを作成し、障害軌跡から効果的な適応を自動的に検出するハーネスオプティマイザを構築する。
7つのビジネス指向エージェントタスクと3つのSLMファミリーにおいて、最適化されたハーネスは、SLM-LLM性能ギャップを閉じ、最高のSLMエージェントがコストの4%で89.7%を回復し、21のタスク-SLMペアのうち16のパフォーマンスを大幅に改善することがわかった。
さらに,より反復的なワークフローを持つタスクや,十分な基礎能力を持つSLMに対して,適応が最適であることを示す。
これらの結果から,日常業務におけるSLMエージェントの実践的展開範囲を拡張できることが示唆された。
関連論文リスト
- Slm-mux: Orchestrating small language models for reasoning [52.461958665375896]
小型言語モデル(SLM)のオーケストレーションのための3段階的アプローチを提案する。
まず,複数のSLMを効果的にコーディネートするマルチモデルアーキテクチャであるSLM-MUXを紹介する。
SLM-MUXはわずか2つのSLMSでQwen 2.5 72BをGPQAとGSM8Kで上回り、MATHでのパフォーマンスに匹敵する。
論文 参考訳(メタデータ) (2025-10-06T17:49:58Z) - RLAE: Reinforcement Learning-Assisted Ensemble for LLMs [21.77261258691006]
大規模言語モデル(LLM)は、様々なモデルの多様な強みを効果的に組み合わせ、様々なタスクのパフォーマンスを高めるための有望なアプローチを提供する。
マルコフ決定プロセス(MDP)のレンズを通してアンサンブルを再構成する新しいフレームワークであるLLMのための強化学習支援アンサンブルを提案する。
提案手法では,入力コンテキストと中間生成状態の両方を考慮してアンサンブル重みを動的に調整するRLエージェントを提案する。
論文 参考訳(メタデータ) (2025-05-31T07:38:41Z) - Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking [61.61356842567952]
LLMに基づくエージェントトレーニングを改善するための新しい手法STePを提案する。
誤差ステップの反射や補正を含む自己反射軌道を合成する。
実験により,提案手法は3つの代表的なタスクにおいてエージェント性能を向上させることが示された。
論文 参考訳(メタデータ) (2025-05-26T14:11:12Z) - How Many Parameters Does Your Task Really Need? Task Specific Pruning with LLM-Sieve [2.33361323991006]
大きな言語モデル(LLM)は、リソース制約された設定において、狭いタスクのためにますますデプロイされる。
LLM-Sieveは,タスク性能の維持に必要な最小パラメータサブセットにLCMを適用可能なフレームワークである。
論文 参考訳(メタデータ) (2025-05-23T20:17:20Z) - Scaling Autonomous Agents via Automatic Reward Modeling And Planning [52.39395405893965]
大規模言語モデル(LLM)は、様々なタスクにまたがる顕著な機能を示している。
しかし、彼らは多段階の意思決定と環境フィードバックを必要とする問題に苦戦している。
人間のアノテーションを使わずに環境から報酬モデルを自動的に学習できるフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-17T18:49:25Z) - Rethinking VLMs and LLMs for Image Classification [6.550471260627169]
大きな言語モデル(LLM)は、新しい機能を実現するために、Visual Language Models(VLM)と統合されつつある。
オブジェクト認識やシーン認識では,LLMを使わないVLMの方が,VLMよりも優れた性能が得られることを示す。
本稿では,視覚的タスクをタスクに適したモデルに効率的にルーティングする,比較的小さなLCMを含む軽量な修正法を提案する。
論文 参考訳(メタデータ) (2024-10-03T23:40:21Z) - Towards Efficient LLM Grounding for Embodied Multi-Agent Collaboration [68.29746557968107]
本稿では,多エージェント協調のための新しいフレームワークを提案する。これは,効率的な自己調整のための強化アドバンテージフィードバック(Reinforced Advantage feedback, ReAd)を導入する。
Over-AIと難解なRoCoBenchの実験は、ReAdが成功率のベースラインを超え、エージェントの相互作用ステップを著しく減少させることを示している。
論文 参考訳(メタデータ) (2024-05-23T08:33:19Z) - Smurfs: Multi-Agent System using Context-Efficient DFSDT for Tool Planning [14.635361844362794]
Smurfsは、DFSDTをモジュール的で、文脈効率が高く、トレーニング不要な設計で強化する新しいマルチエージェントシステムである。
Smurfsは、オープンエンドのStableToolBenchとクローズドエンドのHotpotQAタスクのベースラインメソッドを上回っている。
論文 参考訳(メタデータ) (2024-05-09T17:49:04Z) - Enhancing the General Agent Capabilities of Low-Parameter LLMs through Tuning and Multi-Branch Reasoning [56.82041895921434]
オープンソースの事前訓練された大規模言語モデル(LLM)は、強力な言語理解と生成能力を示す。
現実世界の複雑な問題に対処するエージェントとして使用される場合、ChatGPTやGPT-4のような大型の商用モデルに比べてパフォーマンスははるかに劣る。
論文 参考訳(メタデータ) (2024-03-29T03:48:12Z) - Large Language Model Is Not a Good Few-shot Information Extractor, but a
Good Reranker for Hard Samples! [43.51393135075126]
大きな言語モデル(LLM)は、様々なタスクにおいて顕著な進歩を遂げています。
その結果,従来のLCMは微調整SLMに比べて性能が劣り,レイテンシが高く,予算要求も増大していることがわかった。
LLMの強度とSLMの強度を結合する適応フィルタ-then-rerankパラダイムを提案する。
論文 参考訳(メタデータ) (2023-03-15T12:20:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。