論文の概要: MedicalHarness: A Controlled Evaluation of LLMs and Agent Harnesses on Medical Tasks
- arxiv url: http://arxiv.org/abs/2610.05778v1
- Date: Mon, 05 Oct 2026 04:22:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 04:28:53.645957
- Title: MedicalHarness: A Controlled Evaluation of LLMs and Agent Harnesses on Medical Tasks
- Title(参考訳): メディカル・ハーネス : LLMとエージェント・ハーネスの医学的課題に対する制御的評価
- Abstract要約: 医療エージェントのハーネスでどれだけの結果が変わるかは、めったに測定されていない。
医療タスクにおけるモデルとエージェントハーネスの制御された研究であるメディカルハーネスについて紹介する。
我々は、ハーネスとそのモデルとの相互作用が結果のばらつきの約4分の1を占めることを発見した。
- 参考スコア(独自算出の注目度): 31.961716768954236
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents are increasingly built for medical work and scored on clinical benchmarks. Each such score, however, comes from a model running inside an agent harness, the system that controls the loop between the model and its environment. An agent's score is therefore a property of a model--harness pair. For medical agents, how much outcomes change with the harness has rarely been measured. Measuring this change, and explaining it, raises two challenges. First, a harness comparison must change nothing but the harness and be repeated across models and kinds of task. Second, comparing whole harnesses leaves their mechanisms bundled together, so it cannot show when an individual mechanism helps. To address these challenges, we present MedicalHarness, a controlled study of models and agent harnesses on medical tasks. We first build MedicalHarnessBench to evaluate agents on $107$ tasks across four domains that each test a different harness capability. Using this benchmark, we run five open-weight models under five agent harnesses, changing only the harness within a comparison, and analyze both outcomes and execution traces. To study individual mechanisms, we build MH-Lab, a controlled harness that switches off context management, planning or tool exposure one at a time within a shared execution loop. We find that the harness and its interaction with the model account for about a quarter of the outcome variance, and that no single harness is best across models and tasks. Code and data are available at https://github.com/REAL-Lab-NU/MedicalHarness.
- Abstract(参考訳): LLMエージェントは、医療従事のために構築され、臨床ベンチマークで評価されるようになっている。
しかしながら、それぞれのスコアは、エージェントハーネス内で実行されるモデル、モデルとその環境の間のループを制御するシステムから得られます。
したがって、エージェントのスコアはモデルハーネス対の性質である。
医療従事者にとって、ハーネスでどれだけの結果が変化するかはめったに測定されていない。
この変化を計測し、それを説明すれば、2つの課題が浮かび上がる。
第一に、ハーネス比較はハーネスだけを変えて、モデルやタスクの種類によって繰り返されなければならない。
第二に、ハーネス全体を比較すると、それぞれのメカニズムが束ねられているため、個々のメカニズムがいつ役に立つかは示さない。
これらの課題に対処するために,医療タスクにおけるモデルとエージェントハーネスの制御された研究であるメディカルハーネスを紹介した。
MedicalHarnessBenchを構築し、4つのドメインにまたがる107ドルのタスクでエージェントを評価し、それぞれが異なるハーネス機能をテストします。
このベンチマークを用いて、5つのエージェントハーネスの下で5つのオープンウェイトモデルを実行し、比較中のハーネスだけを変更し、結果と実行トレースの両方を分析します。
個別のメカニズムを研究するために、共有実行ループ内でコンテキスト管理、計画、ツール露出を切り替える制御ハーネスであるMH-Labを構築します。
私たちは、ハーネスとモデルとの相互作用が結果の約4分の1を占めており、モデルやタスクで最高のハーネスは存在しないことに気付きました。
コードとデータはhttps://github.com/REAL-Lab-NU/MedicalHarness.comで公開されている。
関連論文リスト
- What Does a Harness Buy? Tokens, Mostly [9.563027159959587]
生産ハーネスは毎日出荷され、ベンダーはハーネスの変更によるパスレートの上昇を宣伝している。
ほとんど測定されないのは、モデルが固定されたときにハーネス自身がどれだけスコアを動かすかである。
私たちはClaude Code、mini-SWE-agent、OpenCodeという3つのプロダクションハーネスで5つのモデルを実行しています。
論文 参考訳(メタデータ) (2026-10-03T10:47:10Z) - SHarP: Saliency-based Pruning of Agent Harnesses [55.076331468597594]
Agentは、モデル呼び出し、ツールの使用、タスクの実行を調整することで、大規模な言語モデルが複雑なタスクを完了するのを助ける。
結果として、いくつかのハーネスモジュールが冗長であるかどうかは不明である。
ニューラルネットワークのプルーニングにインスパイアされた我々は、タスクパフォーマンスとトークンコストのバランスを改善する手段として、ハーネスプルーニングを研究した。
論文 参考訳(メタデータ) (2026-10-03T00:41:14Z) - Self-Evolving Harness on Multiple Tasks with the Agent as Its Own Optimizer [0.0]
ハーネスとは、プロンプトを整理し、ツールを呼び出し、コンテキストを管理し、実行を制御する言語モデルエージェントを取り巻くコードである。
既存のほとんどの手法では、人間によって設計されたハーネス上で実行される別のプロポーザがソルバのハーネスを変更し、ベンチマーク毎に別のハーネスが進化する。
再帰的自己改善に近いフレームワークを提案する: 同じフリーズモデルであるハーネスの同じバージョンにおいて、まず解法としてタスクを解き、続いて提案者として、完全な実行レコードを読み出し、実行中のハーネスを直接編集する。
進化過程を2段階の深層学習訓練として捉えた。
論文 参考訳(メタデータ) (2026-09-29T18:33:27Z) - HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? [61.02699867449589]
評価単位をタスク出力から実行インフラストラクチャにシフトするベンチマークであるHarnessDevを紹介します。
Creationでは、エージェントは最小限のシードと少数のケースから始まり、完全な実行システムを構築する。
Evolutionでは、独自のハーネスから始まり、ベンチマークのパフォーマンス向上を目標として、下流の実行フィードバックを使用して反復的に修正する。
論文 参考訳(メタデータ) (2026-09-01T15:45:33Z) - JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution [74.58840188662151]
JIT-Agentは、タスク適応エージェントハーネスをオンザフライで合成するために訓練されたハーネスインテリジェンスモデルである。
JIT-Agentは、ジャスト・イン・タイムのハーネス生成のために構築された最初のモデルである。
論文 参考訳(メタデータ) (2026-08-26T10:05:33Z) - Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity [10.3661763716032]
配置において、ハーネスは利用可能な唯一のレバーであるため、自動的に改善することが重量に触れることなくパフォーマンスを上げる自然な方法である。
本稿では,自己進化型エージェント・ハーネス・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T10:26:26Z) - Self-Harness: Harnesses That Improve Themselves [30.839060071524433]
Self-Harnessは、LLMベースのエージェントが、人間のエンジニアや強力な外部エージェントに頼ることなく、自身の運用ハーネスを改善する新しいパラダイムである。
我々は,最小限の初期ハーネスと多様な家系の3つの基本モデルを用いて,ターミナルベンチ2.0上の自己調和をインスタンス化する。
論文 参考訳(メタデータ) (2026-06-08T13:50:23Z) - Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents [82.27610290890475]
i) ハーネス更新、(i) 実行証拠から有用な永続的ハーネス更新を生成する能力、(ii) ハーネスベネフィット、タスク解決時に更新されたハーネスの恩恵を受ける能力の2つのハーネス自己進化能力を分析した。
まず、ハーネス更新は基本能力において平坦である:異なる能力階層のモデルがハーネス更新を生成し、驚くほど類似したゲインをもたらす。
第二に、ハーネスベネフィットは基本能力において単調ではない:弱い層モデルは更新されたハーネスからほとんど恩恵を受けず、中層モデルは最も恩恵を受け、強い層モデルは中層より利益が低い。
論文 参考訳(メタデータ) (2026-05-28T22:16:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。