論文の概要: HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention
- arxiv url: http://arxiv.org/abs/2610.06563v1
- Date: Mon, 05 Oct 2026 15:49:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 07:34:54.835287
- Title: HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention
- Title(参考訳): HERA: 信頼性のあるエージェント回避のためのハーネス環境共進化
- Abstract要約: HERAは、エージェント禁忌のためのハーネス環境共進化のためのフレームワークである。
HERAの進化したハーネスは、ホールドアウト評価タスクにおいて、吸収精度を61.7%から83.3%に改善する。
結果として、最高のハーネス転送は19の他のLLM間で行われ、モデル固有の最適化なしに平均15.3ポイントの禁断精度が向上した。
- 参考スコア(独自算出の注目度): 34.78832817938454
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM) agents are increasingly capable of acting in complex tool-use environments, yet they often fail to recognize when tasks are infeasible and no valid solution exists. Recent work has formalized this reliability gap as the problem of agentic abstention, and existing approaches typically optimize a model or agent harness against a fixed set of tasks, leading to limited generalization to unseen failure modes. We introduce HERA, a framework for harness-environment co-evolution for agentic abstention. HERA consists of (i) a pipeline to automatically construct verifiable pairs of feasible and infeasible tasks by applying controlled environment mutations that transform solvable tasks into cases requiring abstention, and (ii) a co-evolution procedure in which performance failures on previous tasks are used to drive harness adaptation and generate new execution environments and tasks geared towards previous weaknesses. On held-out evaluation tasks, an evolved harness from HERA improves abstention accuracy from 61.7% to 83.3% while improving feasible-task completion from 68.3% to 76.7%, achieving the highest abstention and feasible-task completion among the compared methods. The resulting best harness transfers across 19 other LLMs, improving abstention accuracy by 15.3 percentage points on average without any model-specific optimization, and enabling smaller models to match the performance of more powerful models at an estimated 85% lower cost.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、複雑なツール使用環境において、ますます機能するようになっているが、タスクが有効で、有効なソリューションが存在しないことを認識できないことが多い。
最近の研究はエージェントの停止の問題としてこの信頼性ギャップを形式化しており、既存のアプローチはモデルやエージェントハーネスを一定のタスクセットに対して最適化するのが一般的である。
エージェント禁忌のためのハーネス環境共進化のためのフレームワークであるHERAを紹介する。
HERAは
一 解決可能なタスクを停止を要するケースに変換する制御された環境突然変異を施すことにより、検証可能な実行不可能なタスクのペアを自動的に構築するパイプライン
二 前のタスクのパフォーマンス障害を利用して、ハーネス適応を推進し、前の弱点に向けた新しい実行環境及びタスクを生成する、共進化の手順。
ホールドアウト評価タスクでは、HERAの進化したハーネスは、禁煙精度を61.7%から83.3%に改善し、68.3%から76.7%に改善した。
結果として、他の19のLCM間で最高のハーネス転送が行われ、モデル固有の最適化なしに平均15.3ポイントの禁断精度が向上し、より小型のモデルでもより強力なモデルの性能を85%の低コストで再現できるようになった。
関連論文リスト
- AnyStep-WAM: Budget-Aligned Distillation and Adaptive Inference for World Action Models [31.57475195690971]
我々は、調整可能な予算予測とシーン依存アロケーションのための一般的なフレームワークであるAnyStep World Action Modelを紹介する。
軽量なリスクベネフィットスケジューラは、1段階のプレビューから難易度と予算固有の生徒教育者の忠実度を予測する。
本手法は, タスク成功率を維持しつつ, 平均復調歩数を60.2%, 49.8%, 85.28%削減する。
論文 参考訳(メタデータ) (2026-09-27T16:49:05Z) - Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 [53.71882250666667]
エージェント最適化法で報告されているほとんどの利得はワンショットである。
これは、デプロイされたエージェントにとって重要な設定をテストするものではない。
エージェントハーネス最適化に対する3つのアプローチを比較する。
論文 参考訳(メタデータ) (2026-07-15T16:36:04Z) - ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End? [28.383940617377856]
ORAgentBenchは、自律エージェントを運用研究タスクで評価するための実行基盤ベンチマークである。
さまざまな運用シナリオにまたがる107のヒューマンレビュータスクが含まれており、それぞれに自然言語で簡潔な複数ファイルデータ、設定アーティファクト、必要なスキーマがパッケージされている。
14のフロンティアエージェントモデルによる実験では、現在のエージェントは信頼性の高いORの実践から程遠いままである。
論文 参考訳(メタデータ) (2026-06-18T04:43:23Z) - EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents [75.01735520608075]
既存のベンチマークは、直観的信念を問うことで、主にリテラル・オブ・マインド(ToM)をテストする。
EnactToMは, 3D 家庭で設定された300個のマルチエージェントタスクの進化ベンチマークである。
ハードスプリットでは、7つの評価されたフロンティアモデルすべてが機能的なタスク完了時に0.0%のPass3を獲得し、リテラルな信念プローブでは平均45.0%であった。
論文 参考訳(メタデータ) (2026-05-11T00:04:19Z) - Structural Verification for Reliable EDA Code Generation without Tool-in-the-Loop Debugging [0.6843491191969066]
本稿では,ツール・イン・ザ・ループのデバッグを,実行前に構造的正しさを強制することで除去することを提案する。
シングルステップタスクでは,パスレートが73.0% (LLM+RAG) から76.4% (tool-in-loop) から82.5% に向上する。
マルチステップタスクでは、パスレートは30.0%から70.0%に改善され、さらに軌道レベルの反射で84.0%に改善される。
論文 参考訳(メタデータ) (2026-04-20T20:58:52Z) - Structured Uncertainty guided Clarification for LLM Agents [126.26213027785813]
LLMエージェントは、ツールコール機能を備えた大きな言語モデルを拡張するが、曖昧なユーザ命令は、しばしば誤った呼び出しやタスクの失敗につながる。
本稿では,ツールコールパラメータに対する構造的不確かさの定式化,完全情報の期待値(EVPI)を目標としたPOMDPのモデル化,冗長性防止のためのアスペクトベースコストモデルを提案する。
我々のSAGE-Agentは、この構造化された不確実性を活用し、より優れた効率を達成するために、曖昧なタスクのカバレッジを7~39%増加させ、明確な質問を1.5~2.7$times$に減らした。
論文 参考訳(メタデータ) (2025-11-11T21:50:44Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。