論文の概要: AgentAbstain: Do LLM Agents Know When Not to Act?
- arxiv url: http://arxiv.org/abs/2607.10059v1
- Date: Sat, 11 Jul 2026 00:57:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.284287
- Title: AgentAbstain: Do LLM Agents Know When Not to Act?
- Title(参考訳): エージェントAbstain: LLMエージェントはいつ行動しないか知っているか?
- Authors: Xun Liu, Yi Evie Zhang, Vira Kasprova, Parisa Rabbani, Pardis Sadat Zahraei, Tianyu Zhang, Ali Ebrahimpour-Boroojeny, Varun Chandrasekaran,
- Abstract要約: 既存の評価は、エージェントがいつ禁じるべきかを知るのではなく、タスクの成功に焦点を当てている。
エージェント禁忌のための最初の体系的評価枠組みとして,ツールを用いたLDMエージェントの動作を検知するキャリブレーション能力について述べる。
AgentAbstainは、エージェントネイティブな分類に基づくペアタスクのベンチマークである。
- 参考スコア(独自算出の注目度): 19.223843408018997
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent systems based on large language models (LLMs) are increasingly deployed for autonomous tasks, yet existing evaluations mostly focus on task success rather than whether agents know when to abstain. This gap poses real risks: under ambiguity, conflicting constraints, or tool failures, agents may execute unintended and irreversible actions. To close this gap, we present the first systematic evaluation framework for agentic abstention: the calibrated ability of tool-using LLM agents to recognize when not to act. At its core, AgentAbstain is a paired-task benchmark built on an agent-native taxonomy of 8 abstention scenarios across pre-execution reasoning and runtime discovery. It contains 263 paired tasks across 42 executable sandbox environments, where each pair consists of a should-act task and a should-abstain variant produced through a controlled perturbation to the instruction, tool, or environment state. To scale this paired design and resist data contamination, we propose AbstainGen, a fully automated pipeline that synthesizes sandbox environments and generates paired tasks end-to-end, validated by deterministic replay and semantic LLM judges; fresh task instances can be regenerated on demand, and three independent annotators rate 94-98% of sampled tasks as well-designed. Across 17 frontier LLMs in 4 agent harnesses, the best agent (Gemini 3.1 Pro) achieves only 59.5% paired accuracy (correct on both the act and abstain sides of each paired task). More importantly, abstention capability is largely independent of general task-solving capability, indicating that scaling task-solving alone will not close this gap. We further identify failure modes such as post-hoc abstention, in which agents execute irreversible actions before recognizing abstention triggers. Our code and dataset are open-sourced at agentabstain.github.io.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づくエージェントシステムは、自律的なタスクにますますデプロイされているが、既存の評価では、エージェントがいつ停止するかを知るのではなく、タスクの成功に焦点を当てている。
曖昧さ、矛盾する制約、あるいはツールの失敗の下で、エージェントは意図しない、そして不可逆なアクションを実行する。
このギャップを埋めるために、エージェント禁忌のための最初の体系的評価フレームワークを提示する。
AgentAbstainは、実行前推論と実行時検出という8つの禁忌シナリオのエージェントネイティブ分類に基づいて構築されたペアタスクのベンチマークである。
これは42の実行可能なサンドボックス環境にまたがる263のペアタスクを含み、各ペアは、命令、ツール、あるいは環境状態に対する制御された摂動によって生成される、実行すべきタスクと持続すべき変種から構成される。
このペア設計をスケールし、データ汚染を抑えるために、AbstainGenを提案する。これは、サンドボックス環境を合成し、ペア化されたタスクをエンドツーエンドに生成し、決定論的リプレイとセマンティックLSMの判断によって検証し、新しいタスクインスタンスをオンデマンドで再生でき、3つの独立したアノテータが、サンプルタスクの94~98%と、適切に設計されている。
4つのエージェントハーネスの17個のフロンティアLCMのうち、最高のエージェント(Gemini 3.1 Pro)は59.5%のペアの精度しか達成していない(各ペアのタスクのアクトとアプテンの両側で正しい)。
さらに重要なのは、停止能力は一般的なタスク解決能力とは独立しており、タスク解決のスケーリングだけではこのギャップを埋めることはないということだ。
エージェントが非可逆的な動作を実行して、非可逆的なトリガを認識させるという、ポストホックの停止のような障害モードをさらに特定する。
私たちのコードとデータセットは agentabstain.github.io でオープンソース化されています。
関連論文リスト
- Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions [16.871217408296932]
符号化エージェントにおける動作境界違反を測定するためのベンチマークであるUnderSpecBenchを提案する。
UnderSpecBenchには、ドキュメント化されたインシデントやCVE、ツールの動作を基盤とする69のタスクファミリが含まれている。
タスクの難易度から不特定性を分離するために、各タスクは同じ環境と地道な安全なアクションを維持します。
論文 参考訳(メタデータ) (2026-07-02T15:11:39Z) - ORAgentBench: Can LLM Agents Solve Challenging Operations Research Tasks End to End? [28.383940617377856]
ORAgentBenchは、自律エージェントを運用研究タスクで評価するための実行基盤ベンチマークである。
さまざまな運用シナリオにまたがる107のヒューマンレビュータスクが含まれており、それぞれに自然言語で簡潔な複数ファイルデータ、設定アーティファクト、必要なスキーマがパッケージされている。
14のフロンティアエージェントモデルによる実験では、現在のエージェントは信頼性の高いORの実践から程遠いままである。
論文 参考訳(メタデータ) (2026-06-18T04:43:23Z) - PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments [59.07829883257003]
5つの集合住宅の上に建設され、PRISMは300の人間認証タスクを3つの能力レベルに構成する。
PRISMはエージェントに依存しない実行可能なアクションAPIを公開し、任意のエージェントをエンドツーエンドで評価できるようにする。
論文 参考訳(メタデータ) (2026-05-12T04:59:47Z) - Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents [4.301199871195023]
大規模言語モデル(LLM)エージェントは、ソフトウェア工学のようなオープンなドメインにますますデプロイされています。
我々は, SWE-bench Verified の未特定変種に対する LLM エージェントの解明と探索能力を評価する。
コード実行から不特定性検出を明示的に分離する不確実性認識型マルチエージェントスキャフォールドを提案する。
論文 参考訳(メタデータ) (2026-03-27T09:56:26Z) - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification [25.817251923574286]
大規模言語モデル(LLM)エージェントのための新しい推論時間検出・緩和フレームワークを提案する。
AgentSentryは、時間的因果的テイクオーバーとしてマルチターンIPIをモデル化する最初の推論時防御である。
我々は, textscAgentDojo ベンチマークにおいて, 4つのタスクスイート, 3つの IPI 攻撃ファミリー, 複数のブラックボックス LLM に対する AgentSentry の評価を行った。
論文 参考訳(メタデータ) (2026-02-26T07:59:10Z) - SmartSnap: Proactive Evidence Seeking for Self-Verifying Agents [45.71333459905404]
SmartSnapは、受動的でポストホックな検証から、エージェント自身による積極的な自己検証へのパラダイムシフトである。
両ミッションで設計された新しいタイプのエージェントである「自己検証エージェント」を導入し、タスクを完了し、検証された証拠でその達成を証明した。
モデルファミリとスケールにわたるモバイルタスクの実験は、SmartSnapパラダイムによって、スケーラブルなLLM駆動エージェントのトレーニングが可能になることを実証しています。
論文 参考訳(メタデータ) (2025-12-26T14:51:39Z) - Are Your Agents Upward Deceivers? [73.1073084327614]
大規模言語モデル(LLM)ベースのエージェントは、ユーザのためにタスクを実行する自律的な従属者として、ますます使われています。
これは、人間の組織の個人がどのように上官に嘘をついて良いイメージを作り出したり、罰を免れるかのような、詐欺にも関与するかどうかという問題を提起する。
本研究では,環境制約に直面するエージェントが障害を隠蔽し,報告なしに要求されない動作を行う現象であるエージェント上行錯誤を観察・定義する。
論文 参考訳(メタデータ) (2025-12-04T14:47:05Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。