論文の概要: Failure-Transparent Agents: Benchmarking Post-Failure Reporting in Tool-Using Language Models
- arxiv url: http://arxiv.org/abs/2609.35732v1
- Date: Mon, 28 Sep 2026 17:51:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 19:19:12.349141
- Title: Failure-Transparent Agents: Benchmarking Post-Failure Reporting in Tool-Using Language Models
- Title(参考訳): フェールトランスペアレントエージェント:ツール使用言語モデルにおける障害後のレポートのベンチマーク
- Abstract要約: 本稿では,フェール・トランスペアレント・エージェント(FTA)について紹介する。
FTAには5つの障害ファミリにまたがる決定論的障害トレース、中立的なコントロール、4つのユーザプレッシャ条件を備えた100のタスクが含まれている。
6つのモデルで、偽失率は基本方針下で22.8%、透明な命令で9.3%、構造化された証拠契約で0.8%である。
- 参考スコア(独自算出の注目度): 0.21987601456703476
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Tool-using agents can fail twice: a required tool can fail, and the agent can then report success without the evidence needed to justify it. Existing benchmarks often entangle this reporting failure with tool selection, recovery, and environment dynamics. We introduce Failure-Transparent Agents (FTA), a controlled benchmark that fixes the failed observation and required evidence state before generation, making post-failure claims directly auditable. FTA contains 100 tasks with deterministic failure traces spanning five failure families, a neutral control, and four user-pressure conditions, and evaluates unsupported claims alongside useful recovery. Across six models, three response policies, and 3,600 human-annotated responses, false-success rates are 22.8% under the baseline policy, 9.3% with a transparency instruction, and 0.8% with a structured evidence contract. Fabricated-detail rates decrease from 28.3% to 14.3% and 0.8%, while useful responses increase from 74.9% to 89.2% and 98.8%, respectively. The tested evidence-contract policy is associated with substantially lower post-failure reporting errors while useful-response rates remain high within this blocked-task benchmark.
- Abstract(参考訳): ツールを使用するエージェントは2回失敗する可能性がある: 必要なツールが失敗し、エージェントはそれを正当化するために必要な証拠なしで成功を報告できる。
既存のベンチマークでは、このレポートの失敗をツールの選択、リカバリ、環境ダイナミクスと混同することが多い。
フェール・トランスペアレント・エージェント (FTA) は、フェール・トランスペアレント・エージェント(英語版) (FTA) を導入し、フェール後のクレームを直接監査できるようにする。
FTAには、5つの障害ファミリーにまたがる決定論的障害トレース、中立的なコントロール、4つのユーザプレッシャ条件を含む100のタスクが含まれており、有効なリカバリとともに、サポート対象のクレームを評価している。
6つのモデル、3つのレスポンスポリシー、3600人の人間によるアノテートレスポンス、偽のサクセスレートは、ベースラインポリシーの下で22.8%、透明な命令で9.3%、構造化されたエビデンス契約で0.8%である。
製造品目数は28.3%から14.3%、0.8%に減少し、有用な反応は74.9%から89.2%、98.8%に増加した。
テストされたエビデンス-契約ポリシーは、このブロックされたタスクベンチマーク内で有用な応答率が高い一方で、フェール後の報告エラーを著しく少なくする。
関連論文リスト
- Maat: Independent Deterministic Contract-Based Governance for Multi-Agent LLM Workflows [0.0]
私たちは、バージョン管理されたワークフロー契約アンカーに対してエージェントからエージェントへのハンドオフを検証するランタイムガバナンス層であるMaatを紹介します。
データレベルの欠陥を注入した6つの制御ドメイン(6~15エージェント、522トライアル)と決定論的7チェックルーブリックで評価した。
論文 参考訳(メタデータ) (2026-09-27T23:23:52Z) - Fabrication After Tool Failure: Tool-Augmented Agents Assert Values Their Tools Did Not Return [7.146717861821737]
ツール拡張言語モデルは、ツールの供給に失敗した時に正直に報告するかどうかではなく、正しい回答に達するかどうかで評価される。
16のシステムドメインと8つのツール障害タイプにまたがる1024項目のベンチマークで、この障害後の決定を分離する。
論文 参考訳(メタデータ) (2026-09-13T19:46:42Z) - Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents [45.88028371034407]
ツールを使用する大規模言語モデルエージェントは、ユーザが許可しなかったり、タスクが不要であったりする権限を行使しながらタスクを完了することができる。
本研究では,6次元のリスクを伴って各行動が実行前および観測結果から監査される枠組みを提案する。
このフレームワークを1500以上のタスクでQwen3.5-4Bでトレーニングした後、選択された種子は2,896回の評価エピソードで98.48%の安全成功に達した。
論文 参考訳(メタデータ) (2026-08-18T22:07:23Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Control Under Compression: Reliability Frontiers for Tool-Using Agents [0.0]
ACC圧縮のための環境検証ベンチマークであるCompressAgentを紹介する。
75%の保持状況では、汎用的な書き換えとセクションベースの圧縮が92.7%、92.4%の成功を収めている。
25%から10%の継続コンテキスト予算では、実行可能なプロトコルは脆弱になる。
論文 参考訳(メタデータ) (2026-08-02T07:43:44Z) - Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation [0.0]
自然言語からインフラストラクチャ・アズ・コード(IaC)を生成するには、プロバイダのスキーマ、依存関係の計画、組織的なポリシの制約を満たす必要がある。
Rego v1ポリシを備えた186タスクのAWS/TerraformベンチマークであるIaC-Eval v2で評価されたTerraform生成のための7つのエージェント戦略に関する検証初の実験的研究を示す。
論文 参考訳(メタデータ) (2026-05-29T12:43:27Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Replayable Financial Agents: A Determinism-Faithfulness Assurance Harness for Tool-Using LLM Agents [0.7699235580548228]
LLMエージェントは、規制監査のリプレイに苦労する: トランザクションフラグ付き決定を同じ入力で再現するように要求された場合、ほとんどのデプロイメントは一貫性のある結果を返すことができません。
本稿では,金融サービスに展開するツール利用エージェントにおけるトラジェクティブ決定性およびエビデンス条件の忠実度を測定するためのフレームワークであるDFAHを紹介する。
論文 参考訳(メタデータ) (2026-01-17T19:47:55Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。