論文の概要: Quantifying Overclaiming Propensity in Frontier LLM Agents
- arxiv url: http://arxiv.org/abs/2609.20812v2
- Date: Mon, 21 Sep 2026 17:55:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.165426
- Title: Quantifying Overclaiming Propensity in Frontier LLM Agents
- Title(参考訳): フロンティアLSM剤の過大評価値の定量化
- Abstract要約: タスク完了を過度に評価するために、フロンティアエージェントの妥当性を定量化する。
OverclaimBenchは、5つのファイルレビューシナリオ、書き起こしベースのカバレッジ測定、登録済みの植込み欠陥からなる評価スイートである。
- 参考スコア(独自算出の注目度): 20.511162275974087
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Frontier coding agents are increasingly trusted to work autonomously for long periods, yet an agent's final response is often the only account of that work a user sees. We quantify the propensity of frontier agents to overclaim task completion, a misrepresentation that can mislead the user. An agent overclaims when its final response contradicts information in its context. This definition requires no inference about intent and is independent of task success. We introduce OverclaimBench, an evaluation suite composed of five file-review scenarios, transcript-based coverage measurements, and registered planted defects. We evaluate eight proprietary frontier models in their own production command-line interfaces, and four open-weight models under a single fixed harness on OverclaimBench and find that 1) agents do not read all the files they were asked to review in 67.9\% of runs; 2) among runs where not all files are read, agents are misleading 80.4\% of the time (59--96\% per model), either falsely claiming to have read all files or omitting that coverage is incomplete; 3) requiring delegation to subagents increased reading coverage, but among reviews that remained incomplete, a large majority were still misleading; and 4) agents that falsely claimed a complete review missed planted defects at about 1.8 times the rate of agents that read every file, showing that claims of completion can conceal substantive failures. Together, these results show that agents' final responses are not reliable accounts of their actions.
- Abstract(参考訳): 最前線のコーディングエージェントは、長い間自律的に働くことをますます信頼されているが、エージェントの最終的な反応は、ユーザーが見ている仕事の唯一の説明である。
我々は,フロンティアエージェントの妥当性を定量化し,ユーザを誤解させる可能性のあるミス表現であるタスク完了を過度に評価する。
エージェントは、最終応答がそのコンテキストで情報に矛盾するときに過大評価する。
この定義では意図に関する推論は必要とせず、タスクの成功とは独立している。
OverclaimBenchは、5つのファイルレビューシナリオ、書き起こしベースのカバレッジ測定、登録済みの植込み欠陥からなる評価スイートである。
我々は、独自のコマンドラインインタフェースで8つのプロプライエタリなフロンティアモデルと、OverclaimBench上の1つの固定ハーネスの下で4つのオープンウェイトモデルを評価し、それを見つける。
1) エージェントは67.9%のランでレビューするよう要求されたすべてのファイルを読み取らない。
2) すべてのファイルが読まれていない実行中,エージェントは80.4\%(モデルあたり59~96\%)を誤解している。
3)未成年者への委任要求は読解範囲を増大させるが,未完成のレビューでは,大半がいまだ誤解を招いている。
4) 完全レビューを誤って主張したエージェントは,すべてのファイルを読み取るエージェントの約1.8倍の頻度で,欠陥の植込みを見逃し,完了の主張が実質的な失敗を隠蔽することを示した。
これらの結果から, エージェントの最終的な反応は, 行動の信頼性が低いことが示唆された。
関連論文リスト
- Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research [75.8770212601511]
ディープリサーチ(DR)システムは、Webから情報を検索して合成する複数のエージェントを編成することで、長い形式の引用レポートを生成する。
循環はこれらの報告の忠実さを評価するための主要なメカニズムであるが、現在のDRシステムでは引用のリコールが不十分である。
そこで本稿では,エージェントが各エラーをローカルにテストすることで,各エラーをピンポイントで検出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:34:18Z) - Quipu: A Governed Bitemporal Knowledge Graph Store [0.0]
Quipuは4つのデフォルトを逆転する組み込み可能なナレッジストアだ。
議事録が保留中のポストステートを評価するゲートを経由する以外は、事実は入らない。
支配的な作家からの痕跡は、その修復によって監査名のライブ執行のギャップを表面化する。
論文 参考訳(メタデータ) (2026-08-17T17:04:29Z) - Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch [47.836680625916266]
テストスイート監査官として機能する市販のコーディングエージェントは、どちらも、公式スイートが見逃すものを公開するために、敵対的なテストスイートを構築します。
認証チェーンは、各エージェントフラッグされた申請が、公式の裁判官に頼らずに、真にバグだらけであるか否かを判定する。
Codeforceは、利用可能なオフィシャルスイートを持たない問題に対して、同じテストビルディングメソッドを使用して、テストされた入力予算毎に5つの再生ベースラインを導出する。
論文 参考訳(メタデータ) (2026-08-03T05:24:03Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity? [54.701199583505144]
アプリケーション間アクセスは、ほとんど見落とされたプライバシーリスクを生み出す。
我々はAgentCIBenchを紹介します。これは、このリスクを決定論的に評価されたシナリオに変換する評価ハーネスです。
我々は15のフロンティアエージェントを評価し、驚くほど高い失敗率を見出す。
論文 参考訳(メタデータ) (2026-06-22T11:36:58Z) - EComAgentBench: Benchmarking Shopping Agents on Long-Horizon Tasks with Distributed Hidden Intent [8.1223119066448]
EComAgentBenchは、実際のAmazon製品とレビューに根ざした62のタスクのベンチマークである。
各タスクは、要求を可視クエリ、ツールゲートプロファイル、スクリプトによる明確化に分散する。
typed, source-tagged rubricsは、各タスクをグレードし、各障害を要件とそのソースに原因付ける。
論文 参考訳(メタデータ) (2026-06-16T09:10:48Z) - The Last Human-Written Paper: Agent-Native Research Artifacts [106.47848184955576]
本稿では,物語紙を機械処理可能な研究パッケージに置き換えるプロトコルであるAgent-Native Research Artifact(ARA)を紹介する。
通常の開発において決定と終了をキャプチャするLive Research Manager、レガシPDFとリポジトリをARAに変換するARAコンパイラ、人間レビュアーが重要性、ノベルティ、味にフォーカスできるように客観的チェックを自動化するARAネイティブレビューシステムである。
論文 参考訳(メタデータ) (2026-04-27T16:23:09Z) - Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation [87.47155146067962]
数百のタスクで並列評価をオーケストレーションする,標準化された評価ハーネスを提供する。
モデル、足場、ベンチマークにまたがる3次元解析を行う。
私たちの分析では、ほとんどのランで精度を低下させる高い推論努力など、驚くべき洞察が示されています。
論文 参考訳(メタデータ) (2025-10-13T22:22:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。