論文の概要: CatchBench: When Can an Agent Failure Be Caught?
- arxiv url: http://arxiv.org/abs/2608.22808v2
- Date: Sun, 30 Aug 2026 19:25:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 20:43:35.123089
- Title: CatchBench: When Can an Agent Failure Be Caught?
- Title(参考訳): CatchBench: エージェントの失敗はいつ起こるのか?
- Authors: Yue Zhao,
- Abstract要約: CatchBenchは、監査人の質問を3つの情報状態に分類する。
以前のベンチマークでは、これらの状態の1つを修正したり、テレメトリを変更したりする。
各州は異なる質問を認めており、7つのタスク契約は独自のラベルとメトリクスを持っている。
- 参考スコア(独自算出の注目度): 6.230697997280125
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: When can an agent failure be caught? An audit is usually limited by the record rather than by the method. CatchBench therefore puts one auditor's question to three information states: the declared configuration before a run (PRE), a growing prefix of its trace (LIVE), and the finished trace (POST). Prior benchmarks fix one of these states or vary the telemetry; to our knowledge none scores all three under one task-method interface. Each state admits different questions, so seven task contracts carry their own labels and metrics rather than one leaderboard. Four are evidential; three are Gold-derived mechanism diagnostics. The release scores 72 entrants, from rule scanners and structural models to eleven LLM judges across nine model families (GPT, Claude, Gemini, Gemma, Llama, Qwen, DeepSeek, Mistral, Nova), over 1187 declared configurations and 1162 recorded runs. Most of the arena does not order: 56 of 138 registered contrasts separate, and the rest are published unresolved rather than ranked. The two sharpest results cut against our own data. One rule ignores every name and permission; it flags each capability declared after the first. On one of six configuration sources it reaches a perfect F1, so a score there measures how the corpus was built rather than how well a method reasons. Our admissibility bar then rejected one injected substrate and withheld evidential status from the other. A benchmark number is therefore not interpretable until the process behind its labels is published and tested for the shortcut it may leave. We report both, and regenerate every ordering from released predictions with no model call.
- Abstract(参考訳): エージェントの障害はいつキャッチできますか。
監査は通常、メソッドではなくレコードによって制限される。
したがって、CatchBenchは監査人の質問を3つの情報状態、すなわち、実行前の宣言された設定(PRE)、トレースの増大するプレフィックス(LIVE)、そして完了したトレース(POST)に当てはめる。
これまでのベンチマークでは、これらの状態の1つを修正したり、テレメトリを変更したりしていました。
各州は異なる質問を認めているため、7つのタスク契約は1つのリーダーボードではなく、独自のラベルとメトリクスを持っている。
4つは明らかで、3つはゴールド由来のメカニズム診断である。
リリースでは、ルールスキャナや構造モデルから、9つのモデルファミリー(GPT、Claude、Gemini、Gemma、Llama、Qwen、DeepSeek、Mistral、Nova)にわたる11のLLM審査員まで、72人が参加している。
登録された138のコントラストのうち56は別々であり、残りはランク付けされるよりも未解決である。
最もシャープな2つの結果は、私たち自身のデータに反する。
1つのルールはすべての名前と許可を無視します。
6つのコンフィグレーションソースのうちの1つで完全なF1に達するので、そこでのスコアは、メソッドの理由よりもコーパスがどのように構築されたかを測定する。
我々の許容バーは1つの注入された基質を拒絶し、もう1つの基質から明らかな状態を保留した。
したがって、ベンチマーク番号は、ラベルの背後にあるプロセスが公開され、それが去る可能性のあるショートカットのためにテストされるまで解釈されない。
我々は、モデルコールなしで、リリースした予測から、それぞれを報告し、全ての順序を再生する。
関連論文リスト
- K-Bench: measuring model performance on real scientific agent requests [0.0]
K-Bench 01は、K-Dense Web上のライブユーザトラフィックからサンプリングされた一ターンリクエストから構築された評価である。
3人の盲目の言語モデル判事が8次元のルーリックに対して毎回得点した。
39,934点中47.6%が8点を下回った。
論文 参考訳(メタデータ) (2026-08-21T20:06:08Z) - Quipu: A Governed Bitemporal Knowledge Graph Store [0.0]
Quipuは4つのデフォルトを逆転する組み込み可能なナレッジストアだ。
議事録が保留中のポストステートを評価するゲートを経由する以外は、事実は入らない。
支配的な作家からの痕跡は、その修復によって監査名のライブ執行のギャップを表面化する。
論文 参考訳(メタデータ) (2026-08-17T17:04:29Z) - Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents [29.96375986740068]
Harness-IFは、実行証拠から一度に1つの運用ルールをスコアする。
AP-Accは、不正なデフォルトに対してラベル付けされたルールのみをスコアする。
論文 参考訳(メタデータ) (2026-08-12T07:07:57Z) - The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents [0.0]
本稿では,ポストホックではなく構造的検証を行うためのエージェント機器を提案する。
組織ごとの書き込みエラー、レンダリングサイズ、あるいは塩漬けのカナリアエチョフロアが破られた場合、実行はすべて無効になる。
長期のエージェントが苦しむたびに、クリーンでシングル変数の結果が報告される。
論文 参考訳(メタデータ) (2026-08-04T15:10:37Z) - CallScreenBench: Benchmarking On-Device Models as Phone Secretaries [3.917303377795418]
電話の秘書は、所有者の代理として未知のインバウンドコールを受けます。
ほとんどのベンチマークで評価されるエージェントとは異なり、完了すべきタスクはなく、協調的なユーザもありません。
以下はCallScreenBenchで、この設定を5つの品質次元で評価する。
論文 参考訳(メタデータ) (2026-08-02T06:31:25Z) - Turning Interaction History into Execution State: A Runtime Layer for Long-Horizon Coding Agents [48.967927222079965]
Ledgerは、エージェントの完了したインタラクションを明示的な実行状態に蒸留するランタイム層である。
Ledgerはこの状態をオンライン実行台帳に保持し、各ステップの2つのバウンダリに適用される。
500のSWE-bench検証インスタンス全体で、LedgerはPass@1を56.2%から64.2%に、GPT-5 miniを75.8%から81.0%に、MiniMax M2.5を81.0%に引き上げている。
論文 参考訳(メタデータ) (2026-08-01T18:25:00Z) - DarwinX: Evolving Agent Harnesses Through Natural Selection [48.64258219266629]
ダーウィンXは自己進化を、モデルが凍結されたハーネスの集団の選択として扱う。
一般的なエージェント能力はベンチマーク固有のパッチではなく、タスク、検証、ベースモデルの変更を生き残る。
論文 参考訳(メタデータ) (2026-07-31T05:34:02Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Do Large Language Model Benchmarks Test Reliability? [66.1783478365998]
モデル信頼性の定量化について検討する。
信頼性評価におけるこのギャップにより、我々はいわゆるプラチナベンチマークの概念を提案する。
我々は、これらのプラチナベンチマークにおいて、幅広いモデルを評価し、実際、フロンティアLSMは、単純なタスクで失敗を示す。
論文 参考訳(メタデータ) (2025-02-05T18:58:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。