論文の概要: TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?
- arxiv url: http://arxiv.org/abs/2608.07899v1
- Date: Sat, 08 Aug 2026 03:54:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.554215
- Title: TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?
- Title(参考訳): テレメトリSuffBench: エージェントテレメトリは診断に有効か?
- Authors: Yuxuan Zhu, Peng Pu,
- Abstract要約: 本稿では, 故障検出, 故障オリジンの局所化, 安全な停止を, 不十分な証拠で分離するベンチマークであるTelemetrySuffBenchを紹介する。
統一されたプロトコル、明示的な候補セット、無効なアウトプット会計、サブグループ分析、凍結したブラインドホールドアウトを用いて、5つのフロンティア言語モデルを評価する。
- 参考スコア(独自算出の注目度): 1.7077233340294056
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agent systems increasingly expose execution traces, yet telemetry that reveals a failure may still be inadequate for identifying where that failure originated. We introduce TelemetrySuffBench, a controlled benchmark that separates failure detection, fault-origin localization, and safe abstention under insufficient evidence. The benchmark constructs canonical multi-component traces with delayed-binding faults and renders them as paired coarse views, seven-factor telemetry masks, and exact-equal ambiguous origin pairs. We evaluate five frontier language models using unified protocols, explicit candidate sets, invalid-output accounting, subgroup analyses, and a frozen blind holdout. With full telemetry, origin-step Top-1 accuracy ranges from 33.8% to 97.2% across models. Metadata, OpenTelemetry-compatible, and OpenInference-compatible views retain 99.5% to 100% detection F1 while limiting origin-step accuracy to at most 0.5%, exposing a robust detection-localization gap. Factor ablations further show that removing decision content reduces origin-step accuracy to zero for every model, while provenance removal also causes large model-dependent losses. On rich ambiguous inputs that require abstention, evidence gating reduces unsupported unique-origin answers by 12.5 to 48.6 percentage points for three models, whereas two models still answer every case, revealing strong model dependence in safe abstention. Results on the frozen holdout reproduce the central pattern within the same generator family. These findings show that terminal status can support detection, whereas reliable causal attribution requires explicit decision-to-provenance links and abstention safeguards that remain effective across models. The dataset and benchmark implementation are available at https://anonymous.4open.science/r/TelemetrySuffBench-E635/README.md.
- Abstract(参考訳): エージェントシステムはますます実行トレースを公開するが、障害がどこから来たのかを特定するのに、障害を示すテレメトリは依然として不十分である可能性がある。
本稿では, 障害検出, フォールトオリジンの局所化, 安全な停止を, 不十分な証拠の下で分離する制御ベンチマークであるTelemetrySuffBenchを紹介する。
このベンチマークは、遅延結合障害を伴う標準多成分トレースを構築し、それらをペアの粗いビュー、7要素のテレメトリーマスク、そして正確な等角な原点ペアとして描画する。
統一されたプロトコル、明示的な候補セット、無効なアウトプット会計、サブグループ分析、凍結したブラインドホールドアウトを用いて、5つのフロンティア言語モデルを評価する。
完全テレメトリでは、Top-1の精度はモデル全体で33.8%から97.2%である。
メタデータ、OpenTelemetry互換、OpenInference互換のビューは、99.5%から100%の検知F1を維持し、オリジンステップの精度を少なくとも0.5%に制限し、ロバストな検出と局所化のギャップを露呈する。
因子の短縮により、決定内容の除去は各モデルにおいて原点ステップの精度をゼロに抑える一方、前兆の除去はモデル依存の損失を増大させる。
禁忌を必要とする豊富な曖昧な入力について、証拠のゲーティングにより、3つのモデルに対して12.5から48.6ポイントのユニークなオリジンの回答が減少する一方、2つのモデルは依然として全てのケースに答え、安全な禁忌におけるモデル依存が強く示される。
凍結ホールドアウトの結果は、同じジェネレータファミリー内の中央パターンを再現する。
以上の結果から, 終端状態は検出を支援することができるが, 信頼性の高い因果属性には, モデル間で有効に保たれる明確な判断と回避のための保護が必要であることが示唆された。
データセットとベンチマークの実装はhttps://anonymous.4open.science/r/TelemetrySuffBench-E635/README.mdで公開されている。
関連論文リスト
- Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation [0.0]
モデルが生成した統計量を検出する能力を持っているが、マルチソース合成においてこの能力を採用していないことを示す。
具体的には、ソースの影響は、解析テキストの分布レジスタに応答するが、数値の有効性には反応しない方法論登録ゲートによって制御される。
論文 参考訳(メタデータ) (2026-06-03T20:15:48Z) - What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models [0.0]
シングルプロンプト精度は、言語モデルをベンチマークする主要な方法であるが、重要な信頼性障害を見逃す可能性がある。
15モデルオープンウェイトコーパスの評価を行い,5つの分類と推論ベンチマークによる10のインストラクトモデルに着目した信頼性解析を行った。
まず、評価設計は結論を根本的に変えることができる。
第2に、信頼信号は脆弱である。MMLU-Proでは、各プライマリモデルは、その精度と同一行上のトークン確率信頼の両方よりもかなり高い信頼度を言語的に報告し、単一のプロンプト変種における単一のモデルに対して、動詞のパースレートが崩壊する可能性がある。
論文 参考訳(メタデータ) (2026-05-03T20:05:08Z) - SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio [0.038379177968040606]
言語モデル推論のための単一パス不確実性フレームワークであるSELFDOUBTを提案する。
私たちのキーシグナルであるHedge-to-Verify Ratio(HVR)は、推論トレースが不確実性マーカーを含むかどうかを検出し、もしそうであれば、明示的な自己チェック行動によってオフセットされているかどうかを検出する。
SELFDOUBTは単一の観測された推論軌道で動作し、任意のプロプライエタリなAPI上でのレイテンシとコスト制約によるデプロイメントに適している。
論文 参考訳(メタデータ) (2026-04-07T19:19:29Z) - interwhen: A Generalizable Framework for Verifiable Reasoning with Test-time Monitors [47.363850513075356]
実験時間検証フレームワークであるInterwhenを提案し, 与えられた検証結果に対して, 推論モデルの出力が有効であることを保証する。
検証された推論は、物理的な世界にエージェントを配置するといった高度なシナリオにおいて重要な目標である。
論文 参考訳(メタデータ) (2026-02-05T08:35:01Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Composed Image Retrieval with Text Feedback via Multi-grained
Uncertainty Regularization [73.04187954213471]
粗い検索ときめ細かい検索を同時にモデル化する統合学習手法を提案する。
提案手法は、強いベースラインに対して+4.03%、+3.38%、+2.40%のRecall@50精度を達成した。
論文 参考訳(メタデータ) (2022-11-14T14:25:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。