論文の概要: Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation
- arxiv url: http://arxiv.org/abs/2608.21069v1
- Date: Fri, 21 Aug 2026 13:11:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.550133
- Title: Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation
- Title(参考訳): Spike-Killer: 実際のWindowsワークステーション上での安全なパフォーマンス診断のためのエビデンス強化LDMアシスト
- Abstract要約: LLM支援エージェントは、システムエビデンスを合成し、構成変更を提案し、診断タスクを自動化することができる。
我々は、実際のWindowsワークステーションでフレームタイムの苦情を診断するための、人間公認のワークフローであるSpike-Killerを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM-assisted agents can synthesize system evidence, propose configuration changes, and automate diagnostic tasks, but their flexibility makes an imprecise action or an intrusive collector an operational risk. We present Spike-Killer, a human-approved workflow for diagnosing frame-time complaints on one real Windows workstation. The workflow treats each action as an evidence-gated transaction: it records the exact target state, classifies risk, preserves a snapshot, verifies a postcondition, and retains failed measurements as first-class evidence. This experience paper reports a completed same-day study with Counter-Strike 2 as a demanding target application. The evidence bundle contains preserved state snapshots, exploratory microbenchmarks, a ten-run same-state repeatability probe, live telemetry, a repaired over-broad registry action, incompatible presentation-capture attempts, an invalid local replay, and a system-level tracing replacement. Windows Performance Recorder produced two CS2 local-Bot GPU traces of 90.69 and 85.85 seconds; both were attributed to cs2.exe, exposed DxgKrnl Present metadata, and had zero lost ETW buffers or events. These results qualify trace integrity, not performance: the study reports no frame intervals, P99 estimate, or intervention effect. The contribution is an auditable, human-in-the-loop pattern for trustworthy agent assistance on a real workstation, including explicit stop conditions when evidence is insufficient.
- Abstract(参考訳): LLM支援エージェントは、システムエビデンスを合成し、構成変更を提案し、診断タスクを自動化することができるが、その柔軟性は不正確なアクションや侵入コレクタを運用上のリスクにする。
我々は、実際のWindowsワークステーションでフレームタイムの苦情を診断するための、人間公認のワークフローであるSpike-Killerを紹介する。
ワークフローは、それぞれのアクションをエビデンス付きトランザクションとして扱い、正確なターゲット状態を記録し、リスクを分類し、スナップショットを保存し、ポストコンディションを検証し、失敗した測定結果を第一級のエビデンスとして保持する。
本経験報告では,Counter-Strike 2 を用いた同日調査を要求対象として報告する。
エビデンスバンドルには、保存された状態スナップショット、探索的マイクロベンチマーク、10ランの同状態再現性プローブ、ライブテレメトリ、修復されたオーバーブロードレジストリアクション、互換性のないプレゼンテーションキャプチャの試み、無効なローカルリプレイ、システムレベルのトレース置換が含まれている。
Windows Performance Recorderは2つのCS2ローカルボットGPUトレースを90.69秒と85.85秒で生成した。
実験では、フレーム間隔、P99推定、介入効果は報告されていない。
この貢献は、実際のワークステーションにおける信頼できるエージェント支援のための監査可能な人道支援パターンであり、証拠が不十分な場合に明確な停止条件を含む。
関連論文リスト
- ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts [0.0]
エージェントベンチマークは、エージェントがステートフルランタイム上で実行されている場合でも、最終回答のみを評価することが多い。
OpenClaw上でインスタンス化されたランタイムネイティブエージェント評価のためのトレース対応ベンチマークであるClawProBenchを提案する。
論文 参考訳(メタデータ) (2026-08-23T17:09:02Z) - D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory [10.177699115336425]
D$2$ACCIプロトコルは、ペア化されたエビデンス、保護されたスライス監視、トレースレベルのローカライズ可能性に基づいて、メモリ介入を促進、機能フラグ、拒否する。
我々はMemStackでプロトコルをインスタンス化し、3つの公開ベンチマークで評価し、LoCoMoで93.59%、LongMemEvalで90.93%、PersonaMem-V2で57.20%を達成した。
論文 参考訳(メタデータ) (2026-08-18T13:18:38Z) - SCOUT: Symmetric Consensus Outlier Detection for Failure Localization in LLM Pre-Training [7.018753691717986]
事前トレーニングでは、同期は、ランクローカルなストール、スローダウン、数値的なエラーをジョブワイドな症状へと伝播し、その起源を隠蔽する。
SCOUTは1つの設計原則に基づいて構築された統一型ランタイム障害局所化フレームワークである。
SCOUTはトレーニングループやフレームワークソースの変更なしに、PyTorch、TorchTitan、Megatron-Core、DeepSpeedと統合されている。
論文 参考訳(メタデータ) (2026-08-11T15:12:14Z) - PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution [49.776611937968]
我々は、スケジューリング、検証、メモリ、ベンチマーク、安全性をシステムレベルのサービスとして提供するPhyAgentOSを紹介します。
セッション中心のセッションは、スケジューリング、互換性、監督された実行、エビデンス収集、受け入れの最小単位として、アクションではなくセッションを扱う。
SessionVerifierは、実行終了とセマンティックタスク完了を、成功、失敗、または再計画のエビデンスに基づいて判断する。
ベンチマークはデプロイメントセッションと検証パスを再利用するので、結果は実際の実行に遡る。
論文 参考訳(メタデータ) (2026-07-18T04:46:53Z) - Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning [48.22526014304726]
本稿では,診断後インシデント応答に対するリカバリアクション評価フレームワークであるR2Actについて述べる。
R2Actはインシデントスキーマ、品質ゲート、アクション空間表現、リカバリ妥当性メトリクス、オフライン評価器、ライブ再生プロトコルを定義する。
システムから品質監査されたインシデント302件のベンチマークデータセットとして、このフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2026-07-06T03:05:17Z) - Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents [1.116726665785374]
LLM推論と特殊なツールを組み合わせたグラフ誘導RCAエージェントであるグラフトラバースエージェントを提案する。
我々は、読み取り専用エビデンス収集、伝搬認識診断、有界実行、独立に検証された検証を含む運用上の制約をマップする。
ある固定されたqwenオーバージャッジによってスコアされたITBenchスナップショットでは、監査されたシステムは、同じシステムの初期のイテレーションに対してルート因果F1を上昇させる。
論文 参考訳(メタデータ) (2026-06-07T12:05:09Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Tracking the risk of a deployed model and detecting harmful distribution
shifts [105.27463615756733]
実際には、デプロイされたモデルのパフォーマンスが大幅に低下しないという、良心的なシフトを無視することは理にかなっている。
我々は,警告を発射する有効な方法は,(a)良性な警告を無視しながら有害なシフトを検知し,(b)誤報率を増大させることなく,モデル性能の連続的なモニタリングを可能にすることを論じる。
論文 参考訳(メタデータ) (2021-10-12T17:21:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。