論文の概要: Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems
- arxiv url: http://arxiv.org/abs/2608.26306v1
- Date: Wed, 26 Aug 2026 18:39:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.144465
- Title: Approved Too Late: Verdict Staleness in LLM-Guarded Self-Adaptive Systems
- Title(参考訳): 承認が遅すぎる - LLM誘導型自己適応システムにおける検証静的性
- Abstract要約: 本報告では, ガードレールの判定が使用時に有効であるか否かについて検討する。
私たちは異なる質問に答える3つの量を見分ける。
すべての承認はチェック時に正しいものでなければならないし、使用時には有効でなければならない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: A large language model (LLM) guardrail for a self-adaptive system (SAS) may issue an approval that is correct at check time but stale by actuation. This creates an Execute-stage time-of-check to time-of-use (TOCTOU) hazard. We study verdict freshness: whether a guardrail verdict remains valid when used. We distinguish three quantities that answer different questions: all-candidate verdict change under fixed-action replay, oracle-labeled approval expiry on recorded closed-loop trajectories, and judge-conditioned use-time invalidity. Across five reproducible SAS environments, all-candidate verdict-change rates span 5.3-48.4% at a common replay shift of eight simulator steps. We introduce the Freshness-Bounded Shield (FBS), which estimates each approval's validity horizon from its safe-side margin and recent feature volatility, without an explicit plant-dynamics model. Using fixed settings documented in the artifact, FBS reduces oracle-labeled approval-expiry rates from 3.4-24.7% to 0-1.8% at the same shift. A separate audit of four LLM judges finds nonzero judge-conditioned use-time invalidity in every approval stream. We formulate a freshness contract: every approval must be correct at check time and remain valid at use time.
- Abstract(参考訳): 自己適応システム(SAS)のための大規模言語モデル(LLM)ガードレールは、チェック時に正しいが、アクティベーションによって安定しているという承認を発行することができる。
これにより、Execute-stage time-of-check to time-use (TOCTOU)ハザードが生成される。
本報告では, ガードレールの判定が使用時に有効であるか否かについて検討する。
固定動作リプレイによる全候補判定変更,録音された閉ループ軌道上でのオラクルラベル付き承認期限,判断条件付き使用時無効の3つを区別する。
5つの再現可能なSAS環境の中で、全候補の評定-変更率は5.3-48.4%であり、8つのシミュレータステップの共通のリプレイシフトである。
植物力学モデルを用いることなく, 安全性と最近の特徴変動性から各承認の妥当性を推定するフレッシュネス境界シールド(FBS)を導入する。
FBSは、アーティファクトに記録された固定された設定を使用して、オラクルラベルの承認試験率を3.4-24.7%から0-1.8%に減らした。
4人のLLM審査員による別の監査では、承認ストリーム毎にゼロでない審査条件付き使用時無効が検出される。
すべての承認はチェック時に正しいものでなければならないし、使用時には有効でなければならない。
関連論文リスト
- ChurnBench: A Drift-Aware Benchmark Demonstrating That Refresh Scheduling, Not Cache Age, Governs Staleness in Agentic AI [0.9857528377308394]
我々は、スナップショットではなくタイムラインとして4つのオープンソースエンタープライズデータファブリックを生成するオープンソースのベンチマークであるChurnBenchを紹介する。
すべての変更は追加のみのグランドトラス台帳に書き込まれ、金の答えはその台帳から計算される。
システムのリフレッシュがスケジュール通りに行われると,キャッシュの老朽化を予測できないことがわかった。
論文 参考訳(メタデータ) (2026-09-10T13:19:29Z) - RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges [48.831446371402414]
RecurSEは、訓練可能な裁判官と同期されたポリシーコピーチェッカーをペアにして、裁判官のメタルーブリックに対する推論を監査し、スカラープロセスの報酬を提供する。
本稿では,RecurSEが医療,ペアワイド,要約,プロフェッショナルベンチマークにおいて一貫した一般化を実現していることを示す。
論文 参考訳(メタデータ) (2026-08-25T08:35:04Z) - SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases [0.0]
SynthGuard-ReleaseBenchは、評価の前に使用、候補パネル、許容度、監査スケジュールをロックする監査フレームワークである。
保護されたデータ上で、実際のトレーニングと合成トレーニングを比較し、損失ギャップの有限サンプル境界を同時に与え、コントロールを必要とし、実用性と経験的なプライバシーリスクメカニズムを分離する。
論文 参考訳(メタデータ) (2026-08-14T03:12:17Z) - When Memory Updates but Behavior Does Not: Repairing Implicit Stale Dependencies in Personalized Agent Responses [1.5770673503612611]
メモリ拡張されたエージェントは、ユーザの格納された状態が時代遅れであることを知ることができ、なおも古い値を計画する。
私たちは1つの構造的コントリビュータを特定します。 ドラフトアンコールによる検証は、応答が何を言っているかをチェックします。
論文 参考訳(メタデータ) (2026-08-03T02:49:08Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Mean Time to Remediate Is Not a Fielding Model: A Cadence Audit for Enterprise Vulnerability Management [51.56484100374058]
本稿では,企業脆弱性管理のための改善ケイデンス監査について紹介する。
平均ラグ、放出期間、放出率、コホート幾何、緊急/ルーチン分割、非着地遅延、局所残留圧証拠、宣言されたレートシナリオを記録している。
論文 参考訳(メタデータ) (2026-07-05T21:23:26Z) - Split Tallies: A Discrete Certificate Calculus for Auditing Dynamic Ordered Sets in Constant Memory [0.2864713389096699]
信頼できない当事者が維持する動的順序集合に対するふりかえり監査について検討する。
リーフ指向(2,4)-ツリーは、操作毎にO(log n)最悪のケースタイムを要素ごとに1つの余分な単語でメンテナを実装する。
論文 参考訳(メタデータ) (2026-06-11T12:25:43Z) - PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents [0.0]
自己進化型エージェントは、自身のプロンプト、スキル、オーモーフィケーションの変更を繰り返し提案することで改善する。
Qwen2.5 のエージェント (0.5B-3B) が GSM8K, SVAMP, ARC-Challenge のプロンプトレベルで自己進化する際、greedy は 30-42% の偽陽性と 10-33% の有害な編集をコミットする。
PACEは実際のものをコミットし、グリーディのホールトアウトの精度を著しく低いばらつきと約18%低い評価コストで一致させる。
論文 参考訳(メタデータ) (2026-06-06T11:12:11Z) - FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search [88.16262636915975]
FineVerifyはエージェント検索のためのきめ細かい自己検証フレームワークである。
各質問をチェック可能なサブクエストに分解し、サンプル候補を検証し、最も高い集計スコアの候補を選択する。
FineVerifyは、標準のスケーリングベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-05-30T10:21:20Z) - CITE: Anytime-Valid Statistical Inference in LLM Self-Consistency [10.34950275095264]
本研究では,モデル応答分布の特異なモードとして,あらかじめ指定した対象解の任意の正当性検証について検討する。
本稿では,任意の所定のレベルで偽認証を確実に制御するCITEアルゴリズムを用いた区間統一試験による認証を提案する。
また、カテゴリセットなしの停止時間率を証明し、メインレジーム内の定数に一致するミニマックスの下限を確立し、信頼度の高い投票に拡張する。
論文 参考訳(メタデータ) (2026-05-07T08:41:51Z) - Latent Veracity Inference for Identifying Errors in Stepwise Reasoning [78.29317733206643]
本稿では、精度割当てに対する離散探索アルゴリズムであるVeracity Search(VS)を紹介する。
その他の方法では、後続の精度値よりも後続の分布において難解な推論を行う。
VSを一般化し、新しいコンテキストで正確なゼロショットの精度推論を可能にする。
論文 参考訳(メタデータ) (2025-05-17T04:16:36Z) - OpenFactCheck: Building, Benchmarking Customized Fact-Checking Systems and Evaluating the Factuality of Claims and LLMs [59.836774258359945]
OpenFactCheckは、カスタマイズされたファクトチェックシステムを構築するためのフレームワークである。
ユーザーは自動的にファクトチェッカーをカスタマイズし、文書やクレームの事実的正当性を検証できる。
CheckerEVALは、人間の注釈付きデータセットを使用して、自動ファクトチェッカーの検証結果の信頼性を高めるソリューションである。
論文 参考訳(メタデータ) (2024-05-09T07:15:19Z) - Factcheck-Bench: Fine-Grained Evaluation Benchmark for Automatic Fact-checkers [121.53749383203792]
本稿では,大規模言語モデル (LLM) 生成応答の事実性に注釈を付けるための総合的なエンドツーエンドソリューションを提案する。
オープンドメインの文書レベルの事実性ベンチマークを,クレーム,文,文書の3段階の粒度で構築する。
予備実験によると、FacTool、FactScore、Perplexityは虚偽の主張を識別するのに苦労している。
論文 参考訳(メタデータ) (2023-11-15T14:41:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。