論文の概要: Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric
- arxiv url: http://arxiv.org/abs/2607.12469v1
- Date: Tue, 14 Jul 2026 07:54:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.082201
- Title: Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric
- Title(参考訳): 負荷受動エビデンスとしてのエージェントセーフティ評価:ベンダーニュートラル・クロス・ハーネス・リコンストラクタビリティ・メトリック
- Abstract要約: ベンダーニュートラルでランナブルな計器は、評価妥当性の指標として再構成可能性を示すものはない。
本稿では,8つの意思決定クラスに対する特性レベルの再構成可能性指標を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many agent-safety evaluation results are not yet load-bearing evidence: identical nominal outcomes (task success, attack success, monitor scores) may sit atop materially different evidence regimes. No vendor-neutral, runnable instrument scores reconstructability as an evaluation-validity metric: whether captured evidence can reconstruct the decision a claim depends on. This paper introduces a property-level reconstructability metric over eight decision-property classes and a cross-harness adapter emitting per-decision Evidence Sufficiency Cards backing a per-run monitor-coverage release check. It specifies a counterfactual-replay intervention protocol, implements its replayability-precondition probe, and defines a claim-evidence overclaim gap. On public and bundled traces, without new model runs, twelve-field sufficiency spans 0.458-0.833 across four inputs sharing a surface reading; replay preconditions are unmet in every scored trace. In a synthetic release-gate pair, the sufficiency gate blocks the raw variant (0.542) and passes the instrumented (0.667). Safety-evaluation claims should travel with their reconstructability vector; a reproducibility package regenerates every reported number.
- Abstract(参考訳): 多くのエージェントセーフティ評価結果は、まだ負荷を伴う証拠ではない。同じ名目上の結果(タスクの成功、攻撃の成功、監視スコア)は、実質的に異なるエビデンス体制の上に置かれる可能性がある。
ベンダーニュートラルで実行可能な機器は、要求が依存する決定を再構築できるかどうかという評価正当性指標として再構成可能性を評価するものはない。
本稿では,8つのクラスにまたがる特性レベルの再構成可能性指標と,実行時のモニタ・カバレッジ・リリースチェックをバックアップする決定ごとのエビデンス・カードを出力するクロスハーネス・アダプタを提案する。
対実再生介入プロトコルを定義し、その再生可能性前提プローブを実装し、クレーム・エビデンス・オープリーフギャップを定義する。
公開およびバンドルされたトレースでは、新しいモデルを実行せずに、12フィールドの飽和度は、表面読み取りを共有する4つの入力で0.458-0.833の範囲にまたがる。
合成解放ゲート対において、飽和ゲートは原変種(0.542)をブロックし、計装された(0.667)。
安全性評価クレームは、再構成可能性ベクターと共に移動すべきであり、再現性パッケージは報告されたすべての番号を再生する。
関連論文リスト
- Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG [6.113159481005088]
我々は,エビデンス・フォース・キャリブレーションのためのコントラストストレステストであるForceBENCHを紹介する。
各項目は引用された節を固定し、エビデンス校正されたクレームと局所的な力評価された変種をペアに持つ。
ヘッドライン実験は固定された局所フィルター付き198ペア評価セットを使用する。
論文 参考訳(メタデータ) (2026-05-27T06:47:44Z) - When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context [4.235809074981841]
Retrievalの拡張されたコード生成は、クロスファイルリポジトリのコンテキストに依存するが、検索されたスニペットは、時代遅れのプロジェクト状態から来る可能性がある。
時間的に古いリポジトリスニペットが無害なノイズとして振る舞うか、あるいは現在非互換なコードを積極的に誘導するかを検討する。
論文 参考訳(メタデータ) (2026-05-14T07:18:30Z) - Decision Evidence Maturity Model for Agentic AI: A Property-Level Method Specification [0.0]
エージェントAIシステムは、実行テレメトリを通じて大規模な意思決定証拠を生成するが、プロパティレベルの再構築は失敗することが多い。
このパターンをコンテナ誤認(container fallacy)と呼んでいます。
本稿では,エージェント決定のための特性レベル再構成法であるDecision Evidence Maturity Model (DEMM)を提案する。
論文 参考訳(メタデータ) (2026-04-29T09:59:36Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - Automated Self-Testing as a Quality Gate: Evidence-Driven Release Management for LLM Applications [51.56484100374058]
我々は,エビデンスに基づくリリース決定を伴う品質ゲートを導入する自動自己テストフレームワークを提案する。
内部展開型多エージェント対話型AIシステムの縦型ケーススタディにより,本フレームワークの評価を行った。
論文 参考訳(メタデータ) (2026-03-13T20:44:15Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - To Throw a Stone with Six Birds: On Agents and Agenthood [0.0]
Six Birds Theory (SBT)は、マクロな物体を原始体ではなく誘導的閉包として扱う。
SBT内では,タイプ正当性評価を行う。
我々はこの契約を4つのチェック可能なコンポーネントを用いて有限制御システムで運用する。
論文 参考訳(メタデータ) (2026-02-03T10:46:23Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Look As You Think: Unifying Reasoning and Visual Evidence Attribution for Verifiable Document RAG via Reinforcement Learning [55.232400251303794]
Look As You Think (LAT)は、モデルをトレーニングし、一貫した帰属性を持った検証可能な推論パスを生成するための強化学習フレームワークである。
LATはシングルイメージとマルチイメージの両方でバニラモデルを一貫して改善し、平均ゲインは8.23%、IoU@0.5では47.0%となる。
論文 参考訳(メタデータ) (2025-11-15T02:50:23Z) - A Granular Study of Safety Pretraining under Model Abliteration [64.24346997570275]
本稿では,リフレクションに敏感な方向を除去する軽量プロジェクション技術であるモデルアブリーブレーションについて検討する。
我々は、バランスのとれた有害かつ無害なケースで100のプロンプトを発行し、複数の判断を用いて**Refusal*または***Non-Refusal*として応答を分類し、判断の忠実さを検証する。
本研究は,データ中心の安全コンポーネントが失語中も頑健であるチェックポイントレベルの特徴付けを行う。
論文 参考訳(メタデータ) (2025-10-03T07:01:45Z) - Reconstructing Trust Embeddings from Siamese Trust Scores: A Direct-Sum Approach with Fixed-Point Semantics [0.0]
本研究では,多くの分散セキュリティフレームワークが公開している1次元シームズ信頼スコアから高次元信頼埋め込みを再構築する逆問題について検討する。
合成ベンチマークのスイートは、ガウスノイズの存在下でも、回収された埋め込みはユークリッドとコサインの計測値によって測定されたデバイス間幾何学を保存することを確認している。
詳細な信頼スコアを公開することで、デバイスと評価モデルの両方に関する潜伏した行動情報が漏洩する可能性がある。
論文 参考訳(メタデータ) (2025-08-02T20:19:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。