論文の概要: EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures
- arxiv url: http://arxiv.org/abs/2606.30219v1
- Date: Mon, 29 Jun 2026 12:33:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.217102
- Title: EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures
- Title(参考訳): EvalSafetyGap: LLM評価安全失敗のためのハイブリッド調査と概念フレームワーク
- Authors: Buğra Alperen Uluırmak, Rifat Kurban,
- Abstract要約: 本稿では、物語合成と組み合わせた体系的な探索と、グレーエビデンスを別々に追跡する。
この合成は、ベンチマークの妥当性、動的評価、安全性評価、ジェイルブレイク/拒否の堅牢性、報酬のハッキング、機械的解釈可能性、ガバナンス/監査性という8つのエビデンスストリームにまたがっている。
コントリビューションは、動的評価、透過的なソースレポート、多目的安全測定、監査可能なアライメントプラクティスをサポートするための共通語彙とエビデンスマップである。
- 参考スコア(独自算出の注目度): 0.6588840794922407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM evaluation and AI safety face a shared measurement problem: benchmark scores, reward-model signals, and reported safety metrics can improve while the latent properties they are meant to represent remain difficult to verify. This paper combines a hybrid survey - a systematic search paired with narrative synthesis and separately tracked grey evidence - with a conceptual framework and a structured ten-model audit. The synthesis spans eight evidence streams: benchmark validity, dynamic evaluation, LLM-as-judge reliability, safety evaluation, jailbreak/refusal robustness, reward hacking, mechanistic interpretability, and governance/auditability, covering 2018-2026 evaluation-safety measurement work. We introduce EvalSafetyGap as an organizing hypothesis for comparing evaluation-side and alignment-side proxy failures under optimization pressure, using Goodhart's Law together with two constructs we develop here - an Instability Decomposition and an Alignment Trilemma - as tools for generating testable comparisons. The audit shows how conclusions shift when capability, behavioral safety, and governance are measured separately. In this sample (n = 10), the association between capability and sustained adversarial robustness is statistically indeterminate using the displayed Table 3 inputs (Pearson r = +0.232, p = 0.520), and the apparent open-closed safety gap is modest, driven mainly by governance and disclosure rather than behavioral robustness, and sensitive to how a single borderline model is classified; attempt-budget results are protocol dependent. Because the public evidence uses heterogeneous protocols, the audit is diagnostic rather than rank-generating. The contribution is a shared vocabulary and evidence map to support dynamic evaluation, transparent source reporting, multi-attempt safety measurement, and auditable alignment practice.
- Abstract(参考訳): LLM評価とAI安全性は共有測定の問題に直面している。ベンチマークスコア、報酬モデル信号、報告された安全性指標が改善される一方で、それらが表す潜在特性の検証が困難である。
本稿では,物語合成とグレーエビデンスを別々に追跡した体系的な探索と,概念的枠組みと構造的10モデル監査を組み合わせたハイブリッド調査を行う。
ベンチマークの妥当性、動的評価、LCM-as-judgeの信頼性、安全性評価、jailbreak/refusalの堅牢性、報酬ハック、機械的解釈可能性、ガバナンス/監査可能性の8つのエビデンスストリームが、2018-2026評価-安全測定作業をカバーする。
EvalSafetyGapは、最適化圧力下での評価側とアライメント側のプロキシ障害を比較するための組織仮説として、Goodhartの法則と、不安定分解とアライメント・トリレムマ(alignment Trilemma)という2つの構成法を用いて、テスト可能な比較を生成するためのツールとして紹介する。
監査は、能力、行動安全、ガバナンスが別々に測定されたときに、どのように結論が変わるかを示しています。
このサンプル(n = 10)では、表示された表3入力(Pearson r = +0.232, p = 0.520)を用いて、能力と持続的対向ロバスト性の関係を統計的に不確定にし、明らかに閉ざされた安全ギャップは、主に行動的ロバスト性よりもガバナンスと開示によって引き起こされ、単一の境界線モデルをどのように分類するかに敏感であり、試行予算はプロトコルに依存している。
公的証拠は異種プロトコルを使用するため、監査はランク生成ではなく診断である。
コントリビューションは、動的評価、透過的なソースレポート、多目的安全測定、監査可能なアライメントプラクティスをサポートするための共通語彙とエビデンスマップである。
関連論文リスト
- Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs [20.59321114618083]
単一ターン診断はRAGの安全性を体系的に過大評価し、矛盾は安全な解決法とは無関係であり、普遍的な即時修正は存在しないことを示した。
モデルが認識するものと何をするかのギャップは、検索強化されたシステムが高レベルな設定で信頼される前に測定され、クローズされなければならない。
論文 参考訳(メタデータ) (2026-05-26T15:18:43Z) - Towards Trustworthy Depression Estimation via Disentangled Evidential Learning [50.22167852149165]
EviDepはうつ病の重症度を共同で定量化する明らかな学習フレームワークである。
EviDepは、堅牢な証拠合成を保証するために厳密な情報整合性を強制する。
最先端の予測精度と優れた不確実性校正を実現し、信頼できる臨床スクリーニングのための堅牢なフェールセーフメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-17T13:27:11Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - No Single Metric Tells the Whole Story: A Multi-Dimensional Evaluation Framework for Uncertainty Attributions [0.31498833540989407]
入力特徴に起因して予測の不確実性を説明する手法が提案されている。
本稿では, 正確性, 一貫性, 連続性, コンパクト性に関する具体的実装を提案する。
我々は,不確実性定量化と特徴帰属法を組み合わせた8つの指標を用いた評価枠組みを実証した。
論文 参考訳(メタデータ) (2026-03-25T17:02:13Z) - DREAM: Deep Research Evaluation with Agentic Metrics [21.555357444628044]
本稿では,DREAM(Deep Research Evaluation with Agentic Metrics)を提案する。
DREAM構造評価は、クエリ非依存のメトリクスとツール呼び出しエージェントが生成する適応的なメトリクスを組み合わせた評価プロトコルを用いて行われる。
制御された評価は、DREAMが既存のベンチマークよりも事実や時間的劣化にかなり敏感であることを示している。
論文 参考訳(メタデータ) (2026-02-21T19:14:31Z) - The Emergence of Lab-Driven Alignment Signatures: A Psychometric Framework for Auditing Latent Bias and Compounding Risk in Generative AI [0.0]
本稿では,不確実性の下での潜在特性推定を定量化する新しい監査フレームワークを提案する。
この研究は最適化バイアス、Sycophancy、Status-Quo Legitimizationを含む9つの次元にわたる主要なモデルを監査している。
論文 参考訳(メタデータ) (2026-02-19T06:56:01Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency [78.91846841708586]
完全な自己整合性で答えられた事実でさえ、軽微な文脈干渉の下で急速に崩壊することを示します。
本研究では,概念的近傍における応答コヒーレンスを評価する信念の構造尺度であるNighbor-Consistency Belief(NCB)を提案する。
また、文脈不変の信念構造を最適化し、長い知識の脆さを約30%低減する構造意識訓練(SAT)を提案する。
論文 参考訳(メタデータ) (2026-01-09T16:23:21Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - LatentGuard: Controllable Latent Steering for Robust Refusal of Attacks and Reliable Response Generation [4.29885665563186]
LATENTGUARDは、行動アライメントと教師付き潜在空間制御を組み合わせて、解釈可能で正確な安全操縦を行うフレームワークである。
本研究は, 実用性を損なうことなく, 安全性制御性と応答解釈性の両方を向上することを示す。
論文 参考訳(メタデータ) (2025-09-24T07:31:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。