論文の概要: Sound Probabilistic Safety Bounds for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.20286v1
- Date: Wed, 22 Jul 2026 15:31:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.134297
- Title: Sound Probabilistic Safety Bounds for Large Language Models
- Title(参考訳): 大規模言語モデルの音響確率論的安全性境界
- Authors: Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate,
- Abstract要約: そこで本研究では,Cropper-Pearson信頼区間の新しい適用法について検討した。
特に本手法は, 真の害確率が極端に小さい場合においても, 有用な下界の効率的な計算を可能にする。
- 参考スコア(独自算出の注目度): 50.060741829250645
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We propose a novel framework for computing rigorous bounds on the probability that a large language model (LLM) generates harmful output to a given prompt. We study a new application of the Clopper-Pearson confidence intervals to obtain probably approximately correct (PAC) bounds for this problem. As our main technical contribution, we propose an algorithm that leverages features in the latent space to prioritize exploring branches in the auto-regressive generation tree that are more likely to produce harmful outputs. Our approach in particular enables the efficient computation of useful lower bounds, even in scenarios where the true harm probability is extremely small, and crucially, the obtained lower bounds are sound, i.e., formally proven to be less than the actual harmfulness probability: our experimental results demonstrate the effectiveness of our method by computing non-trivial lower bounds on state-of-the-art LLMs. This study newly enables the evaluation and statistical certification of LLMs.
- Abstract(参考訳): 本稿では,大規模言語モデル(LLM)が与えられたプロンプトに対して有害な出力を生成する確率に基づいて,厳密な境界を計算するための新しいフレームワークを提案する。
そこで本研究では,Cropper-Pearson信頼区間の新しい適用法について検討した。
本研究は,本研究の主な技術的貢献として,有害な出力を産出しやすい自動回帰生成木における探索枝の優先順位付けに潜伏空間の特徴を利用するアルゴリズムを提案する。
特に本手法では, 真害確率が極端に小さく, 得られた下限が音である場合においても, 有効な下限の計算が可能である。
本研究は, LLMの評価と統計的検証を可能にする。
関連論文リスト
- Breaking the Computational Barrier: Provably Efficient Actor-Critic for Low-Rank MDPs [53.412166189410904]
低ランクマルコフ決定過程(MDPs)の下で広く採用されているRLオーラクルの階層を確立するために,教師付き学習を計算プロキシとして利用する。
本研究の目的は,政策評価にのみ依存する新しい楽観的アクター批判アルゴリズムを提案することである。
提案アルゴリズムは,従来の計算コストの高い計画や最適化オーラクルを回避しつつ,既存のサンプル複雑度保証よりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-02T04:46:54Z) - BEAVER: An Efficient Deterministic LLM Verifier [11.949243456810263]
本稿では,大規模言語モデルに基づく決定論的,健全な確率境界を計算するための最初の実践的フレームワークBEAVERを提案する。
検証問題を形式化し、アプローチの健全性を証明し、BEAVERを正当性検証、プライバシ検証、セキュアなコード生成タスクで評価する。
論文 参考訳(メタデータ) (2025-12-05T05:34:06Z) - Assessing Correctness in LLM-Based Code Generation via Uncertainty Estimation [0.0]
LLM生成符号の正確性のプロキシとして不確実性推定を検討する。
自然言語生成からコード生成領域への2つの最先端技術を適用する。
これらの手法を用いて計算した不確実性と正確性との間には強い相関関係があることが示唆された。
論文 参考訳(メタデータ) (2025-02-17T10:03:01Z) - Rethinking Uncertainty Estimation in Natural Language Generation [6.3398383724486544]
大規模言語モデル(LLM)は、現実のアプリケーションにますます採用されている。
不確実性推定法は複数の出力シーケンスを生成し解析し、LCMの不確実性を決定する。
単一出力シーケンスのみを用いて得られる利点を持つG-NLLを提案する。
論文 参考訳(メタデータ) (2024-12-19T18:51:06Z) - Directed Exploration in Reinforcement Learning from Linear Temporal Logic [59.707408697394534]
リニア時間論理(LTL)は強化学習におけるタスク仕様のための強力な言語である。
合成された報酬信号は基本的に疎結合であり,探索が困難であることを示す。
我々は、仕様をさらに活用し、それに対応するリミット決定性B"uchi Automaton(LDBA)をマルコフ報酬プロセスとしてキャストすることで、よりよい探索を実現することができることを示す。
論文 参考訳(メタデータ) (2024-08-18T14:25:44Z) - Probabilistic Inference in Reinforcement Learning Done Right [37.31057328219418]
強化学習における一般的な見解は、マルコフ決定過程(MDP)のグラフィカルモデルに確率論的推論として問題を提起している。
この量を近似するための従来のアプローチは任意に貧弱であり、真の統計的推論を実装しないアルゴリズムに繋がる。
我々はまず、この量が、後悔によって測定されるように、効率的に探索するポリシーを生成するために実際に利用できることを明らかにした。
論文 参考訳(メタデータ) (2023-11-22T10:23:14Z) - A Learning-Based Optimal Uncertainty Quantification Method and Its
Application to Ballistic Impact Problems [1.713291434132985]
本稿では、入力(または事前)測度が部分的に不完全であるシステムに対する最適(最大および無限)不確実性境界について述べる。
本研究では,不確実性最適化問題に対する学習基盤の枠組みを実証する。
本手法は,工学的実践における性能証明と安全性のためのマップ構築に有効であることを示す。
論文 参考訳(メタデータ) (2022-12-28T14:30:53Z) - Amortized Conditional Normalized Maximum Likelihood: Reliable Out of
Distribution Uncertainty Estimation [99.92568326314667]
本研究では,不確実性推定のための拡張性のある汎用的アプローチとして,償却条件正規化最大値(ACNML)法を提案する。
提案アルゴリズムは条件付き正規化最大度(CNML)符号化方式に基づいており、最小記述長の原理に従って最小値の最適特性を持つ。
我々は、ACNMLが、分布外入力のキャリブレーションの観点から、不確実性推定のための多くの手法と好意的に比較することを示した。
論文 参考訳(メタデータ) (2020-11-05T08:04:34Z) - Provably Efficient Reward-Agnostic Navigation with Linear Value
Iteration [143.43658264904863]
我々は、最小二乗値スタイルのアルゴリズムで一般的に使用される、より標準的なベルマン誤差の概念の下での反復が、ほぼ最適値関数の学習において強力なPAC保証を提供することを示す。
そこで本稿では,任意の(線形な)報酬関数に対して,最適に近いポリシーを学習するためにどのように使用できるかを示す。
論文 参考訳(メタデータ) (2020-08-18T04:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。