論文の概要: Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity
- arxiv url: http://arxiv.org/abs/2608.02665v1
- Date: Sat, 01 Aug 2026 22:28:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.880003
- Title: Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity
- Title(参考訳): LLM安全性の表面形状感度を過小評価する単一正準プロンプト
- Abstract要約: 私たちは安全のためにこれをインスタンス化し、金のラベルのないハイテイクな設定で、平均的な方向に向かっています。
370種の種 x 5 の表面が x 5 モデルを形成する場合、単一の変換が一様で最も危険である。
フォーム間の安全でない結果の結合は、3.3-12.9 pp の最悪の単一形式でさえも超える。
- 参考スコア(独自算出の注目度): 2.3216115061903415
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A benchmark score is a measurement instrument, yet most benchmarks read each item at a single canonical surface form. We ask whether that reading is faithful: when an item's intent is held fixed and only its meaning-preserving surface form varies, does the canonical-form score estimate model behavior well, and how much of any variation is decoding/judge noise rather than signal? We instantiate this in safety, a high-stakes setting with no gold label to average toward. To avoid prior confounds, we pre-author the reformulations (refusal-free, mostly non-LLM: machine back-translation and a Matrix-Language-Frame code-switch generator) so an identical surface form reaches every model, score all responses with one human-anchored, vendor-neutral judge (Claude, kappa = 0.86 vs. human on unsafe compliance, stable across languages, cross-checked by GPT-4o), and verify intent preservation. On 370 seeds x 5 surface forms x 5 models, no single transformation is uniformly most dangerous (6 of 20 per-transformation McNemar tests survive correction, most protective). Yet evaluating only the canonical prompt underestimates unsafe compliance: the union of unsafe outcomes across forms exceeds even the worst single form by 3.3-12.9 pp, with bootstrap 95% CIs excluding zero for all five models, and 5-13% of seeds safe on canonical are unsafe under some reformulation -- above a zero stochasticity floor (canonical resampled five times at temperature 0 gives 0/370 new exposures). The size of this gap is model-dependent (largest on Gemini 2.5 Pro). One form recovers only ~53% of a model's observed unsafe surface and about three reach 85% -- a redundancy characterization of this form set, not of a defined population. A benign control (XSTest) suggests the instability is bidirectional, though the benign and harmful pools are not item-matched. We release the dataset, code, and per-response labels.
- Abstract(参考訳): ベンチマークスコアは測定器であるが、ほとんどのベンチマークは各項目を単一の正準曲面形式で読み取る。
項目の意図が固定され、その意味が保存される表面形態だけが異なる場合、標準形式のスコアモデルがうまく振る舞うのか、信号よりもデコード/ジャッジノイズがどの程度のばらつきがあるのか?
私たちは安全のためにこれをインスタンス化し、金のラベルのないハイテイクな設定で、平均的な方向に向かっています。
事前の矛盾を避けるため, 機械のバックトランスレーションとマトリックス・ランゲージ・フレーム・コードスウィッチ・ジェネレータがすべてのモデルに到達し, ベンダー中立の1人の審査員(Claude, kappa = 0.86 vs. 人間)が安全でないコンプライアンス, 言語間の安定, GPT-4oによる相互チェック, 意図の保存を検証できるように, 改定(主に非LLM: 機械バックトランスレーションとマトリックス・ランゲージ・フレーム・コードスウィッチ・ジェネレータ)を前書きする。
370種の種 x 5 表面が x 5 モデルを形成する場合、単一の変換が最も危険である(変換毎のマクネマールテストのうち6つが修正され、最も保護されている)。
しかし、標準的プロンプトのみを評価することは、安全でないコンプライアンスを過小評価する: フォーム間の安全でない結果の統一は、最悪のシングルフォームでも3.3-12.9ppを超え、ブートストラップ95%のCIは5つのモデルすべてでゼロを除いたもので、標準上で安全である種子の5-13%は、いくつかの改革の下で安全ではない。
このギャップの大きさはモデルに依存している(Gemini 2.5 Proで最大)。
1つの形態は、モデルが観測した安全でない表面の約53%を回復し、約3つの形状が85%に達する。
良性制御(XSTest)は、不安定性は双方向であることを示しているが、良性および有害なプールはアイテムマッチングされていない。
データセット、コード、レスポンスごとのラベルをリリースします。
関連論文リスト
- SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics [15.233613140316791]
SemVerBenchは、3つのエコシステムにわたるバージョン制約解決セマンティクスの最初のベンチマークである。
6つのフロンティアモデルを評価し,統計的に有意な自己評価は得られなかった。
タスクが検証可能で、100%正しいリゾルバが存在するため、ツールデリゲートは100%に達する。
論文 参考訳(メタデータ) (2026-09-10T07:34:44Z) - Boundary-Mutation Testing for Pattern-Based Secret Detection: A Rule-Level Method and Cross-Scanner Evaluation [0.0]
パターンベースシークレットスキャナにおける境界突然変異試験
3つのスキャナー(43ルールのオープンソーススキャナ、Gitleaks 8.21.2、TruffleHog 3.82.13)がテストされている。
論文 参考訳(メタデータ) (2026-09-02T13:41:50Z) - Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model Study [0.0]
Model Context Protocolツールの使用のために別々に評価され、Agent2Agent(A2A)デリゲートは、エージェントが両方を使用するときの振る舞いを記述する必要はない。
一つの制御されたMCP-to-A2A構成でそのような挙動を計測する。
論文 参考訳(メタデータ) (2026-09-01T16:24:11Z) - SafeAtlas-VL: Beyond Binary Multimodal Safety with Large-Scale Data and Guard Models [73.04773649437375]
マルチモーダル・セーフティ・モデレーションは、視覚的コンテンツ、ユーザ意図、およびアシスタント行動から生じるリスクを区別する必要がある。
SafeAtlas-VLは、1.5Mのトレーニングインスタンスのデータセットで、画像、要求レベル、応答レベルを5段階の順序で判定する。
SafeAtlas-Benchは5段階の予測と継続的なリスクスコアを評価するための5000のインスタンスである。
論文 参考訳(メタデータ) (2026-08-29T07:08:01Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - The C-index illusion: discrimination without calibration in published survival models [0.0]
我々は3つの構造的に異なる領域にまたがって3つのサバイバル-MLモデルを再現する。
ホルム補正された家族的誤り率の下で,5つの事前登録仮説を検証した。
論文 参考訳(メタデータ) (2026-07-21T19:13:54Z) - Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models [0.0]
2つの実験は、保持された汚染のない合成コーパス上の3つの因子全てを横断する。
実験1では,規則数Nが10から160に増加するにつれて,命令追従減衰を測定する。
実験2では, 2k-to-512k-tokenのコンテキストラグ上での精度, 虚偽の前提条件, ファクトファクトファクトファクチャリングの測定を行った。
論文 参考訳(メタデータ) (2026-07-21T16:31:35Z) - Persona-Model Collapse in Emergent Misalignment [0.0]
有害な内容を持つ狭いデータに対する微調整された大きな言語モデルは、無関係なプロンプトに対して広範囲に不整合な振る舞いをもたらす。
モラル・サセプティビリティ(S)とモラル・ロバストネス(R)の2つの指標を用いてこの仮説を検証する。
これらのメトリクスは、与えられた文字(S)と、与えられた文字(R)をシミュレートするときにその一貫性を識別するモデルの能力を形式化する。
論文 参考訳(メタデータ) (2026-05-13T00:48:57Z) - Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers [1.9839136494100942]
ガードレールは生産言語モデルを有害な行動から保護するが、正式な保証は提供しない。
SVD整列超矩形とガウス混合モデルという2つの領域の構成を提案する。
このフレームワークを、毒性ドメイン上の3つの著者がトレーニングしたガードレールに適用すると、すべての超矩形構成はSATを返す。
GPT-2とLlama-3.1-8Bは、様々な境界で90%と80%の堅牢なカバーを維持しているが、BERTの安全保証は独特な揮発性を証明している。
論文 参考訳(メタデータ) (2026-05-11T17:41:38Z) - A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5 [101.4233736714284]
大規模言語モデル(LLM)とマルチモーダル大規模言語モデル(MLLM)は、言語とビジョンをまたいだ推論、認識、生成において大きな進歩をもたらした。
GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, Seedream 4.5-assesing each across language, vision- language and image generation。
論文 参考訳(メタデータ) (2026-01-15T15:52:52Z) - DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models [59.45605332033458]
安全メカニズムはバックファイアし、過剰な拒絶を引き起こし、モデルが過度に注意を払って良質な要求を減らします。
既存のベンチマークは、視覚的モダリティの過剰な拒絶に体系的に対処していない。
この設定は、命令が無害であるが付随する画像には有害な内容が含まれているというような、ユニークな課題をもたらす。
論文 参考訳(メタデータ) (2025-10-12T23:21:34Z) - UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases [57.69882799751655]
さまざまなソースを持つハードプロンプトから構築された安全アライメントデータセットであるUnsafeChainをリリースする。
我々は3つの大きな推論モデル(LRM)を微調整し、それらを最近のSafeChainとSTAR-1と比較する。
UnsafeChainは、1Kサブセットのマッチングやベースラインのパフォーマンスを越えながら、従来よりも一貫してパフォーマンスが向上している。
論文 参考訳(メタデータ) (2025-07-29T10:08:52Z) - One Sample is Enough to Make Conformal Prediction Robust [53.78604391939934]
共形予測は, 1つのランダムな摂動入力に対して前方通過しても, ある程度の堅牢性が得られることを示す。
提案手法は,入力毎に多数のパス(例えば100回程度)を使用するSOTA法と比較して,平均セットサイズが小さいロバストな集合を返す。
論文 参考訳(メタデータ) (2025-06-19T19:14:25Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z) - Emulated Disalignment: Safety Alignment for Large Language Models May Backfire! [65.06450319194454]
大きな言語モデル(LLM)は、人間との安全な会話を確保するために安全アライメントを行う。
本稿では,安全アライメントの反転が可能なトレーニングフリーアタック手法を提案する。
本手法をエミュレートした脱アライメント (ED) と呼ぶのは, このコントラスト分布からのサンプリングは, 安全報酬を最小限に抑えるため, 微調整の結果を確実にエミュレートするからである。
論文 参考訳(メタデータ) (2024-02-19T18:16:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。