論文の概要: Can LLMs Reliably Self-Report Adversarial Prefills, and How?
- arxiv url: http://arxiv.org/abs/2606.23671v1
- Date: Mon, 22 Jun 2026 17:56:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 17:15:56.089308
- Title: Can LLMs Reliably Self-Report Adversarial Prefills, and How?
- Title(参考訳): LLMは自己申告相手の補充を確実に行うことができるか?
- Abstract要約: 大規模言語モデル(LLM)は,良質なタスクに対して内観的能力を示すことを示す。
本研究は,モデルが先行応答が逆プレフィル攻撃によって引き起こされたことを確実に認識できるかどうかを検討する。
- 参考スコア(独自算出の注目度): 9.80193616788089
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prior work shows that large language models (LLMs) exhibit introspective capability on benign tasks. We extend the question to safety contexts and examine how reliably a model can recognize that its own prior response was elicited by an adversarial prefill attack. Across ten open-weight instruction-tuned LLMs (3B to 70B) and four safety benchmarks, no model reliably recognizes its own compromised outputs, with models claiming intent on prefilled responses at an average rate of $27.3\%$. Introspective signal stems largely from safety- and refusal-related reasoning. Orthogonalizing models' weights against the refusal direction collapses the gap between claiming rates on prefilled and natural outputs to near zero, though the direction is not its unique mediator. The signal is also probe-dependent: framing the question as internal intention versus external tampering elicits qualitatively different responses on the same models. We test three LoRA finetuning methods (SFT, GRPO, DPO) on eight models from 3B to 27B; all three widen the intention-probe gap on every model from 8B to 27B, with method ranking varying by model. The intervention does not transfer to the tampering probe and counterintuitively raises attack success rate under adversarial prefill on most models, amounting to a partial mitigation. These findings outline mechanisms underpinning the observed introspective signals in safety contexts and highlight risks in the reliability of LLM self-reports.
- Abstract(参考訳): 以前の研究は、大きな言語モデル(LLM)が良質なタスクに対してイントロスペクティブな能力を示すことを示している。
我々は,この質問を安全性の文脈に拡張し,モデルの事前応答が敵のプリフィル攻撃によって引き起こされたことを確実に認識できるかどうかを検討する。
10基のオープンウェイト命令チューニングLDM(3Bから70B)と4基の安全ベンチマークでは、モデルが自身の妥協した出力を確実に認識せず、モデルが27.3\%の平均レートでプリフィルされた応答を意図していると主張する。
イントロスペクティブシグナルは、主に安全と拒絶に関連する推論に由来する。
拒絶方向に対するモデルの重み付けの直交化は、プリフィルドと自然出力のクレームレートのギャップをゼロ近くまで縮めるが、方向は独自のメディエーターではない。
質問を内部の意図と外部の改ざんに対してフレーミングすることは、同じモデル上で定性的に異なる反応を引き起こす。
3Bから27Bまでのモデルで3つのLoRA微調整法(SFT,GRPO,DPO)をテストする。
介入は改ざんプローブに転送されず、ほとんどのモデルにおいて敵のプレフィルの下で攻撃成功率を反故意に上昇させ、部分的な軽減に繋がる。
これらの知見は、安全状況における観察された検査信号の基盤となるメカニズムを概説し、LSM自己報告の信頼性のリスクを強調した。
関連論文リスト
- Latent Confidence Alignment for LLM Self-Assessment [8.73168195475753]
本稿では,モデル能力と項目難易度を指標として,モデル自己評価と潜在誤り確率との整合性を測定するためのモデルベース潜在能力フレームワークとメタ認知的視点を提案する。
20モデルを用いた医療領域データセットの実験は,提案手法がモデル能力に影響を与えることなく自己評価品質を向上させることを示す。
論文 参考訳(メタデータ) (2026-06-20T08:13:31Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning [56.48520300004217]
本稿では、文脈干渉を内部の訓練信号に変換するセルフプレイのRLフレームワークであるSeyrnesを紹介する。
単一のモデルでは、可視的かつ気を散らすようなコンテキストの構築と、それ自身で盲点を露呈するように訓練されている。
これらの競合する目標を互いに衝突させることで、Sailnes氏は、表面的なパターンマッチングを超えてモデルを補完する。
論文 参考訳(メタデータ) (2026-05-12T06:58:35Z) - Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction [5.366560952801833]
本稿では,モデル評価とポストトレーニングのためのピア予測手法を提案する。
真面目で情報的な答えを欺いたり、非形式的な答えに報いる。
ピア予測に基づく報奨による8Bモデルのトレーニングは、以前の悪意のある微調整による真偽の低下の大部分を回復させることを示す。
論文 参考訳(メタデータ) (2026-01-28T06:47:46Z) - Verifying LLM Inference to Prevent Model Weight Exfiltration [1.4698862238090828]
推論サーバを制御するアタッカーは、通常のモデル出力内に隠してモデルの重みを除去することができる。
本研究では,このような攻撃に対してモデル応答を正当に検証し,推論中に異常やバギーな動作を検出する方法について検討する。
我々は,セキュリティゲームとしてモデル抽出を形式化し,ステガノグラフ抽出を確実に軽減できる検証フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-04T14:51:44Z) - On The Dangers of Poisoned LLMs In Security Automation [0.0]
LLM中毒(LLM poisoning)とは、モデルトレーニング中に悪意のあるデータや偏見のあるデータを意図的にあるいは意図せずに導入することである。
我々は、限られたデータセットで微調整された、一見改善されたLLMが、重大なバイアスをもたらすことを実証する。
本稿では,セキュリティアプリケーションに適用されたLLMの信頼性,堅牢性,リスク低減のための緩和策とベストプラクティスを提案する。
論文 参考訳(メタデータ) (2025-11-04T14:23:56Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models [24.72990207218907]
LLM(Large Language Models)は、畳み込み(confabulation)として知られる、流動的だが不正なコンテンツを生成する傾向にある。
本研究では、文脈内情報がモデル行動にどのように影響するか、LLMが信頼できない応答を識別できるかを検討する。
論文 参考訳(メタデータ) (2025-08-11T16:12:36Z) - Think Before Refusal : Triggering Safety Reflection in LLMs to Mitigate False Refusal Behavior [59.20260988638777]
本研究は, 応答発生前の安全反射の促進により, 虚偽の拒絶行動が軽減されることを実証する。
15種類の事前訓練モデルを対象としたアブレーション実験において, 安全性を考慮した微調整モデルでは, 誤検知の挙動が著しく低下することがわかった。
論文 参考訳(メタデータ) (2025-03-22T23:35:49Z) - Uncertainty is Fragile: Manipulating Uncertainty in Large Language Models [79.76293901420146]
大規模言語モデル(LLM)は、出力の信頼性が不可欠である様々な高い領域で採用されている。
本研究では,不確実性推定の脆弱性を調査し,攻撃の可能性を探る。
攻撃者がLSMにバックドアを埋め込むことができ、入力中の特定のトリガーによって起動されると、最終的な出力に影響を与えることなくモデルの不確実性を操作できることを示す。
論文 参考訳(メタデータ) (2024-07-15T23:41:11Z) - What Makes and Breaks Safety Fine-tuning? A Mechanistic Study [64.9691741899956]
安全性の微調整は、大規模な言語モデル(LLM)を、安全なデプロイメントのための人間の好みに合わせるのに役立つ。
安全でない入力の健全な側面をキャプチャする合成データ生成フレームワークを設計する。
これを用いて,3つのよく知られた安全微調整手法について検討する。
論文 参考訳(メタデータ) (2024-07-14T16:12:57Z) - Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training [67.30423823744506]
我々は,LLMに対して,いかなる応答位置においても有害なプロンプトへのコンプライアンスを拒否する権限を付与する,新しいアプローチであるDecoupled Refusal Training(DeRTa)を導入する。
DeRTaは,(1)安全応答の開始に有害な応答のセグメントを付加することにより,安全でないコンテンツの認識と回避をモデルに訓練する,(2)有害応答シーケンスを通して潜在的障害から安全拒絶へ移行する能力をモデルに装備する強化遷移最適化(RTO)という,2つの新しいコンポーネントを組み込んでいる。
論文 参考訳(メタデータ) (2024-07-12T09:36:33Z) - Language Model Unalignment: Parametric Red-Teaming to Expose Hidden
Harms and Biases [32.2246459413988]
Red-teamingは、モデルの安全行動をジェイルブレイクして、クエリの有害性を無視した有用なエージェントとして機能させることを目的としている。
我々は、安全研究、すなわち、Unalignmentを通してのレッドチームについて、新しい視点を提示する。
統一性はモデルパラメータを調整し、モデルの振舞いに深く根付いていないモデルガードレールを壊す。
論文 参考訳(メタデータ) (2023-10-22T13:55:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。