論文の概要: Incomplete Prompt Jailbreaks in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.20473v1
- Date: Sun, 24 May 2026 08:11:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.188099
- Title: Incomplete Prompt Jailbreaks in Large Language Models
- Title(参考訳): 大規模言語モデルにおける不完全プロンプトジェイルブレーク
- Authors: Yeonjea Kim, Bumjin Park, Jaesik Choi,
- Abstract要約: 我々はこの現象を不完全な即時脱獄(IPJ)として定式化する。
不完全文継続に伴う多種多様な魅力型を解析する。
我々は、より正確で堅牢なIPJ防御のためのニューロンレベルの介入の可能性を強調した。
- 参考スコア(独自算出の注目度): 26.636903233388832
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly released as open-weight models with safeguards against harmful requests. Nevertheless, sentence completion remains vulnerable to incomplete harmful prompts. In this work, we formalize this phenomenon as incomplete prompt jailbreaks (IPJ) and provide a systematic empirical characterization of when and how incomplete prompts elicit harmful continuations. We analyze diverse attractor types associated with incomplete sentence continuation and show that LLMs systematically delay refusal until sentence termination. We further demonstrate that training models to refuse incomplete harmful prompts via parameter tuning is insufficient, failing to generalize across both content domains and attractor types. To enable fine-grained control, we identify two functional neurons: termination and continuation neurons. By clarifying their roles in sentence completion, we highlight the potential of neuron-level interventions for more precise and robust IPJ defenses.
- Abstract(参考訳): 大きな言語モデル(LLM)は、有害な要求に対して保護されたオープンウェイトモデルとして、ますますリリースされている。
それでも、文の完成は不完全な有害なプロンプトに弱いままである。
本研究では,この現象を不完全急速脱獄(IPJ)として定式化し,いつ,どのように不完全化が有害な継続を誘発するかを系統的に評価する。
我々は,不完全文継続に伴う多種多様なアトラクタタイプを分析し,LLMが文終了まで体系的に拒絶を遅らせることを示す。
さらに、パラメータチューニングによる不完全な有害なプロンプトを拒否するトレーニングモデルは不十分であり、コンテンツドメインとアトラクタタイプの両方を一般化することができないことを実証する。
微細な制御を可能にするため、終端ニューロンと連続ニューロンの2つの機能ニューロンを同定した。
文完成におけるそれらの役割を明らかにすることにより、より正確で堅牢なIPJ防御のためのニューロンレベルの介入の可能性を明らかにする。
関連論文リスト
- Pause or Fabricate? Training Language Models for Grounded Reasoning [50.104657152302956]
不完全情報に基づくグラウンドド推論のために,対話型強化学習(GRIL)によるグラウンドド推論を提案する。
GRILは推論プロセスを2つの段階に分解する: 明確化と一時停止、利用可能な情報が十分かどうかを識別する。
GSM8K-InsufficientおよびMetaMATH-Insufficientの実験では、GRILは前提検出を大幅に改善し(最大45%)、平均応答長を20%以上削減しながらタスク成功率が30%向上した。
論文 参考訳(メタデータ) (2026-04-21T16:45:29Z) - One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety [43.878014611820824]
大きな言語モデル(LLM)は有害な要求を拒否するように訓練されているが、Jailbreak攻撃に弱いままである。
Incrmental Completion Decomposition (ICD) を導入する。
ICDは、全応答を誘発する前に、悪意のある要求に関連する一語連続のシーケンスを付与することを示す。
論文 参考訳(メタデータ) (2026-04-01T04:06:01Z) - Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover [30.86966284669791]
アドリアックは安全に整合した大きな言語モデルを安全でない行動に向けて確実に操ることができる。
本稿では,レプリカ対称性を破るシステムで動作するスピングラスシステムの観点から,プロキシ言語の理論的生成モデルを提案する。
このフレームワーク内では、インジェクションによるインジェクションベースのジェイルブレイクを解析する。
論文 参考訳(メタデータ) (2026-03-11T21:48:03Z) - Defenses Against Prompt Attacks Learn Surface Heuristics [40.392588465939106]
大規模言語モデル(LLM)は、セキュリティに敏感なアプリケーションにますますデプロイされている。
LLMは、ユーザクエリや検索されたコンテンツに逆命令が現れるとき、意図したロジックをオーバーライドすることができる。
最近の防衛は、良心と悪意のあるラベルによる監督された微調整に依存している。
論文 参考訳(メタデータ) (2026-01-12T04:12:48Z) - Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs [54.90315421117162]
完全無害データを用いた新しい毒殺法を提案する。
自己回帰型LPMの因果推論に着想を得て,トリガーと肯定的応答プレフィックスの堅牢な関連性を確立することを目指す。
LLMは最初は同意するように見えるが,その後回答を拒む興味深い抵抗現象を観察する。
論文 参考訳(メタデータ) (2025-05-23T08:13:59Z) - DROJ: A Prompt-Driven Attack against Large Language Models [0.0]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる例外的な機能を示している。
大規模なアライメント努力にもかかわらず、LLMは相変わらず敵の脱獄攻撃を受けやすいままである。
我々はDROJ(Directed Rrepresentation Optimization Jailbreak)という新しいアプローチを導入する。
論文 参考訳(メタデータ) (2024-11-14T01:48:08Z) - Multi-round jailbreak attack on large language models [2.540971544359496]
私たちは"ジェイルブレイク"攻撃をよりよく理解するために、マルチラウンドのジェイルブレイクアプローチを導入します。
この方法は危険なプロンプトを書き換え、有害でない一連のサブクエストに分解する。
実験の結果,ラマ2-7Bは94%の成功率を示した。
論文 参考訳(メタデータ) (2024-10-15T12:08:14Z) - Navigating the OverKill in Large Language Models [84.62340510027042]
モデルがどのように処理し,クエリの安全性を判断するかを検討することで,過剰スキルの要因について検討する。
以上の結果から,モデル内にショートカットが存在することが明らかとなり,"キル"のような有害な単語が過剰に認識され,安全性が強調され,過度なスキルが増すことが示唆された。
我々は、この現象を緩和するために、トレーニングフリーでモデルに依存しないセルフコントラストデコーディング(Self-Contrastive Decoding、CD)を導入する。
論文 参考訳(メタデータ) (2024-01-31T07:26:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。