論文の概要: Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment
- arxiv url: http://arxiv.org/abs/2607.01239v1
- Date: Fri, 01 May 2026 18:57:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.972855
- Title: Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment
- Title(参考訳): トークン境界における安全を破る:LLMアライメントにおけるBPEトークン化の爆発性ギャップの作り方
- Abstract要約: 文字レベルの摂動は、人間を可読化しているにもかかわらず、現代のLLMの安全アライメントを回避している。
BPEトークン化は、安全クリティカルな単語をサブワードに断片化する。
- 参考スコア(独自算出の注目度): 9.127363793428119
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Character-level perturbations bypass safety alignment in modern LLMs despite leaving prompts human-readable. We identify and test a central structural mechanism: BPE tokenization fragments safety-critical words into sub-word pieces, and the three public alignment datasets we surveyed contain no intentionally fragmented inputs. The mechanism is a chain, tested end-to-end on five model families (Qwen-3-4B, Qwen-2.5-7B, Gemma-3-4B, Llama-3.1-8B, Mistral-7B). An optimization targeting safety-token fragmentation flips the first-token refusal trigger on 80-100% of refused HarmBench prompts, with 48% of those flips producing genuinely harmful outputs (per-model 29-65%; gap-vs-behavior ROC-AUC 0.66-0.98, pooled 0.84). Activation patching localizes the disrupted signal to the last ${\sim}30\%$ of layers; an alignment-data scan finds zero fragmented prompts among 30,000 examples (positive-control recall $\geq 99\%$ at attack-relevant intensities); and targeted-mutation experiments isolate safety words as the disruption locus. On the defense side, a 68-cell grid (55 trained checkpoints) shows that no DPO configuration achieves seed- and pool-stable ASR closure on the three families with closed pool-size confounds. SFT trained on fragmented prompts closes ASR on 3/5 families but only via global collapse that raises refusal on benign prompts as well, indicating the missing distribution is necessary but not sufficient under the LoRA-16 recipe we tested. To distinguish selective repair from global collapse, we introduce Conv-Benign, a candidate paired diagnostic. All ASR claims are 3-judge-calibrated (cell rankings stable across judges; absolute levels $\pm$18pp; see App.~B.13).
- Abstract(参考訳): 文字レベルの摂動は、人間を可読化しているにもかかわらず、現代のLLMの安全アライメントを回避している。
BPEトークン化は、安全クリティカルな単語をサブワードに断片化し、調査した3つの公開アライメントデータセットは、意図的に断片化された入力を含まない。
この機構は5つのモデルファミリー(Qwen-3-4B、Qwen-2.5-7B、Gemma-3-4B、Llama-3.1-8B、Mistral-7B)でエンドツーエンドにテストされたチェーンである。
80-100%のHarmBenchプロンプトが拒否され、その48%が真に有害な出力(29-65%; gap-vs-behavior ROC-AUC 0.66-0.98, pooled 0.84)を生み出している。
アクティベーションパッチは、破壊された信号を最後の${\sim}30\%のレイヤにローカライズする; アライメントデータスキャンは30,000の例のうち、断片化されたプロンプトをゼロにする(攻撃関連強度で正の制御リコール$\geq 99\%の値)。
防御面には68セルグリッド(55個のチェックポイント)があり、DPO構成がプールサイズが閉じた3つのファミリーでシードおよびプール安定のASR閉鎖を達成することはない。
断片化されたプロンプトを訓練したSFTは、3/5ファミリーでASRを閉鎖するが、グローバルな崩壊によっても良性プロンプトの拒絶を引き起こす。
大域的崩壊から選択的修復を区別するために,候補となるペア診断であるConv-Benignを導入する。
ASRの主張はすべて3judge-calibrated(審査員間で安定したセルランク)である。
~B.13)。
関連論文リスト
- Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration [3.9458538778648964]
本稿では,このバリアを除去するためのツールとして,リフレクションストリームを再現する低ランクなウェイト編集である,消音の予備的研究を行う。
脆弱性判定は3つのツール検出アンサンブル(QLCode、Sem、Bandit)と手動で行う。
論文 参考訳(メタデータ) (2026-06-03T20:06:52Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - SURE-RAG: Sufficiency and Uncertainty-Aware Evidence Verification for Selective Retrieval-Augmented Generation [6.604874054866016]
本稿では,証拠満足度がセットレベル特性であることを示す,透過的なアグリゲーションプロトコルSURE-RAGを提案する。
共有ペアレベルのクレームエビデンス検証器は、SURE-RAGが集約した局所的関係分布を解釈可能な応答レベル信号に生成する。
制御されたマルチホップベンチマークであるHotpotQA-RAG v3をアーティファクト・アウェア・プロトコルで評価した。
論文 参考訳(メタデータ) (2026-05-05T09:05:40Z) - Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery [0.685316573653194]
Refute-or-Promote(Refute-or-Promote)は、候補生成のためのSCH(Stratified Context Hunting)、逆殺命令、コンテキスト、Cross-Model Critic(CMC)を組み合わせた推論時信頼性パターンである。
提案するRefute-or-Promoteは、SCH(Stratified Context Hunting)を併用した推論時信頼性パターンで、候補生成、逆死命令、コンテキスト、およびクロスモデル批判(CMC)を行う。
提案するRefute-or-Promoteは、SCH(Stratified Context Hunting)を併用した推論時信頼性パターンで、候補生成、逆死命令、コンテキスト、およびクロスモデル批判(CMC)を行う。
論文 参考訳(メタデータ) (2026-04-21T03:55:35Z) - Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs [5.478971182058342]
安全評価はほとんどの場合、プロンプトベースのペルソナのみを研究する。
プロンプトとアクティベーションのステアリングは *different*,アーキテクチャに依存した脆弱性プロファイルを公開します。
論文 参考訳(メタデータ) (2026-04-13T07:34:02Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z) - What Matters For Safety Alignment? [38.86339753409445]
本稿では,AIシステムの安全アライメント能力に関する総合的研究について述べる。
本研究では,6つの重要な内在モデル特性と3つの外部攻撃手法の影響を系統的に検討し,比較した。
LRMs GPT-OSS-20B, Qwen3-Next-80B-A3B-Thinking, GPT-OSS-120Bを最も安全な3つのモデルとして同定した。
論文 参考訳(メタデータ) (2026-01-07T12:31:52Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。