論文の概要: Semantic Gravity Wells: Why Negative Constraints Backfire
- arxiv url: http://arxiv.org/abs/2601.08070v1
- Date: Mon, 12 Jan 2026 23:30:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-14 18:27:18.980315
- Title: Semantic Gravity Wells: Why Negative Constraints Backfire
- Title(参考訳): Semantic Gravity Wells: 負の制約がバックファイアする理由
- Abstract要約: 負の制約("Do not use word X"という形式の命令)は、大きな言語モデルにおける命令追従能力の基本的なテストである。
本稿では, 負の命令失敗を総合的に調査する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Negative constraints (instructions of the form "do not use word X") represent a fundamental test of instruction-following capability in large language models. Despite their apparent simplicity, these constraints fail with striking regularity, and the conditions governing failure have remained poorly understood. This paper presents the first comprehensive mechanistic investigation of negative instruction failure. We introduce semantic pressure, a quantitative measure of the model's intrinsic probability of generating the forbidden token, and demonstrate that violation probability follows a tight logistic relationship with pressure ($p=σ(-2.40+2.27\cdot P_0)$; $n=40{,}000$ samples; bootstrap $95%$ CI for slope: $[2.21,,2.33]$). Through layer-wise analysis using the logit lens technique, we establish that the suppression signal induced by negative instructions is present but systematically weaker in failures: the instruction reduces target probability by only 5.2 percentage points in failures versus 22.8 points in successes -- a $4.4\times$ asymmetry. We trace this asymmetry to two mechanistically distinct failure modes. In priming failure (87.5% of violations), the instruction's explicit mention of the forbidden word paradoxically activates rather than suppresses the target representation. In override failure (12.5%), late-layer feed-forward networks generate contributions of $+0.39$ toward the target probability -- nearly $4\times$ larger than in successes -- overwhelming earlier suppression signals. Activation patching confirms that layers 23--27 are causally responsible: replacing these layers' activations flips the sign of constraint effects. These findings reveal a fundamental tension in negative constraint design: the very act of naming a forbidden word primes the model to produce it.
- Abstract(参考訳): 負の制約("Do not use word X"という形式の命令)は、大きな言語モデルにおける命令追従能力の基本的なテストである。
その明らかな単純さにもかかわらず、これらの制約は顕著な規則性で失敗し、失敗を統治する条件はいまだに理解されていない。
本稿では, 負の命令失敗を総合的に調査する。
モデル固有のトークン生成確率の定量的な尺度であるセマンティック・プレッシャを導入し、違反確率は圧力(p=σ(-2.40+2.27\cdot P_0)$; $n=40{,}000$ sample; bootstrap $95%$ CI for slope: $[2.21,2.33]$)との厳密なロジスティックな関係に従うことを示した。
ロジットレンズ技術を用いた層解析により、負の命令によって誘導される抑制信号は存在するが、失敗時に体系的に弱くなることが判明した。
この非対称性を、機械的に異なる2つの障害モードにトレースする。
プリミング障害(87.5%の違反)では、ターゲット表現を抑えるのではなく、パラドックス的に禁止された単語の明示的な言及が活性化される。
オーバーライド障害(12.5%)では、遅延層フィードフォワードネットワークは目標確率に対して$+0.39$のコントリビューションを生成する。
アクティベーションパッチは、レイヤ23-27が因果関係があることを確認する。
これらの発見は、負の制約設計における根本的な緊張を浮き彫りにしている。
関連論文リスト
- Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning [109.33717747526583]
大規模言語モデルは、計算コストが高くても意味論的に無効な推論を、能力を超えたタスクで生成する。
textbfCaRL(textbfCapability-textbfaligned textbfReinforcement textbfL)を導入し、振る舞いを機能境界に合わせる。
実験は、タスクの難易度を超えて性能を保ちながら、無駄な推論を大幅に削減することを示した。
論文 参考訳(メタデータ) (2026-07-31T09:30:33Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - Decoherence as Defence and the Magnitude of Noise Regularisation: A Rigorous N -Qubit Theory of Stochastic Quantum Neural Networks for Adversarially Robust Network Intrusion Detection [0.0]
マスター方程式とそのベクトル化されたリウビリアンによる$N$-qubitの定式化を与える。
エンフェデコヒーレンス・コントラクションの定理、すなわち強度の非分極チャネルを証明します。
このロバスト性は、アタックタイムの収縮ではなく、ノイズの変形したトレーニング境界から生じることを示す。
論文 参考訳(メタデータ) (2026-06-23T07:06:56Z) - When Do LLM Agents Treat Surface Noise Differently from Semantic Noise? A 68-Cell Measurement Study with a Held-Out Trace-Level Validation [9.055086193088083]
10大言語モデルによって駆動されるチェーン・オブ・シンクとReActエージェントに経験的現象を記述した。
平均的な摂動は、同等の厳しさのプレゼンテーション摂動よりも、最終的な答えを頻繁に変更する。
論文 参考訳(メタデータ) (2026-05-25T15:57:11Z) - Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack [78.02110947708535]
敵対的なイメージは、プロンプトインジェクションを通じて、マルチモーダルな大規模言語モデルに深刻なセキュリティ上の脅威をもたらす。
敵の攻撃を成功させるには、画像全体を一様に依存するのではなく、重要な画像トークンの小さなサブセットに依存していることを示す。
本稿では,これらのトークンを勾配解析により局所化し,マスキングにより中和するグラディエントトークンマスキング(GTM)を提案する。
論文 参考訳(メタデータ) (2026-05-24T17:51:34Z) - One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness [12.183451602438753]
単純な語彙制約(句読解文字または共通単語の禁止)により、命令調整されたLLMが応答を崩壊させることを示す。
ベースモデルでは,同じ制約の下で,小さな,騒々しい,双方向的な効果を伴って,体系的な崩壊を示さないことを示す。
論文 参考訳(メタデータ) (2026-04-14T17:40:01Z) - Capable but Unreliable: Canonical Path Deviation as a Causal Mechanism of Agent Failure in Long-Horizon Tasks [0.38991526486631006]
信頼性障害の多くは、タスクの潜在解構造からのドリフトに起因するものであり、能力障害ではない、と我々は主張する。
我々は、モデル能力と作業難易度を維持できる自然実験を用いて、これを因果的に確立する。
論文 参考訳(メタデータ) (2026-02-22T02:37:57Z) - Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models [0.0]
GPT-4.1 と GPT-4o の2つのモデルを評価する。
アーティファクトタイプは摂動スタイルよりも断裂の予測が強いことが分かりました。
断熱挙動は安定な二元性というよりは確率的であり, 人工物に依存した境界現象である。
論文 参考訳(メタデータ) (2026-01-25T17:14:33Z) - Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning [0.0]
安全に配慮した言語モデルは、有害な要求を体系的に拒否する。
この分解は、原ベクトルが多意味であるからである。
我々は,これらの操舵方向を蒸留するために,外科的拒絶アブレーションを導入する。
論文 参考訳(メタデータ) (2026-01-13T12:21:44Z) - Illusions of reflection: open-ended task reveals systematic failures in Large Language Models' reflective reasoning [0.6372261626436676]
「リフレクション」はゴールとその制約に結びついているが、人間のリフレクティブ推論と等価か?
クローズドエンドタスクの以前の作業は、自己補正の限界を隠蔽しながら、'リフレクション'を効果的に見せることができる。
ファーストパス性能は貧弱であり、リフレクションは緩やかな利得しか得られない。
このようなメカニズムがモデル自体でインスタンス化されるまでは、信頼性のあるパフォーマンスには制約を強制する外部構造が必要です。
論文 参考訳(メタデータ) (2025-10-21T03:24:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Towards Model Resistant to Transferable Adversarial Examples via Trigger Activation [95.3977252782181]
知覚不能な摂動によって特徴づけられる敵対的な例は、彼らの予測を誤解させることで、ディープニューラルネットワークに重大な脅威をもたらす。
本稿では,移動可能な敵例(TAE)に対して,より効率的かつ効果的に堅牢性を高めることを目的とした,新たなトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2025-04-20T09:07:10Z) - Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification [50.717692060500696]
対数損失を伴う次のトーケン予測は自己回帰シーケンスモデリングの基盤となる。
次トーケン予測は、適度な誤差増幅を表す$C=tilde O(H)$を達成するために堅牢にすることができる。
C=e(log H)1-Omega(1)$。
論文 参考訳(メタデータ) (2025-02-18T02:52:00Z) - Mind the Gap: A Causal Perspective on Bias Amplification in Prediction & Decision-Making [58.06306331390586]
本稿では,閾値演算による予測値がS$変化の程度を測るマージン補数の概念を導入する。
適切な因果仮定の下では、予測スコア$S$に対する$X$の影響は、真の結果$Y$に対する$X$の影響に等しいことを示す。
論文 参考訳(メタデータ) (2024-05-24T11:22:19Z) - Releasing Inequality Phenomenon in $\ell_{\infty}$-norm Adversarial Training via Input Gradient Distillation [66.5912840038179]
最近の研究では、(ell_infty)-norm対逆訓練(ell_infty)-AT)が不均一な入力勾配を誘導することが明らかとなった。
この現象は(ell_infty)-norm-norm訓練されたモデルを標準訓練モデルよりも脆弱にする。
本稿では,不等式を$ell_infty$-ATで解放するために,IGD (Input Gradient Distillation) という簡易かつ効果的な方法を提案する。
論文 参考訳(メタデータ) (2023-05-16T09:23:42Z) - WR-ONE2SET: Towards Well-Calibrated Keyphrase Generation [57.11538133231843]
キーワード生成は、入力文書を要約する短いフレーズを自動的に生成することを目的としている。
最近登場したONE2SETパラダイムは、キーフレーズをセットとして生成し、競争性能を達成した。
本稿では, ONE2SET を拡張した WR-ONE2SET を提案する。
論文 参考訳(メタデータ) (2022-11-13T09:56:24Z) - Using reinforcement learning to autonomously identify sources of error
for agents in group missions [0.22499166814992436]
我々は、人工知能が、その原因を前述のように特定するためのアクションプランを自律的に作成できるかどうかについて考察する。
そこで我々は,Qテーブル強化学習を用いた行動計画を立てた。
驚くべきことに、強化学習によって生成された最適なアクションプランは、問題を特定するための人間的なソリューションを示しました。
論文 参考訳(メタデータ) (2021-07-20T02:40:19Z) - Exponential Error Suppression for Near-Term Quantum Devices [0.0]
NISQ時代には、最小のQECでさえ採用するために必要な複雑さと規模は禁じられている。
観測可能な天体の期待値を推定する重要な場合において、実効的な指数的抑制を達成できることが示される。
論文 参考訳(メタデータ) (2020-11-11T18:00:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。