論文の概要: The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification
- arxiv url: http://arxiv.org/abs/2608.11243v1
- Date: Sat, 01 Aug 2026 11:18:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.593661
- Title: The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification
- Title(参考訳): オフ・サポーター:なぜセマンティック・セーフティ制約が学習プロブレム不変量ではないのか、そして、事前設計、封じ込め、検証のために何に従うのか
- Authors: Yoshinori Watanabe,
- Abstract要約: セマンティック・セーフティ・制約(例えば、エージェントはサンドボックスから脱出しない)は、非サポート対象である。
一つの構造的な事実が、現代のAIの安全性において幅広い現象を組織している、と我々は主張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We argue that a single structural fact organizes a wide range of phenomena in contemporary AI safety: a semantic safety constraint (e.g., the agent does not escape its sandbox) is an off-support object. Formally, if q is the data distribution and \(p(\cdot\mid w)\) the model, the safety predicate B is not measurable with respect to \(σ(\text{model}, q)\), whereas the real log-canonical threshold (RLCT) of singular learning theory (SLT) is. From this non-invariance we derive, as corollaries rather than independent observations: (i) why reward hacking and sandbox escape arise under outcome-based optimization; (ii) why encoding such constraints through Bayesian prior design or soft penalty weighting has poor leverage in singular models; (iii) why hard invariants belong in the harness and soft dispositions in the model; (iv) why the same B is nonetheless soundly and locally certifiable by formal verification, exactly as the local learning coefficient (LLC) locally pins the same RLCT --- with two precise points of disanalogy; and (v) why the residual difficulty, identifying which off-support region matters, coincides with performative prediction and self-referential functional dynamics, where SLT's analytic machinery breaks down. We use the July 2026 OpenAI--Hugging Face evaluation incident as the motivating case. Numerical experiments code and related proofs in lean are available at https://github.com/xiangze/Preventing_Jailbreak_as_regularization
- Abstract(参考訳): 我々は、単一の構造的事実が、現代のAIの安全性における幅広い現象を組織していると主張している。
形式的には、q がデータ分布で \(p(\cdot\mid) であれば
w) モデル、安全性述語 B は \(σ(\text{model}, q)\) に対して測定できないが、特異学習理論(SLT)の実際の対数標準しきい値(RLCT)は測定可能である。
この非不変性から、我々は独立的な観察よりも、輪郭として導かれる。
(i)結果に基づく最適化の下で、なぜ報酬のハッキングやサンドボックスエスケープが発生するのか。
2) ベイズ的事前設計又はソフトペナルティ重み付けによるそのような制約の符号化が特異モデルにおいて不十分なレバレッジを持つ理由
三 モデルにおいて、ハード不変物がハーネス及び軟質沈着物に属する理由
(4) 局所学習係数(LLC)が局所的に同じRCCTを2つの正確な解析ポイントでピンするのと同じように、なぜ同じBが形式的検証によって正当かつ局所的に証明されるのか。
(v) SLTの分析装置が故障した場合に,どの非支持領域が重要かという残差困難は, 性能予測や自己参照機能ダイナミクスと一致する。
私たちは、2026年7月のOpenAI-Hugging Face評価事件をモチベーションケースとして使用します。
数値実験コードとリーンの関連証明はhttps://github.com/xiangze/Preventing_Jailbreak_as_regularizationで公開されている。
関連論文リスト
- How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Learning Uncertainty from Sequential Internal Dispersion in Large Language Models [52.29267172760918]
不確実性推定は、大規模言語モデルにおける幻覚を検出するための有望なアプローチである。
最近の手法は一般に不確実性を推定するために内部状態のモデルに依存する。
本稿では,教師付き幻覚検出フレームワークであるシークエンシャル内部変数表現(SIVR)を提案する。
論文 参考訳(メタデータ) (2026-04-17T06:31:29Z) - Quantifying Self-Preservation Bias in Large Language Models [9.590157416396194]
本稿では,emphTwo-role Benchmark for Self-Preservationを紹介する。
役割アイデンティティが客観的ユーティリティを過度に上回る頻度を測定する。
我々は,低改善体制下では,モデルが解釈スラックを利用してポストホック合理化を行うのを観察する。
論文 参考訳(メタデータ) (2026-04-02T15:38:31Z) - CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention [24.03101162891974]
計画指向のエンドツーエンド駆動モデルは、真の因果関係ではなく統計的相関を学習する。
この脆弱性は因果的混乱を引き起こし、モデルがショートカットとしてデータセットバイアスを利用する。
CausalVADは因果的介入を生かした非融合トレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-03-19T07:21:01Z) - Certainty-Validity: A Diagnostic Framework for Discrete Commitment Systems [0.0]
「マシーン学習評価尺度」は、全てのエラーが等価な離散的なコミットメントシステムであると仮定する。
信頼不正確」な振る舞いは、モデルが曖昧なデータの中で構造を幻覚させる場所である。
推論システムのための「Good Training」は、精度ではなく、Certainty-Validity Scoreの最大化によって定義されなければならない。
論文 参考訳(メタデータ) (2026-02-10T21:53:02Z) - How Does Prefix Matter in Reasoning Model Tuning? [57.69882799751655]
推論(数学)、コーディング、安全性、事実性の3つのコアモデル機能にまたがる3つのR1シリーズモデルを微調整します。
その結果,プレフィックス条件付きSFTでは安全性と推論性能が向上し,Safe@1の精度は最大で6%向上した。
論文 参考訳(メタデータ) (2026-01-04T18:04:23Z) - Learning Neural Control Barrier Functions from Expert Demonstrations using Inverse Constraint Learning [1.7235805533661985]
我々は、安全、すなわち制御された前方不変集合に属することを考慮し、システムの状態を分類する制約関数を訓練する。
次に、その関数を使用して、新しいシミュレートされた軌道のセットをラベル付けし、神経CBFをトレーニングします。
4つの異なる環境において、我々のアプローチを実証的に評価し、既存のベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2025-10-24T15:20:34Z) - An Information-Theoretic Framework for Credit Risk Modeling: Unifying Industry Practice with Statistical Theory for Fair and Interpretable Scorecards [1.4824891788575416]
IVは、同一のビン上での善と悪のクレジット結果とで計算されたPSIと完全に等しいことを示す。
我々は、クレジットモデリング固有のパフォーマンス・フェアネストレードオフを、IVの予測パワーを最大化しつつ、IVの保護属性を最小化するものとして定式化する。
この枠組みは理論と実践を橋渡しし、広く使用されている信用リスク指標の厳密な統計基盤を提供する。
論文 参考訳(メタデータ) (2025-09-11T21:05:34Z) - Confident Sinkhorn Allocation for Pseudo-Labeling [40.883130133661304]
半教師付き学習は、ラベル付きデータへの機械学習の依存を減らす重要なツールである。
本稿では,疑似ラベル作成における不確実性の役割を理論的に研究し,CSA(Confident Sinkhorn Allocation)を提案する。
CSAは、信頼度の高いサンプルのみへの最適な輸送を通して、最高の擬似ラベル割り当てを特定する。
論文 参考訳(メタデータ) (2022-06-13T02:16:26Z) - Causal Expectation-Maximisation [70.45873402967297]
ポリツリーグラフを特徴とするモデルにおいても因果推論はNPハードであることを示す。
我々は因果EMアルゴリズムを導入し、分類的表現変数のデータから潜伏変数の不確かさを再構築する。
我々は、反事実境界が構造方程式の知識なしにしばしば計算できるというトレンドのアイデアには、目立たずの制限があるように思える。
論文 参考訳(メタデータ) (2020-11-04T10:25:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。