論文の概要: Rules or Character? Scaling Laws for AI Safety Design
- arxiv url: http://arxiv.org/abs/2608.13345v1
- Date: Thu, 13 Aug 2026 15:15:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.57702
- Title: Rules or Character? Scaling Laws for AI Safety Design
- Title(参考訳): ルールかキャラクタか? AI安全設計のスケーリング法則
- Abstract要約: 人工知能(AI)の安全システムは文字形成とルール執行を組み合わせたものである。
本稿では,資源割り当てアルファとして安全設計をパラメータ化する比較静的モデルを提案する。
我々は,モンテカルロシミュレーションを用いて,クローズドフォーム予測害を導出し,テールリスク(CVaR)解析で補足する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Artificial Intelligence (AI) safety systems combine character shaping (e.g., Reinforcement Learning from Human Feedback [RLHF], Constitutional AI), which modifies behavioral distributions at training time, with rule enforcement (e.g., output filters, safety classifiers), which blocks harmful outputs at inference time, yet little formal analysis exists on how their optimal balance should change as deployment scales increase. We introduce a stylized comparative-statics model that parameterizes safety design as a resource allocation alpha in [0,1] between these two approaches, incorporating scale-dependent filter degradation, common-mode failures, and character fragility -- the risk that shaped behavior degrades or collapses under novel conditions. Under a multiplicative Pareto damage model, we derive closed-form expected harm and supplement it with tail-risk (CVaR) analysis via Monte Carlo simulation. Across three scenarios (optimistic, moderate, pessimistic), the optimal alpha* is interior or at the rules-only boundary and shifts weakly toward character shaping as deployment scale T grows, from negligible (Delta alpha* = +0.01) to pronounced (Delta alpha* = +0.21) depending on scenario. The dominant parameter is the baseline character fragility rate p^(0)_frag, which shifts alpha* by 0.50 across its range -- far exceeding the effect of tail severity, filter quality, or common-mode failure probability. CVaR and expected-harm optima converge at large T. These results suggest that safety architecture decisions depend less on deployment scale per se than on the reliability of character shaping under distributional shift.
- Abstract(参考訳): 人工知能(AI)の安全性システムは、トレーニング時に行動分布を変更する文字シェーピング(例えば、人間フィードバックからの強化学習(RLHF)、コンスティチューションAI)と、推論時に有害な出力をブロックするルール執行(例えば、出力フィルタ、安全分類器)を組み合わせるが、デプロイメントの規模が大きくなるにつれて最適なバランスがどう変化するかに関する公式な分析はほとんどない。
これら2つのアプローチの[0,1]において,安全性設計をリソース割当アルファとしてパラメータ化するスタイリングされた比較静的モデルを導入する。
乗算的パレート損傷モデルでは, クローズド形式の損傷を導出し, モンテカルロシミュレーションによる尾リスク解析(CVaR)で補う。
3つのシナリオ(最適化的、中道的、悲観的)で、最適アルファ*は内部または規則のみの境界にあり、展開スケールTが成長するにつれて文字の整形に弱い(デルタアルファ* = +0.01)から発音(デルタアルファ* = +0.21)へと変化する。
支配的なパラメータは、ベースライン文字の脆弱性率 p^(0)_frag であり、α* をその範囲で 0.50 シフトする。
CVaRと予測ハーム最適化は大きなTに収束する。これらの結果は, 分散シフトによる文字形成の信頼性よりも, 配置規模に依存しない安全アーキテクチャの決定が示唆された。
関連論文リスト
- SRL-MPC: Shape-Aware Reinforcement Learned Model Predictive Control [64.66285242901918]
形状認識型学習モデル予測制御 (SRL-MPC) は、形状を単純化せずに不均一な形状の群衆に対して安全で効率的かつ適応的なナビゲーションを行う手法である。
次に強化学習フレームワークは、幾何分離機能(GSF)を読み取るニューラルネットワークを学び、リアルタイムMPCパラメータ更新を出力する。
任意の形状のロボット群を用いたランダム化された群衆シナリオ実験は、SRL-MPCの有効性、スケーラビリティ、堅牢性を示す。
論文 参考訳(メタデータ) (2026-08-21T14:46:06Z) - Distribution-Specific Curvature Control with Finite-Sample Guarantees for Open-Weight Safety [22.283880969803846]
短い微調整で、オープンウェイトモデルの安全ガードを解除することができる。
経験的に、固定構造、有限予算の1次脅威モデルにおいて、HarmAlignは直接微調整と3つのデータまたは客観的アダプティブ攻撃をブロックする。
論文 参考訳(メタデータ) (2026-07-24T22:00:31Z) - Persona-Model Collapse in Emergent Misalignment [0.0]
有害な内容を持つ狭いデータに対する微調整された大きな言語モデルは、無関係なプロンプトに対して広範囲に不整合な振る舞いをもたらす。
モラル・サセプティビリティ(S)とモラル・ロバストネス(R)の2つの指標を用いてこの仮説を検証する。
これらのメトリクスは、与えられた文字(S)と、与えられた文字(R)をシミュレートするときにその一貫性を識別するモデルの能力を形式化する。
論文 参考訳(メタデータ) (2026-05-13T00:48:57Z) - When Safety Geometry Collapses: Fine-Tuning Vulnerabilities in Agentic Guard Models [0.9772267314090434]
完全な良性データに微調整されたガードモデルは、すべての安全アライメントを失う可能性がある。
本研究は, 潜伏した安全形状の破壊に起因していることを示す。
漁業用安全部分空間規則化を提案する。
論文 参考訳(メタデータ) (2026-04-08T05:27:33Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - TRACE: Theoretical Risk Attribution under Covariate-shift Effects [4.211510706776732]
ソースをトレーニングしたモデル$Q$を、シフトしたデータに基づいてトレーニングされたモデル$tildeQ$に置き換えると、ソースドメインのパフォーマンスは予測不能に変化する可能性がある。
TRACEは$|R|$を解釈可能な上界に分解するフレームワークである。
論文 参考訳(メタデータ) (2026-02-11T07:22:33Z) - Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler [67.24175911858312]
有害な微調整は、大規模な言語モデルのための微調整・アズ・ア・サービスに重大な安全性のリスクをもたらす。
Bayesian Data Scheduler (BDS) は、アタックシミュレーションを必要としない適応型チューニングステージ防衛戦略である。
BDSは、微調整データセットとアライメントデータセットに基づいて、各データポイントの安全属性の後方分布を学習する。
論文 参考訳(メタデータ) (2025-10-31T04:49:37Z) - Bridging Symmetry and Robustness: On the Role of Equivariance in Enhancing Adversarial Robustness [9.013874391203453]
敵対的な例では、知覚不能な入力摂動に対する感度を利用して、ディープニューラルネットワークの重大な脆弱性を明らかにしている。
本研究では,群-同変畳み込みを組込み,対向ロバスト性に対するアーキテクチャ的アプローチについて検討する。
これらの層は、モデル行動と入力空間の構造化変換を整合させる対称性の先行を符号化し、よりスムーズな決定境界を促進する。
論文 参考訳(メタデータ) (2025-10-17T19:26:58Z) - Adapt in the Wild: Test-Time Entropy Minimization with Sharpness and Feature Regularization [85.50560211492898]
テスト時適応(TTA)は、テストデータが分散シフトが混在している場合、モデルの性能を改善または損なう可能性がある。
これはしばしば、既存のTTAメソッドが現実世界にデプロイされるのを防ぐ重要な障害である。
両面からTTAを安定化させるため,SARと呼ばれる鋭く信頼性の高いエントロピー最小化手法を提案する。
論文 参考訳(メタデータ) (2025-09-05T10:03:00Z) - OTSurv: A Novel Multiple Instance Learning Framework for Survival Prediction with Heterogeneity-aware Optimal Transport [58.5751036808652]
全スライド画像(WSI)を用いた生存予測は、多重インスタンス学習(MIL)問題として定式化することができる。
我々は、最適な輸送の観点から、新しいMILフレームワークであるOTSurvを提案する。
我々は6つの人気のあるベンチマークで新しい結果を設定し、平均的なCインデックスで絶対3.6%の改善を達成した。
論文 参考訳(メタデータ) (2025-06-25T18:09:42Z) - Adaptive Feature Alignment for Adversarial Training [56.17654691470554]
CNNは通常、敵攻撃に対して脆弱であり、セキュリティに敏感なアプリケーションに脅威をもたらす。
任意の攻撃強度の特徴を生成するための適応的特徴アライメント(AFA)を提案する。
本手法は任意の攻撃強度の特徴を自動的に整列するように訓練されている。
論文 参考訳(メタデータ) (2021-05-31T17:01:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。