論文の概要: SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models
- arxiv url: http://arxiv.org/abs/2610.07276v1
- Date: Mon, 05 Oct 2026 19:16:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.612766
- Title: SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models
- Title(参考訳): SAFESHIELD:小言語モデルのデプロイ時間安全のための決定組織化フレームワーク
- Abstract要約: デプロイ時の安全性を意思決定問題として定式化し、その2つの要素として、責任指向の安全性決定の分解と、その相互を明確に調整する。
我々は,この定式化を小型言語モデルのデプロイ時安全システムであるSAFESHIELDでインスタンス化する。
我々は,SAFESHIELDを機構レベル実験,アグリゲーションステージアブレーション,制御調整アブレーション,デプロイメント指向ストレススイートを通じて評価した。
- 参考スコア(独自算出の注目度): 2.557825816851682
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deployment-time safety of language models is commonly implemented through runtime guardrails such as input moderation, routing, retrieval verification, and output filtering. Existing deployment frameworks provide increasingly capable mechanisms for these functions, but offer limited guidance on how the safety decisions they produce should be explicitly organized, coordinated, and audited. We formulate deployment-time safety as a decision-organization problem with two elements: responsibility-oriented decomposition of safety decisions and explicit coordination among them. We instantiate this formulation in SAFESHIELD, a deployment-time safety system for small language models that organizes four recurring decision responsibilities (admission, routing, evidence, and release) and records committed decisions in auditable Decision Traces. We evaluate SAFESHIELD through mechanism-level experiments, aggregate stage ablations, controlled coordination ablations, and a deployment-oriented stress suite. Mechanism-level results show that the instantiated safeguards provide the capabilities required by the decision process, while aggregate ablations show substantial degradation in end-to-end safety as the surrounding safety organization is removed. More importantly, dedicated coordination ablations preserve the participating safeguard mechanisms while selectively severing their dependencies: removing admission gating substantially increases false release, and withholding upstream evidence from the release decision reduces release accuracy from 96.0% to 69.5%. These results provide system-level evidence that deployment-time safety depends not only on the capability of individual guardrails, but also on how their decisions are organized and coordinated.
- Abstract(参考訳): 言語モデルのデプロイ時の安全性は、入力モデレーション、ルーティング、検索検証、出力フィルタリングといったランタイムガードレールを通じて一般的に実装されている。
既存のデプロイメントフレームワークは、これらの機能に対してますます有能なメカニズムを提供するが、彼らが生成する安全判断を明示的に整理し、調整し、監査する方法について、限定的なガイダンスを提供する。
デプロイ時の安全性を意思決定問題として定式化し、その2つの要素として、責任指向の安全性決定の分解と、それら間の明示的な協調を定式化する。
SFESHIELDは、4つの繰り返し行われる決定責任(許可、ルーティング、エビデンス、リリース)を組織し、監査可能な決定トレースにコミットした決定を記録する小型言語モデルのデプロイ時安全システムである。
我々は,SAFESHIELDを機構レベル実験,アグリゲーションステージアブレーション,制御調整アブレーション,デプロイメント指向ストレススイートを通じて評価した。
機構レベルの結果から,インスタンス化されたセーフガードは意思決定プロセスに必要な機能を提供する一方で,アグリゲーションは周囲の安全組織を取り除き,エンド・ツー・エンドの安全性を著しく低下させることが示された。
さらに、専用の調整機構は、依存関係を選択的に切断しつつ、参加する保護機構を保ち、入場ゲーティングを除去することで、実質的に偽の解除が増加し、リリース決定から上流の証拠を保留することで、リリース精度を96.0%から69.5%に低下させる。
これらの結果は、デプロイメント時の安全性は個々のガードレールの能力だけでなく、それらの決定がどのように組織化され、調整されるかにも依存する、というシステムレベルの証拠を提供する。
関連論文リスト
- Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems [26.594498540217568]
デプロイされたシステムでは、最も連続的な障害の多くは、目覚ましいよりも静かで、単一のアウトプットに局所化するのではなく、コンポーネントに分散し、障害として認識される前にエコシステムによって正規化される。
現代のAIシステムにおける中心的な安全性の課題は、モデルが有害な応答を放出するかどうかだけではなく、より広範な社会技術システムが、エラーが可視で、競合可能で、封じ込め可能で、回復可能な状態を維持しているかどうかである。
論文 参考訳(メタデータ) (2026-07-21T17:02:37Z) - SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing [21.334890816629237]
LLMエージェントは、ツールコールを通じて現実世界の環境に作用する。
標準セーフガードは、提案された各アクションをセーフまたはアンセーフとラベル付けするガードモデルであるが、このバイナリビューは2つの異なる決定を混同している。
問題をEXECUTE, ASK, REFUSE に対してインスタンスごとの3方向ルーティング決定として再設定し,Safety Sentry でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-15T08:38:16Z) - ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails [57.25411733152009]
推論に基づくガードレールは、最終的な決定を下す前に明確な合理性を生成することによって安全性のモデレーションを改善する。
モデルは、その推論において有害な意図を認識することができるが、それでも安全なラベルを予測したり、政策を根拠とした正当化なしに安全でない決定を下す。
推論に基づくガードレールのための一貫性を考慮したフレームワークであるConsisGuardを提案する。
論文 参考訳(メタデータ) (2026-05-29T09:42:08Z) - Auditing Agent Harness Safety [81.22315979618612]
LLMエージェントは、ツールをディスパッチし、リソースを割り当て、特別なコンポーネント間でメッセージをルーティングする実行ハーネスの中でますます動作します。
ほとんどの安全ベンチマークは最終出力または終端状態のみをスコアするが、多くの違反は終端ではなく、軌道の途中で発生する。
HarnessAuditは、境界コンプライアンス、実行の忠実さ、システムの安定性など、完全な実行軌跡を監査するフレームワークである。
論文 参考訳(メタデータ) (2026-05-14T02:14:28Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - The Alignment Flywheel: A Governance-Centric Hybrid MAS for Architecture-Agnostic Safety [5.399984738447277]
本稿では、アライメントフライホイールをガバナンス中心のハイブリッドMASアーキテクチャとして定式化する。
執行層は実行時に明確なリスクポリシーを適用し、ガバナンスMASは監査、不確実性駆動による検証、バージョン管理による改善を通じてOracleを監督します。
アーキテクチャはProposerとSafety Oracleの両方に関して実装に依存せず、実行時ゲーティング、監査、署名されたパッチ、ステージングロールアウトに必要な役割、アーティファクト、プロトコル、リリースセマンティクスを指定する。
論文 参考訳(メタデータ) (2026-02-28T00:48:06Z) - Assured Autonomy: How Operations Research Powers and Orchestrates Generative AI Systems [18.881800772626427]
生成モデルは、実現可能性、分散シフトに対する堅牢性、ストレステストを提供するメカニズムと組み合わせない限り、運用領域で脆弱である可能性がある、と我々は主張する。
我々は,運用研究に根ざした自律性確保のための概念的枠組みを開発する。
これらの要素は、安全クリティカルで信頼性に敏感な運用領域における自律性を保証するための研究アジェンダを定義する。
論文 参考訳(メタデータ) (2025-12-30T04:24:06Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。