論文の概要: Safety is Non-Compositional: A Formal Framework for Capability-Based AI Systems
- arxiv url: http://arxiv.org/abs/2603.15973v2
- Date: Thu, 19 Mar 2026 02:03:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 12:39:48.216277
- Title: Safety is Non-Compositional: A Formal Framework for Capability-Based AI Systems
- Title(参考訳): 安全は非複合的 - 機能ベースのAIシステムのための形式的フレームワーク
- Abstract要約: 接続能力の依存関係が存在する場合、安全性は非複合的である。
個々の2つのエージェントは、任意の禁止された能力に達することができるが、組み合わせると、突発的な結束依存性を通じて、一括して禁止された目標に達することができる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper contains the first formal proof that safety is non-compositional in the presence of conjunctive capability dependencies: two agents each individually inca- pable of reaching any forbidden capability can, when combined, collectively reach a forbidden goal through an emergent conjunctive dependency.
- Abstract(参考訳): 本論文は, 連接能力依存の存在下で安全が非複合的であることを示す最初の公式な証明を含む: それぞれ2つのエージェントが, 連接能力に到達することで, 連接能力依存を通じて一括して禁じられた目標に達することができる。
関連論文リスト
- Humanoid Safe Stop via Learned Stoppability Value [61.25464390942355]
本稿では,学習した停止ポリシーと学習した停止可能性推定器を組み合わせたタスク非依存のフレームワークを提案する。
推定器は、固定された停止ポリシーの実際の結果によって監督される停止確率推定器と、ハミルトン・ヤコビの物理的状態に対するバックアップによって監督される到達回避推定器である。
論文 参考訳(メタデータ) (2026-09-02T09:29:39Z) - Capability-Gated Language Models: Security Composes, Utility Does Not [0.0]
セキュリティの構成: モノトーン・エリケーションの仮定の下で、確実に一致して、ポイントワイズします。
2つの系統では、中央のホールドアウトは抑制を深め、残る1つの効果はそれを強化する。
論文 参考訳(メタデータ) (2026-08-31T22:35:49Z) - Semantic Non-Assembly: Privacy by Architectural Inertness Under Component Exposure [0.0]
プライバシー保証のクラス(Semantic Non-Assembly)を紹介する。
SNAでは、プライバシは露光の難しさではなく、露光時の情報収量によって特徴づけられる。
本稿では、保証を形式化し、4つのProVerif検証プロパティを確立する。
論文 参考訳(メタデータ) (2026-06-21T02:40:29Z) - Position: A Three-Layer Probabilistic Assume-Guarantee Architecture Is Structurally Required for Safe LLM Agent Deployment [0.0]
安全な操作を共同で構成する3つの次元:意味的意図とポリシーの遵守、環境の妥当性、動的実現可能性。
コミュニティは、各安全次元が独立して認定されたレイヤによって強制される、コントラクトベースのアーキテクチャで対応する必要があります。
このようなアーキテクチャをスケッチし、確率の連鎖則によって認められる構成系レベルの安全性境界を導出する。
論文 参考訳(メタデータ) (2026-05-18T17:13:41Z) - The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents [111.54911637435269]
オーソライゼーション・実行ギャップ(英: Authorization-Execution Gap、AEG)は、オープンワールドエージェントの安全性とセキュリティの問題である。
AEGは、プリンシパルが認可しようとするものと、オープンワールドエージェントが最終的に実行するものとの違いである。
論文 参考訳(メタデータ) (2026-05-10T04:05:31Z) - From Workflow Automation to Capability Closure: A Formal Framework for Safe and Revenue-Aware Customer Service AI [1.452875650827562]
2つのエージェントは、安全であると個別に検証され、組み合わせると、どちらも単独では持たない緊急接続依存性によって、禁じられた目標に達する。
このシフトは、現在のプラットフォームが閉鎖されていない安全性のギャップをもたらしている。2つのエージェントが個別に安全であると確認されると、どちらも単独では持たない創発的な結束依存性によって、禁じられた目標に達する。
論文 参考訳(メタデータ) (2026-03-16T22:48:07Z) - Relationship-Aware Safety Unlearning for Multimodal LLMs [36.94429692322632]
マルチモーダルモデルは、特定のアクションや関係によってリンクされた場合に本質的に安全でない安全障害を示すことができる。
我々は、安全でないオブジェクト(O-ROtext)を明示的に表現するフレームワーク、関係認識型安全学習を提案する。
パラフレーズによるCLIPに基づく実験と評価,文脈的ロバスト性,アウト・オブ・ディストリビューション・イメージ・アタックを含む。
論文 参考訳(メタデータ) (2026-03-15T02:22:26Z) - When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance [79.1968671824977]
テキスト・ツー・イメージ(T2I)拡散モデルは高品質な画像を生成する上で大きな進歩を見せている。
本研究では,適応型安全誘導(CASG)を動的に識別・適用する学習自由フレームワークとして,適応型安全誘導(CASG)を提案する。
T2Iの安全性ベンチマークの実験では、CASGの最先端性能が実証され、既存の方法と比較して有害率が最大15.4%低下した。
論文 参考訳(メタデータ) (2026-02-24T13:20:31Z) - PoSafeNet: Safe Learning with Poset-Structured Neural Nets [49.854863600271614]
既存のアプローチは、しばしば複数の安全制約を均一に、または固定された優先命令によって強制し、実現不可能と不安定な振る舞いを引き起こす。
我々は、この設定を擬似構造的安全性として定式化し、安全制約を部分的に順序づけられた集合としてモデル化し、安全構成を政策クラスの構造的特性として扱う。
この定式化に基づいて、逐次クローズドフォームプロジェクションを介して安全性を強制する、識別可能な神経安全層であるPoSafeNetを提案する。
論文 参考訳(メタデータ) (2026-01-29T22:03:32Z) - SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization [79.14563283347773]
マルチモーダルな大言語モデル (MLLM) は印象的な推論と命令追従能力を示した。
クロスモーダル結合は、個々の入力が良性である場合でも、安全でないセマンティクスを生成する。
自己回帰型マルチモーダル安全アライメントフレームワークであるSafeGRPOを提案する。
論文 参考訳(メタデータ) (2025-11-17T05:09:49Z) - The Alignment Trap: Complexity Barriers [0.0]
本稿は、AIアライメントは単に難しいだけでなく、基本的な論理的矛盾に基づくものである、と論じる。
私たちは、すべての必要な安全ルールを列挙できないため、マシンラーニングを正確に使用しています。
このパラドックスは、5つの独立した数学的証明によって確認される。
論文 参考訳(メタデータ) (2025-06-12T02:30:30Z) - Neural Certificates for Safe Control Policies [108.4560749465701]
本稿では,安全かつ目標達成の両立が保証される動的システムの方針を学習するためのアプローチを開発する。
本手法の有効性は, 振り子, カートポール, UAVなどの各種システムにおいて, 安全かつ目標達成的な政策を学習するための手法の有効性を示す。
論文 参考訳(メタデータ) (2020-06-15T15:14:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。