論文の概要: Protected Cores Are Not Enough: Certifying AI-Proposed Revisions of Temporal Specifications
- arxiv url: http://arxiv.org/abs/2609.33461v1
- Date: Sun, 27 Sep 2026 11:13:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 16:38:21.235664
- Title: Protected Cores Are Not Enough: Certifying AI-Proposed Revisions of Temporal Specifications
- Title(参考訳): 保護されたコアは不十分:一時的な仕様のAI提案の修正を認定
- Abstract要約: 我々は、信頼できないAI提案者が時間的仕様修正を提案し、象徴的な知事がそのアクティベーションを制御するシンボリックアーキテクチャを導入する。
制御された合成実験では、凍結された教師付きAIプロジェクタを使用して、マスクされたコアの障害を1つの決定で説明し、繰り返し支配された修正を繰り返します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Runtime monitoring traditionally evaluates a specification that is fixed before execution or externally modified when requirements change. In learning-enabled and data-intensive systems, however, the temporal relationships represented by a specification may themselves evolve. Allowing an AI component to directly replace a formal specification is unsafe: it may overfit transient behavior, weaken protected requirements, or activate statistically unsupported revisions. We introduce an intersymbolic architecture in which an untrusted AI proposer suggests temporal specification revisions and a symbolic governor controls their activation. Two results organize the framework. First, origin-version semantics makes the outcome of each obligation invariant to later revisions. Second, aggregate certification can conceal systematic failures on protected triggers; simultaneous aggregate and core-conditional post-selection certification controls both targets. A structural invariant preserves designer-protected components, and a proposer-independent lifetime error bound supports repeated activation decisions. The statistical bound concerns the predictable means of completed certification samples; interpreting it as future operational validity requires an additional stability assumption. Controlled synthetic experiments use a frozen supervised AI proposer to illustrate the masked-core failure at one decision and across repeated governed revisions. The proposer is a supervised regressor trained offline on synthetic tasks and frozen before use; it ranks candidates by predicted aggregate margin and never observes the protected-trigger success rate, so the masked-core failure arises from optimising the aggregate rather than from an adversary constructed by hand.
- Abstract(参考訳): 実行時の監視は、伝統的に、実行前に修正された仕様や、要求が変わったときに外部修正された仕様を評価します。
しかし、学習可能でデータ集約的なシステムでは、仕様によって表される時間的関係は、それ自体が進化する可能性がある。
一時的な振る舞いを過度に適合させたり、保護された要件を弱めたり、統計的に推奨されていない修正をアクティベートしたりする可能性がある。
我々は、信頼できないAI提案者が時間的仕様修正を提案し、象徴的な知事がそのアクティベーションを制御するシンボリックアーキテクチャを導入する。
2つの結果がフレームワークを編成する。
第一に、オリジナルバージョンセマンティクスは、各義務の結果を後続の修正に不変にする。
第2に、アグリゲーション認証は、保護されたトリガの体系的な障害を隠蔽することができる。
構造的不変性はデザイナが保護するコンポーネントを保存し、プロジェクタに依存しないライフタイムエラーは繰り返しアクティベーション決定をサポートする。
統計的境界は、完了した認証サンプルの予測可能な手段に関するものであり、将来の運用上の妥当性として解釈するには、さらなる安定性の仮定が必要である。
制御された合成実験では、凍結された教師付きAIプロジェクタを使用して、マスクされたコアの障害を1つの決定で説明し、繰り返し支配された修正を繰り返します。
提案手法は、合成タスクをオフラインでトレーニングし、使用前に凍結する教師付き回帰器であり、予測されたアグリゲーションマージンによって候補をランク付けし、保護されたトリガーの成功率を決して観測しないため、マスクコア障害は、手作業で構築された敵からではなく、アグリゲーションを最適化することから生じる。
関連論文リスト
- Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle [65.6642776933861]
この介入点付近で成長した保護パラダイムについて検討する。
ほとんどの保護は、主に静的あるいは弱い適応的な敵に対して検証されている。
我々は、堅牢で構成可能で、デプロイ可能な所有者側の保護のために、クロスステージ対策とオープンな問題を統合することで、閉鎖する。
論文 参考訳(メタデータ) (2026-08-05T00:46:50Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - The SIGReg Objective as Variational Free Energy: A Theoretical Active-Inference Account of JEPA World Models [47.471225029744424]
JEPA(Joint-Embedding Predictive Architectures)は、潜在世界モデルの主要な設計である。
本稿では,JEPAのトレーニング目標である予測損失と重み付き埋め込み正規化の選択肢が,有効能動推論(AIF)変動自由エネルギーであるか否かを判定する。
論文 参考訳(メタデータ) (2026-07-15T08:59:36Z) - Verification of Adaptive Agentic Controllers through Finite Rule Revision [0.0]
本稿では,有限記号規則で表される適応エージェント制御系に対する有界検証プロトコルを定式化する。
診断の失敗は、ルールの追加、ルール削除、優先度修正など、事前に定義されたルールレベルの編集にマップされる。
修理されたコントローラは、保持されたシミュレーションシードまたはクローンされた初期状態に基づいて評価される。
論文 参考訳(メタデータ) (2026-07-07T13:38:01Z) - A Governance Methodology Layer for AI-Assisted Software Development: Defect Taxonomy, Controlled Ablation, and a Test of Process-Over-Capability [0.0]
5つのAIエージェントの許可とガバナンスモジュールに基づく欠陥クラス分類を提案する。
本稿では,ジェネレータの出力を読み出し,構造化されたバリデーションを出力するランタイム分離型ガバナンスゲートについて述べる。
トークンマッチングされた未構造化プロンプトとハーネス構造化されたレビューを比較した制御アブレーション実験を報告する。
論文 参考訳(メタデータ) (2026-07-01T14:08:41Z) - Quantifying Self-Preservation Bias in Large Language Models [9.590157416396194]
本稿では,emphTwo-role Benchmark for Self-Preservationを紹介する。
役割アイデンティティが客観的ユーティリティを過度に上回る頻度を測定する。
我々は,低改善体制下では,モデルが解釈スラックを利用してポストホック合理化を行うのを観察する。
論文 参考訳(メタデータ) (2026-04-02T15:38:31Z) - Authority-Level Priors: An Under-Specified Constraint in Hierarchical Predictive Processing [0.0]
オーソリティ・レベル優先(英: Authority-Level Priors、ALP)は、アイデンティティレベルの仮説の規制が許容できるサブセットを定義するメタ構造制約である。
ALPは、追加の表現状態や精度よりも高優先度であり、規制制御に許容される仮説を制約している。
計算形式化は、認可された仮説によって生成されるポリシーに対するポリシー最適化を制限する。
論文 参考訳(メタデータ) (2026-03-19T13:27:47Z) - CORE: Context-Robust Remasking for Diffusion Language Models [51.59514489363897]
我々は、推論時リビジョンのためのトレーニング不要フレームワークであるContext-Robust Remasking (CORE)を提案する。
静的トークンの確率を信頼するのではなく、COREは、ターゲットとなるマスク付きコンテキストの摂動に対する感受性を示すことによって、コンテキスト不安定なトークンを識別する。
LLaDA-8B-Baseでは、COREは推論とコードベンチマークの間で一貫した改善を行い、計算に適合したベースラインを上回り、MBPPを最大9.2%改善した。
論文 参考訳(メタデータ) (2026-02-04T00:12:30Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。