論文の概要: Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings
- arxiv url: http://arxiv.org/abs/2607.27849v1
- Date: Thu, 30 Jul 2026 08:26:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.461513
- Title: Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings
- Title(参考訳): カップリング蒸留ベンチマークによる安全誘導型エージェント監督制御:レジームマップ,監査ゲート,共同設計
- Authors: Christian Rosenthal,
- Abstract要約: 本稿では、このチェックをルールベースのフォークツイン対策ゲートに配置する。
SkogestadのカラムAでは、はしごはPIDのみ(C0)、リニアMPC(C1)、アンゲートエージェント(C2)、ゲートエージェント(C3)である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An open-weight LLM can write composition setpoints every five minutes. What a plant still needs is a hard check: named constraints, logged margins, and an admit/block decision before the regulatory layer moves. This paper puts that check in a rule-based forked-twin counterfactual gate (nine pinned constraints) and leaves the regulatory layer unchanged. On Skogestad's Column A the ladder is PID-only (C0), linear MPC (C1), ungated agent (C2), and gated agent (C3) under one contract: identical level closure (M_D, M_B), scenarios, and seeds; C2/C3 share the linear-MPC backend. The split is not subtle. Off-nominal target acquisition: the agent beats Pareto-tuned linear MPC in the strong band (C2/C1 IAE ratio 0.361 at the upper CI). Disturbance rejection on the same 16-point grid inverts by 16.03 at the upper CI (10.18 at the point estimate), where an ungated LLM supervisor does not belong. The gate compresses a specification-abandonment attractor into a bounded offset (d approx. -1.4; P95 cell IAE 11.5 to 0.77). A one-line prompt fix removes the attractor at source (6/10 to 0/10; sensitivity only, not a new headline). In a 250-cell statistical pass, 534 of 590 gate interventions are spec-on-bound geometry: the operating specification sits on a safety limit, so a well-behaved OP becomes inoperable while misbehaving ones are only contained; 318 blocks still correct actively harmful proposals. Headlines are single-column and model-conditional on DeepSeek-V4-Flash. A second-family sweep (NVIDIA Nemotron-3-Super) keeps the disturbance-rejection fails band and plant-side failure geography; magnitudes and protocol operability stay model-conditional, and Super target-acquisition strong cells are survivors only (not confirmation). Transfer means twin, constraint envelope, and setpoint interface, not a second plant class measured here.
- Abstract(参考訳): オープンウェイトLLMは5分毎に合成セットポイントを書ける。
名前付き制約、ログ化されたマージン、規制層が動く前に肯定的/ブロック的な決定などです。
本稿では,このチェックをルールベースのフォークツイン対策ゲート(9つのピン付き制約)に配置し,規制層をそのまま残す。
SkogestadのカラムAでは、はしごはPIDのみ(C0)、リニアMPC(C1)、アンゲートエージェント(C2)、ゲートエージェント(C3)で、同一レベルクロージャ(M_D、M_B、シナリオ、シード)、C2/C3はリニアMPCバックエンドを共有する。
分裂は微妙ではない。
オフ・ノミナル目標獲得: エージェントは強帯域(C2/C1 IAE比0.361)でパレート調整された線形MPCを破る。
同じ16点グリッド上の外乱の拒絶は、上位CI(10.18点)において16.03で逆転し、非ゲートLLMスーパーバイザは属さない。
ゲートは仕様解除アトラクターを有界オフセット(dapprox.-1.4; P95 cell IAE 11.5〜0.77)に圧縮する。
ワンラインプロンプトフィックスはソースのアトラクタを除去する(6/10から0/10; 感度のみ、新しい見出しではない)。
250セルの統計パスでは、590個のゲート介入のうち534個のゲート介入はスペックオンバウンドな幾何学であり、オペレーティング仕様は安全限度に設定されているため、よく理解されているOPは動作不能となり、誤動作のみが含まれ、318ブロックは依然としてアクティブに有害な提案を補正している。
見出しは、DeepSeek-V4-Flashの単一カラムとモデル条件である。
第2のファミリースイープ(NVIDIA Nemotron-3-Super)は、外乱除去がバンドとプラント側の障害地理に失敗し、サイズとプロトコル操作性はモデル条件のままであり、スーパーターゲット獲得強い細胞は生存者のみである(確認されていない)。
転送とは双子、制約エンベロープ、およびセットポイントインターフェースを意味し、ここで測定される第2のプラントクラスではない。
関連論文リスト
- Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation [0.0]
フェデレーションクラスをフロンティアの大規模言語モデルで文書化する。
故障は最初の観測で再現されるが、経験的表面は不安定である。
規制されたフロンティアモデルの正確性は、注意を払わずにシフトする移動したコンプライアンス境界である。
論文 参考訳(メタデータ) (2026-07-25T22:40:02Z) - From CVE to CWE: Syscall-Based HIDS Generalisation [41.99844472131922]
運用環境では、ディフェンダーは既知の脆弱性の新たなエクスプロイトを認識する必要がある。
我々は,CWE(Common Weaknession)クラスを共有するCVEの正常な動作に基づいて訓練された一級異常検知器が,同一クラス内の別の未知のCVEに一般化するか否かを実証的に検証した。
論文 参考訳(メタデータ) (2026-06-21T16:34:39Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents [3.964533007623828]
現代の大規模言語モデル(LLM)エージェントは、行動の時点で決定に関連のある証拠を必要とする。
本稿では、事例コンテキストグラフを構築し、候補単位の決定指向ユーティリティを推定し、選択したエビデンスを型付きメモリカードに圧縮するCICLについて述べる。
CICLは、ツール使用エージェントの意思決定クリティカルコンテキストの測定、ランキング、圧縮のための実用的なレイヤを提供する。
論文 参考訳(メタデータ) (2026-06-06T13:02:28Z) - Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection [0.0]
マルチエージェントの議論は事実と推論を改善するが、ほとんどのレシピは固定されたラウンドカウントを選択する。
我々は,LLM討論のプラグイン計算として,Wald's Sequential Probability Ratio Test (SPRT)を適用した。
GSM8Kでは、ルールは1.01ラウンド(4.06 LLMコール)で97.0%の精度で終了するが、15回のコールで固定5の討論では99.0%の精度で終了する。
MMLUでは、キャリブレーションされたKLは約0に崩壊し、ルール上限は2.1倍のコストで99.5%となる。
論文 参考訳(メタデータ) (2026-05-18T23:43:12Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment [9.127363793428119]
文字レベルの摂動は、人間を可読化しているにもかかわらず、現代のLLMの安全アライメントを回避している。
BPEトークン化は、安全クリティカルな単語をサブワードに断片化する。
論文 参考訳(メタデータ) (2026-05-01T18:57:03Z) - THEIA: Learning Complete Kleene Three-Valued Logic in a Pure-Neural Modular Architecture [0.0]
THEIAは2.75Mのモジュラー・ニューラルアーキテクチャで、外部のシンボル推論や手書きのK3ゲートプリミティブを使わずにタスクデータから完全Kleene 3値論理(K3)真理表を学習する。
トランスフォーマーのベースラインは39の規則すべてで99%に到達し、フラットは0.04pp以内のフェーズ1の精度でTheIAと一致している。
論文 参考訳(メタデータ) (2026-04-13T10:44:15Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning [46.232038247686745]
フェデレートラーニング(FL)は、歯科診断AIにおけるプライバシー制約、不均一なデータ品質、一貫性のないラベル付けを緩和する。
複数のデータ破損シナリオを対象としたパノラマX線撮影において,FLと集中学習(CL)と局所学習(LL)を比較した。
論文 参考訳(メタデータ) (2025-09-08T11:07:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。