論文の概要: NEXUS: Structured Runtime Safety for Tool-Using LLM Agents
- arxiv url: http://arxiv.org/abs/2607.19356v1
- Date: Mon, 25 May 2026 22:24:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.128746
- Title: NEXUS: Structured Runtime Safety for Tool-Using LLM Agents
- Title(参考訳): NEXUS: LLMエージェントの構造化ランタイム安全性
- Abstract要約: NEXUSは、正式な介入ポリシーを適用して、許可、ブロック、要求確認、要求修正の4つのアクションを選択する構造化された計画安全モニターである。
NEXUSは128インスタンスの総合ベンチマークで、F1スコア0.949と4クラスの介入精度0.6406を達成し、規則のみの介入選択を27.3ポイント上回っている。
- 参考スコア(独自算出の注目度): 1.813075010741314
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using LLM agents increasingly execute high-impact actions, making runtime safety monitoring essential. We present NEXUS (Neural EXecution Utility and Safety), a structured-plan safety monitor that applies a formal intervention policy to select among four actions: allow, block, request confirmation, or request revision. NEXUS combines deterministic safety rules, argument-level inspection, and a calibrated logistic-regression risk score for graded escalation. On a 128-instance synthetic benchmark, NEXUS achieves an F1 score of 0.949 and a 4-class intervention accuracy of 0.6406, outperforming rule-only intervention selection by 27.3 percentage points. It also improves over rule-only on R-Judge (F1 = 0.861 vs. 0.849), matches rule-only on AgentHarm due to threat-model limits, and achieves 0% ASR at 99% control allow on IPI. On the rule-blind NEXUS-Stress benchmark, NEXUS reaches an F1 score of 0.881, highlighting the difficulty of fine-grained intervention routing. With 0.205 ms median latency, NEXUS adds under 0.1% overhead to typical agent loops. Code, benchmarks, and the calibrated risk scorer are publicly released.
- Abstract(参考訳): ツールを使用するLLMエージェントは、ますます高インパクトアクションを実行し、実行時の安全監視を不可欠にしている。
我々は, NEXUS(Neural Execution Utility and Safety)という, 許可, ブロック, 要求確認, 要求修正の4つのアクションの中から, 正式な介入ポリシーを適用した構造化された計画安全モニタを提示する。
NEXUSは、決定論的安全性ルール、引数レベルの検査、格付けされたエスカレーションのための校正ロジスティック回帰リスクスコアを組み合わせる。
NEXUSは128インスタンスの総合ベンチマークで、F1スコア0.949と4クラスの介入精度0.6406を達成し、規則のみの介入選択を27.3ポイント上回っている。
また、R-Judgeのルールのみ(F1 = 0.861 vs. 0.849)よりも改善され、脅威モデル制限によるAgentHarmのルールのみと一致し、IPIのコントロール許容率99%で0%のASRを達成する。
NEXUS-Stressベンチマークでは、NEXUSはF1スコアの0.881に達し、きめ細かい介入ルーティングの難しさを強調している。
0.205 ms のレイテンシで、NEXUS は典型的なエージェントループに 0.1% 未満のオーバーヘッドを追加する。
コード、ベンチマーク、キャリブレーションされたリスクスコアラーが公開されている。
関連論文リスト
- Observe Before You Alert: Adaptive Driver Alerting with Vision-Language Models [22.095487498535434]
ダッシュカムビデオからのドライバー警告は、部分的な可観測性の下でのシーケンシャルな意思決定を必要とする。
既存の事故予測モデルはバイナリリスクスコアを出力し、あいまいなシーンをしきい値で処理する。
本稿では,SILENT,OBSERVE,ALERTに対して,警告生成をトリアクションポリシとする視覚言語警告フレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-08T02:08:50Z) - EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents [74.54929751174289]
EvoSafeHarnessは、ターゲットドメイン内の凍結モデルのためのデプロイ可能なハーネスを合成する、安全固有の最適化フレームワークである。
これは平均攻撃成功率を3.3ポイントのユーティリティコストで45.6%から10.0%に下げる。
また、Agent-SafetyBenchでは、すべての犠牲者に対してベストスコアを獲得している。
論文 参考訳(メタデータ) (2026-09-05T05:56:41Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning [54.70033525672316]
ビデオ対応の大型言語モデル(MLLM)は、このウィンドウ内で警告を発する常時オンの安全モニタとして機能する。
今回紹介するPaSBench-Videoは、481のリスクと4つのドメインにわたる259のリスクビデオを備えた740のビデオベンチマークだ。
最も厳密な基準ではモデルが20.0%を超えることはなく、リコールは偽陽性率と強く結びついている。
論文 参考訳(メタデータ) (2026-06-01T16:14:01Z) - Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications [3.93181912653522]
安全に配慮した言語モデルは、言葉が誤用に似ているサイバーセキュリティ要求を拒否することが多い。
これはセキュリティ評価を曖昧なものにする: 失敗した答えは、能力の欠如や、政治介入の拒絶を反映しているかもしれない。
我々は, 拒否, 試行率, 検証済みセキュリティ成功, 一般能力維持, 不安定性, スコープ外不安全コンプライアンスをSecurity-ARで評価した。
論文 参考訳(メタデータ) (2026-05-17T12:18:20Z) - Context-Aware Web Attack Detection in Open-Source SIEM Systems via MITRE ATT&CK-Enriched Behavioral Profiling [0.0]
本稿では,オープンソースのWazuh SIEMプラットフォーム用のAIモジュールであるSmart-SIEMを紹介する。
HTTP応答統計分布を符号化した振る舞いコンテキストベクトルを用いる。
2段階のハイブリッドカスケードは、LightGBMをバイナリアタック検出に、XGBoostを6クラスのアタック分類に組み合わせている。
論文 参考訳(メタデータ) (2026-05-13T10:54:36Z) - Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems [10.660248467840821]
新たなセキュリティリスクの特定と形式化:CFV(Context-Fragmented Violations)
CFVは、個々のエージェントの行動が局所的に安全かつ合理的に見えるが、全体として組織的方針に反する政策違反の類である。
分散ゼロトラスト適用アーキテクチャである分散センチネルを提案する。
論文 参考訳(メタデータ) (2026-04-24T03:08:52Z) - Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis [14.657771106188115]
脆弱性検出のためのトレーニング不要なマルチエージェントフレームワークであるPhoenixを提案する。
Phoenixは、検出をセマンティックスライダ、要求リバースエンジニア、契約審査員の3つのステージに分解する。
PrimeVul Pairedでは、Phoenix は F1 = 0.825 と Pair-Correct = 64.4% を獲得し、RASM-Vul (F1 = 0.668) と VulTrial (F1 = 0.563) を上回る。
論文 参考訳(メタデータ) (2026-04-21T03:02:34Z) - CORA: Conformal Risk-Controlled Agents for Safeguarded Mobile GUI Automation [68.53387633351484]
有害な行為に対する統計的保証を提供するポスト・ポリティクス・プレアクション保護フレームワークであるCORA(Conformal Risk-control GUI Agent)を提案する。
CORAは、安全を選択的行動実行として再定義する:我々は、提案されたステップごとに行動条件リスクを推定するためにガーディアンモデルを訓練する。
このパラダイムを厳格に評価するために、ステップレベルのハーモラベルを持つモバイル安全違反の新しいベンチマークであるPhone-Harmを紹介する。
論文 参考訳(メタデータ) (2026-04-10T09:41:21Z) - Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI [0.0]
トラジェクトリガードはシームズ・リカレント・オートエンコーダであり、コントラスト学習によるタスク・トラジェクトリアライメントと、再構成によるシーケンシャル・アライメントを共同で学習するハイブリッド・ロス機能を備えている。
32ミリ秒のレイテンシで、当社のアプローチは LLM Judge のベースラインよりも17-27倍高速で動作し、実運用環境におけるリアルタイムの安全性検証を可能にします。
論文 参考訳(メタデータ) (2026-01-02T00:27:11Z) - AlphaSteer: Learning Refusal Steering with Principled Null-Space Constraint [49.641959856967276]
提案手法はAlphaSteerと呼ばれる,理論的に基礎的かつ実験的に有効なアクティベーションステアリング法である。
ユーティリティ保存のために、Null-space制約を使って、良性データのステアリングのためのほぼゼロベクトルを構築することを学ぶ。
複数のjailbreak攻撃とユーティリティベンチマークの実験は、AlphaSteerの有効性を示している。
論文 参考訳(メタデータ) (2025-06-08T07:03:28Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z) - SafetyAnalyst: Interpretable, Transparent, and Steerable Safety Moderation for AI Behavior [56.10557932893919]
我々は、新しいAI安全モデレーションフレームワークであるSafetyAnalystを紹介する。
AIの振る舞いを考えると、SafetyAnalystはチェーン・オブ・シークレット・推論を使用してその潜在的な結果を分析する。
効果を28個の完全に解釈可能な重みパラメータを使って有害度スコアに集約する。
論文 参考訳(メタデータ) (2024-10-22T03:38:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。