論文の概要: NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs
- arxiv url: http://arxiv.org/abs/2608.07167v1
- Date: Fri, 07 Aug 2026 12:36:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.497186
- Title: NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs
- Title(参考訳): NiyamAI - ゼロ知識証明を用いた暗号的に検証可能なガードレールを備えたインテント境界AIエージェント
- Abstract要約: 安全対策を実証するフレームワークであるNiyam-AIを紹介する。
我々は,Ner-SafetyBenchとNeMo Guardrails,MetaのLlama Prompt Guard 2,OpenAIのGPT-OSS-Safeguardの2,000の現実世界シナリオについて,Niyam-AIを評価した。
Niyam-AIは390対NeMo(vs 20敗)、115対Prompt Guard 2(vs 13)、384対GPT-OSS-Safeguardで勝利した。
- 参考スコア(独自算出の注目度): 0.20215383828623398
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Giving an AI agent the ability to send emails, query databases, or execute commands is useful--until the agent is tricked into doing something it shouldn't. Prompt injection, hallucinated reasoning, and unsafe tool calls form the primary attack surface for autonomous LLM agents. Existing defenses rely on software checks like system prompts or policy filters running on the same machine the attacker targets, offering no verifiable proof of execution. We introduce Niyam-AI, a framework that makes safety enforcement provable. At session start, permitted tools and constraints are locked into an Intent Contract committed via SHA-256. Every tool call is intercepted and validated by an isolated Judge model; upon passing, a zk-SNARK proof is generated via EZKL. The tool executes only after proof verification, allowing third parties to confirm enforcement without accessing Judge model weights. Evaluating Niyam-AI on 2,000 real-world scenarios from Agent-SafetyBench against NeMo Guardrails, Meta's Llama Prompt Guard 2, and OpenAI's GPT-OSS-Safeguard using 5-fold stratified cross-validation yields an F1 score of 88.5% with a 1.1% false-positive rate (bootstrap 95% CI: [85.19%, 91.88%], N=1000). McNemar's exact paired test confirms significant improvement: Niyam-AI wins 390 discordant scenarios against NeMo (vs 20 losses), 115 against Prompt Guard 2 (vs 13), and 384 against GPT-OSS-Safeguard (vs 19) with p < 0.0001 in all cases. Proof generation adds 2260.6 +/- 218.4 ms per approved action, while verification takes 53.1 +/- 11.8 ms. Niyam-AI provides a guardrail that is both highly accurate and mathematically verifiable--though this reflects a classifier adapted to Agent-SafetyBench evaluated against zero-shot baselines, a distinction discussed in Section IV.C.
- Abstract(参考訳): AIエージェントにメールを送ったり、データベースをクエリしたり、コマンドを実行したりする機能を与えるのは便利です。
プロンプトインジェクション、幻覚的推論、安全でないツールコールは、自律LLMエージェントの主要な攻撃面を形成する。
既存の防御は、攻撃者がターゲットとする同じマシン上で実行されるシステムプロンプトやポリシーフィルタのようなソフトウェアチェックに依存しており、実行の確証は提供されていない。
安全対策を実証するフレームワークであるNiyam-AIを紹介する。
セッション開始時に許可されたツールと制約は、SHA-256を介してコミットされたIntent Contractにロックされる。
すべてのツールコールは分離されたジャッジモデルによってインターセプトされ、検証され、通過すると、zk-SNARK証明がEZKLを介して生成される。
このツールは検証後にのみ実行され、審査員モデルウェイトにアクセスせずに第三者が実施を確認できる。
Niyam-AI を NeMo Guardrails に対するエージェントセーフティベンチ、Meta's Llama Prompt Guard 2 、OpenAI の GPT-OSS-Safeguard の 5 倍成層式クロスバリデーションによる2,000 の現実シナリオで評価すると、F1 スコアは 88.5% となり、偽陽性率は 1.1% となる(bootstrap 95% CI: [85.19%, 91.88%], N=1000)。
ニヤムAIは390対NeMo(vs 20損失)、115対Prompt Guard 2(vs 13)、384対GPT-OSS-Safeguard(vs 19)でp < 0.0001で勝利した。
証明生成は承認されたアクションごとに2260.6 +/- 218.4 msを追加し、検証には53.1 +/- 11.8 msを要するが、ニヤムAIは高度に正確かつ数学的に検証可能なガードレールを提供する。
関連論文リスト
- The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK [0.0]
検証者主導のループにおいて、AIエージェントは古典的および後量子暗号、TLS 1.3、IKEv2、X.509、マトリックスクライアントにまたがるAda/SPARKのベアメタルセキュリティソフトウェアを書いて検証した。
GNATproveは49,280の証明義務を解除し、選択されたプリミティブに対して機能的正当性を確立し、残りのプリミティブに対して実行時のエラーがないことを証明した。
それぞれのレイヤが障害をキャッチし,中心的な教訓を引き出す方法を報告します。エージェントが確立するために信頼できるものは,そのフィードバックの強さに縛られているのです。
論文 参考訳(メタデータ) (2026-07-15T20:09:05Z) - Hallucination as Exploit: Evidence-Carrying Multimodal Agents [10.441697487723568]
マルチモーダルエージェントはますます、スクリーンショットやドキュメント、Webページからツールコールを選択している。
本稿では,自由形式モデルテキストを不許容な証拠として扱うエビデンス搬送型マルチモーダルエージェント(ECA)を提案する。
ECAは不透明なモデルの信念を検証者、スキーマ、実装レベルで監査可能な残留物に変換する。
論文 参考訳(メタデータ) (2026-05-18T23:40:43Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents [0.0]
NabaOSは対話型エージェントのための軽量な検証フレームワークである。
ソースによってAI応答内のすべてのクレームを分類する。
製造されたツールの実行の94.2%、誤り回数の87.6%、虚偽の欠席債権の78.4%を検知する。
論文 参考訳(メタデータ) (2026-03-09T20:45:41Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications [71.27518152526686]
大きな言語モデル(LLM)はテキストの理解と生成に優れており、コードレビューやコンテンツモデレーションといった自動タスクに最適である。
LLMは履歴書やコードなどの入力データに隠された「逆命令」で操作でき、意図したタスクから逸脱する。
本稿では,特定の攻撃タイプに対して80%以上の攻撃成功率を示すとともに,この脆弱性を再開スクリーニングで評価するためのベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-23T08:42:09Z) - Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks [0.0]
Agentic AIは、従来のLLMセーフガードが対処できないセキュリティ脆弱性を導入する。
エージェントAIシステムの最初の体系的テストと比較評価を行う。
新たな「ハロシントコンプライアンス」戦略を含む6つの防衛行動パターンを同定する。
論文 参考訳(メタデータ) (2025-12-16T19:22:50Z) - Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models [71.44858461725893]
信頼できない第三者によって微調整されたモデルを考えると、モデルがバックドアで注入されたかどうかが重要で難しい問題である。
既存の検出方法は通常、トレーニングデータセット、バックドアトリガー、ターゲットの事前知識に依存する。
このような事前知識を伴わずに動作する新しいモデルレベルの検出フレームワークであるAssimilation Matters in DETection (AMDET)を紹介する。
論文 参考訳(メタデータ) (2025-11-29T06:20:00Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z) - Deep Partition Aggregation: Provable Defense against General Poisoning
Attacks [136.79415677706612]
アドリアリン中毒は、分類器の試験時間挙動を損なうために訓練データを歪ませる。
毒殺攻撃に対する2つの新たな防御策を提案する。
DPAは一般的な中毒脅威モデルに対する認証された防御である。
SS-DPAはラベルフリップ攻撃に対する認証された防御である。
論文 参考訳(メタデータ) (2020-06-26T03:16:31Z) - (De)Randomized Smoothing for Certifiable Defense against Patch Attacks [136.79415677706612]
我々は、所定の画像とパッチ攻撃サイズを保証する、パッチ攻撃に対する認証可能な防御を導入する。
本手法はランダム化スムースなロバスト性スキームの幅広いクラスに関係している。
その結果,CIFAR-10およびImageNetに対するパッチ攻撃に対する認証済みの防御技術が確立した。
論文 参考訳(メタデータ) (2020-02-25T08:39:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。