論文の概要: PolicyGuard: Prompt-Configurable Semantic DLP for LLM Coding Agents
- arxiv url: http://arxiv.org/abs/2608.02687v2
- Date: Wed, 05 Aug 2026 14:16:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.218832
- Title: PolicyGuard: Prompt-Configurable Semantic DLP for LLM Coding Agents
- Title(参考訳): PolicyGuard: LLM符号化エージェントのためのプロンプト構成可能なセマンティックDLP
- Authors: Kyutae Park, Jungwon Kim, Daeyeol Shim,
- Abstract要約: 既存のデータ損失防止ソリューションは、厳格なパターン、モデル微調整、カスタマイズ可能なベンダー管理型分類器に依存している。
自然言語ポリシーファイルを使用してプロンプトを分類するプレモデルインターセプションフレームワークであるPhysageGuardを提案する。
主な貢献は,(1) 分類基準がコード変更やモデル再訓練を伴わない非技術者によって編集可能なポリシー文書で完全に定義されるポリシ・アズ・プロンプト・パラダイム,(2) テンプレート・ファミリーレベルのデータ分割,隠蔽ホールドアウト,凍結したテストセットによる一般化の厳密な評価を行うシールされた評価プロトコルである。
- 参考スコア(独自算出の注目度): 0.8836202788658859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: AI coding agents accept free-form natural language prompts that may inadvertently contain credentials, personally identifiable information (PII), or proprietary business data. Existing data loss prevention (DLP) solutions rely on rigid regex patterns, model fine-tuning, or vendor-managed classifiers with limited customizability. We present PolicyGuard, a pre-model interception framework that classifies user prompts using an LLM guided by a natural language policy file. Our key contributions are: (1) the policy-as-prompt paradigm, where DLP classification criteria are defined entirely in a plaintext policy document editable by non-engineers without code changes or model retraining; (2) a sealed evaluation protocol with template-family-level data splits, hidden holdouts, and frozen test sets to rigorously assess generalization; and (3) a comprehensive empirical evaluation across 2,000 multilingual prompts demonstrating 96.5% effective block rate (EBR) with only 3.0% false positive rate (FPR) on a frozen test set of 927 prompts, and perfect 100% accuracy on a 217-prompt hidden holdout. Information-matched baseline experiments show that PolicyGuard's natural language format significantly outperforms equivalent content in JSON format (McNemar chi-squared = 31.58, p < 0.001) and dramatically outperforms zero-shot classification (Cohen's h = 0.915). Cross-model portability experiments demonstrate that the same policy achieves 86.4-96.5% EBR across four different LLMs without modification.
- Abstract(参考訳): AIコーディングエージェントは、インテリジェンス、個人識別可能な情報(PII)、あるいはプロプライエタリなビジネスデータを含む可能性のある、自由形式の自然言語プロンプトを受け入れる。
既存のデータ損失防止(DLP)ソリューションは、厳密なRegexパターン、モデル微調整、あるいはカスタマイズ性に制限のあるベンダー管理型分類器に依存している。
本稿では,自然言語ポリシーファイルで案内された LLM を用いてユーザプロンプトを分類する,プレモデルインターセプションフレームワークである PolicyGuard を提案する。
1) DLP分類基準がコード変更やモデル再トレーニングなしで編集可能な平文ポリシー文書で完全に定義されるポリシ・アズ・プロンプト・パラダイム,(2)テンプレート・ファミリーレベルのデータ分割,隠されたホールトアウト,凍結したテストセットを厳格に評価するための封印された評価プロトコル,(3)凍結された927プロンプトに対して96.5%の有効ブロックレート(EBR)を示す2,000個のマルチリンガルプロンプロンプト(EBR)を包括的に評価し, 100%の正確性を示した。
情報マッチングによるベースライン実験では、PolicyGuardの自然言語フォーマットはJSONフォーマットで同等のコンテンツ(McNemar chi-squared = 31.58, p < 0.001)を著しく上回り、ゼロショット分類(Cohen's h = 0.915)を劇的に上回ります。
クロスモデルポータビリティ実験では、4つの異なるLLMに対して86.4-96.5% EBRを変更せずに達成している。
関連論文リスト
- Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis [31.25049774595995]
本研究は, 拒絶行動が相変わらず (相変わらず) 維持されているか, あるいは同系統モデルで再分類されたかを検討した。
我々は、脆弱性検出、CWE属性、脆弱なラインローカライゼーション、ルート原因ローカライゼーション、実行可能パッチバリデーションについて、アラインド状態とアライテッド状態の評価を行った。
論文 参考訳(メタデータ) (2026-07-07T05:04:48Z) - Can Multi-Agent LLMs Identify Their Peers? Stylometric Fingerprinting in Role-Constrained Political Analysis [0.0]
政治的ステートメント分析のための多エージェント大言語モデル(LLM)パイプラインは、ピア保存に対して脆弱である。
本稿では,LLMが匿名化条件下での政治分析テキストの背後にあるモデルファミリを識別できるかどうかを,初めて体系的に調査する。
論文 参考訳(メタデータ) (2026-05-20T04:56:42Z) - How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection [8.360057179027322]
言語間の脆弱性検出において、コード表現形式がどのように偽陽性行動を形成するかは、まだ理解されていない。
学習時間と推論時間の両方で、原文と刈り取られた抽象構文木を比較し、学習強度とコード表現形式を体系的に変化させる。
言語間のFPRは、トレーニング時間と推論時間の両方の表現の合同効果を反映している。
論文 参考訳(メタデータ) (2026-04-30T11:01:03Z) - LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests [0.0]
コーディングエージェントとLLMベースのアプリケーションは、通常、潜在的に敏感なコンテンツをクラウドのLLM APIに送信し、ログ化、保持、トレーニングに使用されるか、召喚される可能性がある。
プライバシ保護型LCM要求に対する8つの手法の系統的実証評価を行った。
MCPやOpenAI互換のAPIと互換性のあるオープンソースシムで、全8つ(あるいはデプロイメントがまだ実現不可能な、牽引可能な研究段階のサブセット)を実装しています。
論文 参考訳(メタデータ) (2026-04-13T21:05:42Z) - Self-reflection in Automated Qualitative Coding: Improving Text Annotation through Secondary LLM Critique [1.5749416770494706]
大規模言語モデル(LLM)は、大規模なデータセットの高度な定性的な符号化を可能にする。
簡単な一般化可能な2段階のワークフローを提示する: LLMは人間設計のコードブックを適用し、二次LPM批評家は各正のラベルに対して自己回帰を行う。
我々は,Apache Software Foundationのプロジェクト評価に関する議論において,3,000件以上の高コンテンツメールに対する6つの定性的なコードに対して,このアプローチを評価した。
論文 参考訳(メタデータ) (2026-01-14T22:27:13Z) - VulAgent: Hypothesis-Validation based Multi-Agent Vulnerability Detection [55.957275374847484]
VulAgentは仮説検証に基づくマルチエージェント脆弱性検出フレームワークである。
セマンティクスに敏感なマルチビュー検出パイプラインを実装しており、それぞれが特定の分析の観点から一致している。
平均して、VulAgentは全体的な精度を6.6%改善し、脆弱性のある固定されたコードペアの正確な識別率を最大450%向上させ、偽陽性率を約36%削減する。
論文 参考訳(メタデータ) (2025-09-15T02:25:38Z) - Benchmarking Unified Face Attack Detection via Hierarchical Prompt Tuning [58.16354555208417]
PADとFFDはそれぞれ物理メディアベースのプレゼンテーションアタックとデジタル編集ベースのDeepFakeから顔データを保護するために提案されている。
これら2つのカテゴリの攻撃を同時に処理する統一顔攻撃検出モデルがないことは、主に2つの要因に起因する。
本稿では,異なる意味空間から複数の分類基準を適応的に探索する,視覚言語モデルに基づく階層型プロンプトチューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T16:35:45Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - Gen-Z: Generative Zero-Shot Text Classification with Contextualized
Label Descriptions [50.92702206798324]
ゼロショットテキスト分類のための生成的プロンプトフレームワークを提案する。
GEN-Zはラベルの自然言語記述に基づく入力テキストのLM可能性を測定する。
データソースの文脈化によるゼロショット分類は、ゼロショットベースラインと少数ショットベースラインの両方を一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2023-11-13T07:12:57Z) - ExtractGPT: Exploring the Potential of Large Language Models for Product Attribute Value Extraction [51.87391234815163]
電子商取引プラットフォームは、属性と値のペアという形で構造化された製品データを必要とする。
BERTベースの抽出法では,タスク固有の大量のトレーニングデータを必要とする。
本稿では,大規模言語モデル (LLM) を,より訓練的かつ堅牢な代替手段として活用することを検討する。
論文 参考訳(メタデータ) (2023-10-19T07:39:00Z) - SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for
Generative Large Language Models [55.60306377044225]
「SelfCheckGPT」は、ブラックボックスモデルの応答をファクトチェックする単純なサンプリングベースアプローチである。
本稿では,GPT-3を用いてWikiBioデータセットから個人に関するパスを生成する手法について検討する。
論文 参考訳(メタデータ) (2023-03-15T19:31:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。