論文の概要: PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs
- arxiv url: http://arxiv.org/abs/2608.09028v1
- Date: Mon, 10 Aug 2026 02:28:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.041209
- Title: PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs
- Title(参考訳): PolicyKG: 制度政策をSHACL知識グラフに変換するためのエージェントLLMパイプライン
- Abstract要約: PolicyKGはポリシーPDFを読み、各文を義務、許可、禁止として分類する。
その後、ラベルを一階のデオン論理に上げ、SHACL制約を出力する。
4つのステージは、ステージごとのバリデータを持つLangGraphステートマシン上で実行される。
- 参考スコア(独自算出の注目度): 2.4851820343103035
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Institutional policies stay in natural language while the systems that check compliance demand machine-readable constraints. Bridging that gap is still done by hand. PolicyKG closes the loop. It is an LLM pipeline that reads a policy PDF, classifies each sentence as an obligation, permission, or prohibition, lifts the label into first-order deontic logic, and emits SHACL constraints. Four stages run on a LangGraph state machine with per-stage validators. The piece that matters most is the Corpus Adapter: a YAML vocabulary registry that grounds LLM predicates in a target ontology. Retargeting to a new domain means swapping the registry, not retraining a model. On the Asian Institute of Technology Policies and Procedures corpus (1,663 sentences, 443 rules), PolicyKG reaches 86.9% deontic classification accuracy (Cohen's kappa = .709). Three annotators independently re-label a 50-item sample and agree at Fleiss' kappa = .844. SHACL shape correctness on a 69-shape subset is F1 = .866. The FOL path handles 79.2% of rules; the rest go through a direct NL-to-SHACL fallback. We audited every one of the 443 rules for second- or higher-order constructs. An automated regex checklist flagged none, and a first-author pass on the 92 FOL-fallback cases confirmed the same. The exact upper 95% Clopper-Pearson bound on the true HOL rate is 0.67%. This is an audit finding for one corpus, not a proof of FOL sufficiency for institutional policy. Swapping the AIT registry for a GDPR registry raises exact property alignment from 1/15 to 11/15 (Fisher's exact p < .001; Cohen's h = 1.53). On the LexDeMod lease-contract benchmark (N = 200), Macro F1 drops to .370 because lease English uses "shall be entitled" for permission -- exactly the vocabulary mismatch registry swap is meant to fix. Repeated runs produce hash-identical SHACL outputs.
- Abstract(参考訳): 制度上のポリシーは自然言語に留まり、コンプライアンスをチェックするシステムは機械可読性の制約を要求する。
そのギャップを埋めることはまだ手作業です。
PolicyKGはループを閉じる。
LLMパイプラインはポリシーPDFを読み、各文を義務、許可、禁止として分類し、ラベルを一階のデオン論理に引き上げ、SHACL制約を出力する。
4つのステージは、ステージごとのバリデータを持つLangGraphステートマシン上で実行される。
最も重要なものはCorpus Adapter(リンク)である。YAML語彙レジストリで、LLMがターゲットオントロジーで述語する。
新しいドメインへの再ターゲティングは、モデルの再トレーニングではなく、レジストリをスワップすることを意味します。
アジア技術政策・手続きコーパス(1,663文、443規則)では、ポリシーKGは86.9%のデオン分類精度に達する(コーエンのカッパ=.709)。
3つのアノテータは独立に50イテムのサンプルを再ラベルし、Fleiss' kappa = .844に一致する。
69個の部分集合上のSHACL形状の正しさは F1 = .866 である。
FOLパスは79.2%のルールを処理し、残りはNL-to-SHACLフォールバックを経由する。
2階または高階のコンストラクトに対する443のルールの1つを監査しました。
自動リジェックスチェックリストにはフラグが付けられず、92のFOLフォールバックケースにファースト著者が合格したことも確認された。
真のHOL速度に縛られた95%のクロッパー・ピアソンの正確な上限は0.67%である。
これは1つのコーパスに対する監査であり、FOLが制度政策に十分であることの証明ではない。
AITレジストリをGDPRレジストリにスワップすると、正確なプロパティアライメントが1/15から11/15になる(Fisherの正確なp < .001; Cohenのh = 1.53)。
LexDeModのリース契約ベンチマーク(N = 200)では、マクロF1が.370に低下する。
繰り返し実行するとハッシュIDのSHACL出力が生成される。
関連論文リスト
- SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics [15.233613140316791]
SemVerBenchは、3つのエコシステムにわたるバージョン制約解決セマンティクスの最初のベンチマークである。
6つのフロンティアモデルを評価し,統計的に有意な自己評価は得られなかった。
タスクが検証可能で、100%正しいリゾルバが存在するため、ツールデリゲートは100%に達する。
論文 参考訳(メタデータ) (2026-09-10T07:34:44Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - Grounded Normative Rule Generation with Structured Search [47.28595196084396]
基底ノルム規則合成(GNRS)として問題を定式化する。
GNRS-SearchはMarkov Chain Monte Carlo(MCMC)サンプリングを利用して、離散5スロットアンドオーグラフ(AOG)を最適化するフレームワークである。
GNRS-Benchは8つのシーンにまたがる116の制御目標にまたがるベンチマークであり、RealCharterBenchは53のリアルなポリシータスクに隠れたソース節で遷移を評価する。
論文 参考訳(メタデータ) (2026-08-23T05:43:42Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - GRID: Grammar-Railed Decoding for Enterprise SQL Generation [0.0]
文法制約付き復号エンジンGRID(Grammar-Railed Decoding)を提案する。
LALR(1)自体を実行可能なオラクルとして使用する。
4つの保証(音量、完全性、終了、およびほぼ一定に近いコスト)は明示的な前提条件で記述される。
論文 参考訳(メタデータ) (2026-07-11T19:25:23Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Context-Aware Distillation and Ablation for Text2DSL [78.29352305480285]
我々は、コンテクスト対応蒸留により、プロンプトのみの合成生成を置き換える。
教師の大きな言語モデルは、明示的に定義された構造化コンテキストの下で機能する。
これは、検証されたポルキットベンチコーパスを4,204対から10,073対にスケールする。
論文 参考訳(メタデータ) (2026-06-21T16:27:24Z) - Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation [51.56484100374058]
以前の作業では、アクティブフィルタの背後にライブのGeminiバックエンドを追加することで、測定可能なカバレッジが得られなかった。
L_4$-real(Gemini-2.5-flash, token-budget cap, rate limit, output scrub)と同様の$L_5$-no-regexを導入するが、9パターンフィルタは無効である。
3つのサブ言語にまたがる敵対的プローブに対して評価を行った。
論文 参考訳(メタデータ) (2026-06-12T18:54:24Z) - Hierarchical Certified Semantic Commitment for Byzantine-Resilient LLM-Agent Collaboration [30.310793549183117]
本稿では,BFTにインスパイアされたプロトコルH-CSC(Hierarchical Certified Semantic Commitment)を紹介する。
H-CSCはBFT対応バケット(0.31から2.04度)に低角偏差でコミットし、意図したようにBFTを超えるラウンド(n3f+1)の100%を中止する。
論文 参考訳(メタデータ) (2026-06-05T14:35:58Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - LLM StructCore: Schema-Guided Reasoning Condensation and Deterministic Compilation [0.0]
契約誘導推論(SGR)を基礎とした契約駆動型2段設計によるDyspnea CRF充填(134項目)のCL4Health 2026申請について述べる。
フィールドの大部分が不明であり、公式のスコアリングは空の値とサポートなしの予測の両方をペナルティ化する。
ひとつのステップ "LLM" アプローチから,ステージ1の要約を解析し,項目名を正規化し,エビデンス付き偽陽性フィルタを適用し,出力を 134-item フォーマットに拡張する,完全に決定論的な 0-LLM コンパイラに移行する。
論文 参考訳(メタデータ) (2026-04-22T13:42:00Z) - Reducing Maintenance Burden in Behaviour-Driven Development: A Paraphrase-Robust Duplicate-Step Detector with a 1.1M-Step Open Benchmark [1.9537983097153042]
振る舞い駆動開発スイートは、ドキュメント化されたメンテナンスコストとステップ重複の重複を蓄積します。
私たちはこれまでで最大の組織横断的なBDDステップコーパスをリリースします。
論文 参考訳(メタデータ) (2026-04-22T11:44:05Z) - PCN-Rec: Agentic Proof-Carrying Negotiation for Reliable Governance-Constrained Recommendation [0.0]
PCN-Rec(PCN-Rec)は、自然言語による推論を決定論的執行から切り離す、証明付きネゴシエーションパイプラインである。
MovieLens-100Kでは、PCN-Recが98.55%のパスレートを達成した。
論文 参考訳(メタデータ) (2026-01-14T15:00:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。