論文の概要: EADC: Evaluation of Advanced and Deep-level Compliance in Large Language Models
- arxiv url: http://arxiv.org/abs/2609.26175v1
- Date: Tue, 22 Sep 2026 12:00:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.349792
- Title: EADC: Evaluation of Advanced and Deep-level Compliance in Large Language Models
- Title(参考訳): EADC:大規模言語モデルにおける高度・深層コンプライアンスの評価
- Abstract要約: EADCは、AIコンプライアンス知識グラフとAIコンプライアンス法の専門家に基づく、大規模言語モデル(LLM)の新たな高度な評価ベンチマークである。
我々のフレームワークは、高度に高度に高度な逆境シナリオを蒸留し、合成する自動化された進化型エージェントを可能にする。
得られたデータセットは、重要な規制フロンティアをカバーする広範囲で多次元の分類を提供する。
- 参考スコア(独自算出の注目度): 8.982923759813952
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) have been used in various industries. However, ensuring their compliance with complex laws and regulatory frameworks remains a great challenge. Existing evaluation paradigms mainly rely on static benchmarks that suffer from three severe limitations: First, the compliance rules being used do not comply with the requirements of Artificial Intelligence (AI) laws and regulations; Second, they only handle apparent, explicit compliance risks, leaving implicit and covert compliance risks undetected; Third, they fail to track the systematic propagation of risks along logical dependency chains or evaluate compliance within nuanced, context-based real-world scenarios. To bridge this critical gap, we introduce EADC, a novel advanced evaluation benchmark of LLMs based on an AI compliance knowledge graph and AI compliance legal experts. By mapping abstract legal rules into structured logical multi-relational graphs, our framework enables automated, evolving agents to distill and synthesize highly sophisticated adversarial scenarios. This compliance benchmark is reviewed and corrected by human AI legal experts throughout the whole process. The resulting dataset (4,435+ QA pairs) provides an extensive, multi-dimensional taxonomy covering critical regulatory frontiers, including bias and discrimination, fairness, personal privacy protection, and values. Crucially, our compliance dataset moves beyond shallow string-matching by incorporating contextual long-horizon interactions and logic-driven hazard chains, capturing deeply embedded compliance anomalies that bypass traditional filters. Experiment evaluations demonstrate that our framework exposes critical regulatory blind spots in state-of-the-art LLMs, offering a rigorous, AI laws and regulations-aligned benchmark to safeguard high-level and deep compliance in the application of LLMs.
- Abstract(参考訳): 大型言語モデル (LLM) は様々な産業で使われている。
しかしながら、複雑な法律や規制フレームワークへの準拠を保証することは、依然として大きな課題です。
既存の評価パラダイムは、主に3つの厳しい制限に悩まされている静的なベンチマークに依存している。 まず、使用されるコンプライアンスルールは、人工知能(AI)の規則と規則の要件を満たしていない。
この重要なギャップを埋めるために、私たちは、AIコンプライアンス知識グラフとAIコンプライアンス法の専門家に基づくLLMの新たな高度な評価ベンチマークであるEADCを紹介します。
抽象的な法則を構造化された論理的マルチリレーショナルグラフにマッピングすることにより、我々のフレームワークは自動化された進化的エージェントを蒸留し、高度に洗練された敵のシナリオを合成することを可能にする。
このコンプライアンスベンチマークは、プロセス全体を通して人間のAI法の専門家によってレビューされ、修正される。
その結果得られたデータセット(4,435以上のQAペア)は、偏見と差別、公正性、個人のプライバシ保護、価値観を含む重要な規制フロンティアをカバーする、広範囲で多次元の分類を提供する。
重要なことに、我々のコンプライアンスデータセットは、コンテキストの長い水平相互作用とロジック駆動型ハザードチェーンを取り入れ、従来のフィルタをバイパスする深く埋め込まれたコンプライアンス異常をキャプチャすることで、浅い文字列マッチングを超えています。
実験により、我々のフレームワークは最先端のLLMにおいて重要な規制盲点を露呈し、厳格でAIの法則と規制に準拠したベンチマークを提供し、LLMの適用における高レベルかつ深いコンプライアンスを守ります。
関連論文リスト
- Reinforcing privacy reasoning in LLMs via normative simulacra from fiction [1.143869785127334]
コンテキスト整合性(Contextual Integrity)は、コンテキスト関連規範内の情報の適切なフローとしてプライバシを定義する、原則化されたフレームワークを提供する。
本稿では、フィクション小説から規範的シミュラクラを抽出し、それらを微調整LDMに使用することを提案する。
異なる社会的文脈にまたがる5つのCI整合ベンチマークを評価した。
論文 参考訳(メタデータ) (2026-04-21T19:16:22Z) - ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance [49.524070843587594]
本研究では,大規模言語モデル(LLM)を活用し,法的領域における入力コンテキストを基盤とするセミルールベースのフレームワークであるContextLensを提案する。
我々は、General Data Protection Regulation()とEU AI Actをカバーする既存のコンプライアンスベンチマークの実験を行います。
その結果、ContextLensはLLMのコンプライアンス評価を大幅に改善し、トレーニングなしで既存のベースラインを越えられることが示唆された。
論文 参考訳(メタデータ) (2026-04-14T05:35:38Z) - Security, privacy, and agentic AI in a regulatory view: From definitions and distinctions to provisions and reflections [53.468443050795344]
人工知能(AI)技術の急速な普及は、動的規制の展望につながった。
AIパラダイムが、特にエージェントAIの形で、より大きな自律性へと移行するにつれ、規制規定を明確にすることはますます困難になっている。
本稿は、2024年から2025年の間に発行された24の関連文書を分析して、EU(EU)のAI規制条項をレビューする。
論文 参考訳(メタデータ) (2026-03-19T13:50:52Z) - AI Act Evaluation Benchmark: An Open, Transparent, and Reproducible Evaluation Dataset for NLP and RAG Systems [0.0]
不均一な公共および社会的セクターにおけるAIの急速な展開は、規制標準やフレームワークへのコンプライアンスの必要性を増大させてきた。
このような標準に対するAIシステムのコンプライアンスレベルを引き出すソリューションの開発は、リソース不足によって制限されることが多い。
本稿では、NLPモデルの評価を容易にするリソースを作成するための、オープンで透明で再現可能な手法を提案する。
論文 参考訳(メタデータ) (2026-03-10T09:47:50Z) - Mirror: A Multi-Agent System for AI-Assisted Ethics Review [104.3684024153469]
MirrorはAIによる倫理的レビューのためのエージェントフレームワークである。
倫理的推論、構造化された規則解釈、統合されたアーキテクチャ内でのマルチエージェントの議論を統合する。
論文 参考訳(メタデータ) (2026-02-09T03:38:55Z) - Lost in Vagueness: Towards Context-Sensitive Standards for Robustness Assessment under the EU AI Act [2.740981829798319]
ロバストネスは、EU人工知能法(AI法)に基づくリスクの高いAIシステムにとって重要な要件である
本稿では,AIシステムが堅牢であることの意味を考察し,文脈に敏感な標準化の必要性を示す。
論文 参考訳(メタデータ) (2025-11-19T17:06:36Z) - Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring [24.13989765643719]
現代の奴隷制度は世界中で何百万人もの人々に影響を与えており、現代の奴隷制度法のような規制の枠組みでは、企業が詳細な開示を公表する必要がある。
これらのステートメントは曖昧で矛盾することが多く、手作業によるレビューの時間とスケールが難しくなる。
専門家の監視を維持しつつルールレベルのコンプライアンス検証にAIを活用する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-11T03:41:44Z) - Argumentation-Based Explainability for Legal AI: Comparative and Regulatory Perspectives [0.9668407688201359]
人工知能(AI)システムは、法的文脈においてますます多くデプロイされている。
いわゆる「ブラックボックス問題」は、自動意思決定の正当性を損なう。
XAIは透明性を高めるための様々な方法を提案している。
論文 参考訳(メタデータ) (2025-10-13T07:19:15Z) - Context Reasoner: Incentivizing Reasoning Capability for Contextualized Privacy and Safety Compliance via Reinforcement Learning [53.92712851223158]
安全とプライバシの問題を文脈整合性(CI)理論に従って文脈整合性問題に定式化する。
CIフレームワークの下では、当社のモデルを3つの重要な規制基準 – EU AI ActとHIPAA – に整合させています。
我々は、安全・プライバシー基準の遵守を高めつつ、文脈推論能力を高めるためにルールベースの報酬を持つ強化学習(RL)を採用している。
論文 参考訳(メタデータ) (2025-05-20T16:40:09Z) - AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons [62.374792825813394]
本稿ではAI製品リスクと信頼性を評価するための業界標準ベンチマークとして,AIluminate v1.0を紹介する。
このベンチマークは、危険、違法、または望ましくない行動を12の危険カテゴリーで引き起こすように設計されたプロンプトに対するAIシステムの抵抗を評価する。
論文 参考訳(メタデータ) (2025-02-19T05:58:52Z) - SeCodePLT: A Unified Platform for Evaluating the Security of Code GenAI [58.29510889419971]
コード生成大型言語モデル(LLM)のセキュリティリスクと能力を評価するための既存のベンチマークは、いくつかの重要な制限に直面している。
手動で検証し、高品質なシード例から始める、汎用的でスケーラブルなベンチマーク構築フレームワークを導入し、ターゲット突然変異を通じて拡張する。
このフレームワークをPython、C/C++、Javaに適用すると、44のCWEベースのリスクカテゴリと3つのセキュリティ機能にまたがる5.9k以上のサンプルデータセットであるSeCodePLTが構築されます。
論文 参考訳(メタデータ) (2024-10-14T21:17:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。