論文の概要: ARCHER: Agentic Rule and Compliance Harness for Executable Regulations
- arxiv url: http://arxiv.org/abs/2607.25566v1
- Date: Tue, 28 Jul 2026 10:54:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.811014
- Title: ARCHER: Agentic Rule and Compliance Harness for Executable Regulations
- Title(参考訳): ARCHER:実行可能規則に対するエージェント・ルールとコンプライアンス・ハーネス
- Abstract要約: テスト駆動で決定的に編成されたマルチエージェントプログラム合成ハーネスであるARCHERを紹介する。
規制コードから監査可能な検証コードを生成し、透過的で適応性があり、スケーラブルなコンプライアンスチェックを可能にする。
当社のコスト精度分析では,自己ホスト型オープンウェイトモデルであるARCHERハーネスを用いることで,フロンティアAPIの精度が4分の1のコストで97.8%に達することが示されている。
- 参考スコア(独自算出の注目度): 0.11862655008303459
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verifying building compliance requires validating thousands of rules against large Building Information Modeling (BIM) designs, which is laborious, capital-intensive, and unscalable. Existing Automated Compliance Checkers (ACCs) are often difficult to generalize across different scenarios, as they are typically developed for highly specific rule sets and use cases. In addition, many ACCs are proprietary, meaning the underlying verification code is not released to end users, so users cannot verify whether their regulatory intent can be accurately captured. We introduce ARCHER (Agentic Rule and Compliance Harness for Executable Regulations), a test-driven, deterministically orchestrated multi-agent program-synthesis harness that generates auditable verification code from regulatory Codes of Practice, enabling transparent, adaptable, and scalable compliance checking. To characterize what makes agentic synthesis work, we evaluate a taxonomy of six harnesses of increasing agentic sophistication across four backbone models, spanning realistic data-governance tiers (from frontier third-party APIs to a fully on-premise open-weights model) on a novel dataset derived from real-world compliance scenarios. ARCHER's deterministic multi-agent orchestration achieves the highest accuracy for every backbone, improving mean union accuracy by 82% over a naive single-pass prompting baseline. Our cost-accuracy analysis further shows that using the ARCHER harness, a self-hosted open-weights model can reach 97.8% of frontier-API accuracy at a quarter of the cost, making data-sovereign compliance checking practical.
- Abstract(参考訳): コンプライアンスの検証には、大規模なビル情報モデリング(BIM)設計に対して数千のルールを検証する必要がある。
既存のAcc(Automated Compliance Checker)は、一般的に特定のルールセットやユースケースのために開発されるため、さまざまなシナリオをまたいだ一般化が難しい場合が多い。
加えて、多くのACCはプロプライエタリであり、つまり、基礎となる検証コードはエンドユーザにはリリースされないため、ユーザは自分の規制意図を正確に把握できるかどうかを検証できない。
テスト駆動で決定論的に編成されたマルチエージェントプログラム合成ハーネスであるARCHER(Agentic Rule and Compliance Harness for Executable Regulations)を導入する。
エージェント合成の動作を特徴付けるために、現実のコンプライアンスシナリオから派生した新しいデータセットに基づいて、現実的なデータガバナンス層(フロンティアサードパーティAPIから完全にオンプレミスのオープンウェイトモデルまで)にまたがる、4つのバックボーンモデル間でエージェントの洗練を増大させる6つの手法の分類を評価した。
ARCHERの決定論的マルチエージェントオーケストレーションは、バックボーン毎の最高精度を達成し、単純なシングルパスプロンプトベースラインよりも平均ユニオン精度を82%向上させる。
当社のコスト精度分析では,自己ホスト型オープンウェイトモデルであるARCHERハーネスを用いることで,フロンティアAPIの精度を4分の1のコストで97.8%にまで向上させることで,データソブリンコンプライアンスの実践性を実現している。
関連論文リスト
- CTRAG: An In-Context Retrieval-based Framework for Automated Compliance Checking using LLMs [3.4983716329137344]
本稿では,自動コンプライアンスチェック用に設計された新しいRAGパイプラインであるCTRAGを提案する。
CTRAGは、サードパーティサービスによる間接コンプライアンスであっても、極めて正確で、文書インフォームドコンプライアンスの検証を実現している。
CTRAGはF1スコア78%、リコール85%を最終配置で達成している。
論文 参考訳(メタデータ) (2026-08-03T16:40:16Z) - Bayesian control for coding agents [63.64172141184361]
本稿では,コーディングエージェントのためのコスト依存型シーケンシャル仮説テストフレームワークを提案する。
ベイズ管制官は、正確性に対する信念を維持し、より多くの証拠を集め、候補者を精査し、検証し、停止するかを決定する。
本研究では, 信頼状態が, 不確実性定量化のためのトークン確率と生ツール・サクセスベースラインを上回り, 解釈可能な正当性スコアを得ることを示す。
論文 参考訳(メタデータ) (2026-06-23T11:41:32Z) - Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering [54.97384993676565]
複雑な国内R&D規制から派生した運用知識グラフを特徴とする,新たなベンチマークであるRegOps-Benchを用いて,レギュレーションコンプライアンスQAを形式化する。
RefWalkはクロスドキュメントの引用を横切り、マックスベースのアグリゲーションを通じてマルチビュー候補を融合させ、ソースへのクレームを明示的にマッピングするためにルールごとの属性を強制する。
論文 参考訳(メタデータ) (2026-05-28T10:38:38Z) - IMMACULATE: A Practical LLM Auditing Framework via Verifiable Computation [49.796717294455796]
経済的なモチベーションのある逸脱を検出するための実践的な監査フレームワークIMMACULATEを提案する。
IMMACULATEは、検証可能な計算を用いて少数のリクエストを選択的に監査し、暗号オーバーヘッドを償却しながら強力な検出保証を達成する。
論文 参考訳(メタデータ) (2026-02-26T07:21:02Z) - Overcoming Joint Intractability with Lossless Hierarchical Speculative Decoding [58.92526489742584]
我々は無益な無益な提案をする。
承認されたトークンの数を大幅に増加させる検証方法。
HSDは様々なモデルファミリやベンチマークの受け入れ率に一貫した改善をもたらすことを示す。
論文 参考訳(メタデータ) (2026-01-09T11:10:29Z) - Compliance as a Trust Metric [1.0264137858888513]
本稿では,規制コンプライアンスを定量的かつダイナミックな信頼度として運用することで,この研究ギャップを埋める。
私たちのコントリビューションは、各違反の深刻度を、そのボリューム、時間、ブレッドス、臨界度など、複数の次元に沿って評価する定量的モデルです。
人工病院のデータセット上でACEを評価し,複雑なHIPAAおよびHIPAA違反を正確に検出できることを実証した。
論文 参考訳(メタデータ) (2026-01-03T21:14:40Z) - Generation of Programmatic Rules for Document Forgery Detection Using Large Language Models [10.32461766065764]
文書偽造は、法律、経済、政府のプロセスに対する脅威が増大している。
既存の可否チェックは、ソフトウェアエンジニアによって手作業で実装される。
大規模言語モデル(LLM)によるコード生成の最近の進歩は、これらのチェックの自動生成とスケーリングの新たな可能性を提供する。
論文 参考訳(メタデータ) (2025-12-22T10:08:25Z) - CIFE: Code Instruction-Following Evaluation [3.941243815951084]
我々は1,000のPythonタスクのベンチマークを導入し、それぞれが13のカテゴリにまたがる平均7つの開発者指定制約とペアリングした。
補完的付着度を用いて14個のオープンソース・クローズド・ソース・モデルを評価し,C2Aスコア(C2A Score)を提案する。
その結果、部分的満足度と厳密な満足度の間には実質的なギャップがみられ、強いモデルは90%以上の部分的密着性を達成する一方、厳密な密着性は39-66%に留まった。
論文 参考訳(メタデータ) (2025-12-19T09:43:20Z) - Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring [24.13989765643719]
現代の奴隷制度は世界中で何百万人もの人々に影響を与えており、現代の奴隷制度法のような規制の枠組みでは、企業が詳細な開示を公表する必要がある。
これらのステートメントは曖昧で矛盾することが多く、手作業によるレビューの時間とスケールが難しくなる。
専門家の監視を維持しつつルールレベルのコンプライアンス検証にAIを活用する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-11T03:41:44Z) - RAGulating Compliance: A Multi-Agent Knowledge Graph for Regulatory QA [0.0]
規制コンプライアンス質問応答(QA)は、正確で検証可能な情報を必要とする。
我々は、レギュレーション三重項の知識グラフ(KG)とレトリーバル拡張生成(RAG)を統合する新しいマルチエージェントフレームワークを提案する。
我々のハイブリッドシステムは、複雑な規制クエリにおいて従来の手法よりも優れており、組込み三重項による事実の正しさが保証されている。
論文 参考訳(メタデータ) (2025-08-13T15:51:05Z) - Fast or Better? Balancing Accuracy and Cost in Retrieval-Augmented Generation with Flexible User Control [52.405085773954596]
Retrieval-Augmented Generationは、大規模な言語モデル幻覚を緩和するための強力なアプローチとして登場した。
既存のRAGフレームワークは、しばしば無差別に検索を適用し、非効率な再検索につながる。
本稿では,精度・コストのトレードオフを動的に調整できる新しいユーザ制御可能なRAGフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-17T18:56:20Z) - Relational Action Bases: Formalization, Effective Safety Verification,
and Invariants (Extended Version) [67.99023219822564]
我々はリレーショナルアクションベース(RAB)の一般的な枠組みを紹介する。
RABは両方の制限を解除することで既存のモデルを一般化する。
データ対応ビジネスプロセスのベンチマークにおいて、このアプローチの有効性を実証する。
論文 参考訳(メタデータ) (2022-08-12T17:03:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。