論文の概要: Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152
- arxiv url: http://arxiv.org/abs/2608.16394v1
- Date: Mon, 17 Aug 2026 10:46:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.641358
- Title: Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152
- Title(参考訳): LLMを用いた規制・コンプライアンスシナリオ生成のためのレギュララG:国連規制第152号を事例として
- Abstract要約: 本稿では,RegulaRAG(Retrieval-Augmented Generation (RAG)パイプライン)について紹介する。
本システムをテストするため,国連規制第152号(AEBS)の全シナリオを対象とした手作業による評価を行った。
- 参考スコア(独自算出の注目度): 27.082302648704708
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generating regulation-compliant test scenarios is essential for validating safety-critical automotive systems, yet Large Language Models (LLMs) struggle to ground outputs in long, hierarchical standards. We present RegulaRAG, a Retrieval-Augmented Generation (RAG) pipeline that couples SmartChunking, reference-aware enrichment of paragraphs and tables via graph traversal, with Smart Retrieve & Rerank over these enriched units. To test our system, we evaluate on a manually curated dataset covering all scenarios in UN Regulation No. 152 (AEBS). Our study comprises: (i) a three-step progressive search that identifies near-optimal retrieval parameters without exhaustive grid search; (ii) head-to-head comparisons against five baseline RAG systems; and (iii) a robustness stress test that scales the source corpus with distractor content. Outputs are evaluated using a customized penalized scoring metric. Across all experiments, RegulaRAG achieves the highest average Meta-Score (82.99), outperforming the next-best system by 43% (NoRAG: 57.94), while operating at 14k-25k tokens per query versus up to 500k for graphcentric baselines. It maintains strong performance, remaining stable even as the number of regulatory sources grows, whereas competing RAG systems degrade sharply in both quality and robustness.
- Abstract(参考訳): 安全クリティカルな自動車システムの検証には,規制に準拠したテストシナリオの生成が不可欠である。
本稿では,RegulaRAG(Retrieval-Augmented Generation, RAG)パイプラインについて紹介する。
本システムをテストするため,国連規制第152号(AEBS)の全シナリオを対象とした手作業による評価を行った。
私たちの研究は以下のとおりである。
一 網羅的な網羅探索を行わず、最適に近い探索パラメータを識別する三段階のプログレッシブサーチ
(二)5基RAGシステムに対する頭対頭比較、及び
三 ソースコーパスを散逸した内容でスケールする頑健性ストレステスト。
出力は、カスタマイズされたペナル化スコアによって評価される。
全ての実験で、RegulaRAGは平均平均Meta-Score (82.99)を43%(NoRAG:57.94)で上回り、クエリあたり14k-25kトークンで、グラフ中心のベースラインでは最大500kで動作する。
競争力のあるRAGシステムは品質と堅牢性の両方で著しく低下する一方、規制ソースの数が増えても安定している。
関連論文リスト
- Grounded Normative Rule Generation with Structured Search [47.28595196084396]
基底ノルム規則合成(GNRS)として問題を定式化する。
GNRS-SearchはMarkov Chain Monte Carlo(MCMC)サンプリングを利用して、離散5スロットアンドオーグラフ(AOG)を最適化するフレームワークである。
GNRS-Benchは8つのシーンにまたがる116の制御目標にまたがるベンチマークであり、RealCharterBenchは53のリアルなポリシータスクに隠れたソース節で遷移を評価する。
論文 参考訳(メタデータ) (2026-08-23T05:43:42Z) - FAB-Bench: A Framework for Adaptive RAG Benchmarking in Semiconductor Manufacturing [21.340021473068663]
半導体製造におけるRAGシステムの適応ベンチマークのためのエンドツーエンドフレームワークであるFAB-Benchを紹介する。
FAB-Benchは、事実的正確性、文脈的利用、完全性、検索関連性、技術的な深さ、推論一貫性を測定する6つの診断指標を定義している。
1,300以上の候補から,3つの合成戦略にまたがる200の問合せ対の高品質なベンチマークを算出した。
論文 参考訳(メタデータ) (2026-05-26T02:32:51Z) - EverydayGPT: Confidence-Gated Routing for Efficient and Safe Hybrid GPT-RAG Conversational QA [0.0]
EverydayGPTは、信頼性保証ルーティング機構を中心に構築された軽量な会話型QAシステムである。
CGRは、高速なRAG抽出によって解決することで、クエリの85%に対してコストのかかるGPT経路の呼び出しを回避している。
システムは F1 = 0.226 +/- 0.004 を GPT のみの 0.171 と無条件の RAG の 0.210 と比較すると達成する。
論文 参考訳(メタデータ) (2026-04-24T12:44:26Z) - Controllable and Verifiable Tool-Use Data Synthesis for Agentic Reinforcement Learning [82.89535601592739]
マルチレベル検証を用いた自己進化型合成により,信頼性の高い基本ツール利用軌跡を生成する2段階パイプラインを提案する。
これらの拡張は、トラクタツール、間接的または曖昧なユーザクエリ、ノイズ、マルチフォーマット、あるいは誤ったツール出力を導入します。
本設計では,標準事例に対する参照マッチングによる報酬の自動計算と,エラー検出などの特別な動作に対する軽量な判断支援検証を実現する。
論文 参考訳(メタデータ) (2026-04-10T18:38:52Z) - Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning [79.88942231770629]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を向上させるための訓練後の中心的なツールとなっている。
統一表記によるロールアウトパイプラインの形式化とGenerate-Filter-Control-Replay(GFCR)の導入
検証可能な報酬、プロセスの監督、判断に基づくゲーティング、ガイドとツリー/セグメントのロールアウト、アダプティブな計算割り当て、早期終了と部分的なロールアウト、スループット最適化、自己改善のための再生/再配置でRLにまたがる手法を合成する。
論文 参考訳(メタデータ) (2026-04-08T00:53:29Z) - ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis [96.92417622318267]
ATBenchは、エージェント安全性の構造化、多様性、現実的な評価のための軌道レベルのベンチマークである。
リスクソース、障害モード、現実世界の危害の3つの側面に沿ってエージェント的リスクを編成する。
1000個の軌道(安全503個、安全497個)があり、平均9.01ターンと3.95kトークンがあり、2,084個のツールにまたがるプールから1,954個のツールが呼び出されている。
論文 参考訳(メタデータ) (2026-04-02T13:26:20Z) - Evaluating Embedding Models and Pipeline Optimization for AI Search Quality [0.0]
我々は,AI駆動検索システムにおける各種テキスト埋め込みモデルとパイプライン構成の性能を評価する。
11,975対のクエリチャンクペアのカスタム評価データセットを,米国市議会の会議記録から合成した。
論文 参考訳(メタデータ) (2025-11-27T09:09:39Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - RuleRAG: Rule-Guided Retrieval-Augmented Generation with Language Models for Question Answering [18.59602224175808]
ルール誘導型検索拡張生成方式(RuleRAG-ICL)を提案する。
RuleQAの実験では、Recall@10では+89.2%の検索品質が向上し、Exact Matchでは+103.1%の回答精度が向上した。
さらに、既存のRAGデータセット4つの実験では、ルールQAのルールを提供することで、ルールRAGが有効であることを示している。
論文 参考訳(メタデータ) (2024-10-15T14:51:45Z) - Toward General Instruction-Following Alignment for Retrieval-Augmented Generation [63.611024451010316]
Retrieval-Augmented Generation (RAG) システムの効果的な適用には、自然な指示に従うことが不可欠である。
RAGシステムにおける命令追従アライメントのための,最初の自動化,拡張性,検証可能な合成パイプラインであるVIF-RAGを提案する。
論文 参考訳(メタデータ) (2024-10-12T16:30:51Z) - RankRAG: Unifying Context Ranking with Retrieval-Augmented Generation in LLMs [60.38044044203333]
大規模言語モデル(LLM)は、通常、検索拡張生成(RAG)において、レトリバーからトップkコンテキストを利用する。
本稿では,RAGにおける文脈ランク付けと回答生成の両目的のために,単一のLLMをチューニング可能な新しい命令微調整フレームワークであるRanRAGを提案する。
例えば、GPT-4-0613, GPT-4-turbo-2024-0409, ChatQA-1.5, RAGベンチマークの最先端性能を備えたオープンソースモデルなどである。
論文 参考訳(メタデータ) (2024-07-02T17:59:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。