論文の概要: Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents
- arxiv url: http://arxiv.org/abs/2608.06312v1
- Date: Thu, 06 Aug 2026 17:27:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 15:25:20.983211
- Title: Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents
- Title(参考訳): 国立標準文書のルール集中レビューのためのLCMのベンチマークと強化
- Abstract要約: 大規模言語モデル(LLM)は、複雑なプロフェッショナルタスクをますますサポートしているが、ルール集約型文書レビューにおけるそれらの能力は、十分に評価されていない。
既存のベンチマークはドメイン知識と質問応答に重点を置いており、プロのドキュメントの品質レビューをほとんど見落としている。
GB/T-Benchは,全国標準文書の構造化レビューのための最初のベンチマークである。
- 参考スコア(独自算出の注目度): 7.397429318828859
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) increasingly support complex professional tasks, yet their capabilities in rule-intensive document review remain insufficiently evaluated. National standard documents, such as China GB/T standards, offer a representative testbed: they are lengthy, highly structured, and governed by explicit rules for scope, terminology, normative wording, and cross-section consistency. Existing benchmarks focus on domain knowledge and question answering, largely overlooking intrinsic quality review for professional documents. Such reviews rely heavily on human experts, making them costly and difficult to scale. To bridge this gap, we introduce GB/T-Bench, the first benchmark for the structured review of national standard documents. Its GB/T Review Taxonomy is a hierarchical schema covering document structure, scope alignment, normative modality, terminology consistency, and normative references, with 25 diagnosable error types. A controllable counterexample generation mechanism combines deterministic rules and constrained LLM rewriting to process 488 documents into 7,306 traceable review error instances for evaluation. We also develop a diagnosis-oriented evaluation protocol requiring exact matches on error location, review dimension, and error type, plus document-level coverage metrics. We further propose GB/T-Reviewer, a multi-agent framework that converts review knowledge into specialized skills and coordinates global inspection, targeted diagnosis, rule scanning, and result verification. Experiments with 14 mainstream LLMs reveal a substantial human-LLM gap: the strongest model achieves only 0.3280 CMCS versus 0.6640 for experts. GB/T-Reviewer raises the best CMCS to 0.5094, showing the value of structured skill coordination for rule-intensive document review. This work paves the way for trustworthy AI in standardization and other high-stakes document domains.
- Abstract(参考訳): 大規模言語モデル(LLM)は、複雑なプロフェッショナルタスクをますますサポートしているが、ルール集約型文書レビューにおけるそれらの能力は、十分に評価されていない。
中国 GB/T 規格のような国定標準文書は、長大で高度に構造化されており、スコープ、用語、規範的語法、断面整合性の明示的な規則によって統治されている。
既存のベンチマークはドメイン知識と質問応答に重点を置いており、主に専門文書の本質的な品質レビューを見落としている。
このようなレビューは人間の専門家に大きく依存しているため、コストがかかりスケールが困難である。
このギャップを埋めるために、国定標準文書の構造化レビューのための最初のベンチマークであるGB/T-Benchを紹介する。
GB/T Review Taxonomyは、文書構造、スコープアライメント、規範的モダリティ、用語の一貫性、規範的参照を含む階層的なスキーマであり、25の診断可能なエラータイプがある。
制御可能な逆例生成機構は、決定論的ルールと制約付きLCM書き換えを組み合わせ、488文書を処理し、7,306のトレーサブルなレビューエラーインスタンスに評価する。
また, エラー位置, レビューディメンション, エラータイプ, および文書レベルのカバレッジ指標の正確な一致を必要とする診断指向評価プロトコルを開発した。
さらに、レビュー知識を専門的なスキルに変換し、グローバル検査、ターゲット診断、ルールスキャン、結果検証をコーディネートする多エージェントフレームワークであるGB/T-Reviewerを提案する。
最強のモデルは0.3280 CMCSであり、専門家は0.6640である。
GB/T-Reviewer は最高のCMCSを 0.5094 に引き上げ、ルール集約型文書レビューにおける構造化されたスキル調整の価値を示している。
この作業は、標準化やその他の高度なドキュメントドメインにおいて、信頼できるAIの道を開くものだ。
関連論文リスト
- ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation [54.82704239643649]
本稿では, 紙固有の診断と具体的, 基礎的なリビジョン計画とを結びつける, 反感に満ちたポストトレーニングフレームワークである ActReview を紹介する。
我々の中心的な洞察は、著者の反論は、レビュアーの懸念に対処するための妥当な行動を明らかにし、それゆえ、リビジョン指向のフィードバックに対する潜在的な監督を提供することができるということである。
またActReview-Benchは、診断品質とリビジョンの有用性を評価するために、1,000インスタンスの人為的なベンチマークである。
論文 参考訳(メタデータ) (2026-09-08T17:30:16Z) - Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing [53.41293908252118]
我々は、エキスパートレベルの文書解析のための困難を意識したベンチマークであるDocBench博士を紹介する。
Dr. DocBenchは52のBISACドメインにまたがり、障害ベースのサンプリングによってドキュメントを選択する。
約100ページにわたる長いドキュメントから4,514ページの注釈付きページが含まれており、レイアウト、読み込み順序、階層的関係、ドメイン固有のビジュアルコンテンツなど、65kの高品質なアノテーションがある。
本分析では,文書インテリジェンスを診断・進展するための総合的なテストベッドとしてDocBench博士が注目されている。
論文 参考訳(メタデータ) (2026-05-31T18:35:30Z) - RWGBench: Evaluating Scholarly Positioning in Related Work Generation [43.26813089097539]
テキスト類似性ではなく引用判断の観点からRWGを評価するベンチマークである textbfRWGBench を導入する。
RWGBenchは40,108のコンピュータサイエンス論文の大規模なコレクションと1.09百万のドキュメントの検索コーパスから構築されている。
実験では、標準的な評価によって隠蔽されている現在のシステムの体系的な制限が示され、Oracleは検索レベルとジェネレーションレベルのボトルネックをさらに歪めている。
論文 参考訳(メタデータ) (2026-05-30T16:53:14Z) - RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora [11.316299961548415]
本稿では,文書をアトミックな事実に分解することで,現実的なベンチマークを構築するためのフレームワークを提案する。
またRedQAでは、4-hop General-Wikiで66.4% PerfRecall@10から5.0-27.9% PerfRecall@10に4-hopでダウンする。
論文 参考訳(メタデータ) (2026-04-21T03:54:09Z) - ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents [50.27474750319121]
公式ガイドライン、論文の内容、人間によるレビューから派生した、紙固有のルーリックに従ってテキストをレビューする。
本稿では、公式ガイドライン、論文の内容、人手によるレビューに基づいて、レビューテキストを評価するベンチマークであるREVIEWBENCHを紹介する。
本稿では,レビューを起草段階と接地段階に分解するルーリック誘導ツール統合マルチエージェントフレームワークであるREVIEWGROUNDERを提案する。
論文 参考訳(メタデータ) (2026-04-15T16:33:04Z) - Wiki Live Challenge: Challenging Deep Research Agents with Expert-Level Wikipedia Articles [56.724847946825285]
Wiki Live Challenge (WLC)は、最新のWikipedia Good Articles(GA)をエキスパートレベルの参照として活用する、ライブベンチマークである。
Wiki Evalは, 品質基準39の細粒度評価手法と, 事実検証性のための厳密な指標を含む総合的な評価フレームワークである。
論文 参考訳(メタデータ) (2026-02-02T03:30:13Z) - RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension [65.81339691942757]
RPC-Bench(RPC-Bench)は、高品質なコンピュータサイエンス論文のレビュー・リビューの交換から構築された大規模質問応答ベンチマークである。
我々は、科学研究の流れに沿ったきめ細かい分類を設計し、モデルがなぜ、何、どのように学術的な文脈で質問するかを理解し、答える能力を評価する。
論文 参考訳(メタデータ) (2026-01-14T11:37:00Z) - DEER: A Comprehensive and Reliable Benchmark for Deep-Research Expert Reports [49.217247659479476]
ディープリサーチシステムは、多段階の推論とエビデンスベースの合成を通じて専門家レベルのレポートを生成することができる。
既存のベンチマークは、エキスパートレポートの体系的な基準を欠いていることが多い。
専門家レベルのディープリサーチレポートを評価するためのベンチマークであるDEERを紹介する。
論文 参考訳(メタデータ) (2025-12-19T16:46:20Z) - LegalRikai: Open Benchmark - A Benchmark for Complex Japanese Corporate Legal Tasks [2.399077824457897]
本稿では,日本の企業法慣行を模倣する4つの複雑なタスクからなる新しいベンチマークであるLegalRikai: Open Benchmarkを紹介する。
本ベンチマークでは,100個のサンプルを抽出し,複数の実測値と比較した。
論文 参考訳(メタデータ) (2025-12-12T05:47:06Z) - DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM [35.910677096654574]
文書解析は、構造化されていないPDF画像を半構造化データに変換することを目的としており、多様な領域における情報のデジタル化と活用を容易にする。
一般的なプラクティスは、しばしば標準ベンチマークで最高のパフォーマンスモデルを選択する。
本稿では,文書解析評価をきめ細かな誤り検出と解析として形式化するDOCR-Inspectorを紹介する。
論文 参考訳(メタデータ) (2025-12-11T13:16:33Z) - Expert Preference-based Evaluation of Automated Related Work Generation [54.29459509574242]
本稿では,従来の作業評価基準と専門家固有の嗜好を統合したマルチターン評価フレームワークGREPを提案する。
より優れたアクセシビリティを実現するため、我々はGREPの2つの変種を設計する: プロプライエタリなLLMを評価対象とするより正確な変種と、オープンウェイトなLLMをより安価な代替品である。
論文 参考訳(メタデータ) (2025-08-11T13:08:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。