論文の概要: Version- and Scope-Aware Question Answering over Normative Documents: A Deployed System and an End-to-End Evaluation at Production Scale
- arxiv url: http://arxiv.org/abs/2609.18769v1
- Date: Wed, 16 Sep 2026 14:52:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.858496
- Title: Version- and Scope-Aware Question Answering over Normative Documents: A Deployed System and an End-to-End Evaluation at Production Scale
- Title(参考訳): 規範的文書に対するバージョン・スコープ対応質問応答:展開システムと生産規模でのエンド・ツー・エンド評価
- Abstract要約: ドキュメントをアップロードして要求する”というのは、ホストされた検索サービスでは一般的なデフォルトです。
運用デプロイメントに提供される約73,000の候補規範ドキュメントに対して、このデフォルトを評価します。
ホストされたサービスと、生成前の明示的なルールによってバージョンとスコープを解決した管理システムを比較します。
- 参考スコア(独自算出の注目度): 1.751268480681041
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Correctly answering a question grounded in normative documents often depends on information outside any single passage: whether the retrieved document is the version currently in force; whether it applies to the jurisdiction, subject (such as an institution or applicant), and date at issue; and whether each normative claim can be traced to its supporting source text. Hosted retrieval services have substantially lowered the engineering cost of building an initial system over such corpora, making "upload the documents and ask" a common default. We evaluate this default on approximately 73,000 candidate normative documents supplied to a production deployment. The evaluation uses a stratified sample of 200 questions from our published benchmark, with a gold source document for every question; the released sampling rule reads no system outputs or scores. We compare the hosted service with a governed system that resolves version and scope through explicit rules before generation. The governed system scored 97.7 overall, while the hosted service scored 88.1, a gap of 9.6 points computed from unrounded means. The question set, the answer text evaluated for both systems, the scores, and the scripts used to reproduce the reported benchmark statistics are public. The governed configuration has operated as a commercial product since January 2026 and serves 1,126 registered users; named customer organizations include Zhipu AI and Lecheng Health. By mid-April 2026, it had reached roughly 100,000 calls per workday.
- Abstract(参考訳): ノルマティブ文書に根拠のある質問に正しく答えるには、検索された文書が現在有効であるかどうか、管轄権、主題(機関や出願人など)、問題のある日付、それぞれのノルマティブクレームが支援元文書に遡ることができるかどうかなど、単一のパス以外の情報に依存することが多い。
ホストされた検索サービスは、このようなコーパス上に初期システムを構築するためのエンジニアリングコストを大幅に削減し、"ドキュメントをアップロードして要求"を共通のデフォルトにする。
運用デプロイメントに提供される約73,000の候補規範ドキュメントに対して、このデフォルトを評価します。
評価では,得られたベンチマークから得られた200の質問の階層化サンプルを使用し,すべての質問に対してゴールドソースの資料を出力する。
ホストされたサービスと、生成前の明示的なルールによってバージョンとスコープを解決した管理システムを比較します。
支配されたシステムは総合で97.7点、ホストされたサービスは88.1点、未処理の手段で計算された9.6点の差であった。
質問セット、両方のシステムで評価された回答テキスト、スコア、レポートされたベンチマーク統計を再現するのに使用されるスクリプトは公開されています。
管理された構成は2026年1月から商用製品として運用されており、登録ユーザーは1,126人である。
2026年4月中旬までに1日あたり約10万件の電話がかかっていた。
関連論文リスト
- AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents [21.842813905857863]
AtomCiteは、回答をクレームに解析し、引用されたページのイメージに対して各クレームをチェックし、決定論的修復ポリシーを適用します。
インジェクションされたベンチマークでは、約93%のバイナリ検証精度に達し、OCRのみの条件ではかなり上回っている。
その修理方針は、正しいクレームの90%以上を保持しながら、34%から87-90%までの混合液の引用精度を引き上げている。
論文 参考訳(メタデータ) (2026-09-05T01:31:50Z) - HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries [1.5965246343492343]
HIRAは、トレーニング不要でオンプレミスの検索拡張された、規制されたデプロイメントにおけるドキュメント分類のためのカスケードである。
信頼された文書は、検索によって直接分類され、不確実または視覚的に不確実な文書は、ローカルにホストされた検証者に渡される。
プライベートな80クラスのトレーディングファイナンスコーパスでは、HIRAが30,233のドキュメント生成ストリームを処理し、わずか1,945のドキュメントに対して人間の修正を要求する。
論文 参考訳(メタデータ) (2026-08-22T06:19:19Z) - XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding [66.6175918865927]
XL-DocBenchは、超長期文書理解のための完全に人間検証されたベンチマークである。
1,519人は6つの専門ドメインと2,303ページまでのコンテキストからの質問を保持した。
各質問には、12の推論ラベル、専門家による注釈付きエビデンスページ、型付き検証ルール、回答フォーマットの1つがある。
論文 参考訳(メタデータ) (2026-07-21T09:38:24Z) - RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense [0.0]
企業文書の大量生成には、財務紛争の物語、コンプライアンス通知、監査要約が含まれる。
統一されたガードレール層の前に、プロダクションシステムはしばしば別々のPIIリアクション、コンテンツモデレーション、フォーマット検証ステップを縫い合わせていた。
本稿では,テキストと画像入力のためのガードレールオーケストレーションレイヤを提案する。
論文 参考訳(メタデータ) (2026-06-01T00:24:30Z) - Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt Engineering Quality Assurance [0.0]
AEGISに適用されたエージェント駆動型監査の単一システム事例研究を報告する。
本報告では, 明示的な符号規則, 非単調な収束, 監査スコープの拡がりを含む7カテゴリーの欠陥分類を報告する。
論文 参考訳(メタデータ) (2026-05-12T15:39:04Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents [77.22389710754452]
マルチターンマルチデイタスクを中心に構築された同僚エージェントのベンチマークであるベンチを紹介する。
現在のリリースには、13のプロのシナリオにわたる100のタスクが含まれており、5つのステートフルなサンドボックスサービスに対して実行される。
最強のモデルは75.8の重み付きスコアに達するが、最も厳格なタスク成功率は20.0%に過ぎず、部分的な進歩が一般的であることを示している。
論文 参考訳(メタデータ) (2026-04-26T16:05:02Z) - Document Layout Annotation: Database and Benchmark in the Domain of
Public Affairs [62.38140271294419]
レイアウトラベルの異なるデジタル文書を半自動アノテートする手法を提案する。
スペイン政府から24データソースの集合を用いて,行政領域におけるDLAの新しいデータベースを収集する。
実験の結果,提案したテキストラベリング手順を99%の精度で検証した。
論文 参考訳(メタデータ) (2023-06-12T08:21:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。