論文の概要: HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries
- arxiv url: http://arxiv.org/abs/2608.21792v1
- Date: Sat, 22 Aug 2026 06:19:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.470732
- Title: HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries
- Title(参考訳): HIRA: 規制産業における文書分類のための人身検索型カスケード
- Abstract要約: HIRAは、トレーニング不要でオンプレミスの検索拡張された、規制されたデプロイメントにおけるドキュメント分類のためのカスケードである。
信頼された文書は、検索によって直接分類され、不確実または視覚的に不確実な文書は、ローカルにホストされた検証者に渡される。
プライベートな80クラスのトレーディングファイナンスコーパスでは、HIRAが30,233のドキュメント生成ストリームを処理し、わずか1,945のドキュメントに対して人間の修正を要求する。
- 参考スコア(独自算出の注目度): 1.5965246343492343
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Document classification in regulated industries is constrained by data residency, limited cold-start labels, scarce review capacity, and costly model-governance procedures. We present HIRA, a training-free, on-premises retrieval-augmented cascade for document classification in regulated deployments that combines BM25 over OCR text, dense text embeddings, and image-level representations through validation-calibrated weighted reciprocal-rank fusion. Confident documents are classified directly by retrieval; uncertain or visually confusable documents are passed to a locally hosted LLM verifier, which receives the OCR text, retrieved exemplars, label descriptions, and confusion-specific terms. When the verifier remains uncertain, the document is sent to human review. Each correction is stored as a margin-weighted retrieval exemplar and updates a Dirichlet-smoothed confusion graph, letting the system improve without updating model weights. On a private 80-class trade-finance corpus, HIRA processes the full 30,233-document production stream while requesting human correction for only 1,945 documents (6.4%), improving Macro-F1 from 0.6218 to 0.8548. On the corrected Tobacco-3482 benchmark, HIRA reaches 0.9423 Macro-F1 with a locally hosted DeepSeek-R1-Distill-Qwen-32B verifier, 17.4 percentage points above the zero-shot LLM baseline, while invoking the verifier for only about 40% of documents and reducing LLM calls by approximately 60%. With 518 human corrections (24.8% of the pool), HIRA matches the fully labelled pool oracle, in which all 2,086 pool documents are indexed with their ground-truth labels. These results show that selective human feedback and retrieval-memory adaptation can be a practical alternative to repeated model retraining for long-tail document classification in regulated deployments.
- Abstract(参考訳): 規制産業における文書分類は、データ常駐、限定的なコールドスタートラベル、レビュー能力の不足、コストのかかるモデルガバナンス手順によって制限されている。
我々は,OCRテキスト上のBM25,高密度テキスト埋め込み,および画像レベルの表現を検証校正された重み付き逆ランク融合によって組み合わせた,文書分類のための,トレーニング不要でオンプレミス検索拡張カスケードであるHIRAを提案する。
信頼された文書は、直接検索によって分類され、不確実または視覚的に不確実な文書は、ローカルにホストされたLCM検証器に渡され、OCRテキスト、検索された例、ラベル記述、混乱固有の用語が受信される。
検証者が不確実なままである場合、その文書は人間のレビューに送られる。
各補正はマージン重み付き検索例として格納され、ディリクレスムーズな混乱グラフを更新する。
民間の80クラスの取引ファイナンスコーパスでは、HIRAが30,233ドキュメントの生産ストリームを処理し、わずか1,945文書(6.4%)の修正を要求し、マクロF1を0.6218から0.8548に改善した。
修正されたTobacco-3482ベンチマークでは、HIRAは、ローカルにホストされたDeepSeek-R1-Distill-Qwen-32B検証器で0ショットLLMベースラインよりも17.4ポイント高い0.9423 Macro-F1に達した。
518人の修正(24.8%のプール)により、HIRAは2,086件のプール文書の全てに基調ラベルが付けられている完全にラベル付けされたプールオラクルと一致する。
これらの結果から,選択的フィードバックと検索メモリ適応は,規制展開における長期文書分類のための反復的モデル再訓練の代替となる可能性が示唆された。
関連論文リスト
- Approval Integrity and Recovery in LLM Answer Publication [0.2864713389096699]
LLMシステムでは、承認されたコンテンツを現在の承認コンテキストにバインドする必要がある。
本研究は,Lightcapの公開実施機構において,正確なコンテンツバインディング,承認更新性,チェックポイントリカバリについて検討する。
論文 参考訳(メタデータ) (2026-09-14T13:48:48Z) - IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications [52.570108663867046]
研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
論文 参考訳(メタデータ) (2026-09-09T17:59:04Z) - AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents [21.842813905857863]
AtomCiteは、回答をクレームに解析し、引用されたページのイメージに対して各クレームをチェックし、決定論的修復ポリシーを適用します。
インジェクションされたベンチマークでは、約93%のバイナリ検証精度に達し、OCRのみの条件ではかなり上回っている。
その修理方針は、正しいクレームの90%以上を保持しながら、34%から87-90%までの混合液の引用精度を引き上げている。
論文 参考訳(メタデータ) (2026-09-05T01:31:50Z) - Pair-Level Essay-Scale Republication and Reuse from Fragmented Historical Text Reuse: A Workflow Study on Eighteenth-Century Books and Newspapers [0.40873486380569585]
この研究は、18世紀のスコットランドの哲学者デイヴィッド・ヒュームのエッセイに焦点をあてた。
我々は、このタスクをペアレベルのエビデンスとして定式化し、可算的な伝達関係に集約する。
完全なECCO-ECCO候補宇宙では、最終ワークフローの771に比べて14,886対のリプリントとして直接LLMベースラインがフラグ付けされる。
論文 参考訳(メタデータ) (2026-08-27T16:43:27Z) - Novelty-Aware Agentic Retrieval: Comparing Research Contributions Through Structured Multi-Step Reasoning [0.0]
ノベルティ・アウェア・リサーチ・エージェント(英: Novelty-Aware Research Agent)は、エージェント検索システムのプロトタイプである。
RAGパイプライン上の多段階推論を6つのタイプドコントラクトコンポーネントを通じて階層化する。
論文毎のコントリビューション記録、紙レベルのオーバーラップ、問題xメソッドギャップマトリックスなど、構造化された比較アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-06-20T17:04:02Z) - RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - Resolving the Robustness-Precision Trade-off in Financial RAG through Hybrid Document-Routed Retrieval [7.563079821809866]
Hybrid Document-Routed Retrieval (HDRR)は、SFRを文書フィルタとして使用する2段階アーキテクチャである。
実験の結果,HDRRは各測定値において最高の性能を示した。
論文 参考訳(メタデータ) (2026-03-26T18:05:38Z) - DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis [6.329569532501952]
文書偽造検出のための最初の統一ゼロショットベンチマークであるDOCFORGE-BENCHを提案する。
テキスト改ざん、レシート偽造、ID文書操作にまたがる8つのデータセットにまたがる14の手法を評価する。
私たちの中心的な発見は、シングルスレッドプロトコルでは見えない、広範囲にわたるキャリブレーション障害です。
論文 参考訳(メタデータ) (2026-03-02T04:26:57Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique [36.96848724920411]
我々は、見えないUnicode文字を文書に埋め込むテキスト保存型透かしフレームワークを導入する。
我々は50の文書を微調整した後の応答を検出する際に0.1%未満の失敗率を実験的に観察した。
100%TPR@0% FPRに対応する18,000以上の課題において、突発的な回答は得られなかった。
論文 参考訳(メタデータ) (2025-10-07T08:34:08Z) - LLMs Can Patch Up Missing Relevance Judgments in Evaluation [56.51461892988846]
我々は、大きな言語モデル(LLM)を使って、不確定な文書を自動的にラベル付けします。
TREC DLトラックの関連性判定から関連文書をランダムにドロップすることで,穴の度合いの異なるシナリオをシミュレートする。
Vicuna-7B と GPT-3.5 Turbo の平均値に対して,Kendall tau の0.87 と 0.92 の相関式が得られた。
論文 参考訳(メタデータ) (2024-05-08T00:32:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。