論文の概要: MADP: A Multi-Agent Pipeline for Sustainable Document Processing with Human-in-the-Loop
- arxiv url: http://arxiv.org/abs/2605.17159v1
- Date: Sat, 16 May 2026 21:18:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.713898
- Title: MADP: A Multi-Agent Pipeline for Sustainable Document Processing with Human-in-the-Loop
- Title(参考訳): MADP:Human-in-the-Loopによる持続可能なドキュメント処理のためのマルチエージェントパイプライン
- Authors: Diego Gosmar, Giovanni Zenezini,
- Abstract要約: MADPは、ディープラーニングに基づく分類と解析と大規模言語モデル抽出を組み合わせたマルチエージェントアーキテクチャである。
2026年1月までに処理された実世界の955の文書のプロダクション展開は97.0%の完全自動化率を達成した。
我々のハイブリッドAI+HITLアプローチは、従来の手作業よりもCO2排出量を69%削減し、エネルギー消費量を69%削減し、水の使用量を63%削減します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Document processing automation remains a critical challenge in enterprise environments, where traditional manual approaches are labor-intensive and error-prone. We present MADP, a multi-agent architecture that addresses the challenge of automating document processing in enterprise settings by combining deep learning-based classification and parsing with large language model extraction, while maintaining accuracy through selective human validation. Our system integrates five specialized agents--Classificator, Splitter, Parser, Extraction, and Validator--with a Human-in-the-Loop (HITL) mechanism and a novel Prompt Fine Tuning with Feedback Inheritance (PFTFI) approach. The operational analysis on a production use-case scenario of 100,000 invoices per year indicates a potential reduction of Full-Time Equivalent (FTE) requirements by approximately 70%. Production deployment on 955 real-world documents processed through January 2026 achieves a 97.0% full-pipeline automation rate, with only 3% requiring non-AI fallback. Ablation evaluation on a stratified 100-document subset (5 documents per each of 20 supplier/document-type categories) demonstrates that the full MADP configuration with Human-in-the-Loop supervision attains 98.5% document-level accuracy. Additionally, we present a comprehensive sustainability analysis showing that our hybrid AI+HITL approach reduces CO2 emissions by 69%, energy consumption by 69%, and water usage by 63% compared to traditional manual processing. Benchmark comparisons of multiple LLM backends (Granite-Docling, Mistral-Small, DeepSeek-OCR) provide practical insights for deployment in production environments.
- Abstract(参考訳): ドキュメント処理の自動化は、従来の手作業によるアプローチが労働集約的かつエラーを起こしやすい企業環境において、依然として重要な課題である。
深層学習に基づく分類と解析を大規模言語モデル抽出と組み合わせることで,企業環境における文書処理の自動化という課題に対処するマルチエージェントアーキテクチャであるMADPを提案する。
本システムでは,PFTFI(Prompt Fine Tuning with Feedback Inheritance)アプローチ,HITL(Human-in-the-Loop)機構,PFTFI(Prompt Fine Tuning with Feedback Inheritance)アプローチの5つの特殊エージェントを統合した。
年間10万件の請求書の運用シナリオに関する運用分析は、フルタイム等価(FTE)要件を約70%削減する可能性を示唆している。
2026年1月までに処理された実世界の955の文書のプロダクション展開は97.0%の完全自動化率に達し、非AIのフォールバックはわずか3%である。
階層化された100文書サブセット(20のサプライヤ/ドキュメントタイプカテゴリ毎の5文書)のアブレーション評価は、Human-in-the-Loopによる完全なMADP構成が98.5%の文書レベルの精度を実現することを示す。
さらに,我々のハイブリッドAI+HITLアプローチがCO2排出量を69%削減し,エネルギー消費量を69%削減し,水使用量を従来の手作業よりも63%削減することを示す総合的サステナビリティ分析を行った。
複数のLLMバックエンド(Granite-Docling、Mistral-Small、DeepSeek-OCR)のベンチマーク比較は、運用環境へのデプロイに実用的な洞察を提供する。
関連論文リスト
- OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - An Industrial-Scale Retrieval-Augmented Generation Framework for Requirements Engineering: Empirical Evaluation with Automotive Manufacturing Data [0.5156484100374058]
Retrieval-augmented Generation (RAG) は知識集約的なタスクを約束するが、産業用REのRAGを評価する以前の研究は行われていない。
本稿では,産業要求自動化のためのRAGの総合的実証評価について,自動車製造文書を用いた総合評価を行った。
RAGは、完全なトレーサビリティを持つ98.2%の抽出精度を達成し、それぞれ24.4%、19.6%のベースラインを上回っている。
論文 参考訳(メタデータ) (2026-03-20T22:05:08Z) - Dynamic Template Selection for Output Token Generation Optimization: MLP-Based and Transformer Approaches [0.0]
動的テンプレート選択は応答品質を損なうことなく大幅なコスト削減を実現する。
この研究は、機械学習の理論的基礎を持つ形式的問題定式化、それに対応する複雑性解析を伴う4つのアルゴリズム、生産システム全体にわたる広範な実証検証など、いくつかの重要な要素に貢献している。
論文 参考訳(メタデータ) (2025-11-17T21:00:22Z) - Agentic AI Sustainability Assessment for Supply Chain Document Insights [0.0]
本稿では,エージェント人工知能(AI)を中心としたサプライチェーン運用におけるドキュメントインテリジェンスのための総合的持続可能性評価フレームワークを提案する。
文書集約紙抽出において, 評価可能な環境性能を提供しながら, 自動化効率を向上させるという2つの目的に対処する。
我々は,AI支援型HITLとエージェントAIのシナリオにより,エネルギー消費の最大7倍,二酸化炭素排出量の90-97%,水利用の89-98%を手作業で行うことができることを示した。
論文 参考訳(メタデータ) (2025-11-10T13:38:08Z) - Intelligent Reservoir Decision Support: An Integrated Framework Combining Large Language Models, Advanced Prompt Engineering, and Multimodal Data Fusion for Real-Time Petroleum Operations [0.0]
本研究では,最新の大規模言語モデルと先進的な技術と総合的な貯水池解析のためのマルチモーダルデータ融合を組み合わせた新しい統合フレームワークを提案する。
このフレームワークは、5万以上の石油工学文書、チェーン・オブ・ソート推論、および高速場適応のための数ショット学習を備えたドメイン固有検索強化世代(RAG)を実装している。
このシステムは、評価中のリスクの高いインシデントを伴わず、96.2%の安全性を確保しながら、秒以下の応答時間を達成する。
論文 参考訳(メタデータ) (2025-09-14T18:13:27Z) - OmniEAR: Benchmarking Agent Reasoning in Embodied Tasks [52.87238755666243]
OmniEARは,言語モデルが身体的相互作用やツールの使用,マルチエージェントの協調にどう影響するかを評価するためのフレームワークである。
我々は、家庭と工業領域にまたがる1500のシナリオにおける連続的な物理的特性と複雑な空間的関係をモデル化する。
我々の体系的な評価は、モデルが制約から推論しなければならない場合、厳しい性能劣化を示す。
論文 参考訳(メタデータ) (2025-08-07T17:54:15Z) - A Large-Scale Study of Relevance Assessments with Large Language Models: An Initial Look [52.114284476700874]
本稿では,4つの異なる関連性評価手法が展開された大規模評価(TREC 2024 RAG Track)の結果について報告する。
自動生成UMBRELA判定は、完全に手動による判断を置き換えて、実行レベルの有効性を正確に捉えることができる。
意外なことに、LLMアシストは完全な手作業による評価と相関を増さないようで、人間のループプロセスに関連するコストは明らかな有意義な利益をもたらすものではないことを示唆している。
論文 参考訳(メタデータ) (2024-11-13T01:12:35Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z) - Exposing Limitations of Language Model Agents in Sequential-Task Compositions on the Web [69.6913064185993]
言語モデルエージェント(LMA)は、ミューティステップ決定タスクにおける有望なパラダイムとして登場した。
約束にもかかわらず、現実世界のアプリケーションでの彼らのパフォーマンスはまだ過小評価されている。
既存のLMAはベースタスクで平均94.0%の成功率を達成したが、その性能は構成タスクで平均24.9%に低下した。
論文 参考訳(メタデータ) (2023-11-30T17:50:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。