論文の概要: IDP AutoOpt: Agent-Driven Optimization of Document Processing Pipeline Configurations
- arxiv url: http://arxiv.org/abs/2607.26075v1
- Date: Mon, 13 Jul 2026 20:14:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.098938
- Title: IDP AutoOpt: Agent-Driven Optimization of Document Processing Pipeline Configurations
- Title(参考訳): IDP AutoOpt: 文書処理パイプライン構成のエージェント駆動最適化
- Abstract要約: IDP AutoOptは、インテリジェントなドキュメント処理パイプラインのための高性能な構成を発見する自動LLMエージェントである。
小さなラベル付きセットで設定をスコアし、フィールドレベルのエラーを診断し、ターゲットとする編集を生成し、人間が認可したドメインスキルによってガイドされる再評価を行う。
- 参考スコア(独自算出の注目度): 4.639043440418973
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present IDP AutoOpt, an autonomous LLM agent that discovers high-performing configurations for intelligent document processing (IDP) pipelines. Tuning IDP prompts, models, OCR settings, and schemas jointly currently costs domain specialists 20 to 80+ person-hours per document type and does not scale as enterprises add document classes. IDP AutoOpt runs a closed loop: it scores a configuration on a small labeled set, diagnoses field-level errors, generates targeted edits, and re-evaluates, guided by human-authored domain skills that encode production expertise. Across extraction, classification, and packet-splitting tasks deployed in healthcare, marketing-intelligence, and financial-services settings, IDP AutoOpt matches or exceeds human-expert accuracy at equal or lower cost (on an extraction benchmark, 90.2% vs 81.6% at 4.6 x lower per-page cost), cutting configuration time from weeks to under two hours. We further show that agent LLM capability has a hard threshold below which optimization fails, and that curated domain skills outperform raw source-code access, which can degrade performance when provided without structure. We also share practical lessons on context management and variance mitigation. Requiring only a configurable pipeline, a scoring function, and a small labeled set, the approach extends beyond IDP to other enterprise AI systems, such as RAG and multi-agent workflows, where configuration bottlenecks deployment.
- Abstract(参考訳): IDP AutoOptは、インテリジェント文書処理(IDP)パイプラインのための高性能な構成を発見する自律LLMエージェントである。
IDPプロンプト、モデル、OCR設定、スキーマの調整は現在、ドキュメントタイプごとに20~80時間以上かかり、企業がドキュメントクラスを追加するためスケールしない。
IDP AutoOptは、小さなラベル付きセットで設定をスコアし、フィールドレベルのエラーを診断し、ターゲットとする編集を生成し、プロダクションの専門知識を符号化する人間公認のドメインスキルによってガイドされる再評価を行う。
医療、マーケティング・インテリジェンス、金融サービスに配備されたパケット分割タスクの全体にわたって、IDP AutoOptは、同等または低いコストで人間の専門的正確性(抽出ベンチマークでは、90.2%対81.6%対ページ毎のコスト4.6倍)と一致し、構成時間を数週間から2時間未満に短縮する。
さらに、エージェントLLMの能力は、最適化が失敗するハードしきい値を持ち、処理済みのドメインスキルが生のソースコードアクセスより優れており、構造がなくても性能を劣化させることができることを示す。
また、コンテキスト管理と分散緩和に関する実践的な教訓を共有します。
構成可能なパイプライン、スコアリング機能、小さなラベル付きセットのみを必要とするこのアプローチは、IDPを越えてRAGやマルチエージェントワークフローなど、他のエンタープライズAIシステムにも拡張され、構成のボトルネックが展開される。
関連論文リスト
- A Formal Hierarchical Architecture for Agentic Orchestration with Stack-Based Execution and Lazy Discovery [5.106901034158075]
本稿では,エージェントオーケストレーションのための階層的,スキルベースのアーキテクチャを提案する。
機能はルートツリーとして構成され、内部ノードがルーティング決定を行い、リーフノードが決定論的タスクを実行する。
グローバルメモリをローカライズされたスタックフレームに置き換えることで、ある実行ブランチからの出力が別の実行ブランチにリークすることを防ぐ。
論文 参考訳(メタデータ) (2026-07-13T06:15:51Z) - Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization [0.0]
本稿では,LLM-orchestrated multi-agentコラボレーションに基づく,信頼性の高い自己コンパイル可能なBDフレームワークを提案する。
提案したアーキテクチャは、BDライフサイクルを、データ取り込み、データクリーニング、機能エンジニアリング、AutoMLトレーニング、モデル評価、MLOpsのデプロイ、監視、ドリフト検出のための特別なエージェントに分解する。
フレームワークには、共有アーティファクトガバナンス、サポート、Human-in-the-loopチェックポイント、ドリフト対応フィードバックループも含まれている。
論文 参考訳(メタデータ) (2026-06-16T13:34:27Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - AVDA: Autonomous Vibe Detection Authoring for Cybersecurity [0.1633272850273525]
AVDAは、モデルコンテキストプロトコル(MCP)を活用して、組織コンテキストをAI支援コード生成に統合することで検出を自動化するフレームワークである。
我々は,多種多様な生産検出コーパスと最先端LCMの3つのオーサリング戦略 – Baseline, Sequential, Agentic – を評価した。
その結果,エージェント品質の87%をトークンコストの40倍以下で達成できた。
論文 参考訳(メタデータ) (2026-03-26T21:52:33Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem [90.17610617854247]
本稿では,エージェントモデルの生産パイプラインを最適化する基盤インフラであるエージェント学習エコシステム(ALE)を紹介する。
ALEは、重量最適化のためのトレーニング後のフレームワークであるROLL、軌道生成のためのサンドボックス環境マネージャであるROCK、効率的なコンテキストエンジニアリングのためのエージェントフレームワークであるiFlow CLIの3つのコンポーネントで構成されている。
ROMEはALEが基盤として100万件以上のトラジェクトリをトレーニングしたオープンソースエージェントです。
論文 参考訳(メタデータ) (2025-12-31T14:03:39Z) - Agent WARPP: Workflow Adherence via Runtime Parallel Personalization [0.0]
大規模言語モデル(LLM)はタスク指向対話(TOD)システムにますます適用されてきている。
並列パーソナライゼーション(WARPP)は、マルチエージェントランタイムとオーケストレーションを組み合わせた、トレーニング不要でモジュール化されたフレームワークである。
ユーザ属性に基づいて条件分岐を動的にプルーニングすることで、このフレームワークは推論のオーバーヘッドを減らし、実行時のツール選択を狭める。
論文 参考訳(メタデータ) (2025-07-23T23:27:49Z) - Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning [68.00304954972232]
コントローラ、例えば視覚言語モデルと外部ツールを統合するマルチモーダルエージェントは、複雑なマルチモーダルタスクに対処する際、顕著な能力を示した。
これらのエージェントを訓練するための既存のアプローチは、広範囲なヒューマン・アノテートされたタスク・アンサー・ペアとツール・トラジェクトリに依存している。
本研究では,事前に収集したデータのないマルチモーダルエージェント,すなわち SPORT の反復ツール利用探索手法を提案する。
Sportには、タスク合成、ステップサンプリング、ステップ検証、優先度調整の4つの反復的なコンポーネントがある。
論文 参考訳(メタデータ) (2025-04-30T12:01:27Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - DocETL: Agentic Query Rewriting and Evaluation for Complex Document Processing [10.712756715779822]
大規模言語モデル(LLM)は、データ処理において有望であることを示している。
これらのフレームワークは、ユーザが指定した操作を実行する際のコスト削減に重点を置いている。
これは複雑なタスクやデータに問題があります。
本稿では,複雑な文書処理パイプラインを最適化するDocETLを提案する。
論文 参考訳(メタデータ) (2024-10-16T03:22:35Z) - Benchmarking Agentic Workflow Generation [80.74757493266057]
複数面シナリオと複雑なグラフワークフロー構造を備えた統合ワークフロー生成ベンチマークであるWorfBenchを紹介する。
また,サブシーケンスとサブグラフマッチングアルゴリズムを利用したシステム評価プロトコルWorfEvalを提案する。
我々は、生成されたタスクが下流のタスクを強化し、推論中により少ない時間で優れたパフォーマンスを達成することを観察する。
論文 参考訳(メタデータ) (2024-10-10T12:41:19Z) - AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoML [56.565200973244146]
自動機械学習(Automated Machine Learning, ML)は、開発パイプライン内のタスクを自動化することによって、AI開発を加速する。
近年の作業では,そのような負担を軽減するために,大規模言語モデル(LLM)の利用が始まっている。
本稿では,フルパイプのAutoMLに適した新しいマルチエージェントフレームワークであるAutoML-Agentを提案する。
論文 参考訳(メタデータ) (2024-10-03T20:01:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。