論文の概要: DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
- arxiv url: http://arxiv.org/abs/2607.19865v1
- Date: Wed, 22 Jul 2026 07:52:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:38.020468
- Title: DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
- Title(参考訳): DocOps: 複雑なドキュメント操作における自律エージェントの検証可能なベンチマーク
- Abstract要約: 本稿では,階層的な分類を基盤とした決定論的に検証可能な評価フレームワークであるDocOpsを紹介する。
DocOpsに基づいて,各種エージェントハーネスのクローズドおよびオープンソースモデルを体系的に評価する。
我々の研究は、グローバルな文書整合性を維持するためのエージェントの能力境界を明らかにし、堅牢で非破壊的なエージェントの将来の設計に光を当てている。
- 参考スコア(独自算出の注目度): 106.74348504930124
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As autonomous agents rapidly evolve, their ability to reliably manipulate ubiquitous digital documents has become critical for enabling general-purpose AI assistants and automating complex workspace workflows. In this paper, we introduce DocOps, a deterministically verifiable evaluation framework underpinned by a hierarchical taxonomy that deconstructs document operations inspired by real-world practices into atomic dimensions and escalating workflow complexities. Based on DocOps, we systematically evaluate representative closed- and open-source models across various agentic harnesses, revealing that even the most advanced frontier configurations still exhibit profound limitations when handling highly coupled, long-range tasks. Furthermore, a fine-grained analysis of existing agents' manipulation behaviors uncovers 3 key failure modes: long-term state tracking collapse, shallow semantic verification, and destructive editing of structural metadata. Ultimately, our work exposes the capability boundaries of agents in maintaining global document consistency, shedding light on the future design of robust, non-destructive agents for complex digital ecosystems.
- Abstract(参考訳): 自律エージェントが急速に進化するにつれて、ユビキタスなデジタルドキュメントを確実に操作する能力は、汎用AIアシスタントの実現と複雑なワークスペースワークフローの自動化に欠かせないものになっている。
本稿では,実世界のプラクティスにインスパイアされた文書操作を原子次元に分解し,ワークフローの複雑さをエスカレートする階層的分類によって決定的に検証可能な評価フレームワークDocOpsを紹介する。
DocOpsをベースとして,さまざまなエージェントハーネスにまたがるクローズドおよびオープンソースモデルを体系的に評価し,高度に結合された長距離タスクを扱う場合,最も高度なフロンティア構成でさえも重大な制限を課していることを明らかにした。
さらに、既存のエージェントの操作動作のきめ細かい分析により、長期状態追跡の崩壊、浅いセマンティック検証、構造メタデータの破壊的な編集という、3つの重要な障害モードが明らかになった。
最終的に、我々の研究は、グローバルなドキュメント一貫性を維持するためのエージェントの能力の境界を明らかにし、複雑なデジタルエコシステムのための堅牢で非破壊的なエージェントの将来の設計に光を当てています。
関連論文リスト
- DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows [69.12339622053588]
我々はDuMateBenchを紹介した。DuMateBenchは匿名化およびプライバシスクリーニングによるユーザセッションから再構築されたリアルセッションベンチマークである。
結果として得られたベンチマークは、8つの広いシナリオにまたがる200のタスクと、17のきめ細かい機能カテゴリで構成されている。
これらのタスクは、Isufficient、Unstable、Noisyの3種類の環境複雑性を注入した、分離されたDockerコンテナで実行します。
論文 参考訳(メタデータ) (2026-08-27T02:36:23Z) - ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - DocOS: Towards Proactive Document-Guided Actions in GUI Agents [54.27655693145045]
textbfDocOSは、完全にインタラクティブな環境で文書誘導問題解決を評価するために設計されたベンチマークである。
実験の結果、エージェントはプロアクティブ検索中に関連情報を確実に見つけるのに苦労し、検索した指示を忠実に正確な行動に移すのに失敗することが判明した。
論文 参考訳(メタデータ) (2026-05-18T08:36:04Z) - Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers [27.817039954088315]
ツールレベルの専門知識を学習するための自己進化型マルチエージェントシステムである textbfGeoEvolver を紹介する。
GeoEvolverはエンドツーエンドのタスクの成功を継続的に改善し、複数のバックボーンで平均12%向上することを示す。
論文 参考訳(メタデータ) (2026-01-30T15:11:07Z) - Yunque DeepResearch Technical Report [12.184074646161223]
Yunque DeepResearchは階層的でモジュール的で堅牢なディープリサーチフレームワークである。
さまざまなエージェントによるディープリサーチベンチマークで最先端のパフォーマンスを実現している。
私たちは、コミュニティに力を与えるためのフレームワーク、再現可能な実装、そしてアプリケーションケースをオープンソースにしています。
論文 参考訳(メタデータ) (2026-01-27T13:10:00Z) - DeepSynth-Eval: Objectively Evaluating Information Consolidation in Deep Survey Writing [53.85037373860246]
本稿では,情報統合能力を客観的に評価するためのベンチマークであるDeep Synth-Evalを紹介する。
一般チェックリスト(実例)と制約チェックリスト(構造体)を用いたきめ細かい評価プロトコルを提案する。
その結果,エージェント型プラン・アンド・ライトは単ターン生成よりも大幅に優れていた。
論文 参考訳(メタデータ) (2026-01-07T03:07:52Z) - Synthesizing Procedural Memory: Challenges and Architectures in Automated Workflow Generation [0.5599792629509229]
本稿では、受動的ツールユーザからアクティブなワークフローアーキテクトへの移行を運用する。
エージェントは仮説、調査、コードの科学的方法論を強制することによって、堅牢で生産レベルのコードスキルを自律的に書けることを実証する。
論文 参考訳(メタデータ) (2025-12-23T11:33:32Z) - Designing Domain-Specific Agents via Hierarchical Task Abstraction Mechanism [61.01709143437043]
階層型タスク抽象化機構(HTAM)を中心とした新しいエージェント設計フレームワークを提案する。
具体的には、HTAMは、社会的役割のエミュレーションを超えて、代わりに、複数のエージェントシステムを、あるドメインの固有のタスク依存グラフを反映する論理階層に構造化する。
我々は、複雑な地理空間解析に適したマルチエージェントシステムであるEarthAgentとして、このフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2025-11-21T12:25:47Z) - Build Your Personalized Research Group: A Multiagent Framework for Continual and Interactive Science Automation [41.659285482346235]
我々は,リアルタイムエージェント推論によって動的に決定されるテキストを特徴とするオープンソースのマルチエージェントフレームワークであるtexttfreephdlaborを提案する。
このフレームワークは、テキスト自動コンテキストのコンパクト化、情報劣化を防ぐためのテキストワークスペースベースのコミュニケーション、セッション間のテキストメモリ持続性、およびテキストノンブロッキング人間の介入メカニズムを含む包括的なインフラを提供する。
論文 参考訳(メタデータ) (2025-10-17T13:13:32Z) - Deep Research Agents: A Systematic Examination And Roadmap [109.53237992384872]
Deep Research (DR) エージェントは複雑な多ターン情報研究タスクに取り組むように設計されている。
本稿では,DRエージェントを構成する基礎技術とアーキテクチャコンポーネントの詳細な分析を行う。
論文 参考訳(メタデータ) (2025-06-22T16:52:48Z) - DocAgent: A Multi-Agent System for Automated Code Documentation Generation [7.653779364214401]
本稿では、トポロジ的コード処理によるインクリメンタルコンテキスト構築のための新しいマルチエージェント協調システムDocAgentを紹介する。
特殊なエージェント(Reader、Searcher、Writer、Verifier、Orchestrator)が共同でドキュメントを生成する。
また, 完全性, ヘルプ性, 真実性を評価する多面的評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-04-11T17:50:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。