論文の概要: Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows
- arxiv url: http://arxiv.org/abs/2607.27648v1
- Date: Thu, 30 Jul 2026 03:59:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.390193
- Title: Not as Sweet by Another Name: An Empirical Study of Format Robustness in LLM Document Workflows
- Title(参考訳): LLM文書ワークフローにおける形式的ロバスト性に関する実証的研究
- Authors: Xiaoyu Zhang, Xianyun Cheng, Tianlin Li, Yuwei Zheng, Yue Yang, Yang Liu,
- Abstract要約: 本研究では,4つの代表的なタスク,4つの実世界のタスク,4つの文書形式にまたがる大規模な実証的研究を行う。
以上の結果から,フォーマットの変動は体系的かつ深刻な脅威となることが明らかとなった。
本研究は,文書形式が中性ラッパーではなく,LCMシステムの信頼性に影響を与える重要な要因であることを示す。
- 参考スコア(独自算出の注目度): 19.259315558139573
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-driven software systems are rapidly evolving from plain-text conversations to document-centric end-to-end workflows, where the same semantic content can be delivered in diverse document formats (e.g., CSV) through file upload interfaces. Yet existing testing work focuses on the robustness and reliability of models and systems whose input is a single prompt string, leaving a critical question unanswered: Can these document workflows maintain robust behaviors when the same content arrives in a different document format? To fill the gap, in this paper, we propose a format-aware metamorphic testing framework with three metamorphic relations to comprehensively evaluate the format robustness of end-to-end LLM document workflows. Based on this framework, we conduct a large-scale empirical study spanning four representative LLM workflows, four real-world tasks, and four document formats, comprising a total of 48,000 workflow executions. Our findings reveal that format variation poses a systematic and serious threat. Merely switching formats can cause accuracy to drop by up to 53.63% and trigger decision drifts in over 41% of instances. We further design lightweight mitigation strategies from the users' perspective that recover up to 44.21% of format-induced decision drift without model retraining. Our study demonstrates that document format is not a neutral wrapper but a critical factor affecting the reliability of LLM software systems, calling for corresponding testing and safeguards in the deployment in real-world high-stakes scenarios.
- Abstract(参考訳): LLM駆動のソフトウェアシステムは、プレーンテキストの会話からドキュメント中心のエンドツーエンドワークフローへと急速に進化し、ファイルアップロードインターフェースを通じて、同じセマンティックコンテンツをさまざまなドキュメントフォーマット(例:CSV)で配信することができる。
しかし、既存のテスト作業では、入力が単一のプロンプト文字列であるモデルやシステムの堅牢性と信頼性に重点を置いており、重要な疑問は解決されていない。
このギャップを埋めるために,本論文では3つのメタモルフィック関係を持つ書式対応メタモルフィックテストフレームワークを提案し,エンドツーエンドのLCM文書ワークフローの書式ロバスト性を包括的に評価する。
この枠組みに基づいて,4つのLLMワークフロー,4つの実世界のタスク,4つのドキュメントフォーマットからなる大規模実証的研究を行い,合計48,000のワークフロー実行を実現した。
以上の結果から,フォーマットの変動は体系的かつ深刻な脅威となることが明らかとなった。
単にフォーマットを切り替えるだけで、53.63%の精度が低下し、決定のドリフトを41%以上のインスタンスで引き起こすことがある。
さらに、モデル再トレーニングなしに、フォーマットによる決定のドリフトの44.21%を回復する、ユーザの視点から軽量な緩和戦略を設計する。
本研究は,文書フォーマットが中立的なラッパーではなく,LLMソフトウェアシステムの信頼性に影響を与える重要な要因であることを示す。
関連論文リスト
- What to Format and How: A Benchmark and Workflow Approach for Document Formatting [25.500100602233076]
現実世界のフォーマットは、しばしば文書の内容に基づいてターゲットを特定する必要がある。
DocFormBenchは、Text-to-Formatの評価をさまざまなフォーマットに拡張するベンチマークです。
そこで我々は,修正の実行からフォーマットや方法まで,対象のローカライゼーションを分離するDocFormFlowを提案する。
論文 参考訳(メタデータ) (2026-06-01T09:02:33Z) - Hybrid OCR-LLM Framework for Enterprise-Scale Document Information Extraction Under Copy-heavy Task [11.672798725644121]
この作業は、OCRエンジンとLLM(Large Language Models)を戦略的に組み合わせて、反復的な文書抽出タスクに固有の正確性と効率のトレードオフを最適化する。
3つの抽出パラダイム(ダイレクト、リプレース、テーブルベース)にまたがる25のコンフィギュレーションを、4つのフォーマットにまたがるIDドキュメント上で実装し、評価する。
論文 参考訳(メタデータ) (2025-10-11T09:40:34Z) - On-Premise AI for the Newsroom: Evaluating Small Language Models for Investigative Document Search [2.853035319109148]
検索拡張生成(RAG)機能を備えた大規模言語モデル(LLM)は、文書発見のプロセスの高速化を約束する。
我々は5段階のパイプラインを通して透明性と編集制御を優先するジャーナリスト中心の検索手法を提案する。
我々は2つのコーパス上で3つの量子化モデル(Gemma 3 12B, Qwen 3 14B, GPT-OSS 20B)を評価し,信頼性のかなりの変動を見出した。
論文 参考訳(メタデータ) (2025-09-29T20:50:40Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - On the Comprehensibility of Multi-structured Financial Documents using LLMs and Pre-processing Tools [41.122196205034165]
本稿では,大規模言語モデル (LLMs) とマルチモーダル大規模言語モデル (MLLMs) の機能について考察する。
MLLM である GPT-4o は, 直接文書を送受信した場合, 複数構造化文書に対して 56% の精度が得られた。
論文 参考訳(メタデータ) (2025-06-05T15:52:44Z) - WildDoc: How Far Are We from Achieving Comprehensive and Robust Document Understanding in the Wild? [64.62909376834601]
本稿では,自然環境における文書理解の評価に特化して設計されたWildDocについて紹介する。
WildDoc上での最先端MLLMの評価は、従来のベンチマークと比べて性能が大幅に低下し、モデルの頑健さが不十分であることを示す。
論文 参考訳(メタデータ) (2025-05-16T09:09:46Z) - LLMs Are Biased Towards Output Formats! Systematically Evaluating and Mitigating Output Format Bias of LLMs [69.40865293066885]
本稿では,大規模言語モデル(LLM)の性能評価において,形式バイアスを考慮した最初の体系的評価を提案する。
本稿では,複数の質問回答,ラッピング,リスト,マッピングの4つのカテゴリにまたがる経験的形式バイアス評価について述べる。
論文 参考訳(メタデータ) (2024-08-16T10:45:45Z) - DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems [99.17123445211115]
本稿では,大規模言語モデル(LLM)に基づく文書読解システムを評価するベンチマークであるDocBenchを紹介する。
我々のベンチマークには、人間のアノテーションの募集と、合成質問の生成が含まれる。
実際の文書は229件、質問は1,102件で、5つのドメインにまたがって4種類の質問がある。
論文 参考訳(メタデータ) (2024-07-15T13:17:42Z) - Robustness of Structured Data Extraction from In-plane Rotated Documents using Multi-Modal Large Language Models (LLM) [0.0]
本研究では,文書スキューが3つの最先端マルチモーダルモデルのデータの抽出精度に与える影響について検討した。
モデル毎に安全な面内回転角(SIPRA)を同定し,スキューがモデル幻覚に及ぼす影響について検討する。
論文 参考訳(メタデータ) (2024-06-13T08:55:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。