論文の概要: Semantic Integrity Failures in Document-to-LLM Supply Chains
- arxiv url: http://arxiv.org/abs/2606.15020v1
- Date: Fri, 12 Jun 2026 23:30:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-16 16:21:32.647476
- Title: Semantic Integrity Failures in Document-to-LLM Supply Chains
- Title(参考訳): 文書からLLMへのサプライチェーンにおける意味的整合性障害
- Authors: Side Liu, Jiang Ming,
- Abstract要約: ドキュメントからLLMアプリケーションは通常、アップロードされたPDFを、ユーザーが観察または監査できない隠された抽出層を通じてテキストに翻訳することで読み取る。
1つの文書は、モデル推論の前に2つのセマンティックビューを持つことができる。
抽出器が攻撃者制御または抽出者依存のテキストを返却する25の抽出ギャップ(EG)をインスタンス化し、レンダリングされたページは良性または異なる内容を表示する。
- 参考スコア(独自算出の注目度): 2.7632206861687023
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Document-to-LLM applications typically read uploaded PDFs by first translating them into text through a hidden extraction layer that users cannot observe or audit. We show that this layer enables split-view PDFs: one document can have two semantic views before model reasoning. By mining specification-permitted or implementation-tolerated representation gaps at the PDF render/extract boundary, we instantiate 25 extraction gaps (EG) in which extractors return attacker-controlled or extractor-dependent text while the rendered page shows benign or different content. The gaps form four families: semantic overrides, hidden semantic injection, reading-order splits, and font-decoding splits, and 14 gaps have no exact path/mechanism-level match in prior PDF-to-LLM attacks. We evaluate these gaps on 16 PDF processing stacks and 7 commercial LLM services. Each gap causes render-extract divergence on at least one stack. Under a gap-level exposure criterion, every evaluated service exposes at least one gap, with 12/25 to 21/25 exposed gaps. Exposure is driven mainly by the ingestion stack -- not model identity alone. We further show that tested safety filters cover only selected hidden-text constructions. To support triage, we develop a static screening scanner whose rules trigger on all 25 benchmark gaps, and discuss dual-view consistency as a longer-term defense direction.
- Abstract(参考訳): ドキュメントからLLMアプリケーションは通常、アップロードされたPDFを、ユーザーが観察または監査できない隠された抽出層を通じてテキストに翻訳することで読み取る。
1つの文書は、モデル推論の前に2つのセマンティックビューを持つことができる。
PDFレンダリング/抽出境界における仕様許容あるいは実装許容の表現ギャップをマイニングすることにより、抽出器が攻撃者制御や抽出者依存のテキストを返却する25個の抽出ギャップ(EG)をインスタンス化する。
ギャップは、セマンティックオーバーライド、シーケンシャルインジェクション、読み取り順序分割、フォントデコードスプリットの4つのファミリーで構成され、14のギャップは、以前のPDF-to-LLM攻撃において正確なパス/メカニズムレベルマッチを持たない。
16のPDF処理スタックと7つの商用LCMサービス上でこれらのギャップを評価する。
各ギャップは、少なくとも1つのスタック上でレンダリング-エクストラクションのばらつきを引き起こす。
ギャップレベル露光基準の下では、評価された各サービスは少なくとも1つのギャップを露光し、12/25から21/25露光のギャップを露光する。
露出は主に取り込みスタックによって駆動される -- モデルIDのみではありません。
さらに、テストされた安全フィルタは、選択された隠れテキスト構造のみをカバーすることを示す。
トリアージを支援するために,25のベンチマークギャップすべてにルールをトリガーする静的スクリーニングスキャナを開発し,長期的な防御方向として両視点の整合性について議論する。
関連論文リスト
- MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - Lightweight and Production-Ready PDF Visual Element Parsing [0.0]
既存のPDFは複雑なビジュアルを見逃し、非形式的なアーティファクトを抽出し、断片化された要素を生成し、キャプションと対応する要素を確実に関連付けることができない。
本稿では,視覚的要素を正確に検出し,キャプションを関連付ける軽量かつ生産レベルのPDF解析フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-25T12:40:13Z) - Multi-Vector Index Compression in Any Modality [73.7330345057813]
後期の相互作用は、テキスト、画像、ビジュアルドキュメント、ビデオにおける情報検索の主要なパラダイムとして現れてきた。
インデックス圧縮には,シーケンスリサイズ,メモリトークン,階層プール,新しいアテンション誘導クラスタリング(AGC)の4つのアプローチを導入する。
AGCは、ドキュメントの最もセマンティックな領域をクラスタセントロイドとして識別し、トークンの集合を重み付けするために注意誘導機構を使用する。
論文 参考訳(メタデータ) (2026-02-24T18:57:33Z) - PDFInspect: A Unified Feature Extraction Framework for Malicious Document Detection [0.0]
この研究は、グラフベース、構造化、メタデータ駆動分析を統合し、PDF文書ごとにリッチな特徴表現を生成する統一的なフレームワークを提案する。
提案されたアプローチはスケーラブルで、170で、現実世界のPDF脅威インテリジェンスをサポートするように設計されている。
論文 参考訳(メタデータ) (2026-01-19T09:23:40Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - Decoding Latent Attack Surfaces in LLMs: Prompt Injection via HTML in Web Summarization [1.3537117504260623]
大規模言語モデル(LLM)は、コンテンツ要約のためのWebベースシステムに統合されつつある。
本研究では、Webページの可視コンテンツを変更することなく、非可視的なHTML要素をどのように活用して敵の命令を埋め込むかを検討する。
論文 参考訳(メタデータ) (2025-09-06T21:05:18Z) - Open-Vocabulary Segmentation with Unpaired Mask-Text Supervision [87.15580604023555]
Unpair-Segは、弱制御されたオープン語彙セグメンテーションフレームワークである。
未ペア画像マスクと画像テキストペアから学習し、独立して効率的に収集することができる。
ADE-847とPASCAL Context-459データセットで14.6%と19.5%のmIoUを達成した。
論文 参考訳(メタデータ) (2024-02-14T06:01:44Z) - Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic
Segmentation [59.37587762543934]
本稿では,弱開語彙セマンティックセマンティックセグメンテーション(WOVSS)の問題点について検討する。
既存の方法は、グループトークンの使用に関する粒度の矛盾に悩まされる。
マルチモーダル正規化を組み込んだプロトタイプ誘導ネットワーク(PGSeg)を提案する。
論文 参考訳(メタデータ) (2023-10-29T13:18:00Z) - An Efficient Coarse-to-Fine Facet-Aware Unsupervised Summarization
Framework based on Semantic Blocks [27.895044398724664]
教師なし長文要約のためのC2F-FAR(Coarse-to-Fine Facet-Aware Ranking)フレームワークを提案する。
粗いレベルでは、文書をファセット対応のセマンティックブロックに分割し、無意味なブロックをフィルタリングする新しいセグメントアルゴリズムを提案する。
詳細な段階において,各ブロックで有能な文を選択し,選択した文から最終要約を抽出する。
論文 参考訳(メタデータ) (2022-08-17T12:18:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。