論文の概要: LeakageBench: Document-Level Leakage Risk for Redacting Personally Identifiable Information in Document Images
- arxiv url: http://arxiv.org/abs/2609.02207v1
- Date: Wed, 02 Sep 2026 07:21:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.130241
- Title: LeakageBench: Document-Level Leakage Risk for Redacting Personally Identifiable Information in Document Images
- Title(参考訳): LeakageBench: 個人識別情報の文書化における文書リークリスク
- Authors: Vishnu Prasad Vijaya Kumar, Santhosh Venkatesh, Ivan P. Yamshchikov,
- Abstract要約: LeakageBenchは、直接識別子、リンケージキー、コンテキスト再識別サーフェスにまたがる11,954のPIIアノテーションを備えた500のドキュメントイメージからなるテストセットである。
我々は,汎用型OCRパイプライン,商用およびタスク適応型OCR依存検出器,およびエンティティレベルF1,グループワイドリーク,文書レベルリークメトリクスを用いたOCRフリービジョン言語モデルを評価する。
- 参考スコア(独自算出の注目度): 4.372645928060847
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-world personally identifiable information (PII) redaction often operates on document images---scans, screenshots, and PDF renderings---where OCR errors, layout structure, and visual noise determine whether sensitive information is actually removed. Existing PII benchmarks are mostly text-centric and do not measure document-level redaction risk: a page remains unsafe if even one identifier is missed. We introduce LeakageBench, a challenge set of 500 document images with 11,954 GDPR-aligned PII annotations spanning direct identifiers, linkage keys, and contextual re-identification surfaces. We evaluate generic OCR pipelines, commercial and task-adapted OCR-dependent detectors, and OCR-free vision-language models using entity-level F1, group-wise leakage, and document-level leakage metrics. Code Interpreter raises GPT-5.5 localization F1 from 0.090 to 0.249, but critical page-level leakage remains 0.968. These results show that stronger detection and tool assistance improve localization without making most pages safe for release. LeakageBench provides a diagnostic benchmark for high-recall, spatially grounded PII redaction in document images.
- Abstract(参考訳): 実世界の個人識別可能な情報 (PII) のリアクションは、しばしば文書イメージ(スキャン、スクリーンショット、PDFレンダリング)で動作し、OCRエラー、レイアウト構造、視覚ノイズは、機密情報が実際に削除されているかどうかを判断する。
既存のPIIベンチマークはテキスト中心であり、ドキュメントレベルのリアクションリスクを計測しない。
直接識別子、リンケージキー、コンテキスト再識別サーフェスにまたがる11,954のGDPR対応PIIアノテーションを備えた500のドキュメントイメージからなる課題セットであるLeakageBenchを紹介した。
我々は,汎用型OCRパイプライン,商用およびタスク適応型OCR依存検出器,およびエンティティレベルF1,グループワイドリーク,文書レベルリークメトリクスを用いたOCRフリービジョン言語モデルを評価する。
Code InterpreterはGPT-5.5ローカライゼーションF1を0.090から0.249に引き上げるが、ページレベルの重要なリークは0.968のままである。
これらの結果は、ほとんどのページを安全にリリースすることなく、より強力な検出とツールアシストがローカライズを改善することを示している。
LeakageBenchは、ドキュメントイメージにおける高リコール、空間的グラウンドのPIIリアクションの診断ベンチマークを提供する。
関連論文リスト
- TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection [52.986874008247554]
本稿では,静的アンカーを入力条件付きビジュアルプロトタイプに置き換える言語フリーフレームワークReCAPを提案する。
ReCAPリセンターは、境界ゲート変調により、各画像の正常と異常なプロトタイプを分離した。
3つのセグメンテーションデータセットで最高のゼロショットレベルのAUROCと、24の複数ショット設定のうち23のゼロショットレベルのAUROCを達成する。
論文 参考訳(メタデータ) (2026-08-01T04:46:55Z) - The Character Error Vector: Decomposable errors for page-level OCR evaluation [0.0]
本稿では,OCRのキャラクタ評価器であるキャラクタエラーベクトル(CEV)を紹介する。
CEVはパースとOCRとインタラクションエラーコンポーネントに分解できる。
我々は、他のメトリクスに対してCEVのパフォーマンスを検証する。
論文 参考訳(メタデータ) (2026-04-07T17:56:06Z) - DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis [6.329569532501952]
文書偽造検出のための最初の統一ゼロショットベンチマークであるDOCFORGE-BENCHを提案する。
テキスト改ざん、レシート偽造、ID文書操作にまたがる8つのデータセットにまたがる14の手法を評価する。
私たちの中心的な発見は、シングルスレッドプロトコルでは見えない、広範囲にわたるキャリブレーション障害です。
論文 参考訳(メタデータ) (2026-03-02T04:26:57Z) - MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns [80.05126590825121]
MonkeyOCR v1.5は、レイアウト理解とコンテンツ認識の両方を強化する統合ビジョン言語フレームワークである。
複雑なテーブル構造に対処するために,視覚的整合性に基づく強化学習手法を提案する。
2つの特別なモジュール、Image-Decoupled Table ParsingとType-Guided Table Mergingを導入し、テーブルの信頼性の高いパースを可能にする。
論文 参考訳(メタデータ) (2025-11-13T15:12:17Z) - LOCR: Location-Guided Transformer for Optical Character Recognition [55.195165959662795]
自動回帰中にトランスフォーマーアーキテクチャに位置案内を組み込むモデルであるLOCRを提案する。
125Kの学術文書ページから777万以上のテキスト配置ペアからなるデータセット上でモデルをトレーニングする。
これは、編集距離、BLEU、METEOR、F測定によって測定されたarXivから構築されたテストセットの既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-04T15:34:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。