論文の概要: Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms
- arxiv url: http://arxiv.org/abs/2607.21780v1
- Date: Thu, 23 Jul 2026 19:52:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.991525
- Title: Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms
- Title(参考訳): Khondo: Bangla形式のドキュメントパケット分割のためのマルチモーダルベンチマーク
- Abstract要約: 金堂はバングラデシュ政府形態の文書パケット分割のための最初のベンチマークである。
従来の英語やOCRベースのデータセットとは異なり、Khondoはバイリンガル(バングラ英語)で視覚ネイティブである。
14の行政領域にまたがって、連続から完全なシャッフルまでの5つの統合スキームにまたがる。
- 参考スコア(独自算出の注目度): 13.071620971838316
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Document packets, multiple documents concatenated into a single file, are common in government and administrative workflows, yet splitting them into their constituent documents is difficult, especially for low-resource languages. We introduce Khondo (Bangla for split/segment), the first benchmark for document packet splitting on Bangladeshi government forms. Unlike prior English and OCR-text-based datasets, Khondo is bilingual (Bangla--English) and vision-native; where models operate directly on page images. It spans five concatenation schemes, from sequential to fully shuffled, across 14 administrative domains, with ground-truth boundaries, domain types, and page order. Zero-shot evaluation of MLLMs shows they cluster pages into their source documents fairly well but struggle in restoring the original page order once shuffled. To isolate what drives this difficulty, we run two controlled analyses, varying the prompt instruction and then the packet language. Both primarily affect ordering rather than clustering: (a) explicit page-order instructions are necessary but insufficient, and (b) English packets are ordered more reliably than Bangla, making page arrangement the dominant challenge and language a secondary but consistent factor. Khondo establishes page-order reconstruction as a key open problem in vision-based, low-resource document understanding, and provides a controlled benchmark for measuring progress toward solving it. Our dataset and code is available at https://huggingface.co/datasets/Mausul/khondo
- Abstract(参考訳): 単一のファイルにまとめられた複数のドキュメントである文書パケットは、政府や行政のワークフローでは一般的であるが、特に低リソース言語では、それらを構成文書に分割することは困難である。
バングラデシュ政府形態の文書パケット分割のための最初のベンチマークであるKhondo(Bangla for split/segment)を紹介する。
従来の英語やOCRベースのデータセットとは異なり、Khondoはバイリンガル(バングラ英語)で視覚ネイティブで、モデルがページイメージ上で直接動作する。
シーケンシャルから完全なシャッフルまで、14の行政ドメインにまたがる5つの結合スキームにまたがる。
MLLMのゼロショット評価は、ソースドキュメントにページをかなりうまくクラスタ化しているが、一度シャッフルされた元のページ順序の復元に苦労していることを示している。
この困難を招いたものを分離するために、我々は2つの制御された解析を行い、プロンプト命令とパケット言語を変化させる。
どちらもクラスタリングよりもオーダリングに大きく影響します。
(a)明示的なページ順命令は必要だが不十分であり、
b)英語のパケットはBanglaより確実に順序付けされ、ページの配置が主要な課題となり、言語は二次的だが一貫した要素となる。
Khondoは、視覚ベースの低リソース文書理解において、ページ順再構築が鍵となる問題として確立し、その解決に向けた進捗を測定するための制御されたベンチマークを提供する。
私たちのデータセットとコードはhttps://huggingface.co/datasets/Mausul/khondoで利用可能です。
関連論文リスト
- EMBLEM: Enhancing Multi-script Table Detection through Masking [14.822713626646332]
MANDALA(Multi-script Annotated Documents for Table Detection)は18の言語と15のスクリプトにまたがる2,323のテーブルを含むページのデータセットである。
また、マルチスクリプトテーブル検出(MTD)のためのマスキングに基づくパラダイムであるEMBLEMを提案する。
EMBLEMは、スクリプトやフォント固有の詳細を隠したマスク付き画像を生成し、豊富な英語文書で事前訓練されたモデルがスクリプトに依存しないページレイアウトに集中できるようにする。
論文 参考訳(メタデータ) (2026-09-08T06:57:50Z) - TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension [12.574173764520728]
BaFCoはBanglaフォーム理解のためのベンチマークデータセットである。
BaFCoは200ページの複雑なバングラデシュ政府のフォームをキュレートする。
最新のMLLMをChatGPT, Gemini, Claude, Qwen, Kimiシリーズから評価した。
論文 参考訳(メタデータ) (2026-07-06T20:17:38Z) - MPDocBench-Parse: Benchmarking Practical Multi-page Document Parsing [74.84107522458798]
MPDocBench-Parseは、現実世界のアプリケーションにおけるマルチページ文書解析のためのベンチマークである。
433の注釈付き文書に3,246ページあり、英語と中国語の15種類の文書を網羅しており、レイアウトは様々である。
論文 参考訳(メタデータ) (2026-05-21T07:36:41Z) - MoDora: Tree-Based Semi-Structured Document Analysis System [62.01015188258797]
半構造化文書は、様々な不規則なレイアウトで配置された様々なインターリーブされたデータ要素を統合する。
MoDora は半構造化文書解析のための LLM を利用したシステムである。
実験では、MoDoraは5.97%-61.07%の精度でベースラインを上回っている。
論文 参考訳(メタデータ) (2026-02-26T14:48:49Z) - KH-FUNSD: A Hierarchical and Fine-Grained Layout Analysis Dataset for Low-Resource Khmer Business Document [11.302542266122579]
クメール語はカンボジアで1700万人以上が毎日話す言語である。
専門リソースの欠如は、ビジネスドキュメントにとって特に深刻です。
Khmer形式文書理解のための最初の公開データセットである textbfKH-FUNSD を提示する。
論文 参考訳(メタデータ) (2025-12-04T13:28:44Z) - Contextual Document Embeddings [77.22328616983417]
本稿では,コンテキスト化された文書埋め込みのための2つの補完手法を提案する。
第一に、文書近傍を明示的にバッチ内コンテキスト損失に組み込む別のコントラスト学習目標である。
第二に、隣接する文書情報をエンコードされた表現に明示的にエンコードする新しいコンテキストアーキテクチャ。
論文 参考訳(メタデータ) (2024-10-03T14:33:34Z) - mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding [103.05835688963947]
本稿では,高解像度文書画像を324個のトークンに圧縮する高解像度DocCompressorモジュールを提案する。
DocOwl2は、マルチページ文書理解ベンチマークにまたがる最先端の新たなベンチマークを設定し、最初のトークンレイテンシを50%以上削減する。
同様のデータで訓練されたシングルイメージMLLMと比較して、DocOwl2はビジュアルトークンの20%未満で、同等のシングルページ理解性能を実現しています。
論文 参考訳(メタデータ) (2024-09-05T11:09:00Z) - DAPR: A Benchmark on Document-Aware Passage Retrieval [57.45793782107218]
我々は,このタスクemphDocument-Aware Passage Retrieval (DAPR)を提案する。
State-of-The-Art(SoTA)パスレトリバーのエラーを分析しながら、大きなエラー(53.5%)は文書コンテキストの欠如に起因する。
提案するベンチマークにより,検索システムの開発・比較を今後行うことができる。
論文 参考訳(メタデータ) (2023-05-23T10:39:57Z) - Cross-Modal Entity Matching for Visually Rich Documents [4.8119678510491815]
視覚的にリッチなドキュメントは、視覚的な手がかりを使ってセマンティクスを強化します。
これらのドキュメントの構造化クエリを可能にする既存の作業は、これを考慮に入れない。
この制限に対処するクロスモーダルなエンティティマッチングフレームワークであるJunoを提案する。
論文 参考訳(メタデータ) (2023-03-01T18:26:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。