論文の概要: BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension
- arxiv url: http://arxiv.org/abs/2607.05614v1
- Date: Mon, 06 Jul 2026 20:17:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.317468
- Title: BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension
- Title(参考訳): BaFCo: 複雑なBanglaフォームの理解のためのドキュメント理解ベンチマーク
- Abstract要約: BaFCoはBanglaフォーム理解のためのベンチマークデータセットである。
BaFCoは200ページの複雑なバングラデシュ政府のフォームをキュレートする。
最新のMLLMをChatGPT, Gemini, Claude, Qwen, Kimiシリーズから評価した。
- 参考スコア(独自算出の注目度): 12.574173764520728
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Document comprehension is a challenging yet impactful task for Multimodal Large Language Models, especially as these systems see growing adoption in real-world, human-centric applications. However, this adoption is limited for low-resource languages such as Bangla due to the scarcity of high-quality annotated data. To address this gap, we introduce BaFCo, a benchmark dataset for Bangla form comprehension with a focus on Document Layout Analysis (DLA) and Key Information Extraction (KIE). BaFCo curates 200 multi-page complex Bangladeshi government forms, sourced from across diverse sectors including agriculture, education, banking, and land management. To accurately capture the structural and contextual complexity of these forms, we define a fine-grained annotation schema comprising 26 types of form entities, along with a separate coarse form entity set consisting of 5 types. We evaluate the latest MLLMs from the ChatGPT, Gemini, Claude, Qwen, and Kimi series using zero-shot and chain-of-thought prompts under both low and high reasoning setups. Our results reveal limitations in current MLLMs' ability in comprehending Bangla forms, particularly in accurately localizing highly granular form entities. Our dataset and code is available at: https://huggingface.co/datasets/Mausul/bafco
- Abstract(参考訳): 文書理解(Document comprehension)は、マルチモーダルな大規模言語モデルにおいて、現実の人間中心のアプリケーションで採用が増加する中、困難な作業である。
しかし、高品質な注釈付きデータの不足のため、Banglaのような低リソース言語ではこの採用は限られている。
このギャップに対処するため、Banglaフォーム理解のためのベンチマークデータセットであるBaFCoを紹介し、ドキュメントレイアウト分析(DLA)とキー情報抽出(KIE)に焦点を当てた。
BaFCoは、農業、教育、銀行、土地管理など様々な分野から派生した、200ページの複雑なバングラデシュの政府形態をキュレートしている。
これらの形式の構造的・文脈的複雑さを正確に把握するために、26種類の形式エンティティと5つの型からなる別個の粗い形式エンティティセットからなる微粒化アノテーションスキーマを定義する。
本稿では,ChatGPT,Gemini,Claude,Qwen,Kimiシリーズの最新MLLMを,ゼロショットとチェーン・オブ・シークレットのプロンプトを用いて低推論と高推論の両方で評価する。
以上の結果から,バングラフォームの理解における現在のMLLMの能力,特に高度に粒度の細かい実体の正確な局在化における限界が明らかとなった。
私たちのデータセットとコードは、https://huggingface.co/datasets/Mausul/bafcoで利用可能です。
関連論文リスト
- Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms [13.071620971838316]
金堂はバングラデシュ政府形態の文書パケット分割のための最初のベンチマークである。
従来の英語やOCRベースのデータセットとは異なり、Khondoはバイリンガル(バングラ英語)で視覚ネイティブである。
14の行政領域にまたがって、連続から完全なシャッフルまでの5つの統合スキームにまたがる。
論文 参考訳(メタデータ) (2026-07-23T19:52:58Z) - Polite on the Surface, Wrong in Practice: A Curated Dataset for Fixing Honorific Failures in Multilingual Bangla Generation [0.0815557531820863]
我々はtextbfBangLa アプリケーションと DialoguE 生成のための新しい,文化的に整合した命令チューニングデータセットを提案する。
我々はこのリソースを利用して、DeepSeek-8BやLLaMA-3.2-3Bなど、先進的なオープンウェイトアーキテクチャを体系的に微調整し、評価する。
我々の経験的評価は、データセットに微調整されたモデルが、構造的忠実度と名誉的アライメントを大幅に改善することを示している。
論文 参考訳(メタデータ) (2026-05-21T13:43:07Z) - From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding [15.376371030121094]
ReceiptBenchは10万の多様なレシートからなる、大規模で人間による注釈付きベンチマークである。
ReceiptBenchは10万の多様なレシートからなる大規模で人手による注釈付きベンチマークである。
論文 参考訳(メタデータ) (2026-05-21T12:37:03Z) - UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters [55.34921520578968]
視覚言語モデル(VLM)は、テキストと公式の統一的な認識を実現している。
パラメータが0.1Bしか持たない統一認識モデルUniRec-0.1Bを提案する。
文字、単語、行、段落、文書など、複数のレベルでテキストや公式の認識を行うことができる。
論文 参考訳(メタデータ) (2025-12-24T10:35:21Z) - IndicDLP: A Foundational Dataset for Multi-Lingual and Multi-Domain Document Layout Parsing [8.447520506307567]
IndicDLPは、11の代表的なIndic言語と12の共通文書ドメインにまたがる大規模な基礎文書レイアウトデータセットである。
IndicDLPにおける英語モデルの微調整が性能を著しく向上させることを示す。
IndicDLPでトレーニングされたモデルは、Indicレイアウトをはるかに越えて一般化され、ドキュメントのデジタル化に有用なリソースとなっている。
論文 参考訳(メタデータ) (2025-12-23T10:49:37Z) - Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding [61.36285696607487]
文書理解は、財務分析から科学的発見への応用に不可欠である。
現在のアプローチでは、OCRベースのパイプラインがLarge Language Models(LLM)やネイティブのMultimodal LLMs(MLLM)に制限されている。
Retrieval-Augmented Generation (RAG)は、外部データの基底モデルを支援するが、文書のマルチモーダルな性質は、テキスト、テーブル、チャート、レイアウトを組み合わせることで、より高度なパラダイムを必要とする。
論文 参考訳(メタデータ) (2025-10-17T02:33:16Z) - Instruction Tuning on Public Government and Cultural Data for Low-Resource Language: a Case Study in Kazakh [57.002807772016524]
カザフスタンの主要な制度的・文化的知識をカバーする大規模な(10,600サンプル)命令追従データセットを導入,オープンソース化する。
データセット構築のためのオープンウェイトモデルとクローズドウェイトモデルを比較し,GPT-4oをバックボーンとして選択する。
データセット上の微調整Qwen、Falcon、Gemmaは、複数の選択タスクと生成タスクの両方において、一貫したパフォーマンス改善をもたらします。
論文 参考訳(メタデータ) (2025-02-19T11:44:27Z) - BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data [61.936320820180875]
大規模言語モデル(LLM)は、様々な領域でますます重要になっている。
BabelBenchは、コード実行によるマルチモーダルなマルチ構造化データ管理におけるLLMの熟練度を評価する革新的なベンチマークフレームワークである。
BabelBenchの実験結果から,ChatGPT 4のような最先端モデルでさえ,大幅な改善の余地があることが示唆された。
論文 参考訳(メタデータ) (2024-10-01T15:11:24Z) - SRFUND: A Multi-Granularity Hierarchical Structure Reconstruction Benchmark in Form Understanding [55.48936731641802]
階層的に構造化されたマルチタスク形式理解ベンチマークであるSRFUNDを提案する。
SRFUNDはオリジナルのFUNSDとXFUNDデータセットの上に洗練されたアノテーションを提供する。
データセットには、英語、中国語、日本語、ドイツ語、フランス語、スペイン語、イタリア語、ポルトガル語を含む8つの言語が含まれている。
論文 参考訳(メタデータ) (2024-06-13T02:35:55Z) - XFormParser: A Simple and Effective Multimodal Multilingual Semi-structured Form Parser [32.62155069664013]
textbfXForm textbfPARSER(textbfXForm)を導入する。
InDFormSFTも開発しています。InDFormSFTは、さまざまな産業的文脈でフォームのパースニーズに対処するデータセットです。
論文 参考訳(メタデータ) (2024-05-27T16:37:17Z) - Can Large Language Models Understand Real-World Complex Instructions? [54.86632921036983]
大型言語モデル(LLM)は人間の指示を理解することができるが、複雑な命令には耐えられない。
既存のベンチマークでは、LLMが複雑な命令を理解する能力を評価するには不十分である。
複雑な命令を体系的に追従するLSMの能力を評価するためのベンチマークであるCellOを提案する。
論文 参考訳(メタデータ) (2023-09-17T04:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。