論文の概要: Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA
- arxiv url: http://arxiv.org/abs/2608.28635v1
- Date: Sat, 08 Aug 2026 15:52:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-06 19:38:41.455812
- Title: Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA
- Title(参考訳): MLLMは低リソースのKhmerドキュメントを本当に理解しているか? KhmerドキュメントVQAのパイロットスタディ
- Authors: Nimol Thuon, Panhapin Theang,
- Abstract要約: 本稿では,Khmer文書画像を用いたオープンMLLMのパイロット診断について述べる。
Khmer-scriptの回答は、英語や数値の分野よりもかなり難しいままである。
- 参考スコア(独自算出の注目度): 0.8594140167290097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent multimodal large language models (MLLMs) have advanced document understanding, visual question answering, and text extraction. However, their reliability in low-resource, non-Latin settings remains uncertain. Khmer form documents present particular challenges because they contain complex script forms, mixed Khmer-English fields, and monetary values in both Cambodian Riel and US Dollars. Available resources for Khmer Document VQA are also limited. This paper presents a pilot diagnostic evaluation of open MLLMs on Khmer document images. We construct an evaluation subset from the previously introduced KH-FUNSD collection, covering invoices, receipts, quotations, and other business forms. The subset includes questions in English and Khmer, with answers retained in their original English, Khmer, mixed-script, or numeric forms. Rather than introducing a full public benchmark, this study examines the capabilities and failure modes of existing models. We evaluate representative open Qwen-VL models using direct image-based prompting and compare parser-assisted and external OCR-assisted configurations with Qwen3-VL-8B. Direct Qwen3-VL-8B outperforms smaller models, achieving 51.9% overall accuracy, although performance remains limited for Khmer-script and mixed-script answers. External OCR produces the strongest results, reaching 61.9% with Tesseract and 61.6% with PaddleOCR. Nevertheless, Khmer-script answers remain substantially more difficult than English and numeric fields. The results indicate that current MLLMs can process visually clear English and structured numeric content, but reliable native Khmer document understanding remains an open challenge.
- Abstract(参考訳): 近年のマルチモーダル大言語モデル(MLLM)は、文書理解、視覚的質問応答、テキスト抽出が進歩している。
しかし、低リソースで非ラテン語設定での信頼性は依然として不確実である。
クメール形式の文書は、複雑なスクリプト形式、クメール・イングリッシュ・フィールドの混合、カンボジアのリエルとアメリカ・ドルの両方の通貨価値を含むため、特定の課題を示す。
Khmer Document VQAの利用可能なリソースも制限されている。
本稿では,Khmer文書画像を用いたオープンMLLMのパイロット診断について述べる。
これまでに導入されたKH-FUNSDコレクションから評価サブセットを構築し,請求書,領収書,引用,その他のビジネスフォームを網羅する。
このサブセットには英語とクメール語の質問が含まれており、その答えは元の英語、クメール語、混合文字、あるいは数値形に残されている。
本研究は、完全な公開ベンチマークを導入するのではなく、既存のモデルの機能と障害モードについて検討する。
我々は,Qwen3-VL-8Bを用いて,直接画像ベースプロンプトを用いたオープンなQwen-VLモデルの評価を行い,パーサ支援と外部OCR支援の構成を比較した。
直接Qwen3-VL-8Bはより小型のモデルで51.9%の精度で性能が向上するが、Khmer-script と Mixed-script では依然として性能は限られている。
外部OCRは61.9%、テッセラクトは61.6%、パドルOCRは61.6%である。
それでも、クメール文字の答えは、英語や数字の分野よりもかなり難しいままである。
その結果、現在のMLLMは、視覚的に明瞭な英語と構造化された数値コンテンツを処理できるが、信頼できるネイティブなKhmer文書理解は依然としてオープンな課題であることがわかった。
関連論文リスト
- BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models [37.78339878369385]
BEAR-Benchは英語とロシア語の自己完結型で複雑なベンチマークで、1000の人間による注釈付き質問を含む。
我々は、BEAR-Bench上でGemini 3.1 ProやQwen3.5-397Bを含む16のプロプライエタリでオープンウェイトなMLLMを評価し、最強のシステムでもクリアなヘッドルームを観察する。
論文 参考訳(メタデータ) (2026-08-18T15:29:09Z) - TongGuOCR: A Layout-Aware and Token-Augmented OCR MLLM for Chinese Historical Documents [50.64307290680222]
TongGuOCRは、中国古文書のOCRのためのレイアウト対応およびトークン拡張型マルチモーダル言語モデル(MLLM)である。
TongGuOCRは93.76 ARを達成し、NEDを10.43から6.15に、RO-EDを7.53から3.49に下げる。
論文 参考訳(メタデータ) (2026-08-08T04:50:00Z) - KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR [0.0]
カザフ語は、アラビア語、キリル文字、ラテン文字を用いており、光学文字認識(OCR)の点でユニークである。
低リソースのKazakhスクリプトのためのOCRの開発は非常に少なく、アラビア語とラテン文字のOCRベンチマークや画像は存在しない。
実OCRタスクを模倣するために,フォント,色,雑音の3つのスクリプトに対して,合成した7,219のOCRデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-17T14:24:49Z) - MosaicDoc: A Large-Scale Bilingual Benchmark for Visually Rich Document Understanding [7.650139800950797]
MosaicDocは、ビジュアルリッチドキュメント理解(VRDU)の境界を押し上げるために設計された、大規模なバイリンガル(中国語と英語)リソースである。
72Kイメージと600KのQAペアを持つMosaicDocは、この分野における決定的なベンチマークとして機能する。
このベンチマークにおける最先端モデルの評価は、実際の文書の複雑さを扱う際の現在の限界を明らかにしている。
論文 参考訳(メタデータ) (2025-11-13T03:34:44Z) - CUS-QA: Local-Knowledge-Oriented Open-Ended Question Answering Dataset [1.4999444543328293]
オープンエンド地域質問応答のベンチマークであるCUS-QAを紹介する。
我々は最先端の大規模言語モデル(LLM)を用いて強力なベースラインを提供する。
我々は,人間の回答の正当性判断を促し,それを補うことによって,最先端のLCMを評価した。
論文 参考訳(メタデータ) (2025-07-30T15:10:55Z) - M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization? [49.53982792497275]
本稿では,LVLM(Large Vision-Language Models)が文書中のインターリーブ画像テキストを真に理解しているかどうかを検討する。
既存の文書理解ベンチマークは、しばしば質問応答形式を用いてLVLMを評価する。
マルチモーダル文書要約ベンチマーク(M-DocSum-Bench)について紹介する。
M-DocSum-Benchは500の高品質なarXiv論文と、人間の好みに合わせたインターリーブされたマルチモーダル要約で構成されている。
論文 参考訳(メタデータ) (2025-03-27T07:28:32Z) - CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy [50.78228433498211]
CC-OCRは、マルチシーンテキスト読取、多言語テキスト読取、文書解析、キー情報抽出の4つのOCR中心のトラックで構成されている。
39のサブセットと7,058のフルアノテートされたイメージが含まれており、そのうち41%が実際のアプリケーションからソースされ、初めてリリースされた。
我々は9つの顕著なLMMを評価し、これらのモデルの長所と短所、特にテキストの接地、多目的化、繰り返しの幻覚について明らかにした。
論文 参考訳(メタデータ) (2024-12-03T07:03:25Z) - INDIC QA BENCHMARK: A Multilingual Benchmark to Evaluate Question Answering capability of LLMs for Indic Languages [25.402797722575805]
インデックスQAベンチマーク(Indic QA Benchmark)は、インドの主要言語11言語を対象にした、文脈に基づく質問応答のためのデータセットである。
評価の結果,学習データに強い英語バイアスがあるため,低資源言語では弱い性能を示した。
また、入力を英語に翻訳して処理し、その結果をソース言語に変換して出力するTranslate Testパラダイムについても検討した。
論文 参考訳(メタデータ) (2024-07-18T13:57:16Z) - CaLMQA: Exploring culturally specific long-form question answering across 23 languages [58.18984409715615]
CaLMQAは、文化的に異なる23言語にわたる51.7Kの質問のデータセットである。
我々は,LLM生成長文回答の事実性,関連性,表面品質を評価する。
論文 参考訳(メタデータ) (2024-06-25T17:45:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。