論文の概要: Evaluating Open-Weight LLMs for Turkish Domain Documents Under Retrieval and Hardware Constraints
- arxiv url: http://arxiv.org/abs/2609.28007v1
- Date: Wed, 23 Sep 2026 12:33:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.018096
- Title: Evaluating Open-Weight LLMs for Turkish Domain Documents Under Retrieval and Hardware Constraints
- Title(参考訳): 検索・ハードウェア制約下におけるトルコ語ドメイン文書のオープンウェイトLCMの評価
- Abstract要約: ほとんどのトルコ語対応の大規模言語モデル (LLM) は汎用ベンチマークを用いて評価される。
本稿では,資源制約のあるローカルデプロイメント環境下で,トルコ語文書質問応答のためのオープンウェイト7B-8Bモデルを5つ評価する。
- 参考スコア(独自算出の注目度): 8.353600616465796
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Most Turkish-capable large language models (LLMs) are evaluated using general-purpose benchmarks rather than long, structurally complex domain documents. This paper evaluates five open-weight 7B-8B models for Turkish document question answering under a resource-constrained local deployment setting. The primary benchmark contains 100 systematically validated questions derived from a 109-page industrial R&D report, and the evaluation protocol is replicated using a second 112-page public-sector report and an independently constructed 100-question set. All models are evaluated locally on an NVIDIA RTX 3050 laptop GPU with 6 GB VRAM using controlled prompting, decoding, and 4-bit quantisation. The principal methodological contribution is an evidence-annotated evaluation protocol that separates retrieval failure from downstream model reasoning failure without requiring additional model calls. On the primary benchmark, end-to-end accuracy ranges from 49% to 75%. Seven lexical, dense, and hybrid retrieval configurations are additionally compared using 95% Wilson intervals and exact paired McNemar tests; none significantly outperforms the character TF-IDF baseline on either document. Evidence recall saturates differently across the two reports, showing that retrieval and effective context capacity can be binding constraints for some documents but not others. These results demonstrate that model selection, retrieval behaviour, and hardware limits must be evaluated separately when deploying open-weight LLMs for Turkish domain documents.
- Abstract(参考訳): ほとんどのトルコ語対応の大規模言語モデル(LLM)は、長い、構造的に複雑なドメイン文書ではなく、汎用ベンチマークを用いて評価される。
本稿では,資源制約のあるローカルデプロイメント環境下で,トルコ語文書質問応答のためのオープンウェイト7B-8Bモデルを5つ評価する。
第1のベンチマークは、109ページの産業R&Dレポートから得られた体系的に検証された100の質問を含み、評価プロトコルは第2の112ページの公共セクタレポートと独立に構築された100の質問セットを用いて複製される。
すべてのモデルは、制御プロンプト、デコード、および4ビット量子化を使用して、6GBのVRAMを持つNVIDIA RTX 3050ラップトップGPU上でローカルに評価される。
主要な方法論的貢献は、追加のモデル呼び出しを必要とせずに、検索失敗を下流モデル推論失敗から分離するエビデンスアノテーション付き評価プロトコルである。
主要なベンチマークでは、エンドツーエンドの精度は49%から75%である。
7つの語彙、密度、およびハイブリッドな検索構成を、95%のウィルソン間隔と正確なペアのマクネマール試験を用いて比較する。
エビデンス・リコールは2つのレポートで異なる飽和度を示し、検索と効果的なコンテキストキャパシティがいくつかの文書の制約に結びつく可能性があるが、他の文書ではないことを示す。
これらの結果は、トルコのドメイン文書にオープンウェイト LLM をデプロイする際には、モデル選択、検索動作、ハードウェア制限を別々に評価する必要があることを示している。
関連論文リスト
- Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents [7.397429318828859]
大規模言語モデル(LLM)は、複雑なプロフェッショナルタスクをますますサポートしているが、ルール集約型文書レビューにおけるそれらの能力は、十分に評価されていない。
既存のベンチマークはドメイン知識と質問応答に重点を置いており、プロのドキュメントの品質レビューをほとんど見落としている。
GB/T-Benchは,全国標準文書の構造化レビューのための最初のベンチマークである。
論文 参考訳(メタデータ) (2026-08-06T17:27:23Z) - RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents [0.9003228139607131]
文書解析システムは、住宅ローンの引受、財務報告、サプライチェーンのロジスティクス、臨床記録などの規制された領域にますます多く展開されている。
ほとんどの公開ベンチマークは、学術的なレイアウトや合成散文のアダプタを評価し、単一のOCRまたはマークダウンレベルの類似度スコアを報告している。
実際に規制された文書から構築された2トラックのベンチマークであるRealDocBenchを紹介する。
論文 参考訳(メタデータ) (2026-06-05T15:41:34Z) - A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection [0.42970700836450487]
本稿では,風力タービン羽根試験用分離・エッジ展開可能なパイプラインについて述べる。
The EyesはY26-x-obb指向のバウンディングボックスで、データセットネイティブの解像度で欠陥をローカライズする。
ブリッジは決定論的でパラメータフリーな符号化モジュールであり、検出された各バウンディングボックスをグリッド参照トークンにマップする。
論文 参考訳(メタデータ) (2026-05-26T04:27:38Z) - Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System [0.0]
本研究では、Qwen 3.5 27Bモデルに基づいて構築されたセキュリティ文書分類のためのオープンソースのローカルシステムであるTorchSightについて述べる。
このモデルは、13の許可を受けたソースから78,358のサンプルと、7つのセキュリティカテゴリと51のサブカテゴリをカバーするGPT-4合成データに基づいて訓練された。
その結果、微調整されたローカルモデルでは、文書処理をローカル制御下に保ちながら、正確なセキュリティ文書分類が可能であることがわかった。
論文 参考訳(メタデータ) (2026-05-19T18:18:19Z) - CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence [35.06938031991452]
CiteVQAは要素レベルのバウンディングボックスの引用を各回答と一緒に返さなければならないベンチマークである。
CiteVQAは7つのドメインと2つの言語にまたがる711のPDFに1,897の質問があり、1ドキュメントあたり平均40.6ページである。
Strict Attributed Accuracy (SAA) は、回答と引用された領域の両方が正しい場合にのみ、予測を信用する。
論文 参考訳(メタデータ) (2026-05-13T01:54:42Z) - vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models [58.633451339058986]
VLAモデルは一般的に、各モデルリポジトリによって独立して維持されるベンチマークスクリプト毎に評価される。
本稿では、ベンチマーク実行からモデル推論を分離するオープンソースの評価ハーネスであるvla evalを紹介する。
完全な評価では、vla eval serveとvla eval runの2つのコマンドしか必要としない。
論文 参考訳(メタデータ) (2026-03-14T14:38:53Z) - MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents [57.32877731797049]
MultiHaystackは、大規模なクロスモーダル条件下での検索と推論の両方を評価するために設計された最初のベンチマークである。
モデルが対応するエビデンスを付与した場合,その性能は,全コーパスからそのエビデンスを取得するために必要な場合,急激に低下することがわかった。
論文 参考訳(メタデータ) (2026-03-05T21:43:02Z) - Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning [50.27838512822097]
我々は,グローバルRAG機能を評価するために設計された最初のベンチマークであるGlobalQAを紹介する。
我々は,チャンクレベルの検索によって構造的コヒーレンスを保存するマルチツール協調フレームワークであるGlobalRAGを提案する。
Qwen2.5-14Bモデルでは、GlobalRAGは最強のベースラインである1.51 F1と比較して6.63 F1を達成した。
論文 参考訳(メタデータ) (2025-10-30T07:29:14Z) - UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG [82.84014669683863]
マルチモーダル検索拡張生成(MM-RAG)は,大規模言語モデルを現実世界の知識ベースに適用するための重要なアプローチである。
UniDoc-Benchは、70万の現実世界のPDFページから構築されたMM-RAGのための最初の大規模で現実的なベンチマークである。
実験により,マルチモーダルテキスト画像融合RAGシステムは,非モーダルおよび共同マルチモーダル埋め込みに基づく検索において一貫して優れていた。
論文 参考訳(メタデータ) (2025-10-04T04:30:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。