論文の概要: Engine-Transfer-Bench: An Evidence-Based Benchmark for Document Compilation Engine Selection
- arxiv url: http://arxiv.org/abs/2608.18329v1
- Date: Tue, 18 Aug 2026 21:29:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.210493
- Title: Engine-Transfer-Bench: An Evidence-Based Benchmark for Document Compilation Engine Selection
- Title(参考訳): Engine-Transfer-Bench: ドキュメントコンパイルエンジンの選択のためのエビデンスベースのベンチマーク
- Abstract要約: Engine-Transfer-Bench (ETB): 1,784のオープンドキュメント、信頼性、レイテンシ、テキストの一貫性、障害をカバーした4つのタスクを提示する。
ETB、ETB-Porta、レコメンデータおよびポータビリティゲート、共有インフラストラクチャとしてパブリックなクロスOSハーネスをリリースします。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: There is no shared framework for selecting among document compilation engines (pdfLaTeX, XeLaTeX, LuaLaTeX, Tectonic, Typst, and pandoc PDF backends). We present Engine-Transfer-Bench (ETB): 1,784 open documents, four tasks covering reliability, latency, text consistency, and failures, a pinned harness, and host-tagged multi-OS results. On GitHub Actions (N=4,211 compiles per host across macOS, Ubuntu, and Windows), Tectonic success is stable within 0.9 percentage points (96.3-97.2%), whereas classic TeX Live-style engines vary by 12-20 percentage points according to distribution policy (Ubuntu apt, MiKTeX auto-install, or macOS BasicTeX). On 702 portable LaTeX documents, the tested engines succeed at 100%, making latency the primary selection factor; failures concentrate in 107 engine-specific templates. Within ETB, failures are architectural, involving fonts, layout, and assets, rather than missing packages on a provisioned host. A 50-pair validation of the S_pdf text-consistency metric achieves 94% precision for real content divergence. We release ETB, ETB-Porta, a recommender and portability gate, and a public cross-OS harness as shared infrastructure.
- Abstract(参考訳): ドキュメントコンパイルエンジン (pdfLaTeX, XeLaTeX, LuaLaTeX, Tectonic, Typst, Pandoc PDF バックエンド) を選択するための共有フレームワークはありません。
Engine-Transfer-Bench (ETB): 1,784のオープンドキュメント、信頼性、レイテンシ、テキストの一貫性、障害を含む4つのタスク、ピン付きハーネス、ホストタグ付きマルチOS結果。
GitHub Actions(N=4,211)では、Tectonicの成功率は0.9ポイント(96.3~97.2%)で安定しているが、古典的なTeX Liveスタイルのエンジンはディストリビューションポリシー(Ubuntu apt、MiKTeX Auto-install、macOS BasicTeX)によって12~20ポイント異なる。
702のポータブルなLaTeX文書では、テストエンジンが100%成功し、レイテンシが主要な選択要因となり、障害は107のエンジン固有のテンプレートに集中する。
ETB内の障害は、プロビジョニングされたホストのパッケージを欠くのではなく、フォント、レイアウト、アセットを含むアーキテクチャである。
S_pdfテキスト一貫性メトリックの50対の検証は、実内容のばらつきに対して94%の精度を達成する。
ETB、ETB-Porta、レコメンデータおよびポータビリティゲート、共有インフラストラクチャとしてパブリックなクロスOSハーネスをリリースします。
関連論文リスト
- Code as Representation: A Compilable Parsing Paradigm for Academic Documents [50.40789738182074]
Compilable Academic Document Parsing (CADP)は、コンテキストラプラス実行可能なPythonとして全ページを再構築するパラダイムである。
テキストと複数のSAEタイプを含む全学術ページのエキスパート検証ベンチマークであるCADP-Benchを紹介する。
その結果、フロンティアモデルでさえも、高忠実度で実行可能な再構築を行うのに苦戦していることがわかった。
論文 参考訳(メタデータ) (2026-08-18T09:10:43Z) - TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair [0.0]
既存の文書修復評価は、実証的な欠陥モデルに欠けるアドホックな編集で欠陥を注入する。
We present Fix-Bench, a benchmark for LLM-based full-source document repaired under a mined fault。
3モデルのクロスベンチマークは、DocMutの欠陥は同じ種子のパターンベースの突然変異よりも5.6-9.2 ppの修復が難しいことを示している。
論文 参考訳(メタデータ) (2026-08-07T05:56:35Z) - DocAtlas: Multilingual Document Understanding Across 80+ Languages [58.715440331861295]
本稿では,82言語を対象とした高忠実度OCRデータセットとベンチマークを構築するフレームワークDocAtlasを紹介する。
我々のデュアルパイプライン、ネイティブDOCX文書の微分レンダリング、左右スクリプトの合成ベース生成は正確な構造アノテーションを生成する。
論文 参考訳(メタデータ) (2026-05-12T18:09:38Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - PromptPort: A Reliability Layer for Cross-Model Structured Extraction [0.11280931253550518]
LLMによる構造化抽出は、モデルが理解できないためではなく、出力フォーマットがモデルやプロンプト間で信頼できないため、本番環境では失敗する。
本稿では,決定論的正準化と軽量検証器(DistilBERT)と安全オーバライドポリシを組み合わせた信頼性層であるPromptPortを提案する。
この方法は、保留モデルファミリに一般化し、不確実な場合には明示的な棄権を与え、プロダクションデプロイメントにおける信頼性の高い構造化抽出を可能にする。
論文 参考訳(メタデータ) (2026-01-06T03:54:27Z) - olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models [16.470130668266055]
olmOCRは、PDFをクリーンで線形化された平文に自然な読み順で処理するためのオープンソースのツールキットである。
olmOCRは大規模バッチ処理に最適化されており、異なるハードウェア設定に柔軟にスケールすることができる。
GPT-4o, Gemini Flash 2, Qwen-2.5-VLといったトップビジョン言語モデルでも, olmOCRの方が優れています。
論文 参考訳(メタデータ) (2025-02-25T18:38:38Z) - SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution [56.9361004704428]
大規模言語モデル(LLM)は、様々な複雑なタスクにまたがる顕著な習熟度を示している。
SWE-Fixerは、GitHubの問題を効果的かつ効率的に解決するために設計された、新しいオープンソースフレームワークである。
我々は,SWE-Bench LiteとVerifiedベンチマークに対するアプローチを評価し,オープンソースモデル間の競合性能を実現する。
論文 参考訳(メタデータ) (2025-01-09T07:54:24Z) - Inconsistencies in TeX-Produced Documents [3.3302293148249125]
不整合は多種多様である。
異なるバージョンのエンジンです
流通
この調査とは無関係に修正された2つの新しいバグと5つの既存のバグを特定しました。
論文 参考訳(メタデータ) (2024-07-22T09:52:52Z) - LOCR: Location-Guided Transformer for Optical Character Recognition [55.195165959662795]
自動回帰中にトランスフォーマーアーキテクチャに位置案内を組み込むモデルであるLOCRを提案する。
125Kの学術文書ページから777万以上のテキスト配置ペアからなるデータセット上でモデルをトレーニングする。
これは、編集距離、BLEU、METEOR、F測定によって測定されたarXivから構築されたテストセットの既存のメソッドよりも優れています。
論文 参考訳(メタデータ) (2024-03-04T15:34:12Z) - LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document
Understanding [49.941806975280045]
テキストとレイアウトの事前トレーニングは、視覚的に豊富な文書理解タスクで有効であることが証明されています。
テキスト,レイアウト,イメージをマルチモーダルフレームワークで事前学習することで,テキスト-bfLMv2を提示する。
論文 参考訳(メタデータ) (2020-12-29T13:01:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。