論文の概要: Beyond Recognition: Compact Multi-Domain Arabic Manuscript HTR with Candidate-Selection Analysis and Evidence-Preserving Review
- arxiv url: http://arxiv.org/abs/2608.19385v1
- Date: Wed, 19 Aug 2026 19:04:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.386379
- Title: Beyond Recognition: Compact Multi-Domain Arabic Manuscript HTR with Candidate-Selection Analysis and Evidence-Preserving Review
- Title(参考訳): コンパクト多ドメインアラビア写本HTRの候補選択分析とエビデンス保存
- Abstract要約: 我々は,CNN-BiLSTM-CTC認識器であるPhoenixと,その周辺に構築されたエビデンスを意識したレビューワークフローであるAtharを紹介する。
フェニックスは、考古学、マグレビ、歴史写本の領域に適応している。
Atharはビジュアル読み込みを保存し、バウンダリのある代替情報を公開し、ローカル言語モデルを使用し、ユニークな、曖昧な、あるいは控えめな状態のソースパラレルを検索し、監査可能なTEIとPAGE-XMLレコードをエクスポートする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Historical Arabic manuscript transcription is not only a recognition problem. A usable scholarly system must cope with shifting hands and layouts, preserve uncertain readings, distinguish visual evidence from linguistic plausibility, and record the researcher's final decision. We present Phoenix, a 4.99-million-parameter CNN-BiLSTM-CTC recognizer, and Athar, an evidence-aware review workflow built around it. Phoenix is adapted across archival, Maghrebi, and historical manuscript domains using document-aware replay, an expanded 81-symbol codec, and forgetting guards that reject checkpoints that improve a new domain at unacceptable cost to previous domains. In a pre-specified held-out comparison against the preceding checkpoint, frozen before evaluation and scored with greedy decoding and raw references, Phoenix reduced CER from 22.12% to 17.86% on 10,594 Agapet lines and from 17.72% to 11.84% on 11,684 Omar lines, while regressing from 10.39% to 10.72% on 164 TariMa lines. Across the two large held-out sets, character-weighted CER fell from 19.98% to 14.93%, a 25.3% relative error reduction. A separate same-protocol development diagnostic found the lowest CER for Phoenix on four of four comparable domains (9.59% unweighted macro CER). An N-best diagnostic revealed a 2.15-point oracle gap between beam decoding and Oracle@25, while neural text rerankers, consensus MBR, CTC-posterior quality estimation, and local pre-CTC hidden-state quality estimation recovered less than 4% of this gap. Athar therefore preserves the visual reading, exposes bounded alternatives, uses local language models conservatively, retrieves source parallels with unique, ambiguous, or abstain states, and exports auditable TEI and PAGE-XML records. The results support evaluating manuscript HTR as auditable evidence management rather than silent text replacement.
- Abstract(参考訳): 歴史的アラビア文字の書き起こしは単なる認識の問題ではない。
使用可能な学術システムは、手とレイアウトのシフトに対処し、不確実な読影を保ち、視覚的証拠を言語的妥当性と区別し、研究者の最終決定を記録する必要がある。
我々は、CNN-BiLSTM-CTC認識器であるPhoenixと、その周辺に構築されたエビデンスを意識したレビューワークフローであるAtharを紹介する。
Phoenixは、アーカイブ、Maghrebi、歴史写本ドメインに、文書認識のリプレイ、81記号コーデックの拡張、新しいドメインを改善するためのチェックポイントを以前のドメインに受け入れられないコストで拒否するガードを忘れることによって適応されている。
前回のチェックポイントに対する事前のホールトアウト比較では、評価の前に凍結され、greedyデコードと生の参照で得点され、フェニックスはCERを10,594のアガペットラインで22.12%から17.86%に減らし、11,684のオマールラインで17.72%から11.84%に減らし、164のタリマラインで10.39%から10.72%に減らした。
2つの大きなホールドアウトセットの中で、文字重み付きCERは19.98%から14.93%に低下し、相対誤差は25.3%減少した。
同じプロトコール開発診断では、4つの同等のドメイン(9.59%のマクロCER)のうち、フェニックスで最低のCERが見つかった。
N-bestの診断では、ビームデコーディングとOracle@25の間の2.15ポイントのオラクルギャップが示され、一方、ニューラルテキストリランカー、コンセンサスMBR、CTC後部品質推定、およびローカルCTCによる隠れ状態品質推定は、このギャップの4%以下で回復した。
そのため、Atharは視覚的な読み出しを保存し、境界のある代替品を公開し、ローカル言語モデルを保守的に使用し、ユニークであいまいな状態のソースパラレルを検索し、監査可能なTEIとPAGE-XMLレコードをエクスポートする。
その結果,原稿HTRを無音テキスト置換ではなく,聴覚的エビデンス管理として評価することを支援する。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - Annotated Surrogate Retrieval for Polish Statutory Law [0.0]
本稿では,文書代理法に基づくポーランド法典の検索方法のファミリについて述べる。
ASCRはサロゲートカスケードであり、ASCR-Hはそのカスケードに密度の高いリストを融合させ、DTFは言語モデルの両方のステージを3つの語彙と密度の高いレトリバーで置き換える。
2024年と2025年のポーランドの弁護士試験と法律顧問試験の300問に対して,これら3項目について,語彙,密集度,融解度,融解度と4つの基準値とを比較検討した。
論文 参考訳(メタデータ) (2026-08-31T15:05:00Z) - Evidence-Grounded Constraint Checking in Construction Documents [1.3787753513429983]
抽出された事実を正規化し、4状態ルールを決定的に実行するエビデンス基底パイプラインを提案する。
我々は,29の建設プロジェクトから160の参照ベースタスクに対するPDFエビデンスアロケータの評価を行った。
論文 参考訳(メタデータ) (2026-07-31T06:25:41Z) - Voice Memory for Agentic Speech Recognition [66.69623133635868]
エージェント音声認識のための推論専用スキームであるVoice Memoryを提案する。
同期的に、スコア付き例は、境界編集を通じてそのファイルを更新する。
10のHyPoradiseドメインにオープン修正器、Voice Memory、重み付き単語エラー率8.36%から7.52%の10のドメインがある。
論文 参考訳(メタデータ) (2026-07-29T02:42:56Z) - Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks [0.0]
オープンなPlato/Denarioアーキテクチャの拡張であるPlato-Bioを開発した。
Plato-Bioは明示的なワークフローステートを、プロファイランスレコード、引用チェック、クレーム・ツー・エビデンスリンク、スコープドファイル書き込み、パブリッシュゲートと結合する。
現在のクリーンリビジョンでは、完全なPythonスイートが931パス、6スキップ、エラーやエラーは発生しない。
論文 参考訳(メタデータ) (2026-07-27T03:55:39Z) - From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin [0.0]
本稿では,NVIDIA Nemotron 3.5 ASR Streaming 0.6Bを応用したエンドツーエンドのエンジニアリングスタディを,菊湯,ドリオ,カレンジンに提示する。
この研究は、コーパス監査、Unicode正規化、分割チェック、期間フィルタリング、低レート継続、検証に基づくチェックポイント選択、真のストリーミング評価、アーティファクト保存、孤立したサービスについてカバーしている。
論文 参考訳(メタデータ) (2026-07-21T09:52:57Z) - ITPEval: Benchmarking Formal Translation Across Interactive Theorem Provers [77.95933562142014]
ITPEvalは、4つの主要なIPP間で自動形式証明翻訳を評価するための最初のベンチマークである。
itpevalは、状態が分離されたウォームバックエンドを備えた、統合されたマルチITP認証インフラストラクチャです。
論文 参考訳(メタデータ) (2026-07-07T22:05:55Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Different Strokes for Different Folks: Writer Identification for Historical Arabic Manuscripts [0.5599792629509229]
手書きのアラビア語写本はアラブ世界の知的・文化的遺産を保存している。
歴史的アラビア写本のムハラフデータセットを用いて,個々の線画像から著者の識別を評価する。
著者識別のための注意機構を備えた畳み込みニューラルネットワーク(CNN)モデルを提案する。
論文 参考訳(メタデータ) (2026-04-24T12:55:16Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。