論文の概要: Can Scene Text Recognition Read Rare Compositions?
- arxiv url: http://arxiv.org/abs/2609.00816v1
- Date: Tue, 01 Sep 2026 07:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.42888
- Title: Can Scene Text Recognition Read Rare Compositions?
- Title(参考訳): テキスト認識はレアコンポジションを読み取ることができるか?
- Authors: Genpei Zhang,
- Abstract要約: 6つの標準ベンチマークにおいて、シーンテキスト認識は89-97%正確であると報告され、その問題が飽和として広く扱われている。
私たちは代替の読書を提示する。
同じテスト画像が、基準コーパスに対して、接地的単語の規則性と文字n-gramの新規性によって共同で成層されると、結果の5x5グリッドのレアワードxレアトリグラムコーナーでの精度は、q3/q3センタより10〜18pt下方に低下する。
- 参考スコア(独自算出の注目度): 1.7844382164707184
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scene text recognition is reported as 89--97% accurate on the six standard benchmarks, and the problem is widely treated as saturated. We present an alternative reading. When the same test images are stratified jointly by ground-truth word rarity and character n-gram novelty against a reference corpus, accuracy at the rare-word x rare-trigram corner of the resulting 5x5 grid drops 10--18 pt below the q3/q3 centre across nine English specialised recognisers, and the same direction (corner below centre) holds on all 13 of 13 (language, model) pairs we test across four writing systems (Latin, Han, Han+kana, Arabic). The drop is not a capacity bottleneck. A 6x vision-backbone scale-up (CLIP4STR-Base 158M -> CLIP4STR-Huge 1.0B, OpenCLIP ViT-H/14 LAION-2B) leads every benchmark in aggregate accuracy yet leaves the stress corner unchanged (86.9 -> 86.5, within paired-bootstrap noise). Four converging probes--layer-wise probing, confidence-when-wrong, attention re-balancing, and a cross-script commit-vs-abstain error split--localise the failure to the autoregressive decoder's lexical prior. We then ask how much of the gap existing techniques recover. Of 16 non-architectural mitigations, the largest mean q5/q5 gain is +1.3 pt and none clears the paired-bootstrap noise floor; the only intervention that does is the architectural shift from autoregressive to CTC decoding (SVTRv2, +2.5 pt, p=0.02, n=474). A confidence-routed AR-CTC ensemble adds a directionally consistent +0.6 pt that stays within noise, and its dominant learned coefficient is each model's own minimum-softmax confidence--independently echoing the mechanism above. No configuration we test improves both the compositional corner and aggregate accuracy. The rare-input long tail thus points to architectural change rather than added capacity.
- Abstract(参考訳): 6つの標準ベンチマークにおいて、シーンテキスト認識は89-97%正確であると報告され、その問題が飽和として広く扱われている。
私たちは代替の読書を提示する。
基準コーパスに対して、同じテスト画像が基調的な単語の希薄さと文字n-gramの新規さによって共同で成層化されると、結果の5x5グリッドのレアワードxレアトリグラムコーナーの精度は、q3/q3センターより10-18 pt下、9つの英特化認識器にまたがって、同じ方向(中央のコーン)が、13のペア(言語、モデル)のうち13のすべて(ラテン語、漢語、漢語、アラビア語)でテストする(ラテン語、漢語、漢語、漢語、アラビア語)。
減少はキャパシティボトルネックではありません。
6倍の視覚バックボーンスケールアップ(CLIP4STR-Base 158M -> CLIP4STR-Huge 1.0B, OpenCLIP ViT-H/14 LAION-2B)は、全てのベンチマークを集計精度でリードするが、応力角は変化しない (86.9 -> 86.5, in paired-bootstrap noise)。
4つの収束プローブ、レイヤワイズプローブ、信頼-ホワイトロング、アテンション再バランス、クロススクリプトコミット-vs-abstainエラースプリット — は、自動回帰デコーダの語彙前の障害をローカライズする。
その後、既存のテクニックのギャップがどの程度回復するかを尋ねます。
16の非構造的緩和のうち、最大の平均q5/q5ゲインは+1.3 ptであり、ペアリングされたブートストラップノイズフロアをクリアすることはなく、唯一の介入は自己回帰からCTCデコードへのアーキテクチャシフトである(SVTRv2, +2.5 pt, p=0.02, n=474)。
信頼を損なうAR-CTCアンサンブルは、方向整合 +0.6 pt を追加し、ノイズ内に留まる。
テストした構成は、構成角と集約精度の両方を改善しません。
したがって、レアインプットのロングテールは、容量を増やすのではなく、アーキテクチャの変更を示している。
関連論文リスト
- On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Compress and Forget: bitsandbytes Quantization Amplifies Proactive Interference in LLMs [0.23438564092609357]
プロアクティブ干渉(英: Proactive interference, PI)は、大規模言語モデルにおける文書化された障害モードであり、繰り返し上書きされた値の検索は、事前上書きが蓄積されるにつれて劣化する。
PTQは現在、オープンウェイトモデルのデフォルトのデプロイメントパスとなっているが、この障害モードへの影響はテストされていない。
アーキテクチャ的に異なる3つの命令調整モデルの3つの精度レベル(FP16, INT8, INT4/NF4, ビット/バイト)を評価する。
論文 参考訳(メタデータ) (2026-08-19T06:17:13Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG [45.88028371034407]
マルチモーダル検索拡張生成(RAG)はクリーンなエビデンスで評価されることが多いが、真の検索は、トポロジー的に関係があるが信頼できないコンテンツを返すことができる。
本稿では,多文事実QAにおけるマルチモーダル検索汚染のベンチマークであるQIMG-7を紹介する。
そこで本研究では,Parametric, Text-only, Full-MM の候補解と比較した学習自由な手法として,SATRを提案する。
論文 参考訳(メタデータ) (2026-07-12T15:13:09Z) - Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts [0.0]
学習後の量子化は,タスク精度が保存されている場合でも,大きな言語モデルがどのように推論するかを静かに変更できることを示す。
3つの量子化精度で5つの命令調整LDMから3万のチェーン・オブ・シント出力を分類する。
精度は精度で高いが,Hollow Convergence は NF4 で大きく依存的な変化を示す。
論文 参考訳(メタデータ) (2026-07-10T21:55:05Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks [0.0]
MathCheckのパラフレーズ品質検査では, 19群で4つの意味的不正確なパラフレーズが検出された。
GPT-4oは2位から4位へと降格し、クロード・ハイクとディープ・シークV3が上昇する。
論文 参考訳(メタデータ) (2026-05-27T18:59:18Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - The frame-level leakage trap: rethinking evaluation protocols for intrinsic image decomposition, with source-separable uncertainty as a case study [0.0]
3つのアーキテクチャで、初めてリーク効果を定量化します。
フレームレベルスプリットは、シーンレベルスプリットに対してR_PSNRを1.6〜2.0dB膨張させる。
我々は、S + N で構成された物理インフォームド分解 I = R を、ソース分離可能な三方向不確実性ヘッドで表現する。
論文 参考訳(メタデータ) (2026-05-07T14:37:16Z) - The Digital Afterlife of Empires: Four Language Models Converge on the Same Imperial Cartography of Writing [0.0]
大規模な言語モデルは、過激な不平等を伴う世界の書記システムを処理する。
29のスクリプト(9.7%)は現代のデジタルインフラで完全にサポートされており、158のリビングスクリプトのうち60(38.0%)は完全なサポートを欠いている。
tokenizer の効率は、パラレルテキストで測定された45のスクリプトに対して 31.7 の係数で変化する。
論文 参考訳(メタデータ) (2026-04-30T07:02:45Z) - Span Pointer Networks for Non-Autoregressive Task-Oriented Semantic
Parsing [55.97957664897004]
seq2seq、非自動回帰的、タスク指向を構築するための効果的なレシピは、3つのステップで発話とセマンティックフレームをマッピングする。
これらのモデルは通常、長さ予測によってボトルネックとなる。
本研究では,デコードタスクをテキスト生成からスパン予測へシフトさせる非自己回帰手法を提案する。
論文 参考訳(メタデータ) (2021-04-15T07:02:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。