論文の概要: Handwritten Text Recognition Lives in the High-Pixel Variance Subspace
- arxiv url: http://arxiv.org/abs/2609.35473v1
- Date: Mon, 28 Sep 2026 15:54:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-02 05:04:50.895488
- Title: Handwritten Text Recognition Lives in the High-Pixel Variance Subspace
- Title(参考訳): 高画素可変部分空間における手書き文字認識
- Abstract要約: 手書き文字認識のための自己教師付き事前学習において、画素再構成法はコントラスト法より優れている。
画素再構成の値は、入力の識別信号がどこにあるかによって異なることを示す。
- 参考スコア(独自算出の注目度): 12.562177455958897
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In self-supervised pretraining for Handwritten Text Recognition (HTR), pixel reconstruction methods outperform contrastive methods, unlike in natural-image classification. We argue that this difference follows from where discriminative signal lies in pixel space: for HTR, it is concentrated in high-variance directions and largely absent from low-variance ones. This predicts that objectives preserving high-variance pixel content will transfer best. We test six SSL methods from three families (pixel-grounded MIM, JEPA, and contrastive) under matched encoder, data, and evaluation protocols on six handwriting benchmarks across five languages. With full labels, pixel-groundrounded SSL achieves the lowest CER on every benchmark and both frozen probes, exposes per-position character information that other families recover only through the readout, and is the only family to benefit from pretraining on real handwriting. Pixel-grounded representations are also more label efficient. Across datasets, encoder alignment with the high-variance pixel subspace predicts CER within every method. With a pretrained LLM decoder, a frozen pixel-grounded encoder is competitive with fully fine-tuned supervised baselines; full fine-tuning achieves the lowest mean CER and ranks first or second on every benchmark. These results show that the value of pixel reconstruction depends on where discriminative signal lies in the input.
- Abstract(参考訳): 手書き文字認識(HTR)のための自己教師付き事前訓練では、自然画像分類とは異なり、画素再構成法はコントラスト法よりも優れていた。
この差は、HTRでは高分散方向に集中しており、主に低分散方向を欠いている。
これは、高分散画素コンテンツを保存する目的が、最も多く転送されることを予測している。
我々は,5言語にまたがる6つの手書きベンチマークにおいて,一致したエンコーダ,データ,評価プロトコルの下で,3つのファミリー(画素接地MIM,JEPA,コントラスト)からSSLメソッドを6つテストした。
フルラベルで、ピクセルを囲むSSLは、すべてのベンチマークと凍結プローブで最低のCERを達成し、他の家族がリードアウトを通じてのみ回復する位置ごとの文字情報を公開し、実際の手書きの事前トレーニングの恩恵を受ける唯一の家族である。
ピクセル基底表現もよりラベル効率がよい。
データセット全体にわたって、高分散ピクセルサブスペースとのエンコーダアライメントは、すべてのメソッド内でCERを予測する。
予め訓練されたLCMデコーダでは、凍結したピクセルグラウンドのエンコーダは、完全に微調整された教師付きベースラインと競合する。
これらの結果から、画素再構成の値は、入力の識別信号がどこにあるかによって異なることがわかった。
関連論文リスト
- Embedding Textual Information in Images Using Quinary Pixel Combinations [0.0]
本稿では,RGB空間に画素インテンシティを連続的に組み合わせた画像にテキストデータを埋め込む手法を提案する。
提案手法は,RGB空間において,R,G,Bの各チャネルにおける5つの異なる画素強度の変動が最大100,20個の異なる画素強度の組み合わせで定式化されるようなクエンタリー画素強度の組み合わせに作用する。
論文 参考訳(メタデータ) (2026-01-07T18:58:00Z) - Image Translation with Kernel Prediction Networks for Semantic Segmentation [32.009158106709805]
Domain Adversarial Kernel Prediction Networkは、合成ラベルと翻訳のセマンティックマッチングを保証する。
DA-KPNは、実画像ラベルへのアクセスが制限されたセマンティックセグメンテーションのためのSyn2realベンチマークにおいて、従来のGANベースの手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-07-11T12:56:22Z) - Semi-supervised Counting via Pixel-by-pixel Density Distribution
Modelling [135.66138766927716]
本稿では,トレーニングデータのごく一部をラベル付けした半教師付き群集カウントに着目した。
我々は1つの決定論的値ではなく、確率分布として回帰するためにピクセル単位の密度値を定式化する。
本手法は,様々なラベル付き比率設定の下で,競争相手よりも明らかに優れる。
論文 参考訳(メタデータ) (2024-02-23T12:48:02Z) - Context Does Matter: End-to-end Panoptic Narrative Grounding with
Deformable Attention Refined Matching Network [25.511804582983977]
パノラマ・ナララティブ・グラウンディング(PNG)は、高密度なナラティブキャプションに基づいて、画像中の視覚オブジェクトを分割することを目的としている。
Deformable Attention Refined Matching Network (DRMN) と呼ばれる新しい学習フレームワークを提案する。
DRMNは、トップ$k$で最も類似したピクセルの特徴表現を更新した後、変形可能なアテンションネットワークで画素を反復的に再エンコードする。
論文 参考訳(メタデータ) (2023-10-25T13:12:39Z) - CoupAlign: Coupling Word-Pixel with Sentence-Mask Alignments for
Referring Image Segmentation [104.5033800500497]
画像セグメント化の参照は、自然言語文で記述された視覚オブジェクトのすべてのピクセルをローカライズすることを目的としている。
以前の作業では、参照オブジェクトをハイライトするために、文章の埋め込みとピクセルレベルの埋め込みを簡単に調整することを学びました。
単純で効果的なマルチレベル視覚系列アライメント法であるCoupAlignを提案する。
論文 参考訳(メタデータ) (2022-12-04T08:53:42Z) - Language-driven Semantic Segmentation [88.21498323896475]
本稿では,言語駆動型セマンティックイメージセグメンテーションの新しいモデルLSegを提案する。
テキストエンコーダを用いて記述型入力ラベルの埋め込みを計算する。
エンコーダは、画素埋め込みを対応するセマンティッククラスのテキスト埋め込みに合わせるために、対照的な目的で訓練される。
論文 参考訳(メタデータ) (2022-01-10T18:59:10Z) - Pixel-Stega: Generative Image Steganography Based on Autoregressive
Models [25.528348844618996]
Pixel-Stegaは、自動回帰モデルと算術符号アルゴリズムでピクセルレベルの情報を隠蔽する。
実験の結果,Pixel-Stegaは,画素のエントロピーに応じて,秘密メッセージを適応的に埋め込むことができることがわかった。
論文 参考訳(メタデータ) (2021-12-21T02:34:33Z) - CRIS: CLIP-Driven Referring Image Segmentation [71.56466057776086]
エンドツーエンドのCLIP駆動参照画像フレームワーク(CRIS)を提案する。
CRISは、テキストとピクセルのアライメントを達成するために、視覚言語によるデコーディングとコントラスト学習に頼っている。
提案するフレームワークは, 後処理を伴わずに, 最先端の性能を著しく向上させる。
論文 参考訳(メタデータ) (2021-11-30T07:29:08Z) - Small Lesion Segmentation in Brain MRIs with Subpixel Embedding [105.1223735549524]
ヒト脳のMRIスキャンを虚血性脳梗塞と正常組織に分割する方法を提案する。
本稿では,空間展開埋め込みネットワークによって予測を導出する標準エンコーダデコーダの形式でニューラルネットワークアーキテクチャを提案する。
論文 参考訳(メタデータ) (2021-09-18T00:21:17Z) - Transferring Cross-domain Knowledge for Video Sign Language Recognition [103.9216648495958]
単語レベルの手話認識(WSLR)は手話解釈の基本課題である。
ドメイン不変の視覚概念を学習し、サブタイトルのニュースサインの知識を伝達することでWSLRモデルを肥大化させる新しい手法を提案する。
論文 参考訳(メタデータ) (2020-03-08T03:05:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。