論文の概要: On the Design Fundamentals of Pixel Text Representation Learning
- arxiv url: http://arxiv.org/abs/2609.01147v1
- Date: Tue, 01 Sep 2026 12:20:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.644887
- Title: On the Design Fundamentals of Pixel Text Representation Learning
- Title(参考訳): Pixel Text Representation Learningの設計基礎について
- Authors: Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao,
- Abstract要約: テキストリッチな視覚入力は、ピクセル空間で直接言語を読み、検索し、圧縮できるモデルを必要とする。
既存のピクセルテキストエンコーダは、固定解像度事前学習、視覚的ショートカット学習、弱い視覚的接地、多言語視覚的テキスト理解に苦慮している。
Pixel Linguist IIは、オンザフライレンダリング、統一コントラストグラウンド、および2億8000万以上のトレーニング例の多言語カリキュラムで訓練されたネイティブ解像度の視覚エンコーダです。
- 参考スコア(独自算出の注目度): 28.30074302770897
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-rich visual inputs require models that can read, retrieve, and compress language directly in pixel space, yet existing pixel-text encoders struggle with fixed resolution pretraining, visual shortcut learning, weak visual grounding, and multilingual visual text understanding. In this work, we investigate the fundamental design principles required for robust visual text representation learning. Through systematic controlled ablations, we identify four critical components: variable image resolutions and rendered font sizes provide spatial proxies for high-resolution document generalization; natural image-text pairs are indispensable for grounding and prevent text-only collapse; layout-aware rendering helps prevent pixel-level shortcuts; and a two-stage multilingual curriculum enables effective cross-lingual alignment. By integrating these principles into a scalable training recipe, we train Pixel Linguist II, a native-resolution vision encoder trained with on-the-fly rendering, unified contrastive grounding, and a multilingual curriculum over 280M training examples. Pixel Linguist II sets new state-of-the-art results on English, cross-lingual, and multilingual Visual STS and ViDoRe, while also enabling better MLLM downstream evaluation. Notably, Pixel Linguist II remains robust under 80\% visual token compression, showing great promise for optical context compression. Our code and resources are available at https://github.com/Pixel-Linguist/Pixel-Linguist-II.
- Abstract(参考訳): テキストリッチなビジュアル入力は、ピクセル空間内で直接言語を読み、検索し、圧縮できるモデルを必要とするが、既存のピクセルテキストエンコーダは、固定解像度事前学習、ビジュアルショートカット学習、弱いビジュアルグラウンド、多言語ビジュアルテキスト理解に苦戦している。
本研究では,ロバストなビジュアルテキスト表現学習に必要な基本設計原理について検討する。
可変画像解像度と描画フォントサイズは、高解像度文書の一般化のための空間プロキシを提供する、自然な画像テキストペアは、テキストのみの崩壊を防ぐのに欠かせない、レイアウト認識レンダリングはピクセルレベルのショートカットを防ぐ、そして2段階の多言語カリキュラムは、効果的な言語間アライメントを可能にする、という4つの重要な要素を特定する。
これらの原則をスケーラブルなトレーニングレシピに統合することで、Pixel Linguist IIをトレーニングします。
Pixel Linguist IIは、英語、クロスランガル、多言語Visual STSとViDoReに新しい最先端の結果をセットすると同時に、より優れたMLLM下流評価を可能にする。
特に、Pixel Linguist IIは80%の視覚的トークン圧縮で堅牢であり、光学的コンテキスト圧縮には大きな可能性を秘めている。
私たちのコードとリソースはhttps://github.com/Pixel-Linguist/Pixel-Linguist-IIで公開されています。
関連論文リスト
- PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning [31.386303698437214]
本稿では,視覚的プロンプト入力と長文記述処理を同時に行うように設計された新しいフレームワークPixCLIPを提案する。
我々は,CLIP のオリジナルテキストエンコーダを LLM に置き換え,三分岐画素テキストアライメント学習フレームワークを提案する。
PixCLIPは、ピクセルレベルのインタラクションと長文テキスト処理のブレークスルーを示し、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-11-06T17:54:12Z) - Contrastive Localized Language-Image Pre-Training [60.4967533101887]
コントラスト言語-画像事前学習(CLIP)は、画像/テキスト表現を生成するために視覚エンコーダを訓練するための著名な方法である。
本稿では,CLIPとリージョンテキストのコントラッシブな損失とモジュールを補完することにより,CLOC(Contrastive Localized Language- Image Pre-Trening)を提案する。
CLOCは画像領域認識および検索タスクのための高品質な地域埋め込みを可能にする。
論文 参考訳(メタデータ) (2024-10-03T17:56:09Z) - Bootstrapping Vision-Language Learning with Decoupled Language
Pre-training [46.570154746311935]
本稿では,資源集約型視覚言語事前学習のための凍結型大規模言語モデル (LLM) の最適化を目的とした新しい手法を提案する。
われわれのアプローチは、言語コンポーネントに集中して、視覚的特徴と整合する最適なプロンプトを具体的に特定することによって、多様化している。
我々のフレームワークは、ビデオ学習タスクにおけるその成功例によって検証されるように、アーキテクチャ設計の観点からは、モダリティ非依存かつ柔軟である。
論文 参考訳(メタデータ) (2023-07-13T21:08:15Z) - Language Quantized AutoEncoders: Towards Unsupervised Text-Image
Alignment [81.73717488887938]
Language-Quantized AutoEncoder (LQAE)は、事前訓練された言語モデルを利用して、教師なしの方法でテキストイメージデータを整列することを学ぶ。
LQAEは類似した画像を類似したテキストトークンのクラスタで表現することを学び、一致したテキストイメージペアを使わずにこれら2つのモダリティを整列させる。
これにより、大きな言語モデル(例えばGPT-3)による少数ショット画像の分類や、BERTテキストの特徴に基づく画像の線形分類が可能になる。
論文 参考訳(メタデータ) (2023-02-02T06:38:44Z) - Pix2Struct: Screenshot Parsing as Pretraining for Visual Language
Understanding [58.70423899829642]
Pix2Structは、純粋に視覚的な言語理解のための事前訓練された画像-テキストモデルである。
4つの領域にまたがる9つのタスクのうち6つのタスクにおいて、1つの事前訓練されたモデルが最先端の結果が得られることを示す。
論文 参考訳(メタデータ) (2022-10-07T06:42:06Z) - Language Matters: A Weakly Supervised Pre-training Approach for Scene
Text Detection and Spotting [69.77701325270047]
本稿では,シーンテキストを効果的に表現できる弱教師付き事前学習手法を提案する。
本ネットワークは,画像エンコーダと文字認識型テキストエンコーダから構成され,視覚的特徴とテキスト的特徴を抽出する。
実験により、事前訓練されたモデルは、重みを他のテキスト検出やスポッティングネットワークに転送しながら、Fスコアを+2.5%、+4.8%改善することが示された。
論文 参考訳(メタデータ) (2022-03-08T08:10:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。