論文の概要: Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers
- arxiv url: http://arxiv.org/abs/2607.03994v1
- Date: Sat, 04 Jul 2026 19:30:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.787878
- Title: Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers
- Title(参考訳): フルグリフ画像がトーケン埋め込みに勝る: トランスフォーマーの制御された研究
- Authors: Shuyang Xiang, Hao Guan,
- Abstract要約: 我々は、漢字を表現するために、ビジョンベースモデルとインデックスベースベースラインを使用する。
すべてのテストされたデコーダのバックボーンの中で、ビジョンベースのモデルはベースラインを一貫して上回る。
アドバンテージは空間コヒーレント入力と2次元位置符号化を備えたViTエンコーダの両方を必要とする。
- 参考スコア(独自算出の注目度): 1.920312875157821
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern language models generally represent text as sequences of discrete token embeddings, an assumption deeply rooted in current practice but rarely questioned. We challenge this representation, especially for Chinese, by replacing index-based token embeddings entirely with a single rasterized image of the character sequence, processed by a vision encoder composed of a shared ResNet and a shallow Vision Transformer. To isolate the role of input representation, we construct a dual-branch controlled framework in which both a Vision-based model and an index-based baseline share an identical decoder backbone, training objective, optimizer, and data curriculum. Any performance difference is therefore attributable to the input modality only. Across all tested decoder backbones, the Vision-based model consistently outperforms the baseline, reaching a peak accuracy of 0.429 versus 0.355 for the index-based baseline,that is, a 21% relative improvement, while converging in about half the number of training epochs. The advantage emerges especially within the first five epochs (under 21% of total data) and persists under moderate character corruption: the corrupted Vision model matches the clean index-based baseline. Ablation studies reveal that the advantage requires both spatially coherent input and a ViT encoder with 2D positional encodings. A cross-script comparison on English shows the advantage does not transfer directly to alphabetic writing systems, suggesting that the uniform visual density and radical structure of Chinese characters are enabling conditions. These findings suggest that transformers are more modality-agnostic than commonly assumed, and that discrete tokenization is not a fundamental requirement for Chinese language modeling.
- Abstract(参考訳): 現代の言語モデルは一般的に、テキストを個別のトークン埋め込みのシーケンスとして表現している。
特に中国語では、インデックスベースのトークン埋め込みを文字列の1つのラスタ化画像に置き換え、共有ResNetと浅いビジョン変換器からなるビジョンエンコーダで処理することで、この表現に挑戦する。
入力表現の役割を分離するために、ビジョンベースモデルとインデックスベースベースラインの両方が同一のデコーダバックボーン、トレーニング目標、オプティマイザ、データカリキュラムを共有するデュアルブランチ制御フレームワークを構築した。
したがって、任意の性能差は入力モダリティのみに起因する。
すべてのテストされたデコーダのバックボーン全体で、ビジョンベースのモデルはベースラインを一貫して上回り、インデックスベースのベースラインでは最大精度0.429、0.355に達した。
アドバンテージは、特に最初の5つのエポック(総データの21%以下)で現れ、中程度の文字の破損の下で持続する:腐敗したビジョンモデルは、クリーンなインデックスベースのベースラインと一致します。
アブレーション研究では、空間的コヒーレントな入力と2次元位置符号化を備えたViTエンコーダの両方を必要とすることが示されている。
英語のクロススクリプト比較では、この利点はアルファベットの文字システムに直接移行しないことが示されており、漢字の均一な視覚密度と急激な構造が条件を許容していることが示唆されている。
これらの結果は、トランスフォーマーは一般的に想定されるよりもモダリティに依存しないものであり、離散トークン化は中国語モデリングの基本的な要件ではないことを示唆している。
関連論文リスト
- RADIO1D: Elastic Representations for Condensed Vision Modeling [69.84453279129937]
本稿では,視覚言語モデル (VLM) が固定パッチベースの2次元視覚機能を必要とするという仮定に挑戦する。
RADIO1Dは,マルチ教師の知識蒸留とオートエンコーダ設計を用いて,画像をコンパクトで可変長の1Dトークンシーケンスに圧縮する。
結果として得られた表現は、強い階層的な要約を示し、1つのトークンでも正確なシーン理解を可能にし、合成認識画像検索の改善をサポートする。
論文 参考訳(メタデータ) (2026-07-03T22:58:54Z) - Entropy-Aware Structural Alignment for Zero-Shot Handwritten Chinese Character Recognition [7.632962062462334]
ゼロショット手書き漢字認識は、急進的な意味合成を活用することで、目に見えない文字を認識することを目的としている。
本稿では,情報理論モデリングにより視覚と意味のギャップを埋めるエントロピー対応構造アライメントネットワークを提案する。
ICDAR 2013データセットで55.04%の精度を達成し,新しい最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-03T16:08:40Z) - A Transformer Based Handwriting Recognition System Jointly Using Online and Offline Features [8.419663258260671]
オフライン画像とオンラインストロークデータの早期融合を行うエンド・ツー・エンド・ネットワークを提案する。
我々の手法は最先端の精度を達成し、過去のベストを最大1%上回っている。
論文 参考訳(メタデータ) (2025-06-25T08:58:47Z) - Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models [29.571937393873444]
クロスモーダル・コントラッシブ・ラーニング (CLIP) 法は, 準最適視覚表現能力に悩まされる。
トレーニング可能なパラメータの約8%しか利用できない効率的な視覚言語アライメント手法であるALTA(Align Through Adapting)を提案する。
ALTAは、マスク付きレコードモデリングから事前学習された視覚モデルを適用することにより、検索やゼロショット分類などの視覚言語マッチングタスクにおいて優れた性能を示す。
論文 参考訳(メタデータ) (2025-06-10T17:02:27Z) - Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models [92.18057318458528]
Token-ShuffleはTransformerにおける画像トークンの数を減らす新しい方法である。
我々の戦略は、事前訓練されたテキストエンコーダを必要とせず、MLLMが超高解像度画像合成をサポートできるようにする。
GenAIベンチマークでは、2.7Bモデルがハードプロンプトで0.77点、ARモデルLlamaGenが0.18点、拡散モデルLDMが0.15点である。
論文 参考訳(メタデータ) (2025-04-24T17:59:56Z) - Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation [81.45400849638347]
In-image Machine Translation (IIMT) は、ソース言語のテキストを含む画像をターゲット言語の翻訳を含む画像に変換することを目的としている。
本稿では,4つのモジュールからなるエンドツーエンドIIMTモデルを提案する。
本モデルでは,70.9%のパラメータしか持たないカスケードモデルと比較して競争性能が向上し,画素レベルのエンド・ツー・エンドIIMTモデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2024-07-03T08:15:39Z) - Do Vision and Language Encoders Represent the World Similarly? [22.70701869402434]
CLIPのようなアライメントされたテキストイメージエンコーダは、視覚言語タスクのデファクトモデルになっている。
非整列および整列エンコーダの表現空間は意味論的に類似していることがわかった。
CLIPのようなアライメントエンコーダに統計的に類似性がない場合、アライメントされていないエンコーダのマッチングがトレーニングなしで存在することを示す。
論文 参考訳(メタデータ) (2024-01-10T15:51:39Z) - Single-Stream Multi-Level Alignment for Vision-Language Pretraining [103.09776737512078]
モーダルを複数のレベルで整列させる単一ストリームモデルを提案する。
対称的相互モダリティ再構築と擬似ラベル付きキーワード予測という2つの新しいタスクを用いてこれを実現する。
我々は、ゼロショット/ファインチューニングされた画像/テキスト検索、参照表現、VQAといった一連の視覚言語タスクにおいて、トップパフォーマンスを示す。
論文 参考訳(メタデータ) (2022-03-27T21:16:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。