論文の概要: Scalable Visual Pretraining for Language Intelligence
- arxiv url: http://arxiv.org/abs/2607.09657v1
- Date: Fri, 10 Jul 2026 17:57:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.919751
- Title: Scalable Visual Pretraining for Language Intelligence
- Title(参考訳): 言語知能のためのスケーラブルなビジュアル事前学習
- Authors: Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen,
- Abstract要約: 現在の事前学習アプローチは、ドキュメントやWebページなどの視覚的に豊かなソースを、言語知性を学ぶためのプレーンテキストに変換することによって、視覚的手がかりを捨てる。
本稿では,言語モデルをテキストのみの表現でトレーニングしなければならないというデフォルトの仮定に挑戦し,基礎モデルインテリジェンスのためのスケーラブルな学習者であるVisual Pretrainingを示す。
- 参考スコア(独自算出の注目度): 69.86077531505379
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The rapid progress of large foundation models has been driven predominantly by pretraining on large-scale text corpora. However, many forms of knowledge are conveyed through visual representations, where figures, typeset equations, and page layouts carry rich information that cannot be faithfully or completely captured by text alone. Yet current pretraining approaches discard these visual cues by converting visually rich sources, such as documents and web pages, into plain text for learning language intelligence. This paper challenges the default assumption that language models must be trained on text-only representations and shows that Visual Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study of unsupervised visual pretraining paradigms that directly leverage visual documents without text extraction. Across multiple backbones and benchmarks, visual pretraining on the same underlying corpora consistently outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence.
- Abstract(参考訳): 大規模な基盤モデルの急速な進歩は、大規模テキストコーパスの事前学習によって大きく推進されている。
しかし、多くの形態の知識は視覚表現によって伝達され、図形、型式、ページレイアウトは、テキストだけでは忠実に、あるいは完全に捉えられない豊富な情報を運ぶ。
しかし、現在の事前学習アプローチは、ドキュメントやWebページなどの視覚的に豊かなソースを、言語知性を学ぶためのプレーンテキストに変換することによって、これらの視覚的手がかりを捨てている。
本稿では,言語モデルをテキストのみの表現でトレーニングしなければならないというデフォルトの仮定に挑戦し,基礎モデルインテリジェンスのためのスケーラブルな学習者であるVisual Pretrainingを示す。
この目的のために、テキスト抽出なしで直接視覚文書を活用する教師なしの視覚前訓練パラダイムを体系的に研究する。
複数のバックボーンとベンチマークにまたがって、同じ基盤となるコーパス上の視覚的事前トレーニングは、テキストのみの事前トレーニングを一貫して上回り、スケーラブルな言語インテリジェンスへの効率的なパスを提供する。
関連論文リスト
- Is BERT Blind? Exploring the Effect of Vision-and-Language Pretraining
on Visual Language Understanding [13.300199242824934]
視覚的・言語的な事前学習が、暗黙的な視覚的推論を含むテキストのみのタスクのパフォーマンスを向上させるかどうかを検討する。
本稿では,テキストエンコーダモデルの視覚的推論能力を探索するための視覚言語理解タスクを提案する。
また,テキストのみのタスクにCLIPなどのモデルを適用するための新しいゼロショット知識探索手法であるStroop Probingも提案する。
論文 参考訳(メタデータ) (2023-03-21T17:30:40Z) - Visually-augmented pretrained language models for NLP tasks without
images [77.74849855049523]
既存のソリューションはしばしば視覚的知識増強のために明示的なイメージに依存している。
我々は、新しいtextbfVisually-textbfAugmented fine-tuningアプローチを提案する。
我々のアプローチは、BERT、RoBERTa、BART、T5を異なるスケールで継続的に改善することができる。
論文 参考訳(メタデータ) (2022-12-15T16:13:25Z) - Pix2Struct: Screenshot Parsing as Pretraining for Visual Language
Understanding [58.70423899829642]
Pix2Structは、純粋に視覚的な言語理解のための事前訓練された画像-テキストモデルである。
4つの領域にまたがる9つのタスクのうち6つのタスクにおいて、1つの事前訓練されたモデルが最先端の結果が得られることを示す。
論文 参考訳(メタデータ) (2022-10-07T06:42:06Z) - Visually-Augmented Language Modeling [137.36789885105642]
本稿では,言語モデリングのための関連画像を含むテキストトークンを視覚的に拡張する,VaLMという新しい事前学習フレームワークを提案する。
視覚的に拡張されたコンテキストでは、VaLMは視覚知識融合層を使用してマルチモーダル基底言語モデリングを可能にする。
視覚情報を必要とする多モーダル・コモンセンス推論タスクについて,提案モデルの評価を行った。
論文 参考訳(メタデータ) (2022-05-20T13:41:12Z) - Vision-Language Pre-Training for Boosting Scene Text Detectors [57.08046351495244]
シーンテキスト検出に視覚言語を用いた共同学習を特に応用する。
本稿では,視覚言語による事前学習を通して,文脈化された共同表現を学習することを提案する。
事前訓練されたモデルは、よりリッチなセマンティクスでより情報的な表現を生成することができる。
論文 参考訳(メタデータ) (2022-04-29T03:53:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。