論文の概要: PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.28344v1
- Date: Mon, 01 Jun 2026 23:20:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.587567
- Title: PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation
- Title(参考訳): PIXELRAG:Webスクリーンショットが検索機能強化のためのテキストに勝る
- Authors: Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min,
- Abstract要約: 我々は,Webサイトを視覚的に表現する新しい検索拡張手法であるPixelRAGを紹介する。
PixelRAGはこの形式で完全なウィキペディアコーパス上で動作する最初のパイプラインである。
非検索とテキストベースのRAGベースラインを一貫して上回る。
- 参考スコア(独自算出の注目度): 70.26672362704758
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Augmenting large language models (LLMs) with retrieved web text has become a dominant paradigm, yet the web is not natively textual: existing systems depend on complex parsing pipelines that linearize HTML and discard layout, visual structure, and formatting. We introduce PixelRAG, a new retrieval-augmented method that represents websites in their native visual form and performs retrieval and reading entirely in pixel space, enabling an end-to-end architecture that eliminates text abstraction. PixelRAG is, to our knowledge, the first pipeline to operate over a full Wikipedia corpus in this form, scaling to a datastore of 30 million screenshot images with an efficient visual retrieval index. Built on an existing visual embedding model (i.e., Qwen3-VL-Embedding), PixelRAG further fine-tunes this model on screenshot data with carefully curated contrastive training data. Retrieved screenshots are then fed directly as pixel inputs to a VLM, without intermediate text conversion. PixelRAG consistently outperforms both no-retrieval and text-based RAG baselines, most surprisingly on widely studied text-centric tasks such as NQ and SimpleQA. It also achieves strong gains on multimodal open-domain QA (e.g., MMSearch), benchmarks over noisy news corpora (e.g., LiveVQA), and agentic benchmarks (e.g., MoNaCo), improving accuracy by up to 18.1% over text-based baselines. Finally, pixel representations enable a new efficiency lever for RAG through image compression, achieving up to 3x token cost reduction at lower resolutions while maintaining accuracy. Our results challenge the necessity of text representations in web retrieval, suggesting that web RAG can operate directly in the web's native visual form while improving both performance and efficiency.
- Abstract(参考訳): 検索されたWebテキストによる大規模言語モデル(LLM)の拡張は、支配的なパラダイムとなっているが、Webはネイティブなテキストではない:既存のシステムは、HTMLを線形化しレイアウト、視覚構造、フォーマットを廃止する複雑な解析パイプラインに依存している。
我々はPixelRAGという,Webサイトをネイティブなビジュアル形式で表現し,完全にピクセル空間で検索と読取を行う新しい検索拡張手法を導入し,テキストの抽象化を排除したエンドツーエンドアーキテクチャを実現する。
PixelRAGは、われわれの知る限り、この形式で完全なウィキペディアコーパスを運用する最初のパイプラインであり、効率的なビジュアル検索インデックスを備えた3000万枚のスクリーンショット画像からなるデータストアにスケールする。
既存のビジュアル埋め込みモデル(Qwen3-VL-Embeddingなど)に基づいて構築されたPixelRAGは、このモデルを慎重にキュレートされたコントラストトレーニングデータでスクリーンショットデータに微調整する。
取得したスクリーンショットは、中間テキスト変換なしで直接VLMに画素入力として送信される。
PixelRAGは、NQやSimpleQAといった広く研究されているテキスト中心のタスクにおいて、検索不要とテキストベースのRAGベースラインの両方を一貫して上回っている。
マルチモーダルなオープンドメインQA(例:MMSearch)、ノイズの多いニュースコーパス(例:LiveVQA)、エージェントベンチマーク(例:MoNaCo)のベンチマークも大きく向上し、テキストベースのベースラインよりも18.1%精度が向上した。
最後に、画素表現は画像圧縮によるRAGの新たな効率レバーを可能にし、精度を維持しつつ低解像度で最大3倍のトークンコスト削減を実現する。
本稿では,Web検索におけるテキスト表現の必要性に挑戦し,Web RAGがWebのネイティブな視覚形態で直接動作し,性能と効率を両立させることができることを示唆した。
関連論文リスト
- Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech [3.62994537177299]
テキストを視覚的にグラウンド化することで、異なるUnicodeエンコーディングを持つ構造的に類似した文字が、同様の埋め込みを生成することができる。
視覚的な音声合成のための最初のフレームワークであるPixel-TTSを提案する。
テキストをイメージとしてレンダリングし、2D畳み込み層を通じて投影して埋め込みを生成する。
論文 参考訳(メタデータ) (2026-06-05T11:46:30Z) - Multimodal OCR: Parse Anything from Documents [72.69545534962234]
dots.mocrは、チャート、ダイアグラム、テーブル、アイコンなどのビジュアル要素を第一級解析ターゲットとして扱う。
テキストとグラフィックの両方を構造化出力として再構築し、より忠実なドキュメント再構築を可能にする。
不均一なドキュメント要素に対するエンドツーエンドのトレーニングをサポートする。
論文 参考訳(メタデータ) (2026-03-13T14:42:21Z) - UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation [51.31795451147935]
本稿では,単一のピクセル間拡散フレームワーク内での視覚的理解と視覚的生成を支援する統合生成モデルを提案する。
私たちのゴールは、モデル、タスク、表現の3つの軸に沿った統一を達成することです。
画像間合成と画像間理解の実験は、強いモーダルアライメントを示す。
論文 参考訳(メタデータ) (2025-11-21T03:02:10Z) - When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning [31.696397337675847]
LVLM(Large Vision-Language Models)は通常、画像処理に限定された事前定義されたグリッドを使用する。
動的画像ピラミッド(DIP)を統合したテキスト誘導型トークンプルーニング手法を提案する。
提案手法は,同一データを用いた4つのデータセットにおける既存の高分解能戦略よりも優れる。
論文 参考訳(メタデータ) (2025-03-10T17:51:16Z) - Context Does Matter: End-to-end Panoptic Narrative Grounding with
Deformable Attention Refined Matching Network [25.511804582983977]
パノラマ・ナララティブ・グラウンディング(PNG)は、高密度なナラティブキャプションに基づいて、画像中の視覚オブジェクトを分割することを目的としている。
Deformable Attention Refined Matching Network (DRMN) と呼ばれる新しい学習フレームワークを提案する。
DRMNは、トップ$k$で最も類似したピクセルの特徴表現を更新した後、変形可能なアテンションネットワークで画素を反復的に再エンコードする。
論文 参考訳(メタデータ) (2023-10-25T13:12:39Z) - TextFormer: A Query-based End-to-End Text Spotter with Mixed Supervision [61.186488081379]
Transformerアーキテクチャを用いた問合せベースのエンドツーエンドテキストスポッターであるTextFormerを提案する。
TextFormerは、画像エンコーダとテキストデコーダの上に構築され、マルチタスクモデリングのための共同セマンティック理解を学ぶ。
分類、セグメンテーション、認識のブランチの相互訓練と最適化を可能にし、より深い特徴共有をもたらす。
論文 参考訳(メタデータ) (2023-06-06T03:37:41Z) - Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal
Transformers [46.275416873403614]
我々はPixel-BERTを提案し,画像画素とテキストとの整合性を深層マルチモーダル変換器で学習し,視覚と言語の埋め込みを共同で学習する。
私たちのアプローチでは、VQA(Visual Question Answering)、画像テキスト検索、Natural Language for Visual Reasoning for Real(NLVR)など、下流タスクの最先端技術を実現しています。
論文 参考訳(メタデータ) (2020-04-02T07:39:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。