論文の概要: Visual Text Compression as Measure Transport
- arxiv url: http://arxiv.org/abs/2605.06708v1
- Date: Wed, 06 May 2026 19:02:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:38.478368
- Title: Visual Text Compression as Measure Transport
- Title(参考訳): 交通手段としてのビジュアルテキスト圧縮
- Abstract要約: ビジュアルテキスト圧縮(VTC)は、画像にテキストをレンダリングし、視覚言語モデルで再エンコードすることで、効率的な長文処理を実現する。
トークンの貯蓄は予測通りに下流のユーティリティに変換しません。
測定輸送の言語でVTCを定式化することでこの問題に対処する。
- 参考スコア(独自算出の注目度): 31.044830100566212
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visual text compression (VTC) promises efficient long-context processing by rendering text into an image and re-encoding it with a vision-language model, often producing $3$--$20\times$ fewer decoder tokens than subword tokenization. Yet token savings do not translate predictably into downstream utility: on some tasks the visual path matches or exceeds the text path, on others it collapses, and the compression ratio itself does not predict which regime will occur. The missing quantity is therefore not another summary of efficiency, but a principled measure of task-relevant information loss induced by visual encoding. We address this problem by formulating VTC in the language of measure transport. Treating text and visual tokens as empirical probability measures, we show that the ViT patch encoder induces a push-forward map whose transport cost decomposes into a precision cost from within-patch aggregation and a coverage cost from cross-patch fragmentation. Both terms are estimable from downstream-label-free probes. This formulation yields two operational consequences: a downstream-label-free routing criterion that selects whether to use the visual path for a given input or benchmark instance, and a transport-informed foveation mechanism that re-encodes high-cost regions at higher resolution. Across $24$ NLP datasets at Qwen3-4B, our label-free rule matches the per-dataset oracle on $17/24$ datasets ($70.8\%$), and improves the average task score by $+3.3\%$ with $-10.3\%$ average tokens relative to a pure-LLM.
- Abstract(参考訳): ビジュアルテキスト圧縮(VTC)は、画像にテキストをレンダリングし、それを視覚言語モデルで再エンコードすることで、効率的な長文処理を約束する。
しかし、トークンの保存は、ダウンストリームユーティリティに予測可能に対応していない:あるタスクでは、ビジュアルパスがテキストパスと一致または超過し、他のタスクでは、それが崩壊し、圧縮比自体がどの状態になるかを予測しない。
したがって、不足量は効率の別の要約ではなく、視覚的エンコーディングによって引き起こされるタスク関連情報損失の原理的な尺度である。
測定輸送の言語でVTCを定式化することでこの問題に対処する。
テキストと視覚トークンを実証的確率測定として扱うことで、ViTパッチエンコーダは、転送コストがパッチ内の集約とパッチ間の断片化によるカバレッジコストから精度の高いコストに分解されるプッシュフォワードマップを誘導することを示す。
どちらの用語も、下流ラベルのないプローブから推定できる。
この定式化は、所定の入力またはベンチマークインスタンスにビジュアルパスを使用するかどうかを選択するダウンストリームラベルフリーなルーティング基準と、高解像度で高コスト領域を再エンコードするトランスポートインフォーメーション機構の2つの操作結果をもたらす。
Qwen3-4Bの24ドルNLPデータセット全体で、当社のラベルフリールールはデータセット当たり17/24ドルデータセット(70.8\%$)と一致し、平均タスクスコアを3.3\%$と10.3\%$で改善します。
関連論文リスト
- When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs [13.67813408204418]
視覚情報は視覚言語モデル(VLM)の知覚を強化するが、巨大な視覚トークンは推論コストを増大させる。
既存のビジュアルトークンプルーニング手法は類似性に基づくガイダンスに依存しており、圧縮のためにペアワイズテキストビジョンとビジョンビジョントークン相関を利用する。
本稿では,CMR,テキストアテンション関連性,残余空間の多様性を組み合わせた学習不要なビジュアルトークン圧縮手法であるSIEVEについて述べる。
論文 参考訳(メタデータ) (2026-08-11T05:04:33Z) - Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing [0.0]
生の人間の入力の2つの病理は、非英語のテキストに対するトークン化の非効率性と会話のプロンプトにおける構造的エントロピーの2つのオーバーヘッドを駆動している。
既存のアプローチは、すでに肥大しているコンテキストを圧縮したり、障害が発生した後に介入することで、リアクティブに動作します。
我々は、開発者とクラウドエージェントの間で動作する、飛行前のエッジサイドのプロンプトリライトを導入します。
論文 参考訳(メタデータ) (2026-06-02T13:17:45Z) - Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing [2.6382975801439836]
LLMは、入力中にほとんどのトークンが冗長に見える場合でも、全出力を自動回帰的に再生することでテキストとコードを編集する。
Copy-as-Decodeは、2プリミティブ文法上の構造化復号化として生成を再キャストする復号化機構である。
論文 参考訳(メタデータ) (2026-04-20T12:29:53Z) - PIO-FVLM: Rethinking Training-Free Visual Token Reduction for VLM Acceleration from an Inference-Objective Perspective [59.24570811503256]
本稿では,視覚モデル(VLM)における冗長な視覚トークンを減らし,推論を高速化するPIO-FVLMを提案する。
提案されているPIO-FVLMは、トレーニングフリーで、FlashAttentionと互換性があり、実用的なアプリケーションやデプロイメントに親しみやすい。
LLaVA-Next-7Bでは、PIO-FVLMは視覚トークンの11.1%しか保持していないが、オリジナルのパフォーマンスの97.2%を維持している。
論文 参考訳(メタデータ) (2026-02-04T15:33:10Z) - Global Context Compression with Interleaved Vision-Text Transformation [12.971394377165767]
本稿では,前処理と推論の両方の段階でトークンを節約するグローバルコンテキスト圧縮について検討する。
入力テキストチャンクと視覚的エンコーディングとをインターリーブする新しいトランスフォーマーであるVIST2を提案する。
4$times$圧縮比で、結果として得られたモデルは長文タスクのベースラインよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2026-01-15T13:29:16Z) - $β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment [53.42377319350806]
$-CLIPは、多言語テキスト条件のコントラスト学習フレームワークである。
$-CALは、この階層に固有のセマンティックオーバーラップに対処する。
$-CLIPは、高密度視覚言語対応のための堅牢で適応的なベースラインを確立する。
論文 参考訳(メタデータ) (2025-12-14T13:03:20Z) - VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models [57.2662376527586]
VScanは2段階のビジュアルトークン削減フレームワークである。
1)グローバルスキャンとローカルスキャンを視覚的エンコーディング中にマージすることで,(2)言語モデルの中間層にプルーニングを導入する。
VScanはプリフィルの2.91$times$スピードアップとFLOPの10$times$ダウンを実現し、オリジナルのパフォーマンスの95.4%を維持した。
論文 参考訳(メタデータ) (2025-05-28T17:59:08Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z) - HashAttention: Semantic Sparsity for Faster Inference [95.31739930718116]
本稿では,HashAttention,framing pivotal token Identificationを推薦問題として紹介する。
トークン1個あたり32ビットの補助メモリしか必要とせず、最小品質の損失を最小限に抑えられるため、最大16タイムで使用されるトークンを削減できる。
A100 GPUでは、HashAttentionを組み込むことで、GPT-FASTで4.3times$、FlashDecodeで2.54times$、GPT-FASTで最大3.12times$高スループットを実現している。
論文 参考訳(メタデータ) (2024-12-19T02:34:15Z) - SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference [45.11612407862277]
視覚言語モデル (VLM) では、視覚トークンはテキストトークンと比較して情報量が多すぎるにもかかわらず、計算オーバーヘッドがかなり大きい。
本稿では、余分なパラメータや微調整コストを不要とするSparseVLMと呼ばれるテキスト誘導型トレーニングフリートークン最適化機構を提案する。
論文 参考訳(メタデータ) (2024-10-06T09:18:04Z) - SegViTv2: Exploring Efficient and Continual Semantic Segmentation with
Plain Vision Transformers [76.13755422671822]
本稿では,エンコーダ・デコーダ・フレームワークを用いた意味的セグメンテーションのためのプレーンビジョン変換器(ViT)の能力について検討する。
Intention-to-Mask(atm)モジュールを導入し、平易なViTに有効な軽量デコーダを設計する。
我々のデコーダは、様々なViTバックボーンを使用して人気のあるデコーダUPerNetより優れ、計算コストの5%程度しか消費しない。
論文 参考訳(メタデータ) (2023-06-09T22:29:56Z) - Vcc: Scaling Transformers to 128K Tokens or More by Prioritizing
Important Tokens [65.4435926060951]
本稿では,超長周期の変換器の効率を,各層でより小さな表現に圧縮することで向上することを提案する。
我々のアルゴリズムは効率的であるだけでなく(4Kと16Kのベースラインに比べて3倍以上の効率向上を達成する)、多数のタスクで競合/ベターパフォーマンスを提供する。
論文 参考訳(メタデータ) (2023-05-07T10:32:18Z) - Speculative Decoding: Exploiting Speculative Execution for Accelerating
Seq2seq Generation [80.2267931231335]
本稿では,自己回帰(AR)デコーディングを高速化する投機的実行のアイデアを活用するための投機的デコーディング(SpecDec)を提案する。
SpecDecには2つのイノベーションがある。Spec-Drafter - 効率的なドラフトのために特別に最適化された独立モデル、Spec-Verification - ドラフトされたトークンを効率的に検証するための信頼性の高い方法である。
論文 参考訳(メタデータ) (2022-03-30T17:27:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。