論文の概要: LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression
- arxiv url: http://arxiv.org/abs/2607.08221v1
- Date: Thu, 09 Jul 2026 08:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.463226
- Title: LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression
- Title(参考訳): LUMI:Tokenizer-Agnostic LLM-based Lossless Image Compression
- Authors: Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma,
- Abstract要約: 本稿では,RGB画像圧縮のためのトークン化非依存フレームワークLUMIについて述べる。
LUMIは、ピクセル・アズ・テキストのトークン化を、LLMの連続的な埋め込み空間に生の強度とチャネル情報をマッピングするピクセル埋め込みモジュールに置き換える。
画素埋め込み、位置符号化、ソフトパラメータ、予測ヘッドのみが訓練され、LSMバックボーンは固定されている。
- 参考スコア(独自算出の注目度): 87.04737384323367
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language model (LLM)-based lossless image compression methods typically represent pixel data through the native text interface of a pretrained model, converting pixel values into token sequences that the LLM processes through its vocabulary head. This design shows that pretrained language models can provide probability estimates for image coding, but it also couples compression to tokenizer behavior, vocabulary-specific numeric tokens, and model-family-specific adaptation. In this paper, we present LUMI (LLM-based Unified Model-agnostic lossless Image compression), a tokenizer-agnostic framework for lossless RGB image compression with frozen LLM backbones. LUMI replaces pixel-as-text tokenization with a pixel embedding module that maps raw intensity and channel information into the continuous embedding space of the LLM. It further introduces intra-patch position encoding to retain two-dimensional spatial structure after flattening, and uses a 256-way prediction head to produce probabilities over the native pixel alphabet. Only the pixel embedding, position encoding, soft-prefix parameters, and prediction head are trained, while the LLM backbone remains fixed. Experiments on natural, medical, and remote-sensing image benchmarks with LLaMA, Qwen, and Gemma backbones show that LUMI provides a unified interface across tokenizer families, achieves competitive compression rates, and improves cross-domain robustness over tokenizer-based LLM compression baselines. These results formulate LLM-based lossless image compression as pixel-space adaptation of frozen foundation models rather than tokenizer-specific language-symbol modeling.
- Abstract(参考訳): 大規模言語モデル(LLM)に基づくロスレス画像圧縮法は、通常、事前訓練されたモデルのネイティブテキストインタフェースを介してピクセルデータを表現し、LLMが語彙頭を通して処理するトークンシーケンスに変換する。
この設計は、事前訓練された言語モデルは、画像符号化の確率推定を提供することができるが、また、圧縮とトークン化の挙動、語彙固有の数値トークン、モデルファミリー固有の適応とを結合していることを示している。
本稿では、LLMバックボーンを凍結した無損失RGB画像圧縮のためのトークン化フレームワークLUMI(LLMベースの統一モデル非依存ロスレス画像圧縮)を提案する。
LUMIは、ピクセル・アズ・テキストのトークン化を、LLMの連続的な埋め込み空間に生の強度とチャネル情報をマッピングするピクセル埋め込みモジュールに置き換える。
さらに、フラット化後の2次元空間構造を維持するためにパッチ内位置符号化を導入し、256方向予測ヘッドを使用してネイティブピクセルアルファベット上の確率を生成する。
LLMバックボーンが固定されている間、ピクセル埋め込み、位置符号化、ソフトプリフィックスパラメータ、予測ヘッドのみを訓練する。
LLaMA、Qwen、Gemmaのバックボーンを用いた自然、医学、遠隔センシング画像ベンチマークの実験では、LUMIはトークン化ファミリ間の統一インターフェースを提供し、競合圧縮率を達成し、トークン化ファミリベースのLLM圧縮ベースラインよりもドメイン間の堅牢性を向上させる。
これらの結果から, LLMに基づくロスレス画像圧縮は, トークン化言語記号モデルではなく, 凍結基盤モデルの画素空間適応として定式化される。
関連論文リスト
- Large Language Model for Lossless Image Compression with Visual Prompts [26.132381529841815]
本稿では,大規模言語モデルに視覚的プロンプトを組み込んだ,ロスレス画像圧縮のための新しいパラダイムを提案する。
複数のベンチマークデータセットの実験により,本手法が最先端の圧縮性能を実現することを示す。
我々のアプローチは、医用画像やスクリーンコンテンツ画像など他の領域の画像にも容易に拡張でき、優れたパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2025-02-22T09:36:03Z) - Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning [70.98890307376548]
そこで本研究では,学習中に不信なコンテンツを適応的に緩和する,新しいPatch-wise Cross-modal Feature Mix-up(PCM)機構を提案する。
私たちのPCM-Netは、ドメイン内およびクロスドメインのゼロショット画像キャプションの両方で第1位です。
論文 参考訳(メタデータ) (2024-12-31T13:39:08Z) - Large Language Models for Lossless Image Compression: Next-Pixel Prediction in Language Space is All You Need [53.584140947828004]
前例のないインテリジェンスを持つ言語大モデル(LLM)は、様々なデータモダリティのための汎用ロスレス圧縮機である。
P$2$-LLMは,様々な入念な洞察と方法論を統合した次世代の予測型LLMである。
ベンチマークデータセットの実験では、P$2$-LLMがSOTAの古典的および学習的コーデックに勝ることを示した。
論文 参考訳(メタデータ) (2024-11-19T12:15:40Z) - PIXAR: Auto-Regressive Language Modeling in Pixel Space [51.530056034156374]
テキスト生成を行うピクセルベース自動回帰LDMであるPIXARを紹介する。
デコーダのみで構成されたPIXARは、以前のエンコーダ・デコーダモデルと同等のパラメータ数を保ちながら、自由形式の生成タスクを実行できる。
そこで本研究では,LAMBADAでは8.1,bAbIでは8.5,PIXARでは8.1の可読性と精度を向上させる逆事前学習ステージを提案する。
論文 参考訳(メタデータ) (2024-01-06T22:49:38Z) - Exploring Effective Mask Sampling Modeling for Neural Image Compression [171.35596121939238]
既存のニューラルイメージ圧縮手法の多くは、空間的冗長性を排除するために、ハイパープライアモデルやコンテキストモデルからのサイド情報に依存している。
近年の自然言語処理と高次視覚のための自己教師付き学習手法におけるマスクサンプリングモデルに着想を得て,ニューラル画像圧縮のための新しい事前学習戦略を提案する。
提案手法は,最先端画像圧縮法と比較して計算複雑性の低い競合性能を実現する。
論文 参考訳(メタデータ) (2023-06-09T06:50:20Z) - Modeling Lost Information in Lossy Image Compression [72.69327382643549]
ロスシー画像圧縮は、デジタル画像の最もよく使われる演算子の1つである。
Invertible Lossy Compression (ILC) と呼ばれる新しい非可逆的フレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-22T04:04:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。