論文の概要: Large Language Model as Token Compressor and Decompressor
- arxiv url: http://arxiv.org/abs/2603.25340v1
- Date: Thu, 26 Mar 2026 11:30:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.265975
- Title: Large Language Model as Token Compressor and Decompressor
- Title(参考訳): Token Compressor と Decompressor としての大規模言語モデル
- Abstract要約: 既製のLCMは優れたトークン圧縮機および圧縮機として機能することを示す。
我々は、自己表現型自動符号化学習フレームワークを用いて、長文を離散長潜時符号のコンパクトな内部言語に翻訳する。
- 参考スコア(独自算出の注目度): 13.847845643427119
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In this paper, we establish the novel insight that an off-the-shelf LLM can function as an excellent token compressor and decompressor. To demonstrate, we design a self-expressive autoencoding learning framework fine-tunes a pretrained LLM to translate long texts into a compact internal language of discrete, variable-length latent codes, termed Z-tokens, and to reconstruct the original text exactly from them. The resulting representation is content-adaptive: semantically dense segments receive more Z-tokens, while redundant or predictable regions are aggressively compressed, via lightweight LoRA-based adapter heads. Empirically, our method achieves up to 18 times token reduction on Wikipedia, CNN/DailyMail, HotpotQA, and Qulac-style long-query datasets, while preserving reconstruction fidelity and downstream performance. This simple yet effective design supports applications including prompt compression and autoregressive generation directly in the Z-token space, offering a potential pathway toward token-efficient long-context reasoning.
- Abstract(参考訳): 本稿では,既製のLCMが優れたトークン圧縮機および非圧縮機として機能する,という新たな知見を確立する。
そこで本研究では,自己表現型自動符号化学習フレームワークを設計し,長文を離散長の可変長ラテント符号のコンパクトな内部言語に翻訳し,Z-tokenとよばれ,元のテキストを正確に再構築する。
セマンティックに密接なセグメントはより多くのZトークンを受け取り、冗長または予測可能な領域は軽量のLoRAベースのアダプタヘッドを介して積極的に圧縮される。
提案手法は,ウィキペディア,CNN/DailyMail,HotpotQA,Qulacスタイルのロングクエリデータセットに対して最大18倍のトークン削減を実現し,再構築精度とダウンストリーム性能を維持した。
このシンプルで効果的な設計は、Z-token空間に直接、即時圧縮と自己回帰生成を含むアプリケーションをサポートし、トークン効率の良い長文推論への潜在的経路を提供する。
関連論文リスト
- SimSD: Simple Speculative Decoding in Diffusion Language Models [61.33773959352141]
拡散大言語モデル (dLLMs) は、並列またはブロックワイド復号による高速な推論を提供する。
彼らのマスク付き言語モデリングの定式化は、標準的なトークンレベルの投機的復号法とは相容れないままである。
我々は,dLLMに時間的に有効なトークンレベルのコンテキストを付与する,SimSDと呼ばれるdLLMの投機的復号アルゴリズムを提案する。
提案手法は,平均生成品質を維持しつつ,最大7.46倍高い復号スループットを実現する。
論文 参考訳(メタデータ) (2026-06-01T17:46:46Z) - Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models [35.95256971588258]
大規模言語モデルは、長いプロンプトを処理する際にかなりの計算とメモリコストを発生させる。
我々は,Kトークンの連続ブロックを1つの埋め込みにマージする潜在空間圧縮フレームワークであるK-Token Mergingを提案する。
実験の結果, K-Token Mergingは最大75%の入力長削減を実現し, 性能劣化を最小限に抑えることができた。
論文 参考訳(メタデータ) (2026-04-16T15:32:45Z) - TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling [52.519745466772825]
テキスト音声による音声合成は、自然とインテリジェントな音声に基づく対話を指向する。
TASTEは音声トークンを生成し、テキストのトークンと長さを一致させる。
本稿ではリアルタイム利用に適したTASTEの拡張であるTASTE-Sを提案する。
論文 参考訳(メタデータ) (2026-03-12T18:13:48Z) - On the Semantic and Syntactic Information Encoded in Proto-Tokens for One-Step Text Reconstruction [0.5097809301149341]
自己回帰型大言語モデル(LLM)はテキストトークン・バイ・トーケンを生成し、長さnのシーケンスを生成するためにnフォワードパスを必要とする。
最近の研究によると、凍結したLLMは、たった2つの学習されたプロトトケンから数百のトークンを1つの前方パスで再構築できる。
我々は,これらのプロトタイプが符号化した情報と,再構成と制御制約の下でどのように振る舞うかについて検討する。
論文 参考訳(メタデータ) (2026-02-20T15:54:10Z) - CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs [29.08277140543501]
視覚的トークン圧縮のための新しいパラダイムであるCORE(Compact Object-centric Representation)を紹介する。
COREは効率的なセグメンテーションデコーダを利用してオブジェクトマスクを生成する。
実験により、COREは固定レート圧縮のための6つの信頼性ベンチマークに対して新しい最先端のベンチマークを確立するだけでなく、適応レート設定において劇的な効率向上を達成することが示された。
論文 参考訳(メタデータ) (2025-11-18T03:02:23Z) - zip2zip: Inference-Time Adaptive Tokenization via Online Compression [27.16551923444618]
zip2zipは、大規模言語モデルでコンテキスト適応トークン化を実現するための新しい方法である。
パラメータ効率のよい微調整により、既存のLLMを10GPU時間でzip2zipにアップトレーニングできることが示される。
結果としてLLMはテスト時間適応を行い、目に見えないコンテキストでハイパートークンを使うことを学び、入力トークンと出力トークンを15~40%削減する。
論文 参考訳(メタデータ) (2025-06-01T17:03:02Z) - VQToken: Neural Discrete Token Representation Learning for Extreme Token Reduction in Video Large Language Models [35.38573641029626]
最小限の離散トークンを用いてビデオ全体を表現することを目的としたExtreme Short Token Reductionという新しいタスクを紹介した。
Extreme Short Token Reductionタスクでは、私たちのVQTokenはシーケンスをオリジナルの長さのわずか0.07パーセントまで圧縮し、NextQA-MCベンチマークでは0.6%の精度しか達成していません。
論文 参考訳(メタデータ) (2025-03-21T09:46:31Z) - LightThinker: Thinking Step-by-Step Compression [74.34839026338342]
提案するLightThinkerは,大規模言語モデルを用いて推論中の中間的思考を動的に圧縮する手法である。
人間の認知プロセスにインスパイアされたLightThinkerは、思考ステップをコンパクトな表現に圧縮し、元の推論チェーンを捨てる。
実験によると、LightThinkerは競合精度を維持しながら、ピークメモリ使用量と推論時間を短縮する。
論文 参考訳(メタデータ) (2025-02-21T16:57:22Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z) - CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens [49.569695524535454]
本稿では, ベクトル量子化をエンコーダに挿入することにより, 多言語音声認識モデルから導出される, 教師付きセマンティックトークンを用いた音声表現を提案する。
トークンをベースとした拡張性のあるゼロショットTSシンセサイザーであるCosyVoiceは,テキスト・ツー・ツー・ケン生成のためのLLMと,トークン・ツー・音声合成のための条件付きフローマッチングモデルから構成される。
論文 参考訳(メタデータ) (2024-07-07T15:16:19Z) - Training LLMs over Neurally Compressed Text [55.11828645767342]
本稿では,高度に圧縮されたテキスト上での大規模言語モデル(LLM)の訓練について検討する。
テキストをブロックに分割し,それぞれが同じビット長に圧縮する新しい圧縮手法であるEqual-Info Windowsを提案する。
提案手法は, 大規模化により向上し, パープレキシティと推論速度のベンチマークにおいて, バイトレベルのベースラインをはるかに上回る, ニューラルネットワークによる効果的な学習を実演する。
論文 参考訳(メタデータ) (2024-04-04T17:48:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。