論文の概要: LatentPress: Context Compression Beyond Text and Vision
- arxiv url: http://arxiv.org/abs/2609.01507v2
- Date: Thu, 03 Sep 2026 03:34:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.268856
- Title: LatentPress: Context Compression Beyond Text and Vision
- Title(参考訳): LatentPress: テキストとビジョンを超えたコンテキスト圧縮
- Authors: Zhengze Zhou, Hejian Sang,
- Abstract要約: 会話履歴と長いドキュメントを第3の表現に書き込むLatentPressを紹介します。
小さな読み手マッチングのライターは、アダプタのみをトレーニングしながら、$4-$16times$を圧縮する。
LongMemEvalでは、LatentPressが0.504$の精度で7.70times$の圧縮を実現している。
- 参考スコア(独自算出の注目度): 0.9740025522928776
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Compressed context is usually carried as human-readable text or as rendered images that must be decoded, even when its consumer is a language model. We introduce LatentPress, which writes conversational histories and long documents into a third representation: continuous memory tokens that a frozen decoder reads directly through its input-embedding interface, with no text reconstruction at inference. A small reader-matched writer compresses $4$-$16\times$ while training only an adapter (4.2M-26.2M parameters, $\sim\!0.1\%$ of the decoder). On LongMemEval, LatentPress reaches $0.504$ accuracy at $7.70\times$ compression versus $0.490$ for uncompressed evidence, outperforming text summaries (0.184) and OCR-based compression (0.426 to 0.312). On LongBench-QA, in-domain writers match or exceed raw-context reading at $4$-$8\times$ compression, while $16\times$ trails raw. Writing takes 43ms per conversation, roughly an order of magnitude faster than text summarization or OCR reconstruction, and reading is $5$-$9\times$ faster than raw context or cached OCR. We validate the interface under two transfer settings, zero-shot from UltraChat to LongMemEval memory QA and from LongMemEval-derived QA to unseen LongBench document domains, establishing direct soft tokens as a practical machine-facing context interface beyond text and vision. The implementation of the experiments could be found at: https://github.com/HJSang/LatentPress .
- Abstract(参考訳): 圧縮されたコンテキストは、通常、人間の読みやすいテキストとして、あるいは、そのコンシューマが言語モデルである場合でも、デコードされなければならないレンダリングされたイメージとして運ばれる。
我々はLatentPressを紹介し、会話履歴と長いドキュメントを第3の表現に書き込む: 凍結したデコーダが入力埋め込みインターフェースを通じて直接読み込む連続メモリトークン。
小さい読み手のライターは、アダプタ(4.2M-26.2Mパラメータ、$\sim\!)のみをトレーニングしながら、$4-$16\times$を圧縮する。
デコーダの0.1\%$)。
LongMemEvalでは、LatentPressは7.70\times$圧縮で0.504$、非圧縮的な証拠では0.490$、テキスト要約では0.184、OCRベースの圧縮では0.426〜0.312である。
LongBench-QAでは、ドメイン内のライターが生のテキストの読み込みを4-$8\times$圧縮でマッチまたは超過します。
書き込みは1会話あたり43ミリ秒で、テキストの要約やOCR再構成よりも桁違いに高速で、読み出しは生のコンテキストやキャッシュされたOCRよりも5-$9\times$速い。
我々は,UltraChatからLongMemEvalメモリQAへのゼロショット,LongMemEval由来のQAから未確認のLongBenchドキュメントドメインへのインターフェースを検証し,テキストやビジョンを超えた実用的なマシン対応コンテキストインターフェースとして,直接ソフトトークンを確立する。
実験の実装は、https://github.com/HJSang/LatentPress で確認できます。
関連論文リスト
- VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference [53.883871460875234]
VoxZipは、セマンティックアンコールされたKVキャッシュ圧縮フレームワークである。
第1段階では、音声トークンを時間的に調整、圧縮、融合するために明示的なセマンティックアンカーとして自動音声認識(ASR)文字を使用する。
第2段階では、時間的に減衰した蓄積された注意に基づいて動的フィルタリング戦略を採用し、非定常トークンを除去する。
論文 参考訳(メタデータ) (2026-08-09T08:17:18Z) - AdaCodec: A Predictive Visual Code for Video MLLMs [66.30108093864139]
我々は,このインターフェースを音声予測ビジュアルコードと呼び,ビデオMLLMを textbfAdaCodec としてインスタンス化する。
AdaCodecは、条件付き予測コストが高い場合にのみ、参照フレームに完全なビジュアルトークンを使用する。
これは、動きや予測残差を含むフレーム間の変化をコンパクトなPトークンとしてエンコードする。
論文 参考訳(メタデータ) (2026-06-01T17:56:35Z) - Copy-as-Decode: Grammar-Constrained Parallel Prefill for LLM Editing [2.6382975801439836]
LLMは、入力中にほとんどのトークンが冗長に見える場合でも、全出力を自動回帰的に再生することでテキストとコードを編集する。
Copy-as-Decodeは、2プリミティブ文法上の構造化復号化として生成を再キャストする復号化機構である。
論文 参考訳(メタデータ) (2026-04-20T12:29:53Z) - UIPress: Bringing Optical Token Compression to UI-to-Code Generation [2.462537008029033]
UI-to-Code生成のための軽量な学習圧縮モジュールを提案する。
UIPressは、奥行き分離可能な畳み込み、要素誘導空間再重み付け、トランスフォーマーの改良を組み合わせて、ビジュアルトークンを256の固定予算に圧縮する。
我々の知る限りでは、UI-to-Codeタスクのための最初のエンコーダ側の学習圧縮メソッドである。
論文 参考訳(メタデータ) (2026-04-10T15:58:31Z) - OneLatent: Single-Token Compression for Visual Latent Reasoning [12.825780556445892]
我々は、レンダリングされたCoT画像とDeepSeek-OCR隠蔽状態の監督を通じて、中間推論を単一の潜在トークンに圧縮するフレームワークであるtextbfOneLatentを提案する。
ベンチマーク全体では、OneLatentはテキストCoTと比較して平均出力長を21時間で削減し、平均精度は2.21%しか低下しない。
長鎖論理推論では、OneLatentはProntoQAで99.80%、ProsQAで9.80%、遅延トークンで8.7.4times$に達する。
論文 参考訳(メタデータ) (2026-02-14T12:03:28Z) - Context Cascade Compression: Exploring the Upper Limits of Text Compression [3.013064618174921]
テキスト圧縮の上限を探索するためにContext Cascade Compression C3を導入する。
圧縮率20倍では,DeepSeek-OCRの約60%と比較して98%の復号精度が得られた。
これは、文脈圧縮の領域において、C3圧縮は光学的文字圧縮よりも優れた性能と実現可能性を示すことを示している。
論文 参考訳(メタデータ) (2025-11-19T09:02:56Z) - Glyph: Scaling Context Windows via Visual-Text Compression [91.20717058018745]
Glyphは、長いテキストを画像にレンダリングし、視覚言語モデルで処理するフレームワークである。
提案手法は,従来の長文モデルに匹敵する精度を維持しつつ,3~4倍のトークン圧縮を実現する。
極端な圧縮では、128KテキストのVLMが1Mレベルのテキストタスクにスケールできる。
論文 参考訳(メタデータ) (2025-10-20T17:58:56Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。