論文の概要: ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation
- arxiv url: http://arxiv.org/abs/2608.23463v1
- Date: Mon, 24 Aug 2026 16:31:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:44.198125
- Title: ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation
- Title(参考訳): ProxyFormer:ウルトラロングコンテキストと高分解能生成のためのデュアルストリームプロキシアーキテクチャ
- Abstract要約: ProxyFormerはプロキシトークン上に構築された一般的なデュアルストリームアーキテクチャである。
きめ細かい局所特徴はボトムアップで小さなプロキシ状態に圧縮される。
グローバルな相互作用は圧縮されたプロキシ空間でのみ実行される。
グローバルにコンテキスト化されたプロキシは圧縮され、トップダウンでローカルストリームに注入される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The quadratic growth of attention computation and key-value (KV) cache with respect to sequence length is a central bottleneck for ultra-long-context language models and high-resolution generative models. We propose ProxyFormer, a general dual-stream architecture built upon proxy tokens. In each layer, fine-grained local features are compressed bottom-up into a small set of proxy states; expensive global interactions are performed only in the compressed proxy space; the globally contextualized proxies are then decompressed and injected top-down back into the local stream. Because the local stream persists across layers, fine-grained information that is not captured by one compression step remains accessible for later refinement, alleviating the irreversible information loss of conventional one-shot compression. We further introduce factorized multi-level compression/decompression, layer-wise dynamic compression ratios, asymmetric dual embeddings, and a proxy-only KV-cache inference scheme. On a 16GB GPU with batch size 1, a standard decoder-only model can train sequences of only about 20K tokens, whereas ProxyFormer with a compression ratio of 64 extends the trainable sequence length to about 0.7M. A model trained with a 64K window retains 92%-95% retrieval accuracy on a multi-needle retrieval task with 1,048,576 tokens, and a model trained with an 8K window exceeds 94% accuracy when extrapolated to 256K tokens. Preliminary image-generation experiments demonstrate the feasibility of ProxyFormer for both pixel-space and latent-space flow matching.
- Abstract(参考訳): 列長に対する注意計算とキー値(KV)キャッシュの二次的な成長は、超長文言語モデルや高分解能生成モデルにおいて中心的なボトルネックとなっている。
本稿ではプロキシトークン上に構築された汎用のデュアルストリームアーキテクチャであるProxyFormerを提案する。
各層において、微細な局所的特徴はボトムアップで小さなプロキシ状態に圧縮され、高価なグローバルな相互作用は圧縮されたプロキシ空間でのみ実行され、グローバルなコンテキスト化されたプロキシは圧縮され、ローカルストリームにトップダウンで注入される。
局所的なストリームは層をまたいで持続するため、1つの圧縮ステップでキャプチャされないきめ細かい情報は後続の精細化のためにアクセスでき、従来のワンショット圧縮の不可逆的な情報損失を軽減できる。
さらに、分解されたマルチレベル圧縮/非圧縮、層幅動的圧縮比、非対称な二重埋め込み、プロキシのみのKV-cache推論スキームを導入する。
バッチサイズ1の16GBGPUでは、標準的なデコーダのみのモデルで約20Kトークンのシーケンスをトレーニングできるが、64の圧縮比を持つProxyFormerはトレーニング可能なシーケンス長を約0.7Mまで拡張する。
64Kウィンドウでトレーニングされたモデルは、1,048,576トークンのマルチニードル検索タスクにおいて92%-95%の精度を維持し、8Kウィンドウでトレーニングされたモデルは256Kトークンに外挿された場合94%の精度を達成している。
予備的な画像生成実験は、画素空間と潜時空間の両方のフローマッチングにおいて、ProxyFormerが実現可能であることを示す。
関連論文リスト
- End-to-End Context Compression at Scale [81.70601323130997]
長期コンテキスト言語モデル推論は、KVキャッシュがコンテキスト長とともに増加するにつれて、メモリによってボトルネックとなる。
KVキャッシュを圧縮する最近の技術は、モデル品質を著しく低下させるか、あるいはかなりの時間を要するか、1つの長いプロンプトを圧縮するために計算する。
既存のアプローチは、精度-効率のフロンティア上のKVキャッシュ圧縮と競合しない。
論文 参考訳(メタデータ) (2026-06-08T15:43:16Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Proxy Compression for Language Modeling [58.904023114033954]
プロキシ圧縮は、圧縮された入力の効率性を維持する代替のトレーニングスキームである。
コード言語モデリングの実験では、プロキシ圧縮がトレーニング効率を大幅に向上することを示した。
モデルスケールが大きくなるにつれて、プロキシトレーニングされたモデルは最終的に一致するか、あるいは競合するトークン化アルゴリズムのアプローチになる。
論文 参考訳(メタデータ) (2026-02-04T07:36:46Z) - Compressing Many-Shots in In-Context Learning [61.231471139896506]
マルチショットプロンプトを圧縮することにより,ICL推論のメモリと計算効率を向上させる手法を提案する。
まず,既存のプロンプト圧縮手法がマルチショット圧縮には有効でないことを示す。
本稿では,レイヤワイド圧縮手法であるMemComを提案する。
論文 参考訳(メタデータ) (2025-10-17T16:57:42Z) - Residual Vector Quantization For Communication-Efficient Multi-Agent Perception [1.246150324257064]
中間特徴を圧縮しながら空間的アイデンティティを保持する学習機能であるReVQomを提案する。
ReVQomは、単純なボトルネックネットワークを介して特徴次元を圧縮するエンドツーエンドの手法である。
DAIR-V2XリアルタイムCPデータセットでは、ReVQomは30bppから1365xで273x圧縮を6bppで達成している。
論文 参考訳(メタデータ) (2025-09-25T19:30:27Z) - R1-Compress: Long Chain-of-Thought Compression via Chunk Compression and Search [61.4807238517108]
CoT(Chain-of-Thought)推論は、ステップバイステップの問題解決を可能にすることで、大きな言語モデル(LLM)を強化する。
CoTのLong-CoTへの拡張はトークン長の増加による計算オーバーヘッドを大幅に増加させる。
ローカル情報とコヒーレンスの両方を保存する2段階のチャンクレベル圧縮フレームワークであるR1-Compressを提案する。
論文 参考訳(メタデータ) (2025-05-22T16:06:59Z) - LLMLingua-2: Data Distillation for Efficient and Faithful Task-Agnostic Prompt Compression [43.048684907893104]
本稿では, タスク非依存のプロンプト圧縮に着目し, 一般化性と効率性の向上を図る。
我々は,プロンプト圧縮をトークン分類問題として定式化し,圧縮されたプロンプトが元のプロンプトに忠実であることを保証する。
提案手法は, XLM-RoBERTa-large や mBERT などの小型モデルを用いて圧縮目標を明示的に学習することにより,低レイテンシを実現する。
論文 参考訳(メタデータ) (2024-03-19T17:59:56Z) - Towards Compact CNNs via Collaborative Compression [166.86915086497433]
チャネルプルーニングとテンソル分解を結合してCNNモデルを圧縮する協調圧縮方式を提案する。
52.9%のFLOPを削減し、ResNet-50で48.4%のパラメータを削除しました。
論文 参考訳(メタデータ) (2021-05-24T12:07:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。