論文の概要: Superposed Latent Autoencoder
- arxiv url: http://arxiv.org/abs/2609.01158v1
- Date: Tue, 01 Sep 2026 12:35:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.646805
- Title: Superposed Latent Autoencoder
- Title(参考訳): Superposed Latent Autoencoder
- Authors: Quanling Zhao, Jiaying Yang, Tianqi Zhang, Ziyang Hao, Fatemeh Asgarinejad, Flavio Ponzina, Tajana Rosing,
- Abstract要約: オートエンコーダは通常、各潜在表現を小さくすることで、強い潜在記憶予算を満たす。
本稿では,学習された重ね合わせを通して記憶を共有しながら,高容量の潜伏表現を保存するSLAEを紹介する。
この結果から,表現圧縮の新たな原則が示唆された。全ての潜在表現を小さくする代わりに,表現を広く保ち,メモリ共有を可能にする。
- 参考スコア(独自算出の注目度): 13.14207082623262
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Autoencoders typically meet tight latent-memory budgets by making each latent representation smaller, sacrificing representational capacity. We ask a different question: can multiple wider latents be stored together instead? We introduce the Superposed Latent Autoencoder (SLAE), which preserves high-capacity latent representations while sharing storage through learned superposition. SLAE transforms latents into storage-friendly codes, binds them with randomized keys, superposes multiple codes into a single memory tensor, and learns to recover each latent before decoding. Under the same storage budget, SLAE replaces irreversible dimensional bottlenecks with structured interference that can be suppressed. Across CIFAR-10/100, SVHN, STL-10, Tiny ImageNet, and a wide range of memory budgets, SLAE substantially improves the reconstruction--memory tradeoff, reducing reconstruction error by up to 56% over conventional autoencoders at matched storage. Further analysis shows that SLAE's advantage comes from making wider representations usable under the same storage budget. These gains also extend beyond reconstruction: the information preserved by SLAE improves downstream classification by up to 16.79 percentage points under the same memory budget. Our results suggest a new principle for representation compression: instead of making every latent smaller, keep representations wide and let them share memory.
- Abstract(参考訳): オートエンコーダは、通常、各潜在表現を小さくし、表現能力を犠牲にすることで、厳密な潜在記憶予算を満たす。
複数のより広いラテントを一緒に保存できるのか?
本稿では,学習された重ね合わせを通して記憶を共有しながら,高容量の潜伏表現を保存するSLAEを紹介する。
SLAEは、ラテントをストレージフレンドリーなコードに変換し、ランダムなキーでバインドし、複数のコードを1つのメモリテンソルに重畳し、復号する前に各ラテントを復元することを学ぶ。
同じストレージ予算の下でSLAEは、非可逆的な次元ボトルネックを、抑制可能な構造化された干渉に置き換える。
CIFAR-10/100、SVHN、STL-10、Tiny ImageNet、および幅広いメモリ予算において、SLAEはリコンストラクション-メモリトレードオフを大幅に改善し、マッチしたストレージにおける従来のオートエンコーダよりも最大56%のリコンストラクションエラーを低減した。
さらに分析した結果、SLAEの利点は、同じストレージ予算でより広い表現を使用可能にすることにある。
SLAEによって保存された情報は、同じメモリ予算の下で最大16.79ポイントまで下流の分類を改善する。
この結果から,表現圧縮の新たな原則が示唆された。全ての潜在表現を小さくする代わりに,表現を広く保ち,メモリ共有を可能にする。
関連論文リスト
- Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption [37.96485836820005]
インスタンス比パラメトリック吸収(ISPA)は、KVキャッシュ圧縮を廃棄から蒸留に移行する新しいフレームワークである。
また,ISPAはKVキャッシュの最大50%を視覚的品質で除去できることを示した。
論文 参考訳(メタデータ) (2026-07-01T09:59:28Z) - Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines [4.564896252406974]
マルチモーダル大規模言語モデル (MLLM) は近年,多様な視覚的入力から応答を理解・生成する強力な能力を示した。
これらのモデルがよりリッチな視覚表現にスケールするにつれて、推論はキーバリューキャッシュに大量の視覚トークンを格納することにますます依存している。
MLLMは構造的規則性と表現的冗長性を示し、推論を通して記憶の増大を制御できることを示す。
論文 参考訳(メタデータ) (2026-04-17T22:45:57Z) - Generative Video Compression with One-Dimensional Latent Representation [59.29493435530304]
1次元(1次元)遅延表現(GVC1D)による生成ビデオ圧縮について紹介する。
GVC1Dはビデオデータを、短期と長期の両方の文脈で条件付けられた極端にコンパクトな1D潜在トークンにエンコードする。
実験結果から,GVC1Dの圧縮効率は従来の圧縮法よりも優れていた。
論文 参考訳(メタデータ) (2026-03-16T14:02:17Z) - KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning [8.216400469571084]
効率的な実施計画のためのKVキャッシュ型メモリ管理システムKEEPを提案する。
KEEPは,(1)混合粒度メモリグループによるKVキャッシュ再計算を低減する静的動的メモリ構築アルゴリズム,(2)異なるメモリグループ間の重要なクロスアテンションを動的に識別するマルチホップメモリ再計算アルゴリズム,(3)不均衡なKVキャッシュのロードと異なるレイヤ間のクロスアテンションを排除するレイヤバランスのメモリローディングという3つの重要なイノベーションを特徴としている。
論文 参考訳(メタデータ) (2026-02-27T01:48:07Z) - SSD: Spatial-Semantic Head Decoupling for Efficient Autoregressive Image Generation [5.864475030577771]
自動回帰画像生成モデルのための新しいKVキャッシュ圧縮フレームワークを提案する。
実験の結果,提案手法はメモリ使用量の5$times$削減とスループットの6.6$times$高速化を実現している。
論文 参考訳(メタデータ) (2025-10-21T15:17:37Z) - ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding [55.320254859515714]
ReTaKeは、ビデオLLMsが8倍のフレーム(最大2048年まで)を処理し、類似のモデルも3~5%縮小し、ビデオMME、MLVU、LongVideoBench、LVBenchなどと競合する。
私たちのコードはhttps://github.com/SCZwangxiao/video-ReTaKe.comで公開されています。
論文 参考訳(メタデータ) (2024-12-29T15:42:24Z) - CSR:Achieving 1 Bit Key-Value Cache via Sparse Representation [63.65323577445951]
キャッシュスパース表現(CSR)と呼ばれる新しい手法を提案する。
CSRは、密度の高いKey-Valueキャッシュテンソルをスパースインデックスとウェイトに変換し、LLM推論中によりメモリ効率のよい表現を提供する。
我々の実験は、CSRが最先端KVキャッシュ量子化アルゴリズムに匹敵する性能を達成することを示した。
論文 参考訳(メタデータ) (2024-12-16T13:01:53Z) - UNComp: Can Matrix Entropy Uncover Sparsity? -- A Compressor Design from an Uncertainty-Aware Perspective [85.08718140718707]
UNCompは不確実性を認識したフレームワークで、適応圧縮に使用できる空間パターンを明らかにする。
スパーシティパターンを詳細に分析する不確実性に注目して、UNCompはKVキャッシュサイズを4.74%に削減し、6%のプリフィルスピードアップを実現し、スループットを6.4倍改善した。
論文 参考訳(メタデータ) (2024-10-04T02:32:36Z) - Kanerva++: extending The Kanerva Machine with differentiable, locally
block allocated latent memory [75.65949969000596]
エピソディックメモリとセマンティックメモリは、人間のメモリモデルの重要なコンポーネントです。
我々は、エピソードメモリとセマンティックメモリのギャップを埋める新しい原理ベイズメモリ割り当てスキームを開発しました。
この割り当て方式がメモリ条件画像生成の性能を向上させることを実証する。
論文 参考訳(メタデータ) (2021-02-20T18:40:40Z) - CNN with large memory layers [2.368995563245609]
この作業は、最近提案された製品キーメモリ構造であるcitelarge_Memoryを中心に、多くのコンピュータビジョンアプリケーションに実装されている。
メモリ構造は、ほぼすべてのニューラルネットワークアーキテクチャに拡張されるのに適した単純な計算プリミティブと見なすことができる。
論文 参考訳(メタデータ) (2021-01-27T20:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。