論文の概要: SHARe-KAN: Holographic Vector Quantization for Memory-Bound Inference
- arxiv url: http://arxiv.org/abs/2512.15742v1
- Date: Wed, 10 Dec 2025 04:10:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-12-19 18:10:31.642831
- Title: SHARe-KAN: Holographic Vector Quantization for Memory-Bound Inference
- Title(参考訳): SHARe-KAN:メモリ境界推論のためのホログラフィックベクトル量子化
- Abstract要約: ビジョン・カンはホログラフィック・トポロジーを示しており、情報は特定のエッジに局所化されるのではなく、スプラインの干渉によって分散される。
本稿では,ゲイン形状バイアスベクトル量子化を利用した高密度トポロジーを保ちながら機能的冗長性を利用するフレームワークであるSHARe-KANを提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Kolmogorov-Arnold Networks (KANs) face a fundamental memory wall: their learned basis functions create parameter counts that impose extreme bandwidth demands, hindering deployment in memory-constrained environments. We show that Vision KANs exhibit a holographic topology, where information is distributed across the interference of splines rather than localized to specific edges. Consequently, traditional pruning fails (10% sparsity degrades mAP from 85.23% to 45%, a $\sim$40-point drop). To address this, we present SHARe-KAN, a framework utilizing Gain-Shape-Bias Vector Quantization to exploit functional redundancy while preserving the dense topology. Coupled with LUTHAM, a hardware-aware compiler with static memory planning, we achieve $88\times$ runtime memory reduction (1.13 GB $\to$ 12.91 MB) and match uncompressed baseline accuracy on PASCAL VOC. Profiling on NVIDIA Ampere architecture confirms $>90\%$ L2 cache residency, demonstrating that the workload is decoupled from DRAM bandwidth constraints inherent to spline-based architectures.
- Abstract(参考訳): Kolmogorov-Arnold Networks (KAN) は基本的なメモリウォールに直面している。
ビジョン・カンはホログラフィック・トポロジを示し、情報を特定のエッジに局所化するのではなく、スプラインの干渉に分散させる。
その結果、伝統的なプルーニングは失敗する(10%のスパシティはmAPを85.23%から45%に低下させ、$\sim$40-point drop)。
そこで我々は,高密度トポロジを保ちながら機能的冗長性を活用するために,ゲイン形状ベクトル量子化を利用したSHARe-KANを提案する。
静的メモリプランニングを備えたハードウェア対応コンパイラLUTHAMと組み合わせて,ランタイムメモリの削減 (1.13 GB $\to$ 12.91 MB) を実現し,PASCAL VOCの非圧縮ベースライン精度にマッチする。
NVIDIA Ampereアーキテクチャのプロファイリングでは、90\%$ L2キャッシュ常駐が確認されており、ワークロードがスプラインベースのアーキテクチャ固有のDRAM帯域制限から切り離されていることを実証している。
関連論文リスト
- Budget-Aware Compression Pipeline for Single-GPU LLM Inference: Methods, Trade-offs, and Coupling Effects [16.273825996642703]
我々は,現実的な実行下でのプルーニング,量子化,KV-cache圧縮の相互作用を示す。
我々は実用的なパイプラインを構築し、70Bモデルを約33GBに圧縮し、10kトークンプロンプトで約57トークン/秒を持続し、共通および推論ベンチマークで5%以内の絶対精度を維持した。
論文 参考訳(メタデータ) (2026-08-30T22:54:40Z) - Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption [37.96485836820005]
インスタンス比パラメトリック吸収(ISPA)は、KVキャッシュ圧縮を廃棄から蒸留に移行する新しいフレームワークである。
また,ISPAはKVキャッシュの最大50%を視覚的品質で除去できることを示した。
論文 参考訳(メタデータ) (2026-07-01T09:59:28Z) - FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention [77.12062766962815]
Lookahead Sparse Attention (LSA)は、DeepSeek-V4アーキテクチャ上に構築されたNeural Memory Indexerを利用している。
このアーキテクチャをバックボーンフリーの非結合なトレーニング戦略でインスタンス化する。
FM-DS-V4は、物理KVキャッシュのフットプリントを、フルコンテキストベースラインのわずか13.5%まで圧縮することを示した。
論文 参考訳(メタデータ) (2026-06-08T06:25:54Z) - A Survey of Spatial Memory Representations for Efficient Robot Navigation [4.560386676154887]
52のシステムにまたがる88の参照の空間記憶効率の問題を調査した。
M_textpeak / M_textmap$は、ピーク時メモリ(操作中に消費される全RAMまたはGPUメモリ)と保存されたマップサイズとの比率である。
論文 参考訳(メタデータ) (2026-04-13T02:12:17Z) - Memory-Efficient Structured Backpropagation for On-Device LLM Fine-Tuning [10.913120072779193]
デバイス上での微調整により、大きな言語モデルのプライバシ保護によるパーソナライズが可能になる。
モバイルデバイスは、すべてのワークロード間で共有される6~12GBの厳しいメモリ制約を課す。
メモリ効率のよい構造化バックプロパゲーション(MeSP)を提案する。
MeSPはピークメモリを361MBから136MBのQwen2.5-0.5Bに減らし、これまで不可能だった微調整シナリオを実現する。
論文 参考訳(メタデータ) (2026-02-13T16:24:33Z) - CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving [5.216774377033164]
大規模言語モデル(LLM)は自然言語処理タスクに革命をもたらした。
LLMはキー値(KV)キャッシュの大規模なメモリ要求のため、課題に直面している。
我々は,新しい分散KV-cacheアーキテクチャである textbfCXL-SpecKV を提案する。
論文 参考訳(メタデータ) (2025-12-11T15:40:36Z) - Accelerating LLM Inference via Dynamic KV Cache Placement in Heterogeneous Memory System [20.652641518700346]
大規模言語モデル(LLM)推論は、メモリ帯域幅によってますます制限される。
現代のAIハードウェアは、高速オフパッケージDRAMと高速帯域メモリ(HBM)を統合している。
本研究は,キャパシティ制約下での集積帯域利用を最大化するために,そのようなシステムにまたがる動的KVキャッシュ配置について検討する。
論文 参考訳(メタデータ) (2025-08-17T19:07:08Z) - XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization [58.92253769255316]
LLM推論はメモリフットプリントと帯域幅の要求のために困難である。
XQuantは、ハードウェアプラットフォームの急速に増加する計算能力を利用して、メモリボトルネックを取り除く。
XQuant-CLは、極端な圧縮のためにX埋め込みの層間類似性を利用する。
論文 参考訳(メタデータ) (2025-08-14T06:52:38Z) - HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading [79.38548165722229]
HEADINFERはKVキャッシュをCPURAMにオフロードするが、GPU上のトランスフォーマー層のKVキャッシュを完全に保存する必要はない。
HEADINFERはメモリフットプリントを大幅に削減し,計算効率を向上することを示した。
論文 参考訳(メタデータ) (2025-02-18T06:26:05Z) - Memory Layers at Scale [67.00854080570979]
この研究はメモリ層を概念実証以上のものにし、現代の規模でその有用性を証明している。
ダウンストリームタスクでは、改善されたメモリ層で強化された言語モデルは、予算の2倍以上の高密度モデルよりも優れており、計算とパラメータの両方にマッチする場合の熟練モデルの混合も優れている。
最大128Bのメモリパラメータを持つスケーリング法則を1兆トークンまで事前訓練し,最大8Bパラメータを持つベースモデルと比較した,完全な並列化可能なメモリレイヤの実装を提供する。
論文 参考訳(メタデータ) (2024-12-12T23:56:57Z) - ThinK: Thinner Key Cache by Query-Driven Pruning [63.13363917871414]
大規模言語モデル(LLM)は自然言語処理の分野に革命をもたらし、様々なアプリケーションで前例のない性能を達成した。
本稿では,KVキャッシュのメモリ消費の非効率性に対処する長文シナリオに焦点を当てた。
我々は,最小のチャネルを選択的に切断しながら,注目重量損失を最小限に抑える新しいクエリ依存型KVキャッシュプルーニング手法であるThinKを提案する。
論文 参考訳(メタデータ) (2024-07-30T17:59:08Z) - Topology-aware Embedding Memory for Continual Learning on Expanding Networks [63.35819388164267]
本稿では,メモリリプレイ技術を用いて,メモリ爆発問題に対処する枠組みを提案する。
Topology-aware Embedding Memory (TEM) を用いたPDGNNは最先端技術よりも優れている。
論文 参考訳(メタデータ) (2024-01-24T03:03:17Z) - GEMEL: Model Merging for Memory-Efficient, Real-Time Video Analytics at
the Edge [10.276140547573437]
エッジビジョンモデル間のアーキテクチャ的類似性を利用した新しいメモリ管理手法であるモデルマージを提案する。
多様なワークロードに対する実験により、GEMELはメモリ使用量を最大60.7%削減し、時間/空間の共有のみと比較して、全体的な精度を8~39%向上することが明らかになった。
論文 参考訳(メタデータ) (2022-01-19T16:45:04Z) - MCUNetV2: Memory-Efficient Patch-based Inference for Tiny Deep Learning [72.80896338009579]
メモリボトルネックは畳み込みニューラルネットワーク(CNN)の設計における不均衡なメモリ分布に起因する。
本稿では,ピークメモリを大幅に削減するパッチ・バイ・パッチ・推論スケジューリングを提案する。
ニューラルアーキテクチャサーチによるプロセスを自動化し、ニューラルアーキテクチャと推論スケジューリングを共同で最適化し、MCUNetV2に導いた。
論文 参考訳(メタデータ) (2021-10-28T17:58:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。