論文の概要: When Is 0.1% Enough? Analyzing the Combined Effects of Dimensionality Reduction and Quantization on Text Embedding Compression
- arxiv url: http://arxiv.org/abs/2606.01074v1
- Date: Sun, 31 May 2026 07:37:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:29.192607
- Title: When Is 0.1% Enough? Analyzing the Combined Effects of Dimensionality Reduction and Quantization on Text Embedding Compression
- Title(参考訳): 0.1%が十分であるのはいつか? テキスト埋め込み圧縮における次元減少と量子化の複合効果の分析
- Authors: Riku Kisako, Hayato Tsukagoshi, Ryohei Sasano,
- Abstract要約: 次元の縮小と量子化を組み合わせることで、どちらの方法よりもはるかに強い圧縮が可能になることを示す。
一部の設定では、組み込みはパフォーマンスのほとんど低下することなく、元のサイズの0.1%まで小さくすることができる。
- 参考スコア(独自算出の注目度): 14.629620306591214
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent high-performing text embedding models often output high-dimensional real-valued vectors, resulting in substantial storage and computational costs. To address this issue, compression methods based on dimensionality reduction or quantization have been proposed; however, the effects of combining dimensionality reduction and quantization have not been sufficiently investigated. In this paper, we systematically examine the effectiveness of compressing text embeddings by combining dimensionality reduction and quantization, using four MTEB task families and four pretrained embedding models. The experimental results demonstrate that combining dimensionality reduction and quantization enables substantially stronger compression than using either method alone, that in some settings embeddings can be reduced to as little as 0.1% of their original size with almost no performance degradation, and that the optimal compression strategy depends on the task.
- Abstract(参考訳): 最近の高性能テキスト埋め込みモデルは、しばしば高次元の実数値ベクトルを出力し、かなりの記憶と計算コストをもたらす。
この問題に対処するため,次元の縮小や量子化に基づく圧縮手法が提案されているが,次元の縮小と量子化の併用効果は十分に研究されていない。
本稿では,4つのMTEBタスクファミリと4つの事前学習された埋め込みモデルを用いて,次元削減と量子化を組み合わせたテキスト埋め込みの有効性を体系的に検討する。
実験結果から, 寸法の低減と量子化を併用することで, いずれの手法よりもはるかに強い圧縮が可能であり, 性能劣化をほとんど起こさず, 元のサイズの0.1%に抑えることが可能であり, 最適圧縮戦略はタスクに依存することがわかった。
関連論文リスト
- Arbitrary Ratio Feature Compression via Next Token Prediction [52.10426317889982]
Arbitrary Ratio Feature Compression (ARFC)フレームワークは、任意の圧縮比を単一のモデルでサポートする。
ARCは、次の回帰予測によって圧縮を行う自動回帰モデルである。
MoSモジュールは複数の圧縮結果を利用して圧縮トークンを洗練する。
ERGCは、圧縮中の意味的および構造的関係を維持するために、トレーニングプロセスに統合される。
論文 参考訳(メタデータ) (2026-02-12T02:38:57Z) - A Systematic Study of Compression Ordering for Large Language Models [0.5926203312586109]
本研究では,Qwen2.5 3Bモデルに適用した場合の知識蒸留,構造化プルーニング,低ビット量子化の方法について系統的に検討する。
実験により、量子化は最大のスタンドアロン圧縮を提供する一方で、プルーニングは適度な品質劣化をもたらすことが示された。
論文 参考訳(メタデータ) (2025-11-23T12:46:56Z) - Integrating Pruning with Quantization for Efficient Deep Neural Networks Compression [0.0]
プルーニングと量子化は、モデルのサイズを減らし、処理速度を向上させるために広く使われている圧縮技術である。
本稿では,類似性に基づくフィルタプルーニングとアダプティブ・パワー・オブ・ツー(APoT)量子化を統合し,高い圧縮効率を実現する2つの手法を提案する。
実験により,提案手法は精度の低下を最小限に抑え,効率的なモデル圧縮を実現することを示す。
論文 参考訳(メタデータ) (2025-09-04T14:17:28Z) - Compression Scaling Laws:Unifying Sparsity and Quantization [65.05818215339498]
プレトレーニング中の大規模言語モデル(LLM)のスケーリング挙動に異なる圧縮手法がどう影響するかを検討する。
重みのみの量子化は強力なパラメータ効率乗算器を実現する一方で、重みとアクティベーションの完全な量子化は低ビット幅でのリターンの低下を示す。
以上の結果から,異なる圧縮手法を共通のスケーリング法枠組みの下で統一できることが示唆された。
論文 参考訳(メタデータ) (2025-02-23T04:47:36Z) - Choose Your Model Size: Any Compression of Large Language Models Without Re-Computation [10.376875638696504]
本研究は, 圧縮性能トレードオフを決定するアルゴリズム手法であるACIP (Any Compression via Iterative Pruning) を提案する。
線形層をSVDで再パラメータ化し,その特異値をスペーサ性誘導ペナルティで反復的にプルーする。
本稿では,ACIPが共通量子化に基づく圧縮手法をシームレスに補完することを示す。
論文 参考訳(メタデータ) (2025-02-03T18:40:58Z) - An Enhanced Text Compression Approach Using Transformer-based Language Models [1.2937020918620652]
テキスト圧縮のための変換器ベースのRejuvenateFormeを提案する。
我々の精巧な前処理技術はLe-Ziv-Welchアルゴリズムを取り入れている。
RejuvenateFormeは、EN-DE、EN-FR、BookCorpus corporaのBLEUスコアが27.31、25.78、50.45に達した。
論文 参考訳(メタデータ) (2024-12-15T03:01:17Z) - Edge AI: Evaluation of Model Compression Techniques for Convolutional Neural Networks [0.0]
本研究は,CIFAR-10データセットを用いた画像分類タスクにおけるConvNeXtモデルの圧縮手法を評価する。
その結果, モデルサイズが有意に減少し, 構造化プルーニング技術により最大75%の削減が達成された。
動的量子化はパラメータ数の最大95%の削減を達成する。
論文 参考訳(メタデータ) (2024-09-02T11:48:19Z) - Compression of Generative Pre-trained Language Models via Quantization [62.80110048377957]
従来の量子化手法は, テクスモジニアス単語の埋め込みによって生成タスクに失敗することがわかった。
本稿では,区別可能な単語埋め込みを学習するためのトークンレベルのコントラスト蒸留法と,異なるモジュールに対して量子化器を適応させるモジュールワイドダイナミックスケーリングを提案する。
論文 参考訳(メタデータ) (2022-03-21T02:11:35Z) - Compact representations of convolutional neural networks via weight
pruning and quantization [63.417651529192014]
本稿では、音源符号化に基づく畳み込みニューラルネットワーク(CNN)の新しいストレージフォーマットを提案し、重み付けと量子化の両方を活用する。
我々は、全接続層で0.6%、ネットワーク全体で5.44%のスペース占有率を削減し、最低でもベースラインと同じくらいの競争力を発揮する。
論文 参考訳(メタデータ) (2021-08-28T20:39:54Z) - Towards Compact CNNs via Collaborative Compression [166.86915086497433]
チャネルプルーニングとテンソル分解を結合してCNNモデルを圧縮する協調圧縮方式を提案する。
52.9%のFLOPを削減し、ResNet-50で48.4%のパラメータを削除しました。
論文 参考訳(メタデータ) (2021-05-24T12:07:38Z) - Analyzing and Mitigating JPEG Compression Defects in Deep Learning [69.04777875711646]
本稿では,JPEG圧縮が共通タスクやデータセットに与える影響を統一的に検討する。
高圧縮の一般的なパフォーマンス指標には大きなペナルティがあることが示される。
論文 参考訳(メタデータ) (2020-11-17T20:32:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。