論文の概要: The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP
- arxiv url: http://arxiv.org/abs/2605.26415v1
- Date: Tue, 26 May 2026 00:45:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:41.516913
- Title: The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP
- Title(参考訳): 救済効果:CLIPの量子化崩壊を経た時空間的早期退避
- Authors: Kahyeon Nam, Hyesong Choi,
- Abstract要約: CLIPのような共同埋め込みアーキテクチャでは、量子化されたCNN分類器とは異なる障害モードが導入されている。
我々はこれをQIRC(Quantization-induced Representation Collapse)と呼び、CLIP ViT-B/32を置き換えるINT8上で定量化する。
雑音飽和層をバイパスするLRA-EE(Layer-wise Representation-Aware Early Exit)を提案する。
ImageNet-1K ゼロショット分類では、LRA-EE は FLOP を 13.4% 削減し、Top-1 の精度を +2.44%p (58.72% -> 61.16%) 向上させる。
- 参考スコア(独自算出の注目度): 6.450516062706025
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying Vision-Language Models on resource-constrained hardware typically requires INT8 quantization, but in joint-embedding architectures such as CLIP this introduces a failure mode distinct from quantized CNN classifiers: activation noise accumulated across transformer blocks perturbs the direction of the multimodal embedding, eroding the cosine alignment on which zero-shot retrieval depends. We characterize this as Quantization-Induced Representation Collapse (QIRC) and quantify it on INT8 CLIP ViT-B/32, where the layer-wise noise-to-signal ratio grows from below 10% in shallow blocks to 52% at Layer 11. We propose LRA-EE (Layer-wise Representation-Aware Early Exit), which bypasses noise-saturated deep layers via Spatio-Semantic Aggregation (replacing the immature shallow [CLS] with a global patch-token average), a learned multi-feature gate (confidence, top-2 margin, spatial-activation variance), and Layer-adaptive Confidence Thresholding calibrated to each layer's Information-to-Noise Ratio. On ImageNet-1K zero-shot classification, LRA-EE reduces FLOPs by 13.4% and improves Top-1 accuracy by +2.44%p (58.72% -> 61.16%) over the INT8 baseline. A four-quadrant decomposition isolates the Rescue Effect: 9.5% of samples are correctly classified at shallow exits but lost to noise at full depth, against only 7.1% suffering the inverse.
- Abstract(参考訳): リソース制約のあるハードウェアにビジョンランゲージモデルを配置するには、一般的にINT8量子化を必要とするが、CLIPのような共同埋め込みアーキテクチャでは、量子化されたCNN分類器とは異なる障害モードが導入されている。
我々はこれをQIRC(quantization-induced Representation Collapse)と呼び、INT8 CLIP ViT-B/32で定量化する。
本研究では,LRA-EE (Layer-wise Representation-Aware Early Exit) を提案する。これは,Spaatio-Semantic Aggregation (未熟な浅層(CLS)を大域パッチトケン平均で置き換える),学習された多機能ゲート(信頼度,トップ2マージン,空間アクティベーション分散),および各レイヤのインフォメーション・ツー・ノイズ比に校正された層適応信頼度閾値(Layer-Adaptive Confidence Thresholding)を通じて,雑音飽和層をバイパスする。
ImageNet-1K ゼロショット分類では、LRA-EE は FLOP を 13.4% 削減し、トップ1 の精度を +2.44%p (58.72% -> 61.16%) 改善している。
サンプルの9.5%は浅い出口で正しく分類されるが、完全な深さでノイズによって失われ、逆流に苦しむのはわずか7.1%である。
関連論文リスト
- Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals [83.0127582612634]
Near-boundary Rescue (NSR) は最小限のプラグ・アンド・プレイの修正であり、失った信号を回復するために、アウト・オブ・バウンドトークンを保持する。
NSRはトレーニングの安定性を大幅に改善し、DAPOやGSPOといった強力なベースライン上で一貫したゲインを提供する。
論文 参考訳(メタデータ) (2026-05-21T16:45:31Z) - Attention Sinks and Outliers in Attention Residuals [39.45624457227565]
層間ヌルシグナリングに基づく外部・シンク対応手法を提案する。
AttnResidualアーキテクチャは、追加の深さワイド正規化チャネルを導入している。
AttnResidualの二重正規化設計はシンクの形成と量子化の脆さを高める。
論文 参考訳(メタデータ) (2026-05-18T05:53:09Z) - Layer Collapse in Diffusion Language Models [54.880703002010144]
拡散言語モデル (DLM) は自己回帰言語モデル (AR) の代替として登場した。
DLMの層崩壊は, 過度なトレーニングによるものではなく, 過度なトレーニングによるものであることを示す。
私たちの発見は、非常に実践的な意味を持っている。
論文 参考訳(メタデータ) (2026-05-07T14:39:40Z) - Normalized Architectures are Natively 4-Bit [49.13186675123547]
重みと隠れ表現を単位超球面に制限するアーキテクチャであるnGPTは、本質的に低精度算術よりも堅牢である。
本手法は,最大3B/30Bパラメータの1.2B密度モデルとハイブリッド(Mamba-Transformer)MoEモデルの両方で検証する。
論文 参考訳(メタデータ) (2026-05-07T11:54:07Z) - The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference [2.954681536906518]
KVキャッシングは自己回帰変換器推論におけるユビキタス最適化である。
FP16 KVキャッシュ推論は基本的に再計算と等価ではないことを示す。
論文 参考訳(メタデータ) (2026-04-16T15:59:40Z) - Privacy-Aware Split Inference with Speculative Decoding for Large Language Models over Wide-Area Networks [0.0]
本稿では、信頼性のあるローカルGPUとクラウドGPUのトランスフォーマーを分割する、プライバシーに配慮した大規模言語モデル(LLM)の実用的なシステムを提案する。
我々のシステムは、高速広帯域ネットワーク(WAN)上での自己回帰LDM復号化の独特な課題に対処する。
システムは4.9GBのローカルVRAMと7Bのスループットしか持たない大型モデルに一般化される。
論文 参考訳(メタデータ) (2026-02-18T14:13:08Z) - Ultrafast Deep Learning-Based Scatter Estimation in Cone-Beam Computed Tomography [7.864992877255044]
散乱アーティファクトは、コーンビームCT(CBCT)スキャンの画質を大幅に劣化させる。
深層学習に基づく手法はCBCT測定から散乱を推定する上で有望であることを示す。
モバイルCBCTシステムやエッジデバイスへの展開は、ネットワークのメモリフットプリントが大きいため、依然として制限されている。
論文 参考訳(メタデータ) (2025-09-10T20:07:56Z) - Robust Residual Finite Scalar Quantization for Neural Compression [46.574899938569125]
有限スカラー量子化(FSQ)は、簡易なトレーニングを提供するが、多段階設定での残留等級劣化に悩まされる。
本稿では,2つの新しい条件付け手法を用いて,この基本的な制限に対処するロバスト残留有限スカラー量子化(RFSQ)を提案する。
RFSQの有効性と一般化性を示す。
論文 参考訳(メタデータ) (2025-08-20T15:18:59Z) - Sub-token ViT Embedding via Stochastic Resonance Transformers [51.12001699637727]
Vision Transformer (ViT) アーキテクチャは、画像を高次元のベクトル化トークンの集合として表現し、それぞれが長方形の非重複パッチに対応する。
我々は「確率共鳴」にインスパイアされた無訓練法を提案する。
結果として得られるSRT(Stochastic Resonance Transformer)は、元の表現のリッチな意味情報を保持するが、空間的トークン化の粗い効果を軽減し、より微細な空間領域に基盤を置いている。
論文 参考訳(メタデータ) (2023-10-06T01:53:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。