論文の概要: CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection
- arxiv url: http://arxiv.org/abs/2606.28516v1
- Date: Fri, 26 Jun 2026 18:12:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.58876
- Title: CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection
- Title(参考訳): CLEAR-MoE:キャリブレーション駆動層選択による凍結型視覚変換器からの共有バシスエキスパート抽出
- Abstract要約: CLEAR-MoEは、凍結した事前訓練されたビジョントランスフォーマー(ViT)をバックボーン重みを更新することなく、スパースミクチャー・オブ・エクササイズ(MoE)モデルに変換するポストトレーニングパイプラインである。
GTX 960では、ルーティングと散乱計のオーバーヘッドにより、CLEAR-MoE FFN 1.3-1.7xは高密度ルータよりも遅い。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: We present CLEAR-MoE, a four-phase post-training pipeline that converts a frozen pretrained Vision Transformer (ViT) into a sparse Mixture-of-Experts (MoE) model without updating backbone weights. The pipeline (i) scores feed-forward network (FFN) layers by sparsity, clusterability, and output sensitivity; (ii) decomposes selected layers into a shared low-rank SVD basis and per-cluster residual experts using k-means clustering; (iii) trains lightweight routers supervised by cluster labels; and (iv) dispatches tokens through pluggable CUDA backends. On Imagenette with DeiT-Small, CLEAR-MoE retains 99.9% of the dense model's accuracy (86.70 +/- 0.02% versus 86.73%). Extensive ablation studies reveal a consistent empirical finding: the shared SVD basis is the primary factor responsible for preserving accuracy. Random routing, learned routing, and three different router architectures produce nearly identical performance, with accuracy varying by at most 0.06 percentage points (86.62%-86.68%). Accuracy also remains stable across different SVD ranks, expert counts (2-8), calibration set sizes (50-500), and random seeds. This behavior generalizes across five ViT backbones (DeiT-Tiny, DeiT-Small, DeiT-Base, ViT-Small, and ViT-Base), covering models from 5.7M to 86.6M parameters, with accuracy differences <= 0.10 percentage points from their dense counterparts. On a GTX 960 GPU, routing and scatter-gather overhead make the CLEAR-MoE FFN 1.3-1.7x slower than the dense implementation. A dispatch microbenchmark further shows that routing is an order of magnitude more memory-bound than expert matrix multiplications, identifying fused dispatch kernels as a promising direction for future optimization.
- Abstract(参考訳): 背骨重みを更新することなく、凍結事前訓練された視覚変換器(ViT)をスパースミクチャー・オブ・エクササイズ(MoE)モデルに変換する4相後トレーニングパイプラインであるCLEAR-MoEを提案する。
パイプライン
i) フィードフォワードネットワーク(FFN)層をスパーシリティ、クラスタビリティ、出力感度でスコアする。
(ii)k平均クラスタリングを用いて、選択した層を共有低ランクSVDベースとクラスタごとの残留専門家に分解する。
三 クラスタラベルで管理する軽量ルーターの列車
(iv) プラグイン可能なCUDAバックエンドを通じてトークンをディスパッチする。
DeiT-SmallのImagenetteでは、CLEAR-MoEは高密度モデルの精度の99.9%を維持している(86.70 +/- 0.02%対86.73%)。
大規模なアブレーション研究により、一貫した経験的発見が明らかとなった:共有SVDベースが正確性を維持するための主要な要因である。
ランダムルーティング、学習ルーティング、および3つの異なるルータアーキテクチャは、ほぼ同じ性能を示し、精度は0.06ポイント(86.62%-86.68%)である。
SVDの様々なランク、専門家数(2-8)、キャリブレーションセットサイズ(50-500)、ランダムシードなど、精度も安定している。
この挙動は5つのViTバックボーン(DeiT-Tiny、DeiT-Small、DeiT-Base、ViT-Small、ViT-Base)を一般化し、5.7Mから86.6Mパラメータのモデルをカバーする。
GTX 960 GPUでは、ルーティングと散乱器のオーバーヘッドにより、CLEAR-MoE FFN 1.3-1.7xは高密度実装よりも遅い。
ディスパッチマイクロベンチマークは、ルーティングがエキスパート行列の乗算よりも桁違いにメモリバウンドであることを示し、融合されたディスパッチカーネルを将来の最適化の有望な方向として特定する。
関連論文リスト
- WaVeFuse: Regime-Adaptive Equity Index Forecasting via Channel-Wise Wavelet Denoising and Vertical Attention Fusion [0.0]
WaVeFuseは、エクイティ予測フレームワークのためのハイブリッドなDeep Learningである。
技術指標(TI)の伝搬、チャネル非識別分解、静的マルチブランチ融合に対処する。
WaVeFuseは、研究と意思決定支援のデプロイメントに適した、計算効率のよい、レシシロバストなフレームワークを提供する。
論文 参考訳(メタデータ) (2026-09-13T18:50:33Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - LDAC-Net: A Learnable Multi-Lag Differencing Attention-Convolution Network for Drift-Robust Recognition with Low-Cost MOX Gas Sensors [6.156377010595533]
安価な金属酸化物(MOX)ガスセンサをベースとしたポータブル電子ノイズシステムは、ガスと臭気の認識に実用的なソリューションを提供する。
既存のパイプラインは通常、固定された一階時間差分(FOTD)を使用する。
LDAC-Netは,マルチチャネルMOX信号で直接動作する,注目畳み込みネットワークとは違い,エンドツーエンドで学習可能なマルチラグである。
論文 参考訳(メタデータ) (2026-08-26T11:20:27Z) - How Much Capacity Does EEG Denoising Need? Ultra-Compact Networks reveal Benchmark Saturation and Metric-Utility Gap [0.0]
深層学習EEG(Deep Learning EEG Denoising Architectures)は、数万から数千万のパラメータに拡張されているが、実験変数としてモデルキャパシティを分離した以前の研究はない。
アーキテクチャ,損失,データ分割,トレーニングレシピの両ギャップに対処し,最小限の深さ分離可能な畳み込みU-Netで1.05Kから40.26Kパラメータまでのチャネル幅を網羅する。
論文 参考訳(メタデータ) (2026-06-07T12:17:25Z) - CART: Context-Anchored Recurrent Transformer -- A Parameter-Efficient Architecture with Learned Stability [0.0]
CART(Context-Anchored Recurrent Transformer)は、パラメータ効率のよい言語モデルで、1つの共有コアブロックをR倍の深さで再利用する。
我々は1つのコンシューマGPU上でCARTを2段階に分けて評価した: 64-configuration screen at 3,000 steps, then 36 configurations (P=6, R in 6,8,10, three seed) training for 30500 steps (1B tokens)。
256,512,768,1024: 事前深さPはループ数Rを支配し、Rのステージ1ランクはフルトレーニング時に逆になる(R=6は最高になる)。
論文 参考訳(メタデータ) (2026-05-31T23:26:27Z) - Slimmable ConvNeXt: Width-Adaptive Inference for Efficient Multi-Device Deployment [4.976815699476327]
我々は、Slimmable ConvNeXtを紹介し、ConvNeXtの現代的な設計、特にLayerNormと逆ボトルネックは、チャネル幅のスリム化に特に適していることを示している。
ImageNet-1kでは、Slimmable ConvNeXt-T with 3worksは、4.5 GMACsで80.8%、1.2 GMACsで77.4%、スクラッチから600 epochsでトレーニングされた。
論文 参考訳(メタデータ) (2026-05-21T16:20:18Z) - RD-ViT: Recurrent-Depth Vision Transformer for Semantic Segmentation with Reduced Data Dependence Extending the Recurrent-Depth Transformer Architecture to Dense Prediction [2.8222472653971917]
ViT(Vision Transformer)は最先端のセグメンテーション精度を実現するが、大規模なトレーニングデータセットを必要とする。
本稿では,Recurrent-Depth Vision Transformerアーキテクチャを高密度予測タスクに適用したRD-ViTを提案する。
RD-ViTは、ユニークなトランスフォーマーブロックの深いスタックを単一の共有ブロックループT倍に置き換え、LTI安定状態注入で拡張してコンバージェンスを保証する。
論文 参考訳(メタデータ) (2026-05-05T17:21:18Z) - BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design [71.97035034203275]
バイナライゼーションにおけるゼロ点歪みを解析し,BWTA量子化方式を提案する。
本稿では,Smooth Multi-Stage Quantizationを提案し,レベルワイド・デグラデーション・ストラテジーとMagnitude Alignment Projection Factorを組み合わせた。
実験の結果、BWTAはTransformerベースのモデルに対して、GLUEでは平均3.5%、タスクでは2%未満の精度でフル精度のパフォーマンスにアプローチしていることがわかった。
論文 参考訳(メタデータ) (2026-04-05T04:25:07Z) - Structure-Informed Estimation for Pilot-Limited MIMO Channels via Tensor Decomposition [51.56484100374058]
本稿では、スパース観測から低ランクテンソル完備化としてパイロットリミテッドチャネル推定を定式化する。
合成チャネル実験による最小二乗平均二乗誤差(NMSE)の最小二乗平均誤差(LS)に対する改善
DeepMIMO線トレーシングチャネルの評価では、純粋なテンソル法よりも24-44%NMSEが減少している。
論文 参考訳(メタデータ) (2026-02-03T23:38:05Z) - SDPose: Tokenized Pose Estimation via Circulation-Guide Self-Distillation [53.675725490807615]
SDPoseは小型変圧器モデルの性能向上のための新しい自己蒸留法である。
SDPose-Tは4.4Mパラメータと1.8 GFLOPを持つ69.7%のmAPを取得し、SDPose-S-V2はMSCOCO検証データセット上で73.5%のmAPを取得する。
論文 参考訳(メタデータ) (2024-04-04T15:23:14Z) - MixFormerV2: Efficient Fully Transformer Tracking [49.07428299165031]
トランスフォーマーベースのトラッカーは標準ベンチマークで高い精度を実現している。
しかし、その効率性は、GPUとCPUプラットフォームの両方での実践的なデプロイの障害であり続けている。
本稿では,EmphMixFormerV2と呼ばれるフルトランスフォーマートラッキングフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-25T09:50:54Z) - Global Context Vision Transformers [78.5346173956383]
我々は,コンピュータビジョンのパラメータと計算利用を向上する新しいアーキテクチャであるGC ViT(Global context vision transformer)を提案する。
本稿では,ViTにおける帰納バイアスの欠如に対処し,アーキテクチャにおける可溶性逆残差ブロックを改良して活用することを提案する。
提案したGC ViTは,画像分類,オブジェクト検出,セマンティックセマンティックセグメンテーションタスクにまたがる最先端の処理結果を実現する。
論文 参考訳(メタデータ) (2022-06-20T18:42:44Z) - ERNIE-SPARSE: Learning Hierarchical Efficient Transformer Through
Regularized Self-Attention [48.697458429460184]
情報ボトルネック感度と異なる注目トポロジ間の不整合の2つの要因がスパース変換器の性能に影響を及ぼす可能性がある。
本稿では,ERNIE-Sparseというモデルを提案する。
i) 局所情報とグローバル情報を逐次統一する階層スパース変換器(HST) と、(ii) 注意トポロジの異なる変換器の距離を最小化する自己注意正規化(SAR) の2つの特徴がある。
論文 参考訳(メタデータ) (2022-03-23T08:47:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。