論文の概要: Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining
- arxiv url: http://arxiv.org/abs/2608.04213v1
- Date: Tue, 04 Aug 2026 20:26:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.623974
- Title: Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining
- Title(参考訳): LeJEPAをベースとした自己監督事前学習による注意専用白色箱変圧器
- Authors: Yang Bai, Linyuan Wang, Haoyang Jiang, Nuolin Sun, Libin Hou, Bin Yan,
- Abstract要約: ホワイトボックスネットワークの自己教師型学習に関する既存の研究は、通常、自己教師型学習パラダイムから最適化アルゴリズムを通じてホワイトボックスネットワークの導出を分離する。
本稿では,LJEPAをベースとした自己教師型フレームワークで,タスクの最適埋め込みとして,等方的ガウス分布を仮定する。
本モデルでは,パラメータ数を約31%削減しながら,競合性能を実現する。
- 参考スコア(独自算出の注目度): 6.622672079571481
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing studies on self-supervised learning for white-box networks typically decouple the derivation of white-box networks via optimization algorithms from self-supervised learning paradigms. In this work, we instead revisit the two components from a joint perspective. The LeJEPA-based self-supervised framework assumes an isotropic Gaussian distribution as the optimal embedding distribution for downstream tasks, which is conceptually equivalent to the expansion term $R(Z)$ in the sparse rate reduction objective guiding white-box Transformer optimization. Building on this observation, we use the LeJEPA self-supervised paradigm to optimize $R(Z)$, and derive the remaining terms $R^{c}(Z\mid U_{[K]})+λ\lVert Z\rVert_{0}$ via the alternating direction method of multipliers (ADMM) into an attention-only Transformer that dispenses with the ISTA structure or MLP layers of the original design. Experimental results demonstrate that our attention-only white-box Transformer achieves classification accuracies of $88.88\%$ on CIFAR-10 and $63.54\%$ on CIFAR-100 at the Base scale under the LeJEPA self-supervised paradigm, while the original white-box Transformer CRATE achieves classification accuracies of $89.18\%$ on CIFAR-10 and $63.56\%$ on CIFAR-100. Our model achieves competitive performance while reducing the parameter count by roughly $31\%$. Beyond the white-box setting, we further investigate standard ViTs and find that replacing all MLP blocks with ReLU activations under knowledge distillation removes approximately 66\% of the parameters while preserving competitive accuracy, motivating further investigation into the potential redundancy of MLP modules in standard ViT architectures.
- Abstract(参考訳): ホワイトボックスネットワークの自己教師型学習に関する既存の研究は、通常、自己教師型学習パラダイムから最適化アルゴリズムを通じてホワイトボックスネットワークの導出を分離する。
この作業では、2つのコンポーネントを共同視点で再考する。
LeJEPAベースの自己監督型フレームワークは、ホワイトボックストランスフォーマー最適化を導くスパースレート削減目標における拡張項$R(Z)$と概念的に等価である下流タスクの最適埋め込み分布として、等方的ガウス分布を仮定する。
この観測に基づいて、LeJEPAの自己監督パラダイムを用いて$R(Z)$を最適化し、元の設計のISTA構造やMLP層を省略した注意のみの変換器に、乗算器の交互方向法(ADMM)を介して、残項$R^{c}(Z\mid U_{[K]})+λ\lVert Z\rVert_{0}$を導出する。
実験の結果,CIFAR-10では注意のみのホワイトボックストランスフォーマーが88.88 %,LeJEPA自己管理パラダイムではベーススケールのCIFAR-100では63.54 %,CIFAR-10では89.18 %,CIFAR-100では63.56 %であった。
本モデルでは,パラメータ数を約311\%削減しながら,競合性能を実現する。
ホワイトボックス設定の他に、標準的な ViT だけでなく、全ての MLP ブロックを知識蒸留下での ReLU アクティベーションに置き換えることにより、競合精度を維持しながらパラメータの約 66% を除去し、標準 ViT アーキテクチャにおける MLP モジュールの潜在的な冗長性についてさらなる研究を動機付けている。
関連論文リスト
- MMAO-Cls: Metabolic Multi-Agent Optimization for Joint Feature Selection and Classifier Tuning [0.5156484100374058]
MMAO(Multi-Agent Metabolic)は、分類モデル選択のための信頼性の高い外ループとして機能する。
本稿では,MMAO-Clsを提案する。MMAO-Clsは,各エージェントが2次元特徴マスクとハイパーパラメータを共に符号化する混合空間実現法である。
MMAO-Clsを7種類の標準ベンチマークで評価し,RandomSearch,GA-lite,PSO-lite,内因性no-sharing ablationと比較した。
論文 参考訳(メタデータ) (2026-07-01T23:40:27Z) - ZEBRA: Zero-shot Budgeted Resource Allocation for LLM Orchestration [8.226365534099399]
連続非線形クナップサック問題に対する多相予算割当を低減するフレームワークであるZEBRAを提案する。
150ドルのAPPS符号化ベンチマークでは、ZEBRAの2つの変種は全ての集計基準においてLLM-directよりも優れていた。
我々は,自律型マルチエージェントシステムの経済行動を改善するために,推論時の軽量なアルゴリズムガイダンスを提案する。
論文 参考訳(メタデータ) (2026-05-19T20:50:05Z) - Representation Without Reward: A JEPA Audit for LLM Fine-Tuning [1.2691047660244335]
JEPA(Joint-embedding predictive Architectures)は、モデルが観測された出力よりも遅延表現を予測できるように訓練された時に、より有用な抽象化を学ぶべきであることを提案している。
自己回帰型言語モデルの微調整には、この原理はより厳密な要件を必要とする。
我々は、Llama-3.2-1B-Instruct LoRA を用いて、自然言語からレジェックス生成におけるその要件を検証した。
論文 参考訳(メタデータ) (2026-05-14T20:27:32Z) - A Communication-Theoretic Framework for LLM Agents: Cost-Aware Adaptive Reliability [0.20625936401496228]
大規模言語モデル(LLM)に基づく大規模言語モデルの信頼性技術について検討する。
これらの信頼性手法は6つの古典的信頼性演算子の特別な場合であることを示す。
本稿では,1つのラグランジアンノブが高品質なフロンティアを横断するコストアレスト近傍ルータを提案する。
論文 参考訳(メタデータ) (2026-05-09T19:14:33Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - Learning Accurate Segmentation Purely from Self-Supervision [87.78965637247107]
Selfmentは完全に自己管理型のフレームワークで、人間のラベルなしでオブジェクトを生画像から直接分割する。
Selfmentは、複数のベンチマークで新しい最先端(SoTA)結果を設定する。
論文 参考訳(メタデータ) (2026-02-27T07:36:32Z) - FedSVD: Adaptive Orthogonalization for Private Federated Learning with LoRA [68.44043212834204]
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
Low-Rank Adaptation (LoRA) は、学習における言語モデルの効率的な微調整に広く用いられている。
論文 参考訳(メタデータ) (2025-05-19T07:32:56Z) - Parameterization of Cross-Token Relations with Relative Positional
Encoding for Vision MLP [52.25478388220691]
視覚多層パーセプトロン(MLP)はコンピュータビジョンタスクにおいて有望な性能を示す。
トークンミキシングレイヤを使用して、トランスフォーマーが使用するマルチヘッド自己保持機構とは対照的に、クロストークンインタラクションをキャプチャする。
トークン混合のためのクロストークン関係を効率的に符号化する新しい位置空間ゲーティングユニット(PoSGU)を提案する。
論文 参考訳(メタデータ) (2022-07-15T04:18:06Z) - Group Whitening: Balancing Learning Efficiency and Representational
Capacity [98.52552448012598]
グループホワイトニング(GW)は、ホワイトニング操作の利点を活用し、ミニバッチ内での正規化の欠点を回避する。
我々は、GWが異なるアーキテクチャのパフォーマンスを継続的に改善し、絶対的なゲインが$1.02%$$sim$1.49%$のImageNet上のトップ1精度と$1.82%$$$sim$$21%$のバウンディングボックスAPのCOCO上のバウンディングボックスAPであることを示した。
論文 参考訳(メタデータ) (2020-09-28T14:00:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。