論文の概要: Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling
- arxiv url: http://arxiv.org/abs/2609.30288v1
- Date: Wed, 09 Sep 2026 14:33:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.125727
- Title: Manifold Projection and Iterative Autoencoder Refinement for Masked Language Modeling
- Title(参考訳): マスク言語モデリングのためのマニフォールド投影と反復オートエンコーダ再構成
- Abstract要約: Transformerベースの言語モデルでは、注意がコンテキストミキシングの主要なメカニズムである。
私たちは、低ランクのオートエンコーダから同じボトルネック特性を得る代替手段を構築します。
我々のアーキテクチャは、C4で事前訓練された場合、約1.9倍のFLOPで注目され、パラメータマッチングされたBERTベースラインで評価される。
- 参考スコア(独自算出の注目度): 1.3254304182988284
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In Transformer-based masked language models, attention is the primary mechanism for context mixing, but there are other ways to mix data across tokens. Recent attention-free mixers replace attention with fixed or hypernetwork-generated MLPs, alternating their dynamic, content-dependent weighting for computational simplicity. We build an alternative that gets the same property from a low-rank bottleneck autoencoder. We replace attention with a stack of autoencoder-based mixing modules, one operating over local neighborhoods, one over the full sequence, and one across attention heads, each compressing and reconstructing its input through a bottleneck, and its width is a hyperparameter rather than a training effect. In masked positions, we introduce an iterative refinement procedure that has two distinct steps. A pulling step that pulls an embedding representation toward a weighted average of its neighbors, and a correcting step that projects the result back to the learned manifold via an autoencoder. Our architecture achieves a significant portion of attention's performance at about $1.9 \times$ fewer FLOPs when pretrained on C4 and evaluated with parameter-matched BERT baselines. Our model equals parameter-matched BERT and TinyBERT baselines on the rarest-token frequency bucket using a frequency-aware training schedule that samples rare tokens more than uniformly for the masking tasks.
- Abstract(参考訳): Transformerベースのマスキング言語モデルでは、注意がコンテキストミキシングの主要なメカニズムであるが、トークン間でデータを混ぜる方法は他にもある。
最近の注目のないミキサーは、注意を固定またはハイパーネットワークで生成するMPPに置き換わり、その動的でコンテンツに依存した重み付けを計算の単純さのために交互に行う。
私たちは、低ランクのボトルネックオートエンコーダから同じプロパティを得る代替手段を構築します。
我々は注意をオートエンコーダをベースとした混合モジュールのスタックに置き換える。ひとつは局所的な周辺で動作し、一つは全シーケンスで動作し、一つは注目ヘッドで、それぞれがボトルネックを通じて入力を圧縮、再構成し、その幅はトレーニング効果ではなくハイパーパラメータである。
マスクされた位置では、2つの異なるステップを持つ反復的な洗練手順を導入する。
隣人の重み付き平均に向かって埋め込み表現を引っ張るプルステップと、オートエンコーダを介して学習多様体に結果を投影する修正ステップである。
我々のアーキテクチャは、C4で事前訓練された場合、約1.9 \times$ FLOPsを減らし、パラメータマッチングされたBERTベースラインで評価する。
パラメータマッチングされたBERTとTinyBERTのベースラインを周波数対応のトレーニングスケジュールを用いて、マスクタスクに対して一様以上のレアトークンをサンプリングする。
関連論文リスト
- Distilling Sequential Computation in Transformer Language Models [27.155933358949213]
Transformer言語モデルでは、トークン単位のシーケンスを自動回帰的に処理する。
入力トークンのスパンを崩壊表現に置き換えることで逐次計算を蒸留する手法を提案する。
論文 参考訳(メタデータ) (2026-09-23T02:02:57Z) - Polynomial Mixing for Efficient Self-supervised Speech Encoders [50.58463928808225]
Polynomial Mixer (PoM) はマルチヘッド自己注意の代替品である。
PoMは下流音声認識タスクでその性能を達成する。
論文 参考訳(メタデータ) (2026-02-28T14:45:55Z) - A Transformer Inspired AI-based MIMO receiver [0.5039813366558306]
AttDetの設計は、モデルベースの解釈可能性とデータ駆動の柔軟性を組み合わせる。
5Gチャネルモデルと高次混合QAM変調および符号化方式のリンクレベルシミュレーションによる実演を行う。
AttDetは予測可能で現実的な複雑さを維持しながら、ほぼ最適のBER/BLERパフォーマンスにアプローチすることができる。
論文 参考訳(メタデータ) (2025-10-23T09:05:10Z) - Enhancing DNA Foundation Models to Address Masking Inefficiencies [18.54660252939211]
マスク付きオートエンコーダフレームワークをベースとした改良型エンコーダデコーダアーキテクチャを提案する。
我々は,BIOSCAN-5Mデータセットに対するアプローチを,200万以上のユニークなDNAバーコードから評価した。
論文 参考訳(メタデータ) (2025-02-25T17:56:25Z) - Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning [116.75939193785143]
画像領域における視覚変換器(ViT)のコントラスト学習(CL)は、従来の畳み込みバックボーンのCLに匹敵する性能を達成した。
ViTで事前訓練した3Dポイントクラウドでは、マスク付きオートエンコーダ(MAE)モデリングが主流である。
論文 参考訳(メタデータ) (2024-07-08T12:28:56Z) - Rethinking Patch Dependence for Masked Autoencoders [89.02576415930963]
マスク付きオートエンコーダ(MAE)のデコーダにおけるパッチ間の依存関係が表現学習に与える影響について検討する。
クロスアテンションマスク付きオートエンコーダ(CrossMAE)の簡易な視覚前訓練フレームワークを提案する。
論文 参考訳(メタデータ) (2024-01-25T18:49:57Z) - TimeMAE: Self-Supervised Representations of Time Series with Decoupled
Masked Autoencoders [55.00904795497786]
トランスフォーマネットワークに基づく転送可能な時系列表現を学習するための,新しい自己教師型パラダイムであるTimeMAEを提案する。
TimeMAEは双方向符号化方式を用いて時系列の豊富な文脈表現を学習する。
新たに挿入されたマスク埋め込みによって生じる不一致を解消するため、分離されたオートエンコーダアーキテクチャを設計する。
論文 参考訳(メタデータ) (2023-03-01T08:33:16Z) - ClusTR: Exploring Efficient Self-attention via Clustering for Vision
Transformers [70.76313507550684]
本稿では,密集自己注意の代替として,コンテンツに基づくスパースアテンション手法を提案する。
具体的には、合計トークン数を減少させるコンテンツベースの方法として、キーとバリュートークンをクラスタ化し、集約する。
結果として得られたクラスタ化されたTokenシーケンスは、元の信号のセマンティックな多様性を保持するが、より少ない計算コストで処理できる。
論文 参考訳(メタデータ) (2022-08-28T04:18:27Z) - Relaxed Attention: A Simple Method to Boost Performance of End-to-End
Automatic Speech Recognition [27.530537066239116]
トレーニング中のエンコーダ・デコーダの注意重みに対する均一分布の段階的注入である緩和注意の概念を導入する。
ゆるやかな注意で訓練されたトランスフォーマーは、外部言語モデルを用いたデコーディングにおいて、標準ベースラインモデルよりも一貫して優れていた。
WSJでは,単語誤り率3.65%のトランスフォーマーに基づくエンドツーエンド音声認識のベンチマークを新たに設定した。
論文 参考訳(メタデータ) (2021-07-02T21:01:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。