論文の概要: TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
- arxiv url: http://arxiv.org/abs/2608.22117v1
- Date: Sat, 22 Aug 2026 22:04:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.615016
- Title: TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
- Title(参考訳): TANGO:自然・形式言語モデリングのためのトークン集約非線形ゲーティング演算子
- Authors: Joshua Nunley,
- Abstract要約: TANGOモデル(Token-Aggregated Gating Operators)を紹介する。
各ソーストークンは、SwiGLUベクトルゲートを生成する。
我々はTANGOとRecurrentとUntied Transformer++、フルアテンションGAU、FLASHを比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A standard Transformer block separates cross-token interaction in self-attention from a nonlinear feed-forward network applied independently at each position. We introduce the TANGO model (Token-Aggregated Nonlinear Gating Operators), which replaces these two sublayers with one cross-token gated residual update. Each source token produces a SwiGLU gate vector. Query-key similarities determine a weighted average of source gates for each destination, and the resulting gate rescales projected destination features. TANGO assigns a separate weight to every causally visible source and is quadratic in sequence length. The WANGO model (Windowed Aggregation of Nonlinear Gating Operators) retains the same unnormalized scores within a recent window and uses positive feature-map prefix statistics for older sources, giving linear sequence-length complexity for fixed window and feature dimensions. We compare TANGO and WANGO with Recurrent and Untied Transformer++, full-attention GAU, and FLASH. All models have approximately 44.3M nonembedding parameters and are trained in three matched runs. TANGO, WANGO, and Recurrent Transformer++ apply one shared block four times; the other architectures use four independent blocks. TANGO obtains the lowest mean validation negative log-likelihood on FineWeb-Edu, Lean, and DeepMind Mathematics, although it has the largest analytical forward-pass operation count. WANGO obtains the lowest mean FineWeb-Edu NLL among the architectures with computation linear in sequence length and outperforms Recurrent Transformer++ at nearly the same analytical forward-pass multiply-accumulate count.
- Abstract(参考訳): 標準トランスフォーマーブロックは、各位置で独立して適用される非線形フィードフォワードネットワークから、自己アテンションにおけるクロストケン相互作用を分離する。
TANGOモデル(Token-Aggregated linear Gating Operators)を導入し、これら2つのサブレイヤを1つのクロストークンゲート残差更新に置き換える。
各ソーストークンは、SwiGLUゲートベクトルを生成する。
クエリキーの類似性は、各宛先に対するソースゲートの重み付け平均を決定し、その結果のゲートは予測された宛先特徴を再スケールする。
TANGOはすべての因果可視源に別の重みを割り当て、シーケンス長は2次である。
WANGOモデル(Windowed Aggregation of Non Gating Operators)は、最近のウィンドウで同じ非正規化スコアを保持し、古いソースに対して正のフィーチャーマッププレフィックス統計を使い、固定ウィンドウと特徴次元に対して線形列長の複雑さを与える。
我々はTANGOとWANGOをRecurrentとUntied Transformer++、フルアテンションGAU、FLASHと比較する。
全てのモデルは44.3Mのパラメータを持ち、3つのマッチしたランで訓練される。
TANGO、WANGO、Recurrent Transformer++は1つの共有ブロックを4回適用し、他のアーキテクチャは4つの独立したブロックを使用する。
TANGOは、FineWeb-Edu、Lean、DeepMindの数学において、最も低い平均検定陰性検定値を得るが、最大の分析前方通過演算数を持つ。
WANGOは、配列長と性能が線形なアーキテクチャの中で、最小値のFinWeb-Edu NLLを取得し、Recurrent Transformer++は、ほぼ同じ解析的なフォワードパス乗算累積数である。
関連論文リスト
- Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models [75.80275843320511]
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
論文 参考訳(メタデータ) (2026-07-09T07:37:59Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - A Dual-Path Architecture for Scaling Compute and Capacity in LLMs [1.7347918181145063]
本稿では、フレキシブルにスケールできる新しいデュアルパスブロック、隠れ状態に適用されるシーケンシャルな演算数、キャパシティを提案する。
2つのFLOP予算において、我々のデュアルパスモデルは、言語モデリングと下流評価において一致した同型FLOPモデルを上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-28T16:41:36Z) - Plug-and-Play Spiking Operators: Breaking the Nonlinearity Bottleneck in Spiking Transformers [32.743518029177146]
本稿では,Transformer の非線形性に対するスパイクフレンドリーな近似を実装し,既存の ANN-to-SNN パイプラインに統合するプラグイン・アンド・プレイフレームワークを提案する。
本手法は,これらの非線形計算を,分割,指数化,および$ell$ノルムの3つの繰り返しプリミティブに分解し,集団群を介して実現する。
実験により、対象とする非線形演算子を選択的に置き換えることにより、評価された全てのタスクに対して11%の精度低下が生じることが示された。
論文 参考訳(メタデータ) (2026-05-19T06:59:46Z) - GSPN-2: Efficient Parallel Sequence Modeling [101.33780567131716]
一般化空間伝搬ネットワーク(GSPN)は2次自己アテンションを直線走査型伝搬方式に置き換えることでこの問題に対処する。
GSPN-2は、視覚アプリケーションにおけるグローバル空間コンテキストをモデル化するための新しい効率フロンティアを確立する。
論文 参考訳(メタデータ) (2025-11-28T07:26:45Z) - Gated Associative Memory: A Parallel O(N) Architecture for Efficient Sequence Modeling [0.0]
Gated Associative Memory (GAM) ネットワークは、シーケンスモデリングのための新しい完全に並列なアーキテクチャである。
我々はGAMをゼロから実装し、標準的なトランスフォーマーモデルと現代的な線形時間ベースラインに対して厳密な比較分析を行う。
我々の実験は、GAMは一貫して高速で、トレーニング速度のベースラインの両方を上回り、全てのデータセットで優れた、または競争力のある最終バリデーションの難しさを達成できることを示した。
論文 参考訳(メタデータ) (2025-08-30T20:59:46Z) - Comba: Improving Bilinear RNNs with Closed-loop Control [57.800320390698516]
本稿では,これらのモデルの利点と限界を包括的に分析したBilinear RNNの概念を紹介する。
我々は,状態フィードバックと出力フィードバックの両補正を併用した,スカラー+低ランク状態遷移を取り入れた新しいバイリニアRNNであるCombaを提案する。
また,大規模コーパス上での340M/1.3Bパラメータのトレーニングモデルと,ハードウェア効率のよいチャンクワイド並列カーネルを実装した。
論文 参考訳(メタデータ) (2025-06-03T05:44:50Z) - Fourier Transformer: Fast Long Range Modeling by Removing Sequence Redundancy with FFT Operator [36.66799002929583]
トランスモデルは、計算的に要求されることが知られており、長いシーケンスでは不当にコストがかかる。
本稿では,シークエンスにおける冗長性を段階的に除去する,シンプルかつ効果的なFourier Transformerを提案する。
本モデルは,長距離モデリングベンチマークLRAにおいて,トランスフォーマーベースモデル間の最先端性能を実現する。
論文 参考訳(メタデータ) (2023-05-24T12:33:06Z) - Sketching as a Tool for Understanding and Accelerating Self-attention
for Long Sequences [52.6022911513076]
トランスフォーマーベースのモデルは、自己アテンションモジュールの二次空間と時間的複雑さのために、長いシーケンスを処理するのに効率的ではない。
我々はLinformerとInformerを提案し、低次元投影と行選択により2次複雑性を線形(モジュラー対数因子)に還元する。
理論的解析に基づいて,Skeinformerを提案することにより,自己注意の促進と,自己注意への行列近似の精度の向上を図ることができる。
論文 参考訳(メタデータ) (2021-12-10T06:58:05Z) - Unfolding Projection-free SDP Relaxation of Binary Graph Classifier via
GDPA Linearization [59.87663954467815]
アルゴリズムの展開は、モデルベースのアルゴリズムの各イテレーションをニューラルネットワーク層として実装することにより、解釈可能で類似のニューラルネットワークアーキテクチャを生成する。
本稿では、Gershgorin disc perfect alignment (GDPA)と呼ばれる最近の線形代数定理を利用して、二進グラフの半定値プログラミング緩和(SDR)のためのプロジェクションフリーアルゴリズムをアンロールする。
実験結果から,我々の未学習ネットワークは純粋モデルベースグラフ分類器よりも優れ,純粋データ駆動ネットワークに匹敵する性能を示したが,パラメータははるかに少なかった。
論文 参考訳(メタデータ) (2021-09-10T07:01:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。