論文の概要: Tucker Bottleneck Attention for Multi-Dimensional Sequence Modeling
- arxiv url: http://arxiv.org/abs/2610.09090v1
- Date: Tue, 06 Oct 2026 20:45:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.600082
- Title: Tucker Bottleneck Attention for Multi-Dimensional Sequence Modeling
- Title(参考訳): 多次元シーケンスモデリングのためのタッカーボトルネック注意
- Abstract要約: 効率的なグローバルトークンミキシングに低ランクテンソル構造を利用するTucker bottleneck attention (TuBA)を導入する。
ビデオ予測と地球規模の天気予報では、TuBAは良好な精度と効率のトレードオフを達成している。
ローランクのTuckerコアとマルチフレーム生成も、フルランクの注目とフレーム・バイ・フレームの生成を上回っている。
- 参考スコア(独自算出の注目度): 6.212797494435471
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The quadratic cost of self-attention limits scalability to long sequences from multidimensional data. We introduce Tucker bottleneck attention (TuBA), which exploits low-rank tensor structure for efficient global token mixing. TuBA projects hidden tensors into compact Tucker cores, performs multi-head self-attention and linear projections on the cores, and writes updates back to the ambient space, enabling subquadratic computation. Its autoregressive extension combines bidirectional interactions within cores with causal attention across cores. On video prediction and global weather forecasting, TuBA achieves favorable accuracy-efficiency trade-offs over standard and efficient attention and task-specific models. Compared to standard self-attention, TuBA reduces error and computation by up to 24.7% and 66.6% for video prediction and 37.1% and 85.1% for autoregressive weather forecasting, with speedups up to 4.27 times. Low-rank Tucker cores and multi-frame generation also outperform full-rank attention and frame-by-frame generation, respectively.
- Abstract(参考訳): 自己注意の二次コストは、多次元データからの長いシーケンスに対するスケーラビリティを制限する。
効率的なグローバルトークンミキシングに低ランクテンソル構造を利用するTucker bottleneck attention (TuBA)を導入する。
TuBAはテンソルをコンパクトなTuckerコアにプロジェクションし、マルチヘッドの自己アテンションとリニアプロジェクションを実行する。
自己回帰拡張は、コア内の双方向の相互作用とコア間の因果的注意を結合する。
ビデオ予測とグローバルな天気予報では、TuBAは標準的かつ効率的な注意力とタスク固有のモデルよりも、良好な精度と効率のトレードオフを実現している。
通常の自己注意と比較して、TuBAはビデオ予測で24.7%、66.6%、自動回帰天気予報で37.1%、85.1%のエラーと計算を最大4.27倍に削減している。
ローランクタッカーコアとマルチフレーム生成は、それぞれフルランクアテンションとフレーム・バイ・フレーム生成を上回っている。
関連論文リスト
- DimPO: Dimensionality Reduction for Attention using Preference Optimization [11.300022574469105]
線形射影は、事前訓練されたモデルを更新することなく、クエリとキーベクトルの次元を減少させることができるが、どのトレーニング対象がモデル挙動を最もよく保存するかは、まだ不明である。
最大重み付き鍵に対するキーとアテンションマスの嗜好が、全アテンション分布とKLの発散とを一致させるよりも良い信号を提供するかどうかを問う。
本稿では、リストワイドな選好最適化と、頭部忠実度を表す軽量なトップkクロスエントロピー項を組み合わせたDimPOを提案する。
論文 参考訳(メタデータ) (2026-09-26T12:51:36Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers [54.01042826416009]
ビジュアル生成には高解像度の画像、長いビデオ、マルチモーダルコンテキストが必要である。
原理的なスケーリングレシピを備えたハイブリッドビジュアル拡散バックボーンであるChimeraを紹介した。
密度の高いバックボーンは、一致したフルアテンションWan2.1 2Bベースラインの1.7倍の計算効率を示す。
論文 参考訳(メタデータ) (2026-07-30T17:58:02Z) - TIE: Time Interval Encoding for Video Generation over Events [50.66585165263848]
ディレクタースタイルのプロンプト、ロボットアクション予測、インタラクティブなビデオエージェントは、同時イベントに対する時間的根拠を要求する。
現代のビデオジェネレータは、ポイントワイドな位置エンコーディングを通して、タイムを離散的なポイントとして表現する。
Time Interval TIEは、プラグイン・アンド・プレイ・インターバル・アウェアの一般化である。
論文 参考訳(メタデータ) (2026-05-11T13:23:14Z) - $\nabla$NABLA: Neighborhood Adaptive Block-Level Attention [3.566419648777424]
NABLA(Norborhood Adaptive Block-Level Attention Mechanism)を提案する。
NABLAは、ブロックワイズアテンションと適応パリシティ駆動しきい値を活用することにより、生成品質を維持しながら計算オーバーヘッドを低減する。
実験の結果、NABLAはベースラインに比べて最大2.7倍高速なトレーニングと推論を実現している。
論文 参考訳(メタデータ) (2025-07-17T21:36:36Z) - Scaling Attention to Very Long Sequences in Linear Time with Wavelet-Enhanced Random Spectral Attention (WERSA) [1.7622426179653563]
トランスフォーマーモデルは、通常の注意が2次的なO(n2)$時間複雑性を持つため、長い列で計算にコストがかかる。
WERSA(Wavelet-Enhanced Random Spectral Attention)は、線形な$O(n)$時間複雑性のメカニズムである。
計算負荷を大幅に削減し、精度を損なうことなく、WERSAはより実用的で安価で長いコンテキストモデルを可能にする。
論文 参考訳(メタデータ) (2025-07-11T14:40:40Z) - RAT: Bridging RNN Efficiency and Attention Accuracy via Chunk-based Sequence Modeling [27.094682429698384]
RNNの効率性と注目度を橋渡しする中間設計であるRATを提案する。
RATは入力をチャンクに分割し、局所的な依存関係に対して各チャンク内で繰り返し適用する。
チャンクサイズが16のRATブロックは、100Kトークンシーケンスと9倍の4K位置で、トレーニング速度を7倍改善する。
論文 参考訳(メタデータ) (2025-07-06T15:08:49Z) - Output Scaling: YingLong-Delayed Chain of Thought in a Large Pretrained Time Series Forecasting Model [55.25659103706409]
このフレームワークは,設計した基盤モデルであるYingLongの最先端性能を実現する。
YingLongは、マスク付きトークンリカバリによってトレーニングされた非因果的双方向アテンションエンコーダのみのトランスフォーマーである。
我々は、6Mから3Mパラメータの4つの基礎モデルをリリースし、ゼロショットタスクにおいて優れた結果を示す。
論文 参考訳(メタデータ) (2025-05-20T14:31:06Z) - VSA: Faster Video Diffusion with Trainable Sparse Attention [38.37291040904089]
ビデオ拡散トランス (DiTs) のスケーリングは、注意質量の大部分が少数の位置に集中しているにもかかわらず、2次元の注意によって制限される。
私たちはこの観察を、トレーニング可能なハードウェア効率の良いスパースアテンションであるVSAに変換し、Emphbothのトレーニングと推論の完全なアテンションを置き換える。
論文 参考訳(メタデータ) (2025-05-19T17:30:13Z) - TransNormerLLM: A Faster and Better Large Language Model with Improved
TransNormer [34.790081960470964]
最初の線形注意に基づくLarge Language Model(LLM)であるTransNormerLLMを提案する。
我々は, 位置埋め込み, 線形注意加速度, ゲーティング機構, テンソル正規化, 推論加速度, 安定化など, 高度な修正を行う。
自己収集コーパス上に385M, 1B, 7Bの大きさの列車モデルとアブリケーションを用いてモデル設計を検証する。
論文 参考訳(メタデータ) (2023-07-27T16:45:33Z) - Combiner: Full Attention Transformer with Sparse Computation Cost [142.10203598824964]
計算の複雑さを低く保ちつつ、各注目ヘッドにフルアテンション機能を提供するコンバインダを提案する。
既存のスパース変圧器で使用されるスパースアテンションパターンのほとんどは、そのような分解設計をフルアテンションに刺激することができることを示す。
自己回帰的タスクと双方向シーケンスタスクの両方に関する実験的評価は、このアプローチの有効性を示す。
論文 参考訳(メタデータ) (2021-07-12T22:43:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。