論文の概要: Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions
- arxiv url: http://arxiv.org/abs/2607.19378v1
- Date: Wed, 01 Jul 2026 02:39:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.141814
- Title: Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions
- Title(参考訳): 入力依存長畳み込みによるネイティブ多次元サブクアッドレート演算子
- Abstract要約: 多次元データに適用する場合、注意を向けるサブクワッドラティックな代替手段は妥協を必要とする。
畳み込みのネイティブな幾何学に直接作用するサブクワッドラティックでグローバルな入力依存演算子である textitHyenaND を導入する。
長いコンテキストのゲノム学、コンピュータビジョン、医療画像、PDEモデリング全体において、純粋なハイエナNDスタックは強い注意ベースラインの精度と一致し、ハイエナNDと注意層をインターリーブするハイブリッド構成は純粋な注意と強い再発ベースのハイブリッドの両方より優れている。
- 参考スコア(独自算出の注目度): 14.854950151689062
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Subquadratic alternatives to attention require compromises when applied to multi-dimensional data: standard convolutions lack global receptive fields and input dependency, while recurrent models require rasterizing data such as images, volumes, and partial differential equation (PDE) into an ad-hoc $1\rm D$ scan order that violates their spatial structure. We introduce \textit{HyenaND}, a subquadratic, global, input-dependent operator that acts directly on the native geometry of multidimensional data through convolutions with implicitly parametrized global, input-dependent multi-dimensional convolutional kernels. Our CUDA implementation, \texttt{nSubQ}, fuses the FFT-convolution path to turn HyenaND's $\mathcal{O}(L \log L)$ scaling into wall-clock speedups. Across long-context genomics, computer vision, medical imaging, and PDE modeling, pure HyenaND stacks match the accuracy of strong attention baselines, while hybrid configurations that interleave HyenaND and attention layers outperform both pure attention and strong recurrence-based hybrids.
- Abstract(参考訳): 標準的な畳み込みは、大域的な受容場や入力依存性を欠いているのに対し、再帰モデルは、画像、体積、偏微分方程式(PDE)などのラスタライズされたデータを、空間構造に反するアドホックな1ドルのD$スキャンオーダーに変換する必要がある。
我々は,暗黙的にパラメタライズされた大域的,入力依存の多次元畳み込みカーネルとの畳み込みを通じて,多次元データのネイティブな幾何学に直接作用する,準四進的,大域的、入力依存型演算子である \textit{HyenaND} を紹介する。
我々のCUDA実装である \texttt{nSubQ} は、HyenaNDの$\mathcal{O}(L \log L)$スケールをウォールクロックのスピードアップに変換するために、FFT-畳み込みパスを融合します。
長いコンテキストのゲノム学、コンピュータビジョン、医療画像、PDEモデリング全体において、純粋なハイエナNDスタックは強い注意ベースラインの精度と一致し、ハイエナNDと注意層をインターリーブするハイブリッド構成は純粋な注意と強い再発ベースのハイブリッドの両方より優れている。
関連論文リスト
- Looped SSMs: Depth-Recurrence and Input Reshaping for Time Series Classification [50.994194925685434]
パラメータが$k$のループSSMが$L$倍に反復され、標準SSMと一貫して一致し、性能が良くなることを示す。
また、入力再フォーマットは等しく無視された設計軸であることを示す。
論文 参考訳(メタデータ) (2026-05-15T15:18:12Z) - U-HNO: A U-shaped Hybrid Neural Operator with Sparse-Point Adaptive Routing for Non-stationary PDE Dynamics [7.23685260715089]
中心設計はスパースポイント適応ルーティング(SPAR)であるU字型ハイブリッドニューラル演算子U-HNOを提案する。
SPARは階層的なエンコーダ・ブートネック・デコーダのバックボーンに埋め込まれており、スキップ接続により両分岐とゲートが全ての解像度で動作する。
U-HNOは、相対的なL2とH1メトリクスの両方のタスクの大多数において、最先端のロールアウト精度を達成する。
論文 参考訳(メタデータ) (2026-05-13T04:00:43Z) - AE-ViT: Stable Long-Horizon Parametric Partial Differential Equations Modeling [0.0]
本稿では、畳み込みエンコーダと、潜在表現を操作するトランスフォーマーと、再構成のためのデコーダからなるジョイントモデルを提案する。
提案手法は,潜在進化の効率と全フィールドモデルの忠実さを組み合わせ,多フィールド予測におけるDL-ROM,潜伏変圧器,平VTの性能を向上する。
論文 参考訳(メタデータ) (2026-04-07T21:19:45Z) - Stochastic Dimension Implicit Functional Projections for Exact Integral Conservation in High-Dimensional PINNs [0.0]
ニューラル偏微分方程式(PDE)解法における質量とエネルギーとしての正確な保存則は、高次元において困難である。
本稿では,DS-I|timesDS (DS-I) を演算子にアストックカルサンプリングを導入し,メモリの削減を図る。
MathcalI|timesDSは、解決のためのスケーラブルなアプローチを提供する。
保守的な高次元PDE。
論文 参考訳(メタデータ) (2026-03-31T04:07:51Z) - Spectral-Window Hybrid (SWH) [0.0]
極端な文脈へのシーケンスモデリングのスケーリングには、計算効率と表現表現率のバランスが必要である。
シーケンスモデリングを2つのテキスト並列ストリームに分離するアーキテクチャである textbfSpectral-Window Hybrid (SWH) を提案する。
SWHは、拡張シーケンスに対する効率的な線形スケーリングを実現しつつ、短いコンテキストで標準変換器のパープレキシティと一致することを示した。
論文 参考訳(メタデータ) (2026-01-04T00:31:36Z) - GSPN-2: Efficient Parallel Sequence Modeling [101.33780567131716]
一般化空間伝搬ネットワーク(GSPN)は2次自己アテンションを直線走査型伝搬方式に置き換えることでこの問題に対処する。
GSPN-2は、視覚アプリケーションにおけるグローバル空間コンテキストをモデル化するための新しい効率フロンティアを確立する。
論文 参考訳(メタデータ) (2025-11-28T07:26:45Z) - Adaptive Mesh-Quantization for Neural PDE Solvers [51.26961483962011]
グラフニューラルネットワークは複雑なジオメトリや境界条件に必要な不規則なメッシュを処理できるが、それでもすべてのノードで一様計算処理を適用できる。
適応メッシュ量子化(Adaptive Mesh Quantization): メッシュノード,エッジ,クラスタ特徴間の空間適応量子化であり,量子化モデルで使用されるビット幅を動的に調整する。
我々は,MP-PDEとGraphViTという2つの最先端モデルと統合して,複数のタスクのパフォーマンスを評価することで,フレームワークの有効性を実証する。
論文 参考訳(メタデータ) (2025-11-23T14:47:24Z) - PiT: Progressive Diffusion Transformer [50.46345527963736]
拡散変換器(DiT)は変換器アーキテクチャを用いて画像生成において顕著な性能を発揮する。
DiTは以前信じられていたようなグローバルな情報に大きく依存していない。
Pseudo Progressive Diffusion Transformer (PiT)を提案する。
論文 参考訳(メタデータ) (2025-05-19T15:02:33Z) - Parallel Sequence Modeling via Generalized Spatial Propagation Network [80.66202109995726]
Generalized Spatial Propagation Network (GSPN)は、2次元空間構造を本質的にキャプチャする最適化された視覚タスクのための新しいアテンションメカニズムである。
GSPNは、空間的コヒーレントな画像データを直接操作し、ラインスキャンアプローチを通じて高密度なペアワイズ接続を形成することにより、制限を克服する。
GSPNは、ImageNet分類、クラス誘導画像生成、テキスト・ツー・イメージ生成などの視覚タスクにおいて、より優れた空間忠実性と最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-01-21T18:56:19Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - VTAE: Variational Transformer Autoencoder with Manifolds Learning [144.0546653941249]
深層生成モデルは、多くの潜伏変数を通して非線形データ分布の学習に成功している。
ジェネレータの非線形性は、潜在空間がデータ空間の不満足な射影を示し、表現学習が不十分になることを意味する。
本研究では、測地学と正確な計算により、深部生成モデルの性能を大幅に向上させることができることを示す。
論文 参考訳(メタデータ) (2023-04-03T13:13:19Z) - Polarized Self-Attention: Towards High-quality Pixel-wise Regression [19.2303932008785]
本稿では,高画質画素ワイドレグレッションに対する2つの重要な設計を組み込んだPSAブロックを提案する。
実験の結果,PSAは2Dポーズ推定とセマンティックセグメンテーションのベンチマークにおいて,標準ベースラインを2~4ドル,最先端を1~2ドル,さらに2Dポーズ推定とセマンティックセグメンテーションのベンチマークで1~2ドル向上した。
論文 参考訳(メタデータ) (2021-07-02T01:03:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。