論文の概要: The Impossibility Triangle of Long-Context Modeling
- arxiv url: http://arxiv.org/abs/2605.05066v1
- Date: Wed, 06 May 2026 16:01:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.91978
- Title: The Impossibility Triangle of Long-Context Modeling
- Title(参考訳): 長期モデリングの不合理性三角形
- Authors: Yan Zhou,
- Abstract要約: 我々は、長いシーケンスモデルを管理する基本的なトレードオフを証明します。
i) シーケンス長に依存しないステップ毎のステップ、(ii) シーケンス長に依存しない状態サイズ、(iii) シーケンス長に比例した多くの歴史的事実をリコールする能力、を同時に達成することはできない。
- 参考スコア(独自算出の注目度): 13.030603690976202
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We identify and prove a fundamental trade-off governing long-sequence models: no model can simultaneously achieve (i) per-step computation independent of sequence length (Efficiency), (ii) state size independent of sequence length (Compactness), and (iii) the ability to recall a number of historical facts proportional to sequence length (Recall). We formalize this trade-off within an Online Sequence Processor abstraction that unifies Transformers, state space models, linear recurrent networks, and their hybrids. Using the Data Processing Inequality and Fano's Inequality, we prove that any model satisfying Efficiency and Compactness can recall at most O(poly(d)/log V) key-value pairs from a sequence of arbitrary length, where d is the model dimension and V is the vocabulary size. We classify 52 architectures published before March 2026 into the triangle, showing that each achieves at most two of the three properties and that hybrid architectures trace continuous trajectories in the interior. Experiments on synthetic associative recall tasks with five representative architectures validate the theoretical bound: empirical recall capacity lies strictly below the information-theoretic limit, and no architecture escapes the triangle.
- Abstract(参考訳): 我々は、長いシーケンスモデルを管理する基本的なトレードオフを特定し、証明します。
i) シーケンスの長さ(効率)に依存しないステップ毎の計算
(二 シーケンスの長さ(コンパクト性)に依存しない状態サイズ及び
(三)列の長さに比例した多くの歴史的事実を思い出す能力(リコール)。
我々は、変換器、状態空間モデル、線形リカレントネットワーク、およびそれらのハイブリッドを統一するオンラインシーケンスプロセッサ抽象化において、このトレードオフを形式化する。
データ処理の不等式とファノの不等式を用いて、任意の長さの列から最大 O(poly(d)/log V) 個のキー-値対(d はモデル次元、V はボキャブラリサイズ)をリコールできることを証明した。
我々は2026年3月以前に出版された52のアーキテクチャを三角形に分類し、それぞれのアーキテクチャが3つの特性のうち少なくとも2つの特性を達成し、ハイブリッドアーキテクチャが内部の連続的な軌跡を辿っていることを示す。
5つの代表的なアーキテクチャによる合成連想的リコールタスクの実験は、理論的境界を検証している: 経験的リコール能力は、情報理論の限界より厳密に低く、三角形から逃れるアーキテクチャはない。
関連論文リスト
- Why Can't Transformers Learn Multiplication? Reverse-Engineering Reveals Long-Range Dependency Pitfalls [54.57326125204404]
言語モデルはますます能力が高くなっているが、多桁乗算という一見単純なタスクではまだ失敗している。
直観的連鎖を通して乗法をうまく学習するモデルをリバースエンジニアリングすることでなぜ研究する。
論文 参考訳(メタデータ) (2025-09-30T19:03:26Z) - Sequential-Parallel Duality in Prefix Scannable Models [68.39855814099997]
近年では Gated Linear Attention (GLA) や Mamba など様々なモデルが開発されている。
ニアコンスタント時間並列評価と線形時間、定数空間シーケンシャル推論をサポートするニューラルネットワークモデルの全クラスを特徴付けることができるだろうか?
論文 参考訳(メタデータ) (2025-06-12T17:32:02Z) - State-Free Inference of State-Space Models: The Transfer Function Approach [132.83348321603205]
状態のない推論では、状態サイズが大きくなると大きなメモリや計算コストは発生しない。
提案した周波数領域転送関数のパラメトリゼーション特性を用いてこれを実現する。
長い畳み込みハイエナベースライン上での言語モデリングにおける難易度の改善を報告した。
論文 参考訳(メタデータ) (2024-05-10T00:06:02Z) - Convolutional State Space Models for Long-Range Spatiotemporal Modeling [65.0993000439043]
ConvS5は、長距離時間モデリングのための効率的な変種である。
トランスフォーマーとConvNISTTMは、長い水平移動実験において、ConvLSTMより3倍速く、トランスフォーマーより400倍速くサンプルを生成する一方で、大幅に性能が向上した。
論文 参考訳(メタデータ) (2023-10-30T16:11:06Z) - To Asymmetry and Beyond: Structured Pruning of Sequence to Sequence
Models for Improved Inference Efficiency [37.22592489907125]
モデル精度はエンコーダサイズに結びついており、推論効率はデコーダに接続されていることを示す。
平均的な劣化と非対称性の役割の両方が、データセットのモデルサイズとバリエーションで一致していることが分かりました。
論文 参考訳(メタデータ) (2023-04-05T19:44:20Z) - Triformer: Triangular, Variable-Specific Attentions for Long Sequence
Multivariate Time Series Forecasting--Full Version [50.43914511877446]
本稿では,高い効率と精度を確保するために,三角形,可変特性に着目した注意点を提案する。
我々はTriformerが精度と効率の両方で最先端の手法より優れていることを示す。
論文 参考訳(メタデータ) (2022-04-28T20:41:49Z) - Efficiently Modeling Long Sequences with Structured State Spaces [15.456254157293836]
本稿では,基本状態空間モデルに対する新しいパラメータ化に基づく新しいシーケンスモデルを提案する。
S4は、(i)データ拡張や補助損失を伴わないシーケンシャルCIFAR-10での91%の精度を含む、より大規模な2次元ResNetと同等の、さまざまな確立されたベンチマークで強力な実験結果を得る。
論文 参考訳(メタデータ) (2021-10-31T03:32:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。