論文の概要: ResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modeling
- arxiv url: http://arxiv.org/abs/2607.05583v2
- Date: Thu, 09 Jul 2026 02:10:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.2608
- Title: ResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modeling
- Title(参考訳): 共振器LM:効率よい長期言語モデリングのための因果共振場混合
- Authors: Archie Chaudhury,
- Abstract要約: ResonatorLMは、注意を物理由来の代替品に置き換える新しいメカニズムである。
6Mのマッチング設定では、トレーニングとプリフィルのスピードアップはシーケンスの長さとともに増加する。
小さい6Mの一致した設定では、デコード速度は32Kトークンで最適化された標準のトランスフォーマーに比べて6.47倍に達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Contemporary language models are dominated by the transformer architecture, which leverages self-attention mechanisms to enable more efficient, parallelized training across a wide set of documents and corpora. This has allowed transformers to effectively model data across a wide range of modalities and contexts. However, transformers, along with their conventional counterparts such as recurrent neural networks (RNNs) and convolutional neural networks (CNNs), often struggle to maintain efficiency when processing long contexts. We introduce ResonatorLM, a new mechanism that replaces attention with a physics-derived alternative. ResonatorLM treats token sequences as a single, driven one-dimensional latent field and replaces attention dot products with causal functions of damped resonators. We implement ResonatorLM on a traditional network architecture and test it on standard long-context modeling tasks. We find that in a small, 6M matched setting, training and prefill speedups increase with sequence length, decode speed reaches 6.47x compared to that of a standard, optimized transformer at 32K tokens, and accuracy reaches 61.31 percent (compared to 55.32 percent) on WikiText.
- Abstract(参考訳): コンテンポラリー言語モデルはトランスフォーマーアーキテクチャによって支配されており、このアーキテクチャは、より効率的な並列化トレーニングを可能にするために自己認識機構を活用している。
これにより、トランスフォーマーは、幅広いモダリティとコンテキストにわたってデータを効果的にモデル化することができる。
しかしながら、トランスフォーマーは、リカレントニューラルネットワーク(RNN)や畳み込みニューラルネットワーク(CNN)といった従来のニューラルネットワークと同様に、長いコンテキストを処理する際に効率を維持するのに苦労することが多い。
ResonatorLMは、注意を物理由来の代替品に置き換える新しいメカニズムである。
共振器LMはトークン配列を1次元の1次元潜在場として扱い、注意点生成物を減衰共振器の因果関数に置き換える。
我々は従来のネットワークアーキテクチャ上でResonatorLMを実装し、標準の長文モデリングタスクでそれをテストする。
小型の6Mマッチング設定では、トレーニングとプリフィルのスピードアップがシーケンス長とともに増加し、デコード速度は32Kトークンで最適化されたトランスフォーマーと比較して6.47倍に達し、精度はWikiTextで61.31%(55.32%)に達した。
関連論文リスト
- DeepCoT: Deep Continual Transformers for Real-Time Inference on Data Streams [63.27233749591346]
トランスフォーマーベースのモデルは、ますます複雑なタスクに取り組むために、そのサイズとパラメータ数を劇的に増加させてきた。
ストリームデータ推論は通常、スライディング時間ウィンドウ上で実行され、非常に冗長な計算に繋がる。
提案するDeep Continual Transformer(DeepCoT)は冗長性のないエンコーダのみのモデルであり,最小限の変更で既存のディープエンコーダアーキテクチャに適用できる。
論文 参考訳(メタデータ) (2025-11-21T16:15:43Z) - Attention as an RNN [66.5420926480473]
我々は,そのテキストマンディ・ツー・ワンのRNN出力を効率的に計算できる特別なリカレントニューラルネットワーク(RNN)として注目されることを示す。
本稿では,並列プレフィックススキャンアルゴリズムを用いて,注目のテキストマンディ・ツー・マニーRNN出力を効率よく計算する手法を提案する。
Aarensは、一般的な4つのシーケンシャルな問題設定に散らばる38ドルのデータセットで、Transformersに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2024-05-22T19:45:01Z) - RWKV: Reinventing RNNs for the Transformer Era [54.716108899349614]
本稿では,変換器の効率的な並列化学習とRNNの効率的な推論を組み合わせた新しいモデルアーキテクチャを提案する。
モデルを最大14億のパラメータにスケールし、トレーニングされたRNNの中では最大で、同じサイズのTransformerと同等のRWKVのパフォーマンスを実現しています。
論文 参考訳(メタデータ) (2023-05-22T13:57:41Z) - Container: Context Aggregation Network [83.12004501984043]
最近の発見は、従来の畳み込みやトランスフォーマーコンポーネントを使わずに、シンプルなベースのソリューションが効果的な視覚表現を生成できることを示している。
マルチヘッドコンテキストアグリゲーションのための汎用ビルディングブロックCONText Ion NERtwokを提案する。
より大規模な入力画像解像度に依存する下流タスクにはスケールしないTransformerベースの手法とは対照的に、当社の効率的なネットワークであるModellightは、オブジェクト検出やインスタンスセグメンテーションネットワークに利用することができる。
論文 参考訳(メタデータ) (2021-06-02T18:09:11Z) - Finetuning Pretrained Transformers into RNNs [81.72974646901136]
トランスフォーマーは自然言語生成においてリカレントニューラルネットワーク(RNN)を上回っている。
線形複雑リカレント変種は自己回帰生成に適していることが証明されている。
この研究は、事前訓練された変換器を効率の良い再帰変換器に変換することを目的としている。
論文 参考訳(メタデータ) (2021-03-24T10:50:43Z) - Attention is All You Need in Speech Separation [12.57578429586883]
音声分離のための新しいRNNフリートランスフォーマーベースニューラルネットワークを提案する。
提案モデルは標準的なWSJ0-2/3mixデータセット上での最先端(SOTA)性能を実現する。
論文 参考訳(メタデータ) (2020-10-25T16:28:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。