論文の概要: MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers
- arxiv url: http://arxiv.org/abs/2606.29844v1
- Date: Mon, 29 Jun 2026 06:33:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.082111
- Title: MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers
- Title(参考訳): MATCH: 長期変換器のコンテキスト検索による注意制御
- Abstract要約: MATCHはスケーラブルで効率的なフレームワークであり、動的に統合されたインコンテキスト情報によって注意機構を拡大する。
実験結果から,MATCHは,合成タスクと実世界の自然言語タスクの両方において,スパースアテンションモデルの性能を著しく向上することが示された。
- 参考スコア(独自算出の注目度): 60.12595759596518
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: The quadratic computational cost of traditional attention mechanisms poses a major bottleneck to the scalability and practical deployment of large language models (LLMs), particularly in long-context scenarios. To improve efficiency, existing approaches often enforce rigid structural constraints such as local attention windows. However, these strategies typically lead to substantial performance degradation on tasks requiring precise long-range recall. In this work, we propose MATCH, a scalable and efficient framework that augments sparsified attention mechanisms with dynamically integrated in-context information through an efficient retrieval system. Empirical results show that MATCH significantly improves the performance of sparse-attention models on both synthetic and real-world natural-language tasks. These findings highlight the versatility of MATCH as a general approach for enhancing in-context retrieval capabilities while maintaining the efficiency benefits of sparse attention architectures.
- Abstract(参考訳): 従来の注意機構の二次計算コストは、大規模言語モデル(LLM)のスケーラビリティと実践的展開に大きなボトルネックをもたらす。
効率を改善するために、既存のアプローチは、しばしばローカルアテンションウィンドウのような厳密な構造的制約を強制する。
しかし、これらの戦略は典型的には、正確な長距離リコールを必要とするタスクのパフォーマンスを著しく低下させる。
本研究では,効率の良い検索システムを通じて,動的にテキスト内情報を統合したスペア化アテンション機構を拡張可能な,スケーラブルで効率的なフレームワークであるMATCHを提案する。
実験結果から,MATCHは,合成タスクと実世界の自然言語タスクの両方において,スパースアテンションモデルの性能を著しく向上することが示された。
これらの知見は、スパースアテンションアーキテクチャの効率性を維持しつつ、コンテキスト内検索能力を向上するための一般的なアプローチとして、MATCHの汎用性を強調している。
関連論文リスト
- FAIM: Frequency-Aware Interactive Mamba for Time Series Classification [87.84511960413715]
時系列分類(TSC)は、環境モニタリング、診断、姿勢認識など、多くの実世界の応用において重要である。
本稿では,周波数対応対話型マンバモデルであるFAIMを提案する。
FAIMは既存の最先端(SOTA)手法を一貫して上回り、精度と効率のトレードオフが優れていることを示す。
論文 参考訳(メタデータ) (2025-11-26T08:36:33Z) - Efficient Attention Mechanisms for Large Language Models: A Survey [18.86171225316892]
トランスフォーマーベースのアーキテクチャは、大規模言語モデルの一般的な計算バックボーンとなっている。
最近の研究は、効率的な注意機構の2つの主要なカテゴリを紹介している。
対照的に、スパースアテンションテクニックは、固定パターン、ブロックワイドルーティング、クラスタリング戦略に基づいて、選択されたトークンのサブセットに注意を限定する。
論文 参考訳(メタデータ) (2025-07-25T18:08:10Z) - Quantifying Memory Utilization with Effective State-Size [73.52115209375343]
「我々は、テキスト・メモリ利用の尺度を策定する。」
この計量は、textitinput-invariant および textitinput-variant linear operator を持つシステムの基本的なクラスに適合する。
論文 参考訳(メタデータ) (2025-04-28T08:12:30Z) - PowerAttention: Exponentially Scaling of Receptive Fields for Effective Sparse Attention [73.26995918610669]
大きな言語モデル(LLM)は、長いコンテキストを処理する場合の注意機構の二次的な複雑さによって、効率のボトルネックに直面します。
本稿では,効果的かつ完全なコンテキスト拡張を容易にする新しいスパークアテンション設計であるPowerAttentionを紹介する。
実験によると、PowerAttentionは既存の静的スパースアテンションメソッドを5sim 40%$で上回っている。
論文 参考訳(メタデータ) (2025-03-05T15:24:11Z) - LREA: Low-Rank Efficient Attention on Modeling Long-Term User Behaviors for CTR Prediction [22.366063727224173]
既存のアプローチの限界を克服する新しい注意機構であるLREAを紹介する。
LREAは、情報整合性を維持しながら注意力を維持するために特別に設計された損失関数を組み込んでいる。
論文 参考訳(メタデータ) (2025-03-04T12:12:37Z) - Contextual Reinforcement in Multimodal Token Compression for Large Language Models [0.0]
トークン圧縮は、ますます複雑で多様なデータセットを扱うためにモデルをスケーリングする上で、依然として重要な課題である。
相互依存や意味的関連性を通じてトークンの重要度を動的に調整する,コンテキスト強化に基づく新しいメカニズムを導入する。
このアプローチは,情報表現の品質と一貫性を維持しつつ,トークン使用量の大幅な削減を可能にする。
論文 参考訳(メタデータ) (2025-01-28T02:44:31Z) - Autonomous Structural Memory Manipulation for Large Language Models Using Hierarchical Embedding Augmentation [0.0]
本研究では,マルチレベルセマンティック構造を通じてトークンの表現を再定義する手段として,階層的な埋め込み拡張を導入する。
その結果、より長い入力シーケンスに対して処理オーバーヘッドが大幅に削減され、計算効率が大幅に向上した。
トークン表現とメモリ構成を動的に調整する能力は、様々な予測不可能な入力条件下でモデルの堅牢性に寄与した。
論文 参考訳(メタデータ) (2025-01-23T22:20:36Z) - Core Context Aware Transformers for Long Context Language Modeling [50.774702091154204]
高速な長文モデリングのためのCCAアテンションを提案する。
本手法は,学習過程における冗長性を低下させながら,コアコンテキストに自動的に焦点を合わせ,強化する。
提案手法は,既存の大規模言語モデルにおける自己注意モジュールを最小限の微調整コストで置き換えることができる。
論文 参考訳(メタデータ) (2024-12-17T01:54:08Z) - Interpreting and Improving Attention From the Perspective of Large Kernel Convolution [51.06461246235176]
本稿では,LKCA(Large Kernel Convolutional Attention)について紹介する。
LKCAは、特にデータ制約のある設定において、様々な視覚的タスク間での競合性能を達成する。
論文 参考訳(メタデータ) (2024-01-11T08:40:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。