論文の概要: Low-Rank Attention Residuals
- arxiv url: http://arxiv.org/abs/2607.09694v1
- Date: Fri, 19 Jun 2026 13:27:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.373335
- Title: Low-Rank Attention Residuals
- Title(参考訳): ローランドアテンション残余
- Abstract要約: 注意残差は、大きな言語モデルにおける以前のサブレイヤ出力よりも深い注意で、固定残差和を置き換える。
ルーティングに$r ll d$で$r$次元キーを使用しながら、全次元残差値を保持する低ランクアテンション残差(LR-AttnRes)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Attention Residuals replace the fixed residual sum with depthwise attention over previous sub-layer outputs in large language models (LLMs), but use each output as both a full-dimensional key and value. This couples routing with representation and makes depth-routing scores scale with the hidden width $d$. We propose Low-Rank Attention Residuals (LR-AttnRes), which keep full-dimensional residual values while using $r$-dimensional keys, with $r \ll d$, for routing. Projected LR-AttnRes emits learned low-rank keys from existing output projections, decoupling routing from residual content and achieving the best validation loss among the variants tested. Sliced LR-AttnRes uses the last $r$ dimensions of each value as the routing key, removing the auxiliary key-projection path and reducing residual-side FLOPs while still improving performance. Comprehensive sweeps show that depthwise routing can be effective with far fewer dimensions than the model width. We release code and models to facilitate future research.
- Abstract(参考訳): 注意残差は、大きな言語モデル(LLM)の以前のサブレイヤ出力よりも深い注意で、固定残差和を置き換えるが、各出力をフル次元キーと値の両方として使用する。
これにより、ルーティングと表現を結合し、Deep-routingスコアを、隠された幅$d$でスケールする。
ルーティングには$r$次元キーと$r \ll d$を使用しながら全次元残差値を保持する低ランク注意残差(LR-AttnRes)を提案する。
LR-AttnResは既存の出力プロジェクションから学習した低ランクキーを出力し、残量からのルーティングを分離し、テストされた変種の中で最高の検証損失を達成する。
スライスされたLR-AttnResは、各値の最後の$r$次元をルーティングキーとして使用し、補助的なキー投影パスを削除し、性能を改善しながら残留側FLOPを削減する。
包括的スイープは、モデル幅よりもはるかに少ない次元で、奥行きルーティングが有効であることを示している。
将来の研究を促進するために、コードとモデルをリリースします。
関連論文リスト
- RAIN: Region-Aware Inversion Network for Semantic Watermark Extraction [0.0]
終端回復を画像のようなアンカーとノイズ指向残差に分解する軽量なプロンプトフリー抽出器を提案する。
ノイズ抽出の計算コストはOSIとFARIのどちらよりも低い。
論文 参考訳(メタデータ) (2026-09-14T00:07:17Z) - Role-Decoupled Attention Residuals: Separating Matching and Content Retrieval Across Depth [1.2973070941583096]
Role-Decoupled Attention Residuals (RD-AttnRes)を紹介する。
RD-AttnResは、クエリとキーの間の1つの深さルートを共有し、同じ残元上の独立した値ルートを学習する。
RD-AttnResをFineWeb-Edu上でフリーズ・ペア・プレトレーニングプロトコルを用いて評価する。
論文 参考訳(メタデータ) (2026-08-02T08:19:39Z) - LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models [56.999481798138625]
LimiX-2Mは2Mパラメータモデルであり、広く使われているベンチマークでTabPFN-v2とTabICLのベースラインを上回っている。
本稿では,強力なタブラル基礎モデル(TFM)のための統一トークン化・ルートフレームワークを提案する。
その結果、TFMにおける精度-効率トレードオフを改善するキーレバーとして、バリューアウェアトークン化とリードアウト整列ルーティングが強調された。
論文 参考訳(メタデータ) (2026-06-03T06:07:33Z) - Scaling Attention via Feature Sparsity [50.64995497733461]
超長期のコンテキストにトランスフォーマーをスケールすることは、自己注意のコスト$O(n2 d)$コストによってボトルネックとなる。
本稿では,高次元表現性を維持するために,クエリとキーを$k$sparseコードとして表現するスパース特徴注意法を提案する。
GPT-2とQwen3の事前トレーニングで、SFAは密度の高いベースラインにマッチし、最高2.5タイムのスピードを向上し、FLOPとKVキャッシュを50%近く削減した。
論文 参考訳(メタデータ) (2026-03-17T08:41:50Z) - ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration [8.845117852325997]
ShiftLUTは、LUTベースのすべてのメソッドの中で、高い効率を維持しながら、最大の受容領域を実現する新しいフレームワークである。
従来の最先端のTinyLUTと比較して、ShiftLUTは3.8$times$大きな受容場を実現し、平均PSNRを0.21dB以上改善している。
論文 参考訳(メタデータ) (2026-03-01T04:00:23Z) - HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models [96.76995840807615]
HiRes-LLaVAは、元の文脈情報や幾何学的情報を変更することなく、高解像度入力のサイズを処理するように設計された新しいフレームワークである。
HiRes-LLaVAは、2つの革新的なコンポーネントで構成されている: (i)スライスしたパッチを元の形式に再構築し、ダウンアップサンプリング層と畳み込み層を通じてグローバルとローカルの両方の特徴を効率的に抽出するSliceRestoreアダプタ、(ii)自分自身に基づいてビジョントークンを圧縮するセルフマイニングサンプリング。
論文 参考訳(メタデータ) (2024-07-11T17:42:17Z) - NeRF-Det++: Incorporating Semantic Cues and Perspective-aware Depth
Supervision for Indoor Multi-View 3D Detection [72.0098999512727]
NeRF-Detは、NeRFを用いた屋内マルチビュー3次元検出において、表現学習の強化による優れた性能を実現している。
セマンティックエンハンスメント(セマンティックエンハンスメント)、パースペクティブ・アウェア・サンプリング(パースペクティブ・アウェア・サンプリング)、および順序深度監視を含む3つのソリューションを提案する。
結果として得られたアルゴリズムであるNeRF-Det++は、ScanNetV2とAR KITScenesデータセットで魅力的なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-02-22T11:48:06Z) - Learning Sparse and Low-Rank Priors for Image Recovery via Iterative
Reweighted Least Squares Minimization [12.487990897680422]
本稿では,学習されたスパース制約と低ランク制約下での画像復元のための新しい最適化アルゴリズムを提案する。
提案アルゴリズムは、信号回復に使用されるIRLS(Iteratively Reweighted Least Squares)法を一般化する。
我々の再建結果は競争力が高く、多くの場合、既存の未登録ネットワークよりも優れています。
論文 参考訳(メタデータ) (2023-04-20T17:59:45Z) - Attention Map Guided Transformer Pruning for Edge Device [98.42178656762114]
視覚トランスフォーマー (ViT) は, 全体的かつ隠蔽された人物再識別 (Re-ID) タスクにおいて, 有望な成功を収めた。
本稿では、冗長なトークンとヘッドの両方を除去する新しいアテンションマップガイド(AMG)トランスフォーマープルーニング法を提案する。
Occluded DukeMTMC と Market-1501 に関する総合的な実験により,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2023-04-04T01:51:53Z) - Rotate the ReLU to implicitly sparsify deep networks [13.203765985718201]
本稿では,ReLUアクティベーションを回転させてアーキテクチャにさらなる自由度を与える,という新しいアイデアを提案する。
トレーニングによって回転が学習されるこのアクティベーションは、タスクに重要でないネットワーク内のこれらのパラメータ/フィルタの除去をもたらすことを示す。
論文 参考訳(メタデータ) (2022-06-01T13:38:45Z) - LAPAR: Linearly-Assembled Pixel-Adaptive Regression Network for Single
Image Super-Resolution and Beyond [75.37541439447314]
単一画像超解像(SISR)は、低解像度(LR)画像を高解像度(HR)バージョンにアップサンプリングする根本的な問題を扱う。
本稿では,線形組立画素適応回帰ネットワーク (LAPAR) を提案する。
論文 参考訳(メタデータ) (2021-05-21T15:47:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。