論文の概要: GTR: Gated Token Recurrence for Efficient Dense Prediction
- arxiv url: http://arxiv.org/abs/2609.26590v2
- Date: Wed, 23 Sep 2026 03:03:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.678456
- Title: GTR: Gated Token Recurrence for Efficient Dense Prediction
- Title(参考訳): GTR:高効率デンス予測のためのゲート式トケリカレンス
- Abstract要約: GTR(Gated Token Recurrence)は、ソフトマックスフリーのリカレントビジョンバックボーンである。
GTRは、ゲート線形アテンション、スキャン方向の交互化、空間的に拡張されたSwiGLUブロックを組み合わせる。
- 参考スコア(独自算出の注目度): 23.995331168843748
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Self-attention-based vision backbones perform well on dense prediction, but the quadratic computational cost of global softmax attention limits their efficiency as image resolution increases. We introduce Gated Token Recurrence (GTR), a softmax-free recurrent vision backbone that combines gated linear attention, alternating spatial scan directions, and spatially enhanced SwiGLU blocks. GTR is distilled from a detection-specialized DINOv3 teacher using only final-layer patch-token alignment through a linear projection and squared $\ell_2$ loss, without masked-token prediction or intermediate-layer supervision. With Objects365 detector pre-training, GTR-L achieves 58.9 box AP on COCO \texttt{val2017} with 1.908\,ms median batch-one latency under compiled FP16 execution on an RTX~4090. The same backbone also transfers to instance segmentation, pose estimation, oriented detection, semantic segmentation, and monocular depth estimation. In an isolated kernel benchmark, our specialized chunkwise CUDA operator is $4.0\times$ faster than FLA v0.5.0 at 1.6K tokens on RTX~4090. TensorRT deployment on DRIVE AGX Thor achieves 2.282--8.769\,ms median batch-one latency across the evaluated models. These results show that recurrent token mixing can provide an efficient alternative to global softmax attention for high-resolution dense prediction and edge deployment. Project page: https://intellindust-ai-lab.github.io/projects/GTR/
- Abstract(参考訳): 自己注意に基づく視覚バックボーンは、高密度な予測ではうまく機能するが、グローバルなソフトマックスアテンションの2次計算コストは、画像解像度が増加するにつれて効率を低下させる。
本稿では,Gated Token Recurrence (GTR)を紹介した。これはソフトマックスフリーのリカレント・ビジョンバックボーンで,ゲート線形注意,空間走査方向の交互化,空間拡張SwiGLUブロックを組み合わせたものである。
GTRを検出特殊化したDINOv3教師から線形射影を通した最終層パッチトケンアライメントのみを用いて蒸留し、マスクトケン予測や中間層監視なしに$\ell_2$ロスを2乗した。
Objects365 検出器の事前トレーニングにより、GTR-L は COCO \texttt{val2017} 上の 58.9 ボックス AP を達成する。
同じバックボーンは、インスタンスセグメンテーション、ポーズ推定、方向検出、セマンティックセグメンテーション、モノクル深度推定にも転送される。
分離されたカーネルベンチマークでは、RTX~4090の1.6KトークンでFLA v0.5.0よりも4.0\times$高速である。
DRIVE AGX Thor上のTensorRTデプロイメントは、評価モデル全体で2.282--8.769\,ms中央のバッチ1レイテンシを実現する。
これらの結果から,高分解能密度予測とエッジ展開において,トークンの繰り返し混合はグローバルなソフトマックスアテンションの代替となる可能性が示唆された。
プロジェクトページ: https://intellindust-ai-lab.github.io/ projects/GTR/
関連論文リスト
- TriCalRAG: A Three-Strategy, Retrieval-Augmented Benchmark for On-Premise LLM-Based Root Cause Analysis in AIOps [1.8136615181861766]
クラウドホスト型大規模言語モデル(LLM)は、AIOpsパイプラインの根本原因分析(RCA)にますます使用されている。
データプライバシのリスク、ネットワークレイテンシ、および運用ログボリュームの低いクエリ単位のコストを導入している。
我々は,従来のLSTMを用いたログ異常検出器に対して,vLLMを介して局所的に提供されるオープンウェイトの評価ベンチマークであるRAGを提示する。
論文 参考訳(メタデータ) (2026-09-13T19:52:46Z) - RoofGS: Roofline-Guided End-to-End Acceleration of 3D Gaussian Splatting [20.838595758539498]
RoofGSは、一般的なカーネルアクセラレーションではなく、ボトルネック固有の最適化を適用するレンダリングフレームワークである。
実験の結果、RoofGSは指数指数指数4090よりも10.1ドルのエンドツーエンドのスピードアップを達成した。
論文 参考訳(メタデータ) (2026-08-16T15:06:39Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Hierarchical Transformer Preconditioning for Interactive Physics Simulation [28.137076331332413]
階層型トランスフォーマープレコンディショナー(Hierarchical Transformer Preconditioner)は、弱い許容率のH行列分割に固定されたニューラルプレコンディショナーである。
ネットワークは低ランクの遠距離因子を通して逆をモデル化する。
高速道路の接続を利用して、奥行きを隔ててコンテキストを伝播する。
論文 参考訳(メタデータ) (2026-05-13T11:02:27Z) - $\texttt{SPECS}$: Faster Test-Time Scaling through Speculative Drafts [55.231201692232894]
$textttSPECS$は、投機的デコードにインスパイアされた遅延対応のテスト時間スケーリングメソッドである。
我々の結果は、$textttSPECS$matchはビームサーチの精度を上回り、最大$sim$19.1%のレイテンシを削減していることを示している。
論文 参考訳(メタデータ) (2025-06-15T05:50:05Z) - Speedy MASt3R [68.47052557089631]
MASt3Rは、DUSt3Rを活用して高速な相互マッチング方式を導入することで、画像マッチングを3Dタスクとして再定義する。
高速MASt3Rは、精度を犠牲にすることなく、推論時間(画像ペアあたり198msから91ms)を54%削減する。
この進歩により、リアルタイムな3D理解が可能になり、複合現実ナビゲーションや大規模3Dシーン再構築といったアプリケーションに恩恵をもたらす。
論文 参考訳(メタデータ) (2025-03-13T03:56:22Z) - AiluRus: A Scalable ViT Framework for Dense Prediction [95.1313839257891]
視覚変換器 (ViT) は、その優れた性能のため、視覚タスクの一般的なアーキテクチャとして登場した。
本稿では,画像の異なる領域に対して,その重要度に応じて適応分解能を適用することを提案する。
提案手法を3つの異なるデータセット上で評価し,有望な性能を観察する。
論文 参考訳(メタデータ) (2023-11-02T12:48:43Z) - Efficient Dataset Distillation Using Random Feature Approximation [109.07737733329019]
本稿では,ニューラルネットワークガウス過程(NNGP)カーネルのランダム特徴近似(RFA)を用いた新しいアルゴリズムを提案する。
我々のアルゴリズムは、KIP上で少なくとも100倍のスピードアップを提供し、1つのGPUで実行できる。
RFA蒸留 (RFAD) と呼ばれる本手法は, 大規模データセットの精度において, KIP や他のデータセット凝縮アルゴリズムと競合して動作する。
論文 参考訳(メタデータ) (2022-10-21T15:56:13Z) - EdgeNeXt: Efficiently Amalgamated CNN-Transformer Architecture for
Mobile Vision Applications [68.35683849098105]
入力テンソルを複数のチャネルグループに分割するSDTAエンコーダを導入する。
1.3Mパラメータを持つEdgeNeXtモデルでは、ImageNet-1Kで71.2%のTop-1精度を実現している。
パラメータ5.6MのEdgeNeXtモデルでは、ImageNet-1Kで79.4%のTop-1精度を実現しています。
論文 参考訳(メタデータ) (2022-06-21T17:59:56Z) - Scalable Optimal Transport in High Dimensions for Graph Distances,
Embedding Alignment, and More [7.484063729015126]
最適輸送のためのコスト行列の2つの効率的な対数線形時間近似を提案する。
これらの近似は、複雑な高次元空間に対してもよく機能するエントロピー規則化OTに対する一般的な対数線形時間アルゴリズムを可能にする。
グラフ距離回帰のために,グラフニューラルネットワーク(GNN)と拡張シンクホーンを組み合わせたグラフトランスポートネットワーク(GTN)を提案する。
論文 参考訳(メタデータ) (2021-07-14T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。