論文の概要: ReSS: Residual-Restoring Sparse Attention for 3D Vision Transformers
- arxiv url: http://arxiv.org/abs/2609.35593v1
- Date: Mon, 28 Sep 2026 16:43:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 20:31:55.53548
- Title: ReSS: Residual-Restoring Sparse Attention for 3D Vision Transformers
- Title(参考訳): ReSS:3Dビジョン変換器の残像保持スパークアテンション
- Abstract要約: VGGTのような3次元視覚変換器は、カメラのポーズを予測し、1つの前方通過で多視点画像からシーン形状を推定する。
このコストを削減するため、SparseVGGTとHeSSはブロックレベルで注意を分散させる。
注意確率は、ブロックが取り除かれたとき、モデルの動きが実際にどれだけ変化するかを予測できないことを示す。
- 参考スコア(独自算出の注目度): 37.26361220604091
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: 3D vision transformers such as VGGT predict camera poses and scene geometry from multi-view images in a single forward pass, but their global attention over all concatenated view tokens dominates computation as the number of views grows. To reduce this cost, SparseVGGT and HeSS sparsify attention at the block level, and both retain blocks with high attention probability. However, we observe that attention probability poorly predicts how much the model's behavior actually changes when a block is removed, and we show that this mismatch is why performance collapses as sparsity increases. In this paper, we propose ReSS (ReSidual-ReStoring Sparse Attention), which recasts block selection from a problem of maximizing the retained attention mass to one of minimizing the drift that sparsification leaves in the residual stream. We introduce a drift score that quantifies how much each block shifts the residual, and, since the drift of a drop set depends on the directions of the contribution vectors rather than on their magnitudes alone, an iterative residual restoration procedure that refines the drop set as a whole. Across three backbones and five datasets, ReSS preserves dense performance better than prior methods at matched sparsity. Two further results support drift as the quantity that governs the cost of sparsification: maximizing drift degrades performance faster than random selection, and plotted against realized drift instead of sparsity, all methods fall approximately onto a single curve. Code is available at https://github.com/libary753/ReSS.
- Abstract(参考訳): VGGTのような3Dビジョントランスフォーマーは、カメラのポーズやシーンジオメトリを1つの前方通過で予測するが、すべての連結されたビュートークンに対するグローバルな関心は、ビューの数が増えるにつれて計算を支配している。
このコストを削減するため、SparseVGGTとHeSSはブロックレベルで注意を分散させ、どちらも高い注意確率でブロックを保持する。
しかし、注意確率はブロックが取り除かれたときのモデル動作の実際の変化を予測できないことを示し、このミスマッチが、スパーシティが増大するにつれて性能が崩壊する理由であることを示す。
本稿では,保持された注目質量を最大化する問題からブロック選択を,残ストリームに散在するドリフトを最小化する問題に再キャストするReSS(ReSidual-ReStoring Sparse Attention)を提案する。
本稿では,各ブロックが残差をどの程度シフトするかを定量化するドリフトスコアを導入し,ドロップセットのドリフトは,その大きさのみではなく寄与ベクトルの方向に依存するので,ドロップセット全体を洗練する反復的復元手順を提案する。
3つのバックボーンと5つのデータセットにまたがって、ReSSは、マッチした間隔での以前のメソッドよりも高いパフォーマンスを保っている。
ドリフトの最大化は、ランダム選択よりも高速に性能を低下させ、スパーシティの代わりに実現されたドリフトに対してプロットされ、すべてのメソッドが1つの曲線にほぼ一致する。
コードはhttps://github.com/libary753/ReSSで入手できる。
関連論文リスト
- GAPS: Generative Active Pseudo-view Selection for Sparse-View 3D Gaussian Splatting [3.068803023317505]
3D Gaussian Splatting (3DGS)は、フローター、壊れた幾何学、そしてわずかな視野で訓練された背景を洗い流す。
本稿では、事前学習した画像拡散モデルを用いて、幾何学的に一貫した擬似ビューを生成する交互最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2026-09-20T08:13:18Z) - Training Crossroads for Recurrent Vision Transformers: Recurrence, Neural ODEs, and Deep Supervision [2.1465474237525113]
シングルブロックリカレントViT (bViT) は、1つの共有ブロックを繰り返し適用することで、この成長を除去する。
FLOPが主制約である場合、標準のVTは引き続き好ましいが、繰り返しのVTはメモリ制約下でのパラメータのトレードオフよりも精度がよい。
論文 参考訳(メタデータ) (2026-08-05T14:06:50Z) - Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction [77.75911117889915]
現在のエンドツーエンドのマルチビュー3D再構成手法は、目覚ましい結果を得るが、制限的な静的仮定に依存している。
この理想的な入力への依存は、最も高度なメソッドでさえ、現実世界の設定で失敗する原因となる。
非一貫性の視点から頑健な再構築を行うためのエンドツーエンドフレームワークであるWildにおけるビジュアルジオメトリトランスフォーマーを提案する。
論文 参考訳(メタデータ) (2026-06-22T02:52:22Z) - SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing [77.91660464664615]
Diffusion Transformers (DiTs) はビデオ生成において主要なバックボーンとなっているが、その二次的注意コストは依然として大きなボトルネックとなっている。
本稿では,不足しているコントリビューションをトレーニングなしで回収できることを示す。
パラメータフリーな線形補償分岐であるSVG-EARを導入する。
論文 参考訳(メタデータ) (2026-03-09T22:15:31Z) - Elastic Diffusion Transformer [32.62353162897611]
Diffusion Transformer (DiT) は優れた生成能力を示したが、計算コストは高い。
適応加速度フレームワークである textbfElastic Diffusion Transformer (E-DiT) を提案する。
論文 参考訳(メタデータ) (2026-02-15T05:19:17Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - MCGS: Multiview Consistency Enhancement for Sparse-View 3D Gaussian Radiance Fields [100.90743697473232]
3Dガウシアンによって表現される放射場は、高いトレーニング効率と高速レンダリングの両方を提供する、新しいビューの合成に優れている。
既存の手法では、高密度推定ネットワークからの奥行き先を組み込むことが多いが、入力画像に固有の多視点一貫性を見落としている。
スパースビューからのシーン再構成が可能な3次元ガウススプラッティングに基づくビュー合成フレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-15T08:39:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。