論文の概要: Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics
- arxiv url: http://arxiv.org/abs/2607.03589v2
- Date: Tue, 07 Jul 2026 22:23:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:30:34.684949
- Title: Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics
- Title(参考訳): Vision Non-Causal Trapezoidal Mamba:2次ダイナミクスを用いた視覚SSMにおける方向走査の除去
- Abstract要約: State Space Models (SSM) はVision Transformersの代替として登場した。
VNCT(Vision Non-Causal Trapezoidal Mamba)は2次非Causal Vision SSMである。
VNCTは、より指向性のある表現を示し、画像回転とフリップによる性能劣化を減少させる。
- 参考スコア(独自算出の注目度): 3.759424288761641
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: State Space Models (SSMs) have emerged as an alternative to Vision Transformers, yet most vision SSMs inherit directional token scanning from causal sequence modeling. While effective for sequential data, directional scanning introduces spatial bias and orientation-sensitive representations. We present Vision Non-Causal Trapezoidal Mamba (VNCT), a second-order non-causal vision SSM that enables all image tokens to interact in a single pass, eliminating direSctional scanning and achieving low single-image inference latency. VNCT exhibits more orientation-robust representations, showing reduced performance degradation under image rotations and flips, while improving Boundary IoU by up to 3.7 points, leading to more accurate boundary preservation and object localization. Across ImageNet-1K classification, COCO object detection and instance segmentation, and ADE20K semantic segmentation, VNCT consistently outperforms both directional-scanning vision SSMs and first-order non-causal SSMs. These results show that directional scanning is unnecessary for high-performance vision SSMs and that second-order non-causal state-space modeling offers a simple, efficient, and robust alternative for visual recognition.
- Abstract(参考訳): 状態空間モデル(SSM)はビジョントランスフォーマーの代替として登場したが、ほとんどのビジョンSSMは因果シーケンスモデリングから方向トークンスキャンを継承している。
シーケンシャルなデータには有効であるが、指向性スキャンは空間バイアスや指向性に敏感な表現を導入している。
VNCT(Vision Non-Causal Trapezoidal Mamba)は、全画像トークンが単一のパスで対話可能で、ディレクショナルスキャンが不要で、シングルイメージの推論遅延が低くなる。
VNCTは、画像回転とフリップによるパフォーマンス劣化を低減し、境界IoUを最大3.7ポイント改善し、より正確な境界保存とオブジェクトローカライゼーションを実現している。
ImageNet-1K分類、COCOオブジェクト検出、インスタンスセグメント化、ADE20Kセマンティックセマンティックセマンティックセマンティクスを含むVNCTは、方向走査型ビジョンSSMと一階非因果SSMの両方を一貫して上回っている。
これらの結果から,高性能ビジョンSSMでは指向性走査は不要であり,第2次非因果的状態空間モデリングは視覚認識の単純で効率的で堅牢な代替手段であることが示された。
関連論文リスト
- Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking [81.34609950921023]
近年のビジョン基礎モデルはSAM 2で実証されている。
本稿では, SAM 2 を複雑な VOT シナリオに適用する新たなトラッキングフレームワーク SAMOSA を提案する。
論文 参考訳(メタデータ) (2026-05-21T14:25:28Z) - TCP-SSM: Efficient Vision State Space Models with Token-Conditioned Poles [12.357939380869526]
ステートスペースモデル(SSM)は、長距離ビジョンタスクの注意モデルに代わる魅力的な代替品として登場した。
本稿では,再帰ダイナミクスを明示しつつ効率を向上する構造化選択型SSMフレームワークであるToken-Conditioned Poles SSMを提案する。
TCP-SSMは、ベースライン精度を維持したり超えたりしながら、Vision MambaスタイルのモデルでSSM計算の複雑さを最大44%削減することを示す。
論文 参考訳(メタデータ) (2026-05-12T05:49:46Z) - Can Graphs Help Vision SSMs See Better? [8.221734233588085]
我々は、Vision SSM用のグラフ誘発動的走査演算子である textbfGraphScan を紹介する。
それぞれのトークンに対して、GraphScanは空間的に有界な局所グラフを構築し、相対的な位置バイアスで特徴条件の親和性を学び、出力トークンを生成する。
解析の結果,GraphScanはトークン格子上の解釈可能な変位場を誘導し,ダイナミックスキャニングのセマンティックで空間的に接地されたビューを提供することがわかった。
論文 参考訳(メタデータ) (2026-05-11T22:40:37Z) - Partial Ring Scan: Revisiting Scan Order in Vision State Space Models [32.040984973714394]
状態空間モデル(SSM)は視覚タスクに注目する効率的な代替手段として登場した。
ビジョンSSMは、事前に定義されたスキャン順序に沿って、2D画像を1Dトークンシーケンスにシリアライズする必要がある。
スキャン順序は, 空間的隣接度, 破壊対象の連続性, 回転などの幾何学的変換による劣化を増幅することにより, 性能に重要な影響を与えることを示す。
論文 参考訳(メタデータ) (2026-02-04T03:07:41Z) - Tracking the Unstable: Appearance-Guided Motion Modeling for Robust Multi-Object Tracking in UAV-Captured Videos [58.156141601478794]
マルチオブジェクトトラッキング(UAVT)は、ビデオのフレーム間で一貫したアイデンティティを維持しながら、複数のオブジェクトを追跡することを目的としている。
既存の手法は、通常、動作キューと外観を別々にモデル化し、それらの相互作用を見渡して、最適下追跡性能をもたらす。
本稿では、AMC行列とMTCモジュールの2つの主要コンポーネントを通して、外観と動きの手がかりを利用するAMOTを提案する。
論文 参考訳(メタデータ) (2025-08-03T12:06:47Z) - Spectral State Space Model for Rotation-Invariant Visual Representation Learning [15.131672925920995]
状態空間モデル (SSM) は視覚変換器 (ViT) の代替として登場した。
SSMは概念的に関連があるが、隣接していないパッチ間の関係を識別することができない。
現在の視覚ベースのSSMは回転のような変換に非常に敏感である。
画像内のグローバル構造を効果的にキャプチャする新しいアプローチであるSpectral VMambaを紹介する。
論文 参考訳(メタデータ) (2025-03-09T00:37:43Z) - DAMamba: Vision State Space Model with Dynamic Adaptive Scan [51.81060691414399]
状態空間モデル(SSM)は近年、コンピュータビジョンにおいて大きな注目を集めている。
スキャン順序と領域を適応的に割り当てるデータ駆動型動的適応スキャン(DAS)を提案する。
DASをベースとしたビジョンバックボーンDAMambaの提案は,現在のビジョンタスクにおけるMambaモデルよりもはるかに優れている。
論文 参考訳(メタデータ) (2025-02-18T08:12:47Z) - Parallel Sequence Modeling via Generalized Spatial Propagation Network [80.66202109995726]
Generalized Spatial Propagation Network (GSPN)は、2次元空間構造を本質的にキャプチャする最適化された視覚タスクのための新しいアテンションメカニズムである。
GSPNは、空間的コヒーレントな画像データを直接操作し、ラインスキャンアプローチを通じて高密度なペアワイズ接続を形成することにより、制限を克服する。
GSPNは、ImageNet分類、クラス誘導画像生成、テキスト・ツー・イメージ生成などの視覚タスクにおいて、より優れた空間忠実性と最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-01-21T18:56:19Z) - Mamba2D: A Natively Multi-Dimensional State-Space Model for Vision Tasks [47.49096400786856]
State-Space Models (SSM) は、長年のトランスフォーマーアーキテクチャに代わる強力で効率的な代替品として最近登場した。
多次元の定式化から始めて、現代の選択的状態空間技術を再導出する。
Mamba2Dは、ImageNet-1Kデータセットを用いた標準的な画像分類評価において、視覚タスクに対するSSMの事前適応と同等の性能を示す。
論文 参考訳(メタデータ) (2024-12-20T18:50:36Z) - Efficient Visual State Space Model for Image Deblurring [99.54894198086852]
畳み込みニューラルネットワーク(CNN)とビジョントランスフォーマー(ViT)は、画像復元において優れた性能を発揮している。
本稿では,画像のデブロアに対する簡易かつ効果的な視覚状態空間モデル(EVSSM)を提案する。
提案したEVSSMは、ベンチマークデータセットや実世界の画像に対する最先端の手法に対して好意的に機能する。
論文 参考訳(メタデータ) (2024-05-23T09:13:36Z) - Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model [48.233300343211205]
We propose a new generic vision backbone with bidirectional Mamba block (Vim)。
Vimは画像列を位置埋め込みでマークし、視覚表現を双方向の状態空間モデルで圧縮する。
その結果,高解像度画像に対するTransformerスタイルの理解において,Vimは計算とメモリの制約を克服できることがわかった。
論文 参考訳(メタデータ) (2024-01-17T18:56:18Z) - MotionHint: Self-Supervised Monocular Visual Odometry with Motion
Constraints [70.76761166614511]
モノクローナルビジュアル・オドメトリー(VO)のための新しい自己教師型アルゴリズムMotionHintを提案する。
我々のMotionHintアルゴリズムは、既存のオープンソースSSM-VOシステムに容易に適用できる。
論文 参考訳(メタデータ) (2021-09-14T15:35:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。