論文の概要: Beyond ZOH: Advanced Discretization Strategies for Vision Mamba
- arxiv url: http://arxiv.org/abs/2604.20606v1
- Date: Wed, 22 Apr 2026 14:20:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:11.170762
- Title: Beyond ZOH: Advanced Discretization Strategies for Vision Mamba
- Title(参考訳): ZOHを超えて - Vision Mambaの高度な離散化戦略
- Authors: Fady Ibrahim, Guangjun Liu, Guanghui Wang,
- Abstract要約: Vision Mamba はゼロオーダーホールド (ZOH) の離散化を採用し、入力信号がサンプリング瞬間間で一定であると仮定する。
ZOH, 1次ホールド(FOH), bilinear/Tustin transform(BIL), High-order hold(HOH), 4次ルンゲ・クッタ法(RK4)の6つの離散化スキームを比較した。
- 参考スコア(独自算出の注目度): 7.583024667997012
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision Mamba, as a state space model (SSM), employs a zero-order hold (ZOH) discretization, which assumes that input signals remain constant between sampling instants. This assumption degrades temporal fidelity in dynamic visual environments and constrains the attainable accuracy of modern SSM-based vision models. In this paper, we present a systematic and controlled comparison of six discretization schemes instantiated within the Vision Mamba framework: ZOH, first-order hold (FOH), bilinear/Tustin transform (BIL), polynomial interpolation (POL), higher-order hold (HOH), and the fourth-order Runge-Kutta method (RK4). We evaluate each method on standard visual benchmarks to quantify its influence in image classification, semantic segmentation, and object detection. Our results demonstrate that POL and HOH yield the largest gains in accuracy at the cost of higher training-time computation. In contrast, the BIL provides consistent improvements over ZOH with modest additional overhead, offering the most favorable trade-off between precision and efficiency. These findings elucidate the pivotal role of discretization in SSM-based vision architectures and furnish empirically grounded justification for adopting BIL as the default discretization baseline for state-of-the-art SSM models.
- Abstract(参考訳): 状態空間モデル(SSM)としてのVision Mambaはゼロオーダーホールド(ZOH)の離散化を採用しており、入力信号はサンプリング瞬間間で一定であると仮定する。
この仮定は動的視覚環境における時間的忠実度を低下させ、現代のSSMベースの視覚モデルの達成可能な精度を制約する。
本稿では、ビジョン・マンバ・フレームワーク内でインスタンス化された6つの離散化スキーム(ZOH, First-order hold (FOH), bilinear/Tustin transform (BIL), polynomial interpolation (POL), High-order hold (HOH), and the 4-order Runge-Kutta method (RK4)について、系統的かつ制御的に比較する。
画像分類,セマンティックセグメンテーション,オブジェクト検出におけるその影響を定量化するために,各手法を標準ビジュアルベンチマークで評価する。
以上の結果から,POLとHOHは訓練時間計算のコストが高いほど精度が向上することが示された。
対照的に、BILはZOHに対してわずかなオーバーヘッドで一貫した改善を提供し、精度と効率の最も良好なトレードオフを提供します。
これらの結果は、SSMベースの視覚アーキテクチャにおける離散化の重要な役割を解明し、最先端SSMモデルのデフォルトの離散化ベースラインとしてBILを採用することを実証的に根拠とした。
関連論文リスト
- SMFormer: Empowering Self-supervised Stereo Matching via Foundation Models and Data Augmentation [55.67206878777881]
本稿では、VFM(Vision Foundation Model)とデータ拡張によって導かれる、より信頼性の高いセルフスーパービジョンを統合するフレームワークであるSMFormerを提案する。
SMFormerは、自己教師付きメソッド間での最先端(SOTA)のパフォーマンスを達成し、教師付きメソッドと同等に競合する。
論文 参考訳(メタデータ) (2026-04-11T13:56:41Z) - Deterministic World Models for Verification of Closed-loop Vision-based Systems [2.5051366017487715]
本稿では,システム状態を直接生成画像にマッピングし,正確な入力境界を確保するための決定論的世界モデル(DWM)を提案する。
我々はDWMをStar-based reachability analysis(StarV)を利用した検証パイプラインに統合し、厳密な統計的境界を導出するために共形予測を用いる。
標準ベンチマーク実験により,提案手法は潜在変数ベースラインよりもはるかに密着性が高く,検証性能も良好であることが示された。
論文 参考訳(メタデータ) (2025-12-08T02:32:07Z) - WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training [64.0932926819307]
本稿では,学習速度減衰とモデルマージの正式な関係を確立するフレームワークであるWarmup-Stable and Merge(WSM)を紹介する。
WSMは様々な崩壊戦略をエミュレートするための統一された理論基盤を提供する。
私たちのフレームワークは、複数のベンチマークで広く採用されているWarmup-Stable-Decay(WSD)アプローチよりも一貫して優れています。
論文 参考訳(メタデータ) (2025-07-23T16:02:06Z) - VRS-UIE: Value-Driven Reordering Scanning for Underwater Image Enhancement [104.78586859995333]
状態空間モデル(SSM)は、線形複雑性と大域的受容場のために、視覚タスクの有望なバックボーンとして登場した。
大型で均質だが無意味な海洋背景の優位性は、希少で価値ある標的の特徴表現応答を希薄にすることができる。
水中画像強調(UIE)のための新しい値駆動リダクションスキャンフレームワークを提案する。
本フレームワークは, 水バイアスを効果的に抑制し, 構造や色彩の忠実さを保ち, 優れた向上性能(WMambaを平均0.89dB超える)を実現する。
論文 参考訳(メタデータ) (2025-05-02T12:21:44Z) - Recursive Learning of Asymptotic Variational Objectives [49.69399307452126]
一般状態空間モデル(英: General State-space Model, SSM)は、統計機械学習において広く用いられ、時系列データに対して最も古典的な生成モデルの一つである。
オンラインシーケンシャルIWAE(OSIWAE)は、潜在状態の推測のためのモデルパラメータとマルコフ認識モデルの両方のオンライン学習を可能にする。
このアプローチは、最近提案されたオンライン変分SMC法よりも理論的によく確立されている。
論文 参考訳(メタデータ) (2024-11-04T16:12:37Z) - Efficient High-Resolution Visual Representation Learning with State Space Model for Human Pose Estimation [60.80423207808076]
高解像度の視覚表現を維持しながら長距離依存関係をキャプチャすることは、人間のポーズ推定のような密集した予測タスクに不可欠である。
マルチスケールの畳み込み操作で視覚状態空間モデルを拡張する動的ビジュアル状態空間(DVSS)ブロックを提案する。
HRVMambaは効率的な高分解能表現学習のための新しいモデルである。
論文 参考訳(メタデータ) (2024-10-04T06:19:29Z) - Theoretical Foundations of Deep Selective State-Space Models [13.971499161967083]
ディープSSMは、さまざまなドメインセットで優れたパフォーマンスを示す。
最近の研究で、線形リカレンス電力が入力と隠れ状態の間の乗法的相互作用を可能にすることが示されている。
ランダム線形再帰が単純な入力制御遷移を備える場合、隠れ状態は強力な数学的対象の低次元射影であることを示す。
論文 参考訳(メタデータ) (2024-02-29T11:20:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。