論文の概要: CrossMambaTuning: Synergistic Spatial and Cross-Layer Adaptation for Machine Vision Compression
- arxiv url: http://arxiv.org/abs/2608.25568v1
- Date: Wed, 26 Aug 2026 09:20:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.69988
- Title: CrossMambaTuning: Synergistic Spatial and Cross-Layer Adaptation for Machine Vision Compression
- Title(参考訳): CrossMambaTuning: マシンビジョン圧縮のための相乗的空間とクロスレイア適応
- Abstract要約: そこで我々は,状態空間モデルとパラメータ効率の良い微調整のための層間相互作用機構を統合したCrossMambaTuningという新しいフレームワークを提案する。
具体的には、タスク固有のプロンプトとマルチスケール分岐機能を備えた効率的なMambaアダプタを設計し、局所的な特徴とグローバルな依存関係の両方を正確に把握する。
実験により、CrossMambaTuningは複数のマシンビジョンタスク上での最先端(SOTA)のパフォーマンスを実現し、SOTAメソッドと比較してパラメータのオーバーヘッドを72%削減した。
- 参考スコア(独自算出の注目度): 4.294434416475728
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: To reduce deployment cost and retraining overhead, adapting pretrained learned image compression (LIC) models to downstream machine vision tasks has attracted growing attention. However, existing methods typically insert fine-tuning modules independently into frozen backbones, lacking explicit mechanisms for cross-layer coordination. To address this limitation, we propose a novel framework named CrossMambaTuning, which integrates State Space Models with cross-layer interaction mechanisms for parameter-efficient fine-tuning. Specifically, we design an efficient Mamba adapter equipped with task-specific prompts and multi-scale branching to precisely capture both local features and global dependencies. Furthermore, we introduce a Scale-Invariant Cross-Layer Adapter (SICA) utilizing a parameter-sharing strategy to fuse task information across different scales and reduce redundancy. Extensive experiments demonstrate that CrossMambaTuning achieves state-of-the-art (SOTA) performance on multiple machine vision tasks, reducing parameter overhead by 72\% compared to SOTA methods. Code is available at https://github.com/rsr1123/CrossMambaTuning.
- Abstract(参考訳): デプロイメントコストの削減とオーバーヘッドの再トレーニングのために、ダウンストリームマシンビジョンタスクに事前学習された画像圧縮(lic)モデルを適用することが注目されている。
しかし、既存の手法は通常、微調整モジュールを凍結したバックボーンに独立に挿入し、層間調整の明確なメカニズムを欠いている。
この制限に対処するために、状態空間モデルとパラメータ効率の良い微調整のための層間相互作用機構を統合したCrossMambaTuningという新しいフレームワークを提案する。
具体的には、タスク固有のプロンプトとマルチスケール分岐機能を備えた効率的なMambaアダプタを設計し、局所的な特徴とグローバルな依存関係の両方を正確に把握する。
さらに、パラメータ共有戦略を利用したスケール不変クロスレイヤアダプタ(SICA)を導入し、タスク情報を異なるスケールで融合させ、冗長性を低減した。
大規模な実験により、CrossMambaTuningは複数のマシンビジョンタスク上での最先端(SOTA)性能を実現し、SOTAメソッドと比較してパラメータのオーバーヘッドを72倍削減した。
コードはhttps://github.com/rsr1123/CrossMambaTuningで入手できる。
関連論文リスト
- MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts [37.49087932678935]
MoECodecはトークン対応の画像圧縮フレームワークで、単一のモデル内で複数のダウンストリームタスクをサポートする。
MoECodecは、Transformerベースの圧縮モデルにおけるFFN層を置き換える。
論文 参考訳(メタデータ) (2026-06-19T01:56:25Z) - Auto-FlexSwitch: Efficient Dynamic Model Merging via Learnable Task Vector Compression [54.12624130407679]
タスクベクトルを3つのコンパクトなコンポーネントに分解するT-Switchを提案する。
次に,タスクベクトルを自動生成するトレーニングフリーマージスキームであるAuto-Switchを紹介する。
本稿では,高効率なタスクベクトル圧縮をサポートする動的モデルマージ手法であるAuto-FlexSwitchを提案する。
論文 参考訳(メタデータ) (2026-04-30T16:58:05Z) - Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation [8.840077295284393]
MoBaNetはパラメータ効率とモダリティバランスを持つ対称核融合フレームワークである。
ほとんど凍結されたVFMバックボーン上に構築されたMoBaNetは、一般化可能な表現を維持するために対称なデュアルストリームアーキテクチャを採用している。
ISPRS VaihingenとPotsdamベンチマークの実験は、MoBaNetが最先端のパフォーマンスを達成することを示した。
論文 参考訳(メタデータ) (2026-03-18T13:23:58Z) - Parameter Aware Mamba Model for Multi-task Dense Prediction [69.94454603308196]
本稿では,マルチタスク学習環境における高密度予測に特化して設計された,新しいデコーダベースのフレームワーク Aware Mamba Model (PAMM) を紹介する。
タスク固有のパラメータを統合および設定し、各タスクの固有の特性をキャプチャする、二重状態空間パラメータの専門家を特徴とする。
マルチディレクショナル・ヒルベルト走査法を用いて多角特徴系列を構築し、2次元データに対するシーケンスモデルの知覚能力を向上する。
論文 参考訳(メタデータ) (2025-11-18T13:48:00Z) - Structural Similarity-Inspired Unfolding for Lightweight Image Super-Resolution [88.20464308588889]
効率的な画像SRのための構造類似インスパイアド・アンフォールディング(SSIU)法を提案する。
この方法は、構造的類似性に制約されたSR最適化関数の展開によって設計される。
我々のモデルは現在の最先端モデルより優れており、パラメータ数が低く、メモリ消費が減少している。
論文 参考訳(メタデータ) (2025-06-13T14:29:40Z) - Multi-Level Embedding and Alignment Network with Consistency and Invariance Learning for Cross-View Geo-Localization [2.733505168507872]
CVGL(Cross-View Geo-Localization)は、最もよく似たGPSタグ付き衛星画像を取得することで、ドローン画像のローカライゼーションを決定する。
既存の手法は、モデルの性能を改善する際に、計算と記憶の要求が増大する問題をしばしば見落としている。
マルチレベル・エンベディング・アライメント・ネットワーク(MEAN)と呼ばれる軽量なアライメント・ネットワークを提案する。
論文 参考訳(メタデータ) (2024-12-19T13:10:38Z) - SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks [45.68176825375723]
本稿では,視覚バックボーンネットワークのための効率的な層間特徴集約機構を提案する。
ヒト視覚系における網膜ガングリオン細胞(RGC)にインスパイアされ、SparXと呼ばれる新しいスパース層間結合機構を提案する。
我々の新しい接続機構は、様々な視覚タスクにおいて優れた性能と一般化能力を持つ。
論文 参考訳(メタデータ) (2024-09-15T07:46:18Z) - CAS-ViT: Convolutional Additive Self-attention Vision Transformers for Efficient Mobile Applications [73.80247057590519]
ビジョントランスフォーマー(ViT)は、トークンミキサーの強力なグローバルコンテキスト能力によって、ニューラルネットワークの革命的な進歩を示す。
CAS-ViT: Convolutional Additive Self-attention Vision Transformerを導入し、モバイルアプリケーションにおける効率と性能のバランスを実現する。
ImageNet-1Kのパラメータは12M/21Mで83.0%/84.1%である。
論文 参考訳(メタデータ) (2024-08-07T11:33:46Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z) - Consolidator: Mergeable Adapter with Grouped Connections for Visual
Adaptation [53.835365470800916]
視覚変換器の知識を効率よく効果的に伝達する方法を示す。
調整可能なパラメータの小さなセットを追加して,事前学習モデルを変更するコンソリケータを提案する。
我々のコンソリエータは、0.35%のパラメータで完全な微調整よりも最大7.56の精度で到達できる。
論文 参考訳(メタデータ) (2023-04-30T23:59:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。