論文の概要: MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization
- arxiv url: http://arxiv.org/abs/2608.03885v1
- Date: Tue, 04 Aug 2026 16:20:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 17:47:10.510298
- Title: MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization
- Title(参考訳): MuRA: 効率的なテスト時間ビジョンランゲージ一般化のためのマルチランク適応
- Authors: Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji,
- Abstract要約: 視覚言語モデルは目覚ましいゼロショット能力を示すが、分布シフトによって性能が著しく低下する。
トークンレベルの視覚的複雑さに基づいて適応モジュールを動的に選択・融合する新しいフレームワークであるMulti-Rank Adaptation (MuRA)を提案する。
MuRAは、広範囲のドメイン一般化とクロスデータセットベンチマークで最先端の精度を達成する。
- 参考スコア(独自算出の注目度): 38.96061852021375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language models exhibit remarkable zero-shot capabilities but suffer significant performance degradation under distribution shifts. While test-time adaptation (TTA) via Low-Rank Adaptation offers a parameter-efficient solution, we identify a fundamental bottleneck in current methods: the reliance on static rank configurations. Because visual inputs inherently possess varying information densities, a fixed rank forces an inevitable optimization compromise, leading to underfitting on complex scenes and overfitting on simple ones. To bridge this gap, we propose Multi-Rank Adaptation (MuRA), a novel framework that dynamically selects and fuses adaptation modules of varying capacities based on token-level visual complexity. MuRA synergizes Multi-Rank Orthogonal Decomposition to provide a superior, knowledge-preserving initialization, and Unified Component Fusion with Continuous Router Updating to sustainably learn semantic-to-rank mappings. Furthermore, we provide rigorous theoretical justifications mathematically proving the necessity and gradient stability of this adaptive mechanism. Crucially, MuRA's dynamic design uniquely thrives at the deepest visual layer, capitalizing on the shortest gradient backpropagation path. Extensive experiments demonstrate that MuRA achieves state-of-the-art accuracy across extensive domain generalization and cross-dataset benchmarks while significantly reducing both computational and memory overhead.
- Abstract(参考訳): 視覚言語モデルは目覚ましいゼロショット能力を示すが、分布シフトによって性能が著しく低下する。
低ランク適応によるテスト時間適応(TTA)はパラメータ効率のよいソリューションを提供するが、現在の手法の基本的なボトルネックは、静的な階数設定への依存である。
視覚入力は本質的に様々な情報密度を持つため、固定ランクは必然的に最適化の妥協を迫られ、複雑なシーンに過度に適合し、単純なシーンに過度に適合する。
このギャップを埋めるために、トークンレベルの視覚的複雑さに基づいて様々な能力を持つ適応モジュールを動的に選択・融合する新しいフレームワークであるMulti-Rank Adaptation (MuRA)を提案する。
MuRAはマルチランク直交分解を相乗化し、優れた知識保存初期化と連続ルータ更新による統一コンポーネント融合を提供し、セマンティック・ツー・ランクマッピングを継続的に学習する。
さらに、この適応機構の必要性と勾配安定性を数学的に証明する厳密な理論的正当性を提供する。
重要な点として、Muraのダイナミックデザインは最も深い視覚層で独自に成長し、最短勾配のバックプロパゲーションパスを生かしている。
大規模な実験により、MuRAは広範囲なドメインの一般化とクロスデータセットのベンチマークにまたがって最先端の精度を達成し、計算とメモリのオーバーヘッドを大幅に削減することを示した。
関連論文リスト
- Plug, Play, and Fortify: A Low-Cost Module for Robust Multimodal Image Understanding Models [6.350443894942629]
MWAM(Multimodal Weight Allocation Module)は、トレーニング中の各ブランチのコントリビューションを動的に再バランスするプラグイン・アンド・プレイコンポーネントである。
MWAMは幅広いタスクとモダリティの組み合わせで一貫したパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-02-26T05:51:41Z) - OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL [63.388513841293616]
既存の偽造検出手法は、現実世界の誤報に多いインターリーブされたテキスト、画像、ビデオを扱うのに失敗する。
このギャップを埋めるため,本論文では,オムニバス・ビジョン言語による偽造検出と接地のための統一フレームワークの開発を目標としている。
我々は、OmniVL-Guardという、オムニバス視覚言語による偽造検出と接地のためのバランスの取れた強化学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T09:41:36Z) - LP-LLM: End-to-End Real-World Degraded License Plate Text Recognition via Large Multimodal Models [4.497411606350301]
LPR(Real-world License Plate Recognition)は、モーションボケ、低解像度、複雑な照明などの深刻な劣化によって大きな課題に直面している。
画像復元モデルの画素レベルの最適化目標は、文字認識のセマンティックな目標と不一致である。
本稿では,Qwen3-VLに基づくエンドツーエンド構造対応マルチモーダル推論フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-14T03:32:55Z) - Mixture of Ranks with Degradation-Aware Routing for One-Step Real-World Image Super-Resolution [76.66229730098759]
実世界の画像超解像(Real-ISR)では、既存のアプローチは主に微調整された事前学習拡散モデルに依存している。
単一ステップ画像超解像のためのMixture-of-Ranks (MoR)アーキテクチャを提案する。
LoRAの各ランクを独立した専門家として扱う、きめ細かい専門家分割戦略を導入する。
論文 参考訳(メタデータ) (2025-11-20T04:11:44Z) - Learning from Heterogeneity: Generalizing Dynamic Facial Expression Recognition via Distributionally Robust Optimization [23.328511708942045]
Heterogeneity-Aware Distributional Framework (HDF) は、時間周波数モデリングを強化し、ハードサンプルによる不均衡を軽減するために設計された。
時間周波数分散アテンションモジュール(DAM)は、時間的一貫性と周波数ロバスト性の両方をキャプチャする。
適応最適化モジュール 分散対応スケーリングモジュール (DSM) は、動的に分類と対照的な損失のバランスをとるために導入された。
論文 参考訳(メタデータ) (2025-07-21T16:21:47Z) - Learning to Fuse: Modality-Aware Adaptive Scheduling for Robust Multimodal Foundation Models [0.0]
モーダリティ・アウェア・アダプティブ・フュージョン・スケジューリング(MA-AFS)は、各モーダリティの寄与をインスタンス単位で動的に調節することを学ぶ。
本研究は, 適応融合の重要性を強調し, 信頼性と不確実性を考慮したマルチモーダル学習に向けた有望な方向性を開く。
論文 参考訳(メタデータ) (2025-06-15T05:57:45Z) - Unleashing Network Potentials for Semantic Scene Completion [50.95486458217653]
本稿では,新しいSSCフレームワーク - Adrial Modality Modulation Network (AMMNet)を提案する。
AMMNetは、モダリティ間の勾配流の相互依存性を可能にするクロスモーダル変調と、動的勾配競争を利用するカスタマイズされた逆トレーニングスキームの2つのコアモジュールを導入している。
AMMNetは最先端のSSC法よりも大きなマージンで優れていた。
論文 参考訳(メタデータ) (2024-03-12T11:48:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。