論文の概要: MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning
- arxiv url: http://arxiv.org/abs/2607.12418v1
- Date: Tue, 14 Jul 2026 06:46:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.05572
- Title: MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning
- Title(参考訳): MQAdapter: 粗大なVLMファインチューニングのためのマルチモード量子アダプタ
- Authors: Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang,
- Abstract要約: 本稿では,量子計算を利用した数ショット学習のための粗大なVLM微調整手法を提案する。
MQAdapterは入力画像に最もよく似たTop-Kカテゴリ候補を検索し、セマンティックアンカーとして使用する。
次に、これらのアンカーの誘導の下で視覚的特徴を洗練させるために、クロスモーダル量子学習機構を使用する。
- 参考スコア(独自算出の注目度): 14.855850083028988
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-scale Vision-Language Models have demonstrated impressive transfer learning capabilities across a wide range of tasks. For few-shot classification, we observe that VLMs exhibit a notable ability to filter candidate categories and thus achieve high Top-K accuracy. However, they often struggle with fine-grained discrimination among visually similar categories, resulting in unsatisfactory Top-1 performance, as shown in Figure 1. Existing studies on VLM adapters generally focus on global alignment between visual and textual representations in the feature space, but fail to exploit semantically similar categories to refine fine-grained visual representations. Based on these observations, we propose a novel coarse-to-fine VLM fine-tuning approach for few-shot learning that leverages quantum computation, termed the Multi-Modal Quantum Adapter (MQAdapter). Specifically, MQAdapter first retrieves the Top-K category candidates most similar to the input image and uses them as semantic anchors. It then employs a cross-modal quantum learning mechanism to refine visual features under the guidance of these anchors. The core of this mechanism is the encoding of visual and textual features into quantum states. By leveraging quantum entanglement and superposition in a high-dimensional Hilbert space, MQAdapter effectively models higher-order cross-modal interactions, producing more discriminative representations than traditional Euclidean adapters. MQAdapter is parameter-efficient and can be integrated with various existing fine-tuning algorithms to achieve further performance gains. Evaluations on 15 datasets demonstrate the effectiveness of MQAdapter while requiring fewer trainable parameters.
- Abstract(参考訳): 大規模ビジョンランゲージモデルでは、広範囲のタスクにまたがる素晴らしいトランスファー学習能力が実証されている。
数ショットの分類では、VLMは候補カテゴリをフィルタし、高いTop-K精度が得られる。
しかし、図1に示すように、視覚的に類似したカテゴリ間のきめ細かい識別に苦しむことが多く、満足のいくトップ1のパフォーマンスをもたらす。
VLMアダプタに関する既存の研究は、一般的に、特徴空間における視覚的およびテキスト的表現のグローバルなアライメントに焦点を当てているが、細粒度の視覚的表現を洗練させるために意味論的に類似したカテゴリを利用できない。
これらの観測に基づいて,マルチモーダル量子アダプタ (MQAdapter) と呼ばれる量子計算を利用した数ショット学習のための,より粗大なVLM微調整手法を提案する。
具体的には、MQAdapterは入力画像に最もよく似たTop-Kカテゴリ候補を検索し、セマンティックアンカーとして使用する。
次に、これらのアンカーの誘導の下で視覚的特徴を洗練させるために、クロスモーダル量子学習機構を使用する。
このメカニズムの中核は、視覚的特徴とテキスト的特徴を量子状態に符号化することである。
高次元ヒルベルト空間における量子絡み合いと重ね合わせを利用することで、MQAdapterは高階のクロスモーダル相互作用を効果的にモデル化し、従来のユークリッドアダプタよりもより差別的な表現を生み出す。
MQAdapterはパラメータ効率が良く、さまざまなファインチューニングアルゴリズムと統合して、さらなるパフォーマンス向上を実現することができる。
15データセットの評価は、トレーニング可能なパラメータを少なくしながら、MQAdapterの有効性を示している。
関連論文リスト
- A Contrastive Learning Framework Empowered by Attention-based Feature Adaptation for Street-View Image Classification [0.7746379804154433]
ストリートビュー画像属性分類は、画像分類の重要な下流課題であり、自動運転、都市分析、高精細地図構築などの応用を可能にする。
CLIP-MHAdapterは、パッチ間の依存関係をモデル化するために、マルチヘッド自己アテンションを備えたボトルネックを付加する、現在の軽量CLIP適応パラダイムの亜種である。
約1.4万のトレーニング可能なパラメータで、CLIP-MHAdapterは、Global StreetScapesデータセット上の8つの属性分類タスクに対して、計算コストを低く保ちながら、新しい最先端の結果を達成する、優れた、あるいは競合的な精度を達成する。
論文 参考訳(メタデータ) (2026-02-18T16:41:32Z) - QuIC: A Quantum-Inspired Interaction Classifier for Revitalizing Shallow CNNs in Fine-Grained Recognition [1.2747974581480312]
QuICは軽量なプラグイン・アンド・プレイモジュールで、機能ディメンションを爆発させることなく、安定したシングルステージのエンドツーエンドトレーニングをサポートする。
これはVGG16のTop-1精度を20%近く向上させ、ResNet18の最先端アテンション機構(SE-Block)を上回っている。
論文 参考訳(メタデータ) (2026-01-05T15:09:18Z) - Q-Adapter: Visual Query Adapter for Extracting Textually-related Features in Video Captioning [5.762008844570409]
MLLM(Multimodal Large Language Models)の拡張を目的とした軽量ビジュアルアダプタモジュールを提案する。
Q-Adapterは、学習可能なクエリトークンとゲーティング層をVisionに導入し、外部の監視に頼ることなく、スパース、キャプション関連機能の効果的な抽出を可能にする。
MSR-VTT と MSVD の2つの有名なビデオキャプションデータセットに対して,Q-Adapter の評価を行った。
論文 参考訳(メタデータ) (2025-10-11T04:58:21Z) - Demystifying the Visual Quality Paradox in Multimodal Large Language Models [49.154146792279946]
最近のMLLM(Multimodal Large Language Models)は、視覚言語タスクのベンチマークに優れていますが、入力された視覚的品質がその応答をどのように形作るかについてはほとんど分かっていません。
本研究は,MLLMを先導する最初の体系的な研究と,視覚言語ベンチマークのスイートを対象とする。
モデル,タスク,さらには個々のインスタンスのパフォーマンスさえも,人間の知覚した忠実さから逸脱した画像を改善することができる。
論文 参考訳(メタデータ) (2025-06-18T17:14:07Z) - An Efficient Quantum Classifier Based on Hamiltonian Representations [50.467930253994155]
量子機械学習(QML)は、量子コンピューティングの利点をデータ駆動タスクに移行しようとする分野である。
入力をパウリ弦の有限集合にマッピングすることで、データ符号化に伴うコストを回避できる効率的な手法を提案する。
我々は、古典的および量子モデルに対して、テキストおよび画像分類タスクに対する我々のアプローチを評価する。
論文 参考訳(メタデータ) (2025-04-13T11:49:53Z) - Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning [49.07442840323135]
そこで本研究では,Q-Adaptという,知覚指向型命令チューニングのための新しいパラダイムを提案する。
提案したQ-Adaptは、軽量な視覚的品質評価器を実現し、同等の性能を示す。
論文 参考訳(メタデータ) (2025-04-02T12:02:57Z) - p-Laplacian Adaptation for Generative Pre-trained Vision-Language Models [10.713680139939354]
大きなコーパスで事前訓練された視覚言語モデル(VLM)は、下流のタスクで顕著な成功を収めている。
PETLはフル微調整の代替として注目されている。
グラフニューラルネットワーク(GNN)において,$p$-Laplacianメッセージパッシングを利用する新しいアダプタアーキテクチャである$p$-adapterを提案する。
論文 参考訳(メタデータ) (2023-12-17T05:30:35Z) - Approximately Equivariant Quantum Neural Network for $p4m$ Group
Symmetries in Images [30.01160824817612]
本研究では、平面$p4m$対称性に基づく画像分類のための同変量子畳み込みニューラルネットワーク(EquivQCNNs)を提案する。
2次元イジングモデルの位相検出や拡張MNISTデータセットの分類など、さまざまなユースケースでテストされた結果を示す。
論文 参考訳(メタデータ) (2023-10-03T18:01:02Z) - UniAdapter: Unified Parameter-Efficient Transfer Learning for
Cross-modal Modeling [49.134517040512414]
本論文では,UniAdapterを提案する。UniAdapterは,視覚言語モデルに対するパラメータ効率のよいクロスモーダル適応のための,ユニモーダルおよびマルチモーダルアダプタを統一する。
実験によると、UniAdapterは最先端技術を上回るだけでなく、完全な微調整戦略に勝っている。
論文 参考訳(メタデータ) (2023-02-13T18:59:10Z) - CLIP-Adapter: Better Vision-Language Models with Feature Adapters [84.88106370842883]
即時チューニング以外に、より良い視覚言語モデルを実現するための代替経路があることが示される。
CLIP-Adapterは新たなボトルネックレイヤを採用して、新機能を学び、残留スタイルの機能ブレンディングを実行する。
様々な視覚的分類タスクの実験および広範囲なアブレーション研究は、我々のアプローチの有効性を実証している。
論文 参考訳(メタデータ) (2021-10-09T11:39:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。