論文の概要: ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.08060v1
- Date: Sat, 08 Aug 2026 10:55:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.629921
- Title: ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models
- Title(参考訳): ZOMP:視覚言語モデルのためのゼロ階マルチモーダルプロンプトチューニング
- Abstract要約: ZOMPは、クエリ効率が高く、完全にフォワードのみのプロンプトチューニング手法である。
BPフリーのプロンプトチューニング手法では、数ショットの精度とクエリ効率の両方で一貫して性能が向上する。
その結果,マルチモーダリティと低ランク構造を併用することで,実用的で実用的なBPフリープロンプトチューニングに有効な経路であることが示唆された。
- 参考スコア(独自算出の注目度): 14.64726819144383
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fine-tuning vision-language models such as CLIP typically requires backpropagation (BP) through the full model, which is infeasible when only forward-pass access is available, as is common for memory-constrained edge devices and proprietary model deployments. Prior BP-free, zeroth-order prompt-tuning methods avoid this requirement but often tune prompts in a single modality or optimize over a search space large enough that convergence requires thousands of forward passes, which is impractical under realistic query budgets. We propose ZOMP (Zeroth-Order Multimodal Prompt tuning), a query-efficient, fully forward-only method that tunes deep prompts in both the vision and text branches of a frozen CLIP model using simultaneous perturbation stochastic approximation. ZOMP combines three ingredients: a cross-modal low-rank reparameterization that ties the two branches through a shared factor and keeps the effective search dimensionality small, a gradient-correction momentum term that stabilizes the noisy zeroth-order estimate, and a budget-indexed rank schedule that unlocks capacity as the query budget is spent. Across 13 vision-language benchmarks under a matched 5,000-query budget, ZOMP consistently outperforms prior BP-free prompt-tuning methods in both few-shot accuracy and query efficiency, and it generalizes better across base-to-new, cross-dataset transfer, and out-of-distribution settings. Our results show that jointly exploiting multimodality and low-rank structure is an effective route to practical, query-efficient BP-free prompt tuning.
- Abstract(参考訳): CLIPのような微調整の視覚言語モデルは、通常、完全なモデルによるバックプロパゲーション(BP)を必要とする。
BPフリーでゼロオーダーのプロンプトチューニング手法では、この要件は避けられるが、多くの場合、単一のモダリティでプロンプトをチューニングしたり、数千の前方通過を必要とするような大規模な検索空間を最適化する。
ZOMP (Zeroth-Order Multimodal Prompt tuning) は、同時摂動確率近似を用いて凍結したCLIPモデルのビジョンとテキスト分岐の深いプロンプトを調整し、クエリ効率が高く、完全にフォワードのみの手法である。
ZOMPは、3つの要素を組み合わさったクロスモーダルな低ランク再パラメータ化(英語版)と、有効探索次元を小さく保ち、ノイズゼロ階推定を安定化させる勾配補正モーメント項と、クエリ予算が費やされるにつれてキャパシティをアンロックする予算インデックス付きランクスケジュール(英語版)である。
5,000クエリの予算に適合する13のビジョン言語ベンチマークにおいて、ZOMPは、数ショットの精度とクエリ効率の両方でBPフリーのプロンプトチューニング手法を一貫して上回り、ベース・トゥ・ニュー、クロス・データセット転送、アウト・オブ・ディストリビューション・セッティングで改善されている。
その結果,マルチモーダリティと低ランク構造を協調的に活用することは,実用的でクエリ効率のよいBPフリープロンプトチューニングに有効な方法であることが示唆された。
関連論文リスト
- Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models [65.49950267695267]
我々はコヒーレンス保存コンテクスト蒸留によるパラメトリックメモリの効率的な圧縮フレームワークであるOmni2LoRAを紹介する。
本手法は,マルチモーダルメモリを固定予算で再利用可能なパラメータ状態に変換することにより,応答時間のマルチモーダルトーケン負荷をゼロにする。
論文 参考訳(メタデータ) (2026-08-10T07:49:10Z) - Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models [91.19049123903137]
テキストから画像への推論時間のスケーリングは、単純なBest-of-N$サンプリングからガイド付き検索方法まで進歩している。
これらのアプローチは、いつ、どの程度の頻度でデノベーションを行うかに焦点が当てられているが、生成自体のコストを固定として扱うのがほとんどである。
ウォールクロック評価では、単純なBoNが既にいくつかのガイド付き検索手法に適合または優れていたことを示す。
論文 参考訳(メタデータ) (2026-07-05T19:02:32Z) - Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning [87.18590662029432]
本稿では,プロアクティブルーティングパラダイムであるPRPを提案する。このパラダイムは,ドラフトモデルとターゲットモデルの両方の能力を評価することで,早期意思決定を可能にする。
筆者らの試案であるレーティング学習 (DRL) は内部信頼度推定器を内蔵し, 共同レーティング学習 (JRL) は対象モデルが与えられたクエリをどの程度処理できるかを予測する。
これらの評価により、詳細なインスタンスレベルの textbfProactive Routing が可能になり、全体的なパフォーマンスを損なうことなく、推論を大幅に高速化できる。
論文 参考訳(メタデータ) (2026-06-29T12:30:24Z) - Universally Empowering Zeroth-Order Optimization via Adaptive Layer-wise Sampling [43.822941944402544]
ゼロ階最適化は、微調整された大規模言語モデルのための有望なメモリ効率のパラダイムを提供する。
しかし,壁面収差の緩やかな収束と高い推定分散により,その実用化は厳しく制約されている。
本稿では,適応層型ZO最適化フレームワークであるAdaLeZOを提案する。
論文 参考訳(メタデータ) (2026-04-20T13:37:31Z) - PLUME: Latent Reasoning Based Universal Multimodal Embedding [52.35354073629127]
ユニバーサルマルチモーダル埋め込み(UME)は、異種入力を単一のモデルで共有検索空間にマッピングする。
最近のアプローチでは、埋め込みを抽出する前に明確なチェーン・オブ・シント(CoT)論理を生成することにより、UMEを改善している。
PLUMEは,言語化されたCoTを連続的潜伏状態の短時間の自己回帰ロールアウトに置き換えることで,UMEを進化させる潜在的推論フレームワークである。
論文 参考訳(メタデータ) (2026-04-02T14:04:53Z) - Deterministic Differentiable Structured Pruning for Large Language Models [37.33389749907146]
構造化プルーニングは、重要度の低いアーキテクチャ部品を取り除き、LLM推論コストを削減する。
マスクのみの最適化手法であるDDP(Deterministic Differentiable Pruning)を提案する。
従来のアプローチと比較して、DDPはより表現力が高く、テストミスマッチが減少し、より早く収束する。
論文 参考訳(メタデータ) (2026-03-09T07:59:17Z) - MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation [12.481603155570037]
textbfMMLoP (textbfMulti-textbfModal textbfLow-Rank textbfPrompting) を提案する。
論文 参考訳(メタデータ) (2026-02-24T22:00:34Z) - Towards Generalizable Trajectory Prediction Using Dual-Level Representation Learning And Adaptive Prompting [107.4034346788744]
既存の車両軌道予測モデルは、一般化可能性、予測の不確実性、複雑な相互作用を扱う。
本研究では,(1)自己拡張(SD)とマスドレコンストラクション(MR)による二重レベル表現学習,グローバルコンテキストと細部の詳細の収集,(2)レジスタベースのクエリと事前学習の強化,クラスタリングと抑圧の必要性の排除,(3)微調整中の適応型プロンプトチューニング,メインアーキテクチャの凍結,および少数のプロンプトの最適化といった,新たなトラジェクタ予測フレームワークであるPerceiverを提案する。
論文 参考訳(メタデータ) (2025-01-08T20:11:09Z) - Parameter-efficient Tuning of Large-scale Multimodal Foundation Model [68.24510810095802]
我々はこれらの課題を克服するために、クロスモーダル転送(Aurora)のための優雅なプロンプトフレームワークを提案する。
既存のアーキテクチャの冗長性を考慮すると、まずモード近似を用いて0.1Mのトレーニング可能なパラメータを生成し、マルチモーダルプロンプトチューニングを実装する。
6つのクロスモーダルベンチマークの徹底的な評価は、最先端のベンチマークを上回るだけでなく、完全な微調整アプローチよりも優れていることを示している。
論文 参考訳(メタデータ) (2023-05-15T06:40:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。