論文の概要: Reprogramming Vision-Language Models via Structured Prompt Reparameterization
- arxiv url: http://arxiv.org/abs/2609.36680v1
- Date: Tue, 29 Sep 2026 04:18:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.180699
- Title: Reprogramming Vision-Language Models via Structured Prompt Reparameterization
- Title(参考訳): 構造的プロンプトパラメータ化による視覚言語モデルの再プログラミング
- Abstract要約: 視覚言語モデルでは、視覚的リプログラミングは、バックボーンを固定したまま入力と出力のインターフェイスを変更することで、事前訓練されたモデルを下流タスクに適応させる。
本稿では,各クラス内で複数のテキストプロンプトを集約し,クラス間で残差補正を行う構造化フレームワークを提案する。
入力非依存線形出力アグリゲーションを用いたCLIPベースのビジュアルリプログラミングは,凍結画像埋め込みから下流ロジットへの線形マッピングとして表現できることを示す。
- 参考スコア(独自算出の注目度): 6.794059732596106
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual reprogramming adapts pretrained models to downstream tasks by modifying their input and output interfaces while keeping the backbone fixed. In vision-language models, existing methods mainly rely on intra-class prompt aggregation and do not explicitly model relationships among classes. However, fine-grained categories often exhibit highly overlapping attribute descriptions and strong inter-class correlation in the text embedding space, where discriminative cues lie in subtle low-variance components. We propose Reparameterized Inter-Class Visual Reprogramming (RVP), a structured framework that aggregates multiple text prompts within each class and applies residual correction across classes. We also show that CLIP-based visual reprogramming with input-independent linear output aggregation can be expressed as a linear mapping from frozen image embeddings to downstream logits, and use this view to design a structured reparameterization that models shared semantic components and class-specific differences. RVP uses only a single visual prompt and can be reparameterized at inference into a frozen backbone followed by a linear classifier, incurring nearly zero computational overhead. Across 11 few-shot classification benchmarks and four CLIP backbones, RVP consistently improves over prior visual reprogramming methods with comparable or better inference efficiency.
- Abstract(参考訳): ビジュアルリプログラミングは、バックボーンを固定したまま、入力と出力のインターフェースを変更して、トレーニング済みのモデルを下流タスクに適応させる。
視覚言語モデルでは、既存の手法は主にクラス内のプロンプトアグリゲーションに依存しており、クラス間の関係を明示的にモデル化していない。
しかし、微粒なカテゴリはしばしば、微妙な低分散成分に識別的手がかりが存在するテキスト埋め込み空間において、高い重なり合う属性記述と強いクラス間相関を示す。
本稿では,各クラス内で複数のテキストプロンプトを集約し,クラス間の残差補正を行う構造化フレームワークであるReparameterized Inter-Class Visual Regramming (RVP)を提案する。
また、入力非依存線形出力アグリゲーションを用いたCLIPベースのビジュアルリプログラミングは、凍結画像埋め込みから下流ロジットへの線形マッピングとして表現可能であることを示し、この視点を用いて、セマンティックコンポーネントとクラス固有の相違をモデル化した構造的リパラメータ化を設計する。
RVPは1つの視覚的プロンプトのみを使用し、凍結したバックボーンに再パラメータ化され、線形分類器が続き、計算オーバーヘッドはほぼゼロとなる。
11のスクリーンショット分類ベンチマークと4つのCLIPバックボーンで、RVPは、同等またはより良い推論効率を持つ以前のビジュアルリプログラミングメソッドよりも一貫して改善されている。
関連論文リスト
- PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation [58.1914505657064]
本稿では,クラスレベルのセマンティクスと空間コンテキスト間の知識干渉の課題を軽減するために,単純な並列コストアグリゲーション(PCA-Seg)パラダイムを提案する。
8つのベンチマークの実験では、PCA-Segの各並列ブロックは0.35万のパラメータしか追加せず、最先端のOSPS性能を実現している。
論文 参考訳(メタデータ) (2026-03-18T09:26:43Z) - Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition [55.189113121465816]
本稿では,長い尾を持つ多ラベル視覚認識のための新しい相関適応プロンプトネットワーク(CAPNET)を提案する。
CAPNETはCLIPのテキストエンコーダからの相関を明示的にモデル化する。
テスト時間アンサンブルによる一般化を改善し、視覚・テクスチャのモダリティを実現する。
論文 参考訳(メタデータ) (2025-11-25T18:57:28Z) - Joint Multi-Condition Representation Modelling via Matrix Factorisation for Visual Place Recognition [14.020214078011515]
マルチ参照視覚的位置認識(VPR)に対処し、様々な条件下でキャプチャされた参照セットを用いて、ローカライゼーション性能を向上させる。
本稿では,複数の参照記述子を行列分解から基底表現へ変換する,学習不要で非依存な手法を提案する。
マルチ・レファレンス・データでは,Recall@1が単一参照よりも最大18%向上し,外観や視点の変化に対してマルチ・レファレンス・ベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-20T16:50:03Z) - Understanding Model Reprogramming for CLIP via Decoupling Visual Prompts [20.27639343292564]
視覚的リプログラミングのためのデカップリング・アンド・リウェイト化フレームワークを提案する。
分離視覚プロンプト(DVP)は、明示的な原因によってグループ化された記述を用いて最適化される。
我々はこれらの視覚的プロンプトの出力を確率的再重み付け行列(PRM)と統合し、各下流クラスへの貢献度を測定する。
論文 参考訳(メタデータ) (2025-06-01T13:12:13Z) - Scene Graph Generation with Role-Playing Large Language Models [50.252588437973245]
オープン語彙シーングラフ生成(OVSGG)に対する現在のアプローチは、CLIPのような視覚言語モデルを使用している。
シーン固有の記述に基づくOVSGGフレームワークであるSDSGGを提案する。
対象と対象の複雑な相互作用を捉えるために,相互視覚アダプタと呼ばれる軽量モジュールを提案する。
論文 参考訳(メタデータ) (2024-10-20T11:40:31Z) - Category-Prompt Refined Feature Learning for Long-Tailed Multi-Label Image Classification [8.139529179222844]
Category-Prompt Refined Feature Learning (CPRFL) は長尺多ラベル画像分類の新しい手法である。
CPRFLは、事前訓練されたCLIPの埋め込みからカテゴリプロンプトを初期化し、カテゴリ固有の視覚表現を分離する。
2つのLCMLCベンチマークにおいて,本手法の有効性を検証し,本手法がベースラインよりも優れていることを示す。
論文 参考訳(メタデータ) (2024-08-15T12:51:57Z) - Text Descriptions are Compressive and Invariant Representations for
Visual Learning [63.3464863723631]
本研究では,クラスごとの複数の視覚的特徴に対する人間の理解に則って,頑健な数ショット学習環境では魅力的な性能が得られることを示す。
特に,SLR-AVD (Sparse Logistic Regression using Augmented Visual Descriptors) という新しい手法を導入する。
このメソッドはまず、まず大きな言語モデル(LLM)を介して各クラスの複数の視覚的記述を自動生成し、次にVLMを使用してこれらの記述を各画像の視覚的特徴埋め込みに変換し、最後に、これらの特徴の関連するサブセットを選択するためにスパースロジスティック回帰を使用する。
論文 参考訳(メタデータ) (2023-07-10T03:06:45Z) - Anti-aliasing Semantic Reconstruction for Few-Shot Semantic Segmentation [66.85202434812942]
セグメンテーションを意味的再構成問題として再検討する。
基本クラスの特徴を,新しいクラス再構築のためのクラスレベルのセマンティック空間にまたがる一連の基底ベクトルに変換する。
提案手法はアンチエイリアス・セマンティック・リストラクション (ASR) と呼ばれ, 数発の学習問題に対して, 体系的かつ解釈可能な解法を提供する。
論文 参考訳(メタデータ) (2021-06-01T02:17:36Z) - Graph Sampling Based Deep Metric Learning for Generalizable Person
Re-Identification [114.56752624945142]
我々は、最も一般的なランダムサンプリング手法である有名なpkサンプリングは、深層メトリック学習にとって有益で効率的ではないと主張する。
大規模計量学習のためのグラフサンプリング(GS)と呼ばれる効率的なミニバッチサンプリング手法を提案する。
論文 参考訳(メタデータ) (2021-04-04T06:44:15Z) - Adaptive Prototypical Networks with Label Words and Joint Representation
Learning for Few-Shot Relation Classification [17.237331828747006]
本研究は,少ショット関係分類(FSRC)に焦点を当てる。
クラスプロトタイプの表現にラベル単語を追加するための適応的混合機構を提案する。
FewRelでは、異なる数ショット(FS)設定で実験が行われた。
論文 参考訳(メタデータ) (2021-01-10T11:25:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。