論文の概要: AdaBoosting Text Prompts for Vision-Language Models
- arxiv url: http://arxiv.org/abs/2607.00684v1
- Date: Wed, 01 Jul 2026 09:28:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.830135
- Title: AdaBoosting Text Prompts for Vision-Language Models
- Title(参考訳): AdaBoosting Text Prompts for Vision-Language Models
- Authors: Seokhee Jin, Changhwan Sung, Sunung Mun, Hoyoung Kim, Jungseul Ok,
- Abstract要約: Text Prompt Boosting (TPB)は、各テキストプロンプトベースの分類器を弱い学習者として扱い、それらを強いアンサンブルに順次集約する。
TPBは、タスク固有の、モデルに依存しないキューをテキスト空間に保存し、堅牢なクロスモデル転送を可能にする。
- 参考スコア(独自算出の注目度): 23.676800230947975
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The classification accuracy of pretrained Vision-Language Models (VLMs) relies on the quality of the text prompts. Handcrafted templates and Large Language Model (LLM)-generated descriptions not only make predictions more interpretable, but also enable reuse of the same prompts across heterogeneous VLMs. Recent works construct task-adapted text prompts with a small number of labeled images. However, existing few-shot text prompting methods do not explicitly focus on misclassified examples during prompt construction, leading to only marginal improvements even as more shots become available. To fully exploit few-shot supervision, we propose Text Prompt Boosting (TPB), an AdaBoost-inspired framework that treats each text-prompt-based classifier as a weak learner and sequentially aggregates them into a strong ensemble by explicitly targeting hard, misclassified examples. Extensive experiments show that TPB preserves task-intrinsic, model-agnostic cues in text space, enabling robust cross-model transfer. Across eleven classification benchmarks, TPB improves accuracy on the source model and preserves shot-driven gains when transferred to larger, more capable VLMs, where existing methods struggle to sustain such improvements.
- Abstract(参考訳): 事前訓練された視覚言語モデル(VLM)の分類精度は、テキストプロンプトの品質に依存する。
手書きテンプレートとLLM(Large Language Model)の生成した記述は、予測をより解釈可能であるだけでなく、不均一なVLM間で同じプロンプトの再利用を可能にする。
最近の研究は少数のラベル付き画像でタスク適応型テキストプロンプトを構築している。
しかし、既存の数発のテキストプロンプトメソッドは、プロンプト構築中に誤って分類された例に明示的に焦点を合わせていないため、より多くのショットが利用可能になったとしても、限界的な改善しか得られない。
AdaBoostにインスパイアされたフレームワークであるText Prompt Boosting (TPB)を提案する。
大規模な実験により、TBBはテキスト空間におけるタスク固有の、モデルに依存しないキューを保存し、堅牢なクロスモデル転送を可能にすることが示されている。
11の分類ベンチマークで、TBBはソースモデルの精度を向上し、より大きく、より有能なVLMに移行する際にショット駆動利得を保ち、既存の手法はそのような改善を維持するのに苦労する。
関連論文リスト
- PPBoost: Progressive Prompt Boosting for Text-Driven Medical Image Segmentation [56.238478239463575]
PPBoostは弱いテキスト由来の信号を強く、空間的に接地された視覚的プロンプトに変換する。
画像やピクセルレベルのセグメンテーションラベルを持たない厳格なゼロショット方式で動作する。
テキストや視覚的にプロンプトされたベースラインよりも、Diceと正規化されたSurface Distanceを一貫して改善する。
論文 参考訳(メタデータ) (2025-11-26T23:49:44Z) - Resource-Efficient Adaptation of Large Language Models for Text Embeddings via Prompt Engineering and Contrastive Fine-tuning [3.9914181590063884]
大規模言語モデル(LLM)は自然言語処理(NLP)の基盤となっている。
プリトレーニングされたデコーダのみのLLMの適応戦略について検討する。
論文 参考訳(メタデータ) (2025-07-30T14:49:30Z) - Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation [1.3381749415517021]
大規模言語モデル(LLM)をプロンプトに活用する新たなアプローチが提案されている。
既存の方法は典型的には LLM からテキストベースの応答(つまり記述)を抽出し、プロンプトに組み込む。
記述を抽出し, LLM から直接知識を抽出する新たな手法として, 記述不要なマルチプロンプト学習(DeMul)を提案する。
論文 参考訳(メタデータ) (2025-07-09T07:55:25Z) - Can Better Text Semantics in Prompt Tuning Improve VLM Generalization? [28.041879000565874]
本稿では,大規模言語モデルから得られたクラス記述を活用するプロンプトチューニング手法を提案する。
提案手法では,より一般化可能なプロンプトを学習するために,部分レベルの説明誘導画像とテキストの特徴を合成する。
11のベンチマークデータセットで実施した総合的な実験から,提案手法が確立された手法より優れていたことが判明した。
論文 参考訳(メタデータ) (2024-05-13T16:52:17Z) - Few-shot Action Recognition with Captioning Foundation Models [61.40271046233581]
CapFSARは、テキストを手動でアノテートすることなく、マルチモーダルモデルの知識を利用するフレームワークである。
Transformerをベースとしたビジュアルテキストアグリゲーションモジュールはさらに、モーダル時間間の補完情報を組み込むように設計されている。
複数の標準的な数ショットベンチマークの実験では、提案したCapFSARが既存の手法に対して好適に動作することを示した。
論文 参考訳(メタデータ) (2023-10-16T07:08:39Z) - MetricPrompt: Prompting Model as a Relevance Metric for Few-shot Text
Classification [65.51149771074944]
MetricPromptは、数発のテキスト分類タスクをテキストペア関連性推定タスクに書き換えることで、言語設計の難易度を緩和する。
広範に使われている3つのテキスト分類データセットを4つのショット・セッティングで実験する。
結果から,MetricPromptは,手動弁証法や自動弁証法よりも優れた性能を示した。
論文 参考訳(メタデータ) (2023-06-15T06:51:35Z) - SUR-adapter: Enhancing Text-to-Image Pre-trained Diffusion Models with
Large Language Models [56.88192537044364]
本研究では,事前学習拡散モデルに対するセマンティック・アダプタ (SUR-adapter) と呼ばれる簡易なパラメータ効率の良い微調整手法を提案する。
ユーザエクスペリエンスの向上により,テキストから画像への拡散モデルの使いやすさが向上する。
論文 参考訳(メタデータ) (2023-05-09T05:48:38Z) - CPL: Counterfactual Prompt Learning for Vision and Language Models [76.18024920393245]
本稿では、視覚と言語モデルのための新しいアンダーラインテキストbfCounterfactual underlinetextbfPrompt underlinetextbfLearning (CPL)法を提案する。
CPLは、共同最適化フレームワークにおいて、反ファクト生成とコントラスト学習を同時に採用している。
実験により、CPLは異なるビジョンと言語タスクにおいて優れた数ショットのパフォーマンスを得ることができることが示された。
論文 参考訳(メタデータ) (2022-10-19T08:06:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。