論文の概要: PRiSM: Prototype Regularization for Few-Shot VLMs
- arxiv url: http://arxiv.org/abs/2607.17820v2
- Date: Tue, 21 Jul 2026 19:33:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.611677
- Title: PRiSM: Prototype Regularization for Few-Shot VLMs
- Title(参考訳): PRiSM:Few-Shot VLMのプロトタイプ正規化
- Abstract要約: 近年、ビジョン言語モデルの文脈において、訓練なしの少数ショット適応法が注目されている。
既存のベースラインメソッド上にプラグインやプレイモジュールとしてデプロイできるクラスプロトタイプの正規化であるPRiSMを紹介します。
大規模な実験により、PRiSMは厳しいクラス不均衡や多数のクラスを扱う場合、トレーニング不要のベースラインを改善できることが示されている。
- 参考スコア(独自算出の注目度): 32.74737063872657
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training-free few-shot adaptation methods have gained significant attention recently in the context of Vision-language Models (VLMs). Yet, current benchmarks rely on strong assumptions about the statistics of the adaptation data, e.g., class balance. We question these simplifying assumptions and introduce a more realistic benchmark that varies both the levels of class balance and the effective number of classes in few-shot tasks via Dirichlet sampling. Surprisingly, under our setting, we observe substantial drops in the performances of state-of-the-art methods, more so when the number of labeled samples increases. To mitigate this, we introduce PRiSM, a class-prototype regularization that can be deployed as a plug and play module on top of any existing baseline method, significantly improving performances. Our method optimizes a novel multi-term loss, which includes a regularizer maximizing inter-class pairwise distances, along with additional terms promoting support-feature alignment and fidelity to the baseline prototypes. Furthermore, we introduce an effective and computationally efficient block Majorize-Minimize optimizer for our objective. More specifically, we derive a valid blockwise Lipschitz constant (i.e., a bound on the Hessian's spectral norm), which can be computed efficiently via the Gershgorin circle theorem. Extensive experiments show that PRiSM improves several training-free baselines, with large gains when dealing with severe class imbalance and high numbers of classes.
- Abstract(参考訳): 近年、視覚言語モデル (VLM) の文脈において、訓練なしの少数ショット適応法が注目されている。
しかし、現在のベンチマークは、適応データ(例えば、クラスバランス)の統計に関する強い仮定に依存している。
これらの単純化された仮定に疑問を呈し、ディリクレサンプリングによるクラスバランスのレベルと、数ショットタスクにおける効果的なクラスの数の両方を変えるより現実的なベンチマークを導入する。
驚いたことに、我々の設定下では、最先端の手法の性能が大幅に低下し、ラベル付きサンプルの数が増加すると、より顕著に減少する。
これを軽減するために,既存のベースラインメソッド上にプラグインおよびプレイモジュールとしてデプロイ可能なクラスプロトタイプ正規化であるPRiSMを導入し,性能を大幅に向上する。
提案手法は,クラス間距離を最大化する正規化器と,ベースラインプロトタイプに対するサポート機能アライメントと忠実度を促進させる追加用語を含む,新しい多目的損失を最適化する。
さらに,効率よく計算効率の良いブロックMajorize-Minimizeオプティマイザを提案する。
より具体的には、有効なブロックワイズ・リプシッツ定数(すなわち、ヘッセンのスペクトルノルム上の有界)を導出し、ガーシュゴリンの円定理を通じて効率的に計算できる。
大規模な実験により、PRiSMは厳しいクラス不均衡や多数のクラスを扱う場合、トレーニング不要のベースラインを改善できることが示されている。
関連論文リスト
- Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training [29.56905427210088]
Gragient-ARMは、好みのフィードバックから強化学習を使用するルーリックジェネレータとジャッジを共同で最適化するフレームワークである。
ベンチマークのベースライン間で、勾配-ARMは最先端のパフォーマンスを達成し、オフラインおよびオンラインの強化学習設定において、ダウンストリームポリシーアライメントを大幅に改善することを示す。
論文 参考訳(メタデータ) (2026-02-02T00:50:53Z) - Souper-Model: How Simple Arithmetic Unlocks State-of-the-Art LLM Performance [15.244354622288226]
本稿では,モデルスープの原則的アプローチである Soup Of Category Experts (SoCE) を紹介する。
SoCEは、弱相関カテゴリクラスタごとに「エキスパート」モデルを識別し、最適化された重み付け平均化を用いてそれらを結合する。
提案手法は,複数の領域にまたがる性能とロバスト性の向上を実証する。
論文 参考訳(メタデータ) (2025-11-17T11:13:34Z) - Language Ranker: A Lightweight Ranking framework for LLM Decoding [70.01564145836129]
本稿では,レコメンデーションパイプラインのランク付け段階に類似した復号過程を概念化する。
この知見に触発されて、我々はLanguage Rankerを提案する。
実験の結果、Language Rankerは大規模報酬モデルに匹敵するパフォーマンスを達成する一方で、0.5Mの追加パラメータしか必要としないことがわかった。
論文 参考訳(メタデータ) (2025-10-23T17:56:46Z) - Token-Efficient RL for LLM Reasoning [0.02488650627593658]
本稿では,大規模言語モデル (LLM) において,厳密なメモリと計算限界下での推論に適した強化学習戦略を提案する。
ベースラインサブトラクションを用いた早期ポリシー勾配法に基づいて,出力トークンの小さな情報サブセット上で動作する批判のない手法を設計する。
提案手法は,SVAMPベンチマークの精度を46%から70%以上に向上し,マルチ桁乗算において高い性能を示した。
論文 参考訳(メタデータ) (2025-04-29T14:58:43Z) - SLCA++: Unleash the Power of Sequential Fine-tuning for Continual Learning with Pre-training [68.7896349660824]
本稿では,Seq FTのレンズからの進行オーバーフィッティング問題を詳細に解析する。
過度に高速な表現学習と偏りのある分類層がこの問題を構成することを考慮し、先進的なSlow Learner with Alignment(S++)フレームワークを導入する。
提案手法は,バックボーンパラメータの学習率を選択的に減少させるスローラーナーと,ポストホック方式で不規則な分類層を整列させるアライメントを含む。
論文 参考訳(メタデータ) (2024-08-15T17:50:07Z) - Rethinking Classifier Re-Training in Long-Tailed Recognition: A Simple
Logits Retargeting Approach [102.0769560460338]
我々は,クラスごとのサンプル数に関する事前知識を必要とせず,シンプルなロジットアプローチ(LORT)を開発した。
提案手法は,CIFAR100-LT, ImageNet-LT, iNaturalist 2018など,様々な不均衡データセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2024-03-01T03:27:08Z) - Model-Agnostic Multitask Fine-tuning for Few-shot Vision-Language
Transfer Learning [59.38343286807997]
未知タスクの視覚言語モデルのためのモデル非依存型マルチタスクファインチューニング(MAMF)を提案する。
モデルに依存しないメタラーニング(MAML)と比較して、MAMFは二段階最適化を捨て、一階勾配のみを使用する。
MAMFは5つのベンチマークデータセット上で、数ショットの転送学習において古典的な微調整法よりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2022-03-09T17:26:53Z) - Learning with Multiclass AUC: Theory and Algorithms [141.63211412386283]
ROC曲線 (AUC) の下の領域は、不均衡学習やレコメンダシステムといった問題に対するよく知られたランキング基準である。
本稿では,マルチクラスAUCメトリクスを最適化することで,多クラススコアリング関数を学習する問題について検討する。
論文 参考訳(メタデータ) (2021-07-28T05:18:10Z) - Revisiting Unsupervised Meta-Learning: Amplifying or Compensating for
the Characteristics of Few-Shot Tasks [30.893785366366078]
我々は,限られたデータを用いて視覚認識システムを構築する,少数ショット画像分類への実践的アプローチを開発した。
基本クラスセットラベルは不要であり、識別的埋め込みは教師なしの方法でメタ学習される可能性がある。
数ショットの学習ベンチマークの実験では、従来の手法よりも4~10%のパフォーマンス差で、アプローチが優れていることが確認された。
論文 参考訳(メタデータ) (2020-11-30T10:08:35Z) - Prior Guided Feature Enrichment Network for Few-Shot Segmentation [64.91560451900125]
最先端のセマンティックセグメンテーション手法は、良い結果を得るために十分なラベル付きデータを必要とする。
少数のラベル付きサポートサンプルを持つ新しいクラスに迅速に適応するモデルを学習することで,この問題に対処するためのショットセグメンテーションが提案されている。
これらのフレームワークは、高レベルのセマンティック情報の不適切な使用により、目に見えないクラスにおける一般化能力の低下という課題に直面している。
論文 参考訳(メタデータ) (2020-08-04T10:41:32Z) - Bayesian Few-Shot Classification with One-vs-Each P\'olya-Gamma
Augmented Gaussian Processes [7.6146285961466]
FSC(Few-shot Classification)は、人間のような機械学習への道のりの重要なステップである。
P'olya-Gamma augmentation と one-vs-each softmax approximation の新たな組み合わせを提案する。
標準的な数ショット分類ベンチマークと数ショットドメイン転送タスクの両方において、精度の向上と不確かさの定量化を実証した。
論文 参考訳(メタデータ) (2020-07-20T19:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。