論文の概要: The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.23634v1
- Date: Sun, 23 Aug 2026 15:02:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-26 14:09:34.432832
- Title: The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models
- Title(参考訳): Blending Ratio is not where the performance: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models
- Authors: Liangzhi Li, Bowen Wang, Yiming Qian, Thorsten Neumann, Xia Xie, Guangshun Li,
- Abstract要約: 多くの少数ショット適応手法は、ゼロショットテキストプロトタイプとKラベル付き画像特徴の平均の凸の組み合わせで分類される。
正しい比率は何か、検証データなしで見積もることができるのか、パフォーマンスがどこにあるのかを尋ねる。
4800以上の細胞(SigLIPを含む5つのバックボーン、5つのショットカウント、5つのシード、4つのプロンプトレベル)が、理論上最適な比率は間違った量の信頼できる推定値である。
検証不要な線形プローブは、オラクルチューニングされたブレンド(CLAPは+1.9ポイント、LP++は+1.5ポイント)を破る。
- 参考スコア(独自算出の注目度): 22.461983628330277
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many few-shot adaptation methods for vision-language models classify with a convex combination of the zero-shot text prototype and the mean of the K labelled image features, with a single blending ratio routinely tuned on held-out labels, often on the test set itself. We ask what the family's own bias-variance justification invites: what is the right ratio, can it be estimated without validation data, and is finding it where the performance is? First, the ratio minimising prototype mean-squared error has a closed form whose support-set plug-in is exactly a positive-part James-Stein coefficient shrinking towards the text prototype. Across 4,800 cells (ten datasets, five backbones including SigLIP, five shot counts, five seeds, four prompt tiers) this theoretically optimal ratio is a reliable estimate of the wrong quantity: on the 950 primary-tier cells where it is defined it trails a test-set-oracle ratio by 8.5 points. It saturates near 1, discarding the text prior for a nearest-class-mean classifier, because 78% of the text-image prototype distance it treats as bias is a class-independent offset that the arg max largely cancels. We prove the mechanism and bound its share of the damage at 26% by a counterfactual. Second, leave-one-out on the support set alone sets a ratio landing within 0.9 points of the oracle blend, so it is estimable without validation data. Third, validation-free linear probes beat even the oracle-tuned blend: CLAP by +1.9 points and LP++ by +1.5 on average, and at K >= 4 all four validation-free baselines sit above the oracle, the linear probes by margins excluding zero. These results locate the ceiling in the model class, not the hyperparameter: the ratio can be set near-optimally for free, and it is still not where the performance is. Code, cached features, per-cell records: https://huggingface.co/datasets/Liangzhi-Li/clipbench-blending
- Abstract(参考訳): 視覚言語モデルのための多くの少数ショット適応手法は、ゼロショットテキストプロトタイプとKラベル付き画像特徴の平均の凸の組み合わせを分類し、通常、テストセット自体で、保持ラベルに1つのブレンディング比を調整した。
適切な比率は何か、検証データなしで見積もることができるのか、そしてパフォーマンスがどこにあるのかを見つけようとしているのか?
第一に、平均二乗誤差の比率最小化は、テキストプロトタイプに向かって縮小する正のジェームズ=シュタイン係数であるサポートセットプラグインを持つ閉形式を有する。
4800個の細胞(SigLIPを含む10のデータセット、5つのショットカウント、5つのシード、4つのプロンプトレベルを含む5つのバックボーン)にまたがるこの理論的に最適な比率は、誤った量の信頼できる推定である。
なぜなら、それがバイアスとして扱うテキストイメージのプロトタイプ距離の78%は、argの最大値がキャンセルされるクラス非依存のオフセットであるからである。
我々は、そのメカニズムを証明し、損害のシェアを26%に抑えている。
第2に、サポートセットのみに残した残余は、オラクルブレンドの0.9ポイント以内の比着陸を設定するため、検証データなしで推定可能である。
CLAP は +1.9 点、LP++ は +1.5 点、K >= 4 では 4 つのバリデーションなし基底線がオラクルの上にあり、0 を除いたマージンによる線形プローブである。
これらの結果は、ハイパーパラメータではなくモデルクラスの天井を見つけ、その比率をほぼ最適に設定できる。
コード、キャッシュ機能、セルごとの記録:https://huggingface.co/datasets/Liangzhi-Li/clipbench-blending
関連論文リスト
- When Single-Dataset Conclusions Fail: A 45-Task Study of Threshold Tuning and Resampling for Imbalanced Classification [0.0]
クラス不均衡処理は、単一のベンチマークデータセットで定期的に評価される。
リークフリーなネスト型クロスバリデーションプロトコルの下では、デフォルト0.5しきい値のプレーンランダムフォレストがF1 = 0.861 +/-0.021に達する。
閾値調整の利点は、不均衡比において非単調である。
論文 参考訳(メタデータ) (2026-08-17T05:58:33Z) - Passing Coarse Marginal Checks Can Be Cheap: Persona Mixtures and Imprecise Treatment-Response Estimates in an LLM Persona Panel [0.0]
戦略ゲームにおける16個の軽量人格条件付きGPT-4.1構成の固定パネルについて検討した。
変化は急激なインデクシングであったが、そのシェアは不確実性の仮定に依存していた。
結果は、1つの固定されたモデル・プロンプトパネルに関係し、人間の置換性を確立しない。
論文 参考訳(メタデータ) (2026-08-02T04:10:11Z) - When Does Few-Shot Prompting Help? A Systematic Empirical Study of Shot-Count Effects Across Model Scale, Architecture, and Output Parsing Robustness [0.0]
少数のインプット・アウトプット・デモペアをクエリにプリプロンプトして大きな言語モデルに提示する手法であるFew-shot promptingは、NLPで広く採用されている。
しかし、分類性能において、ショットカウントがモデルスケール、アーキテクチャ、出力フォーマットのコンプライアンスとどのように相互作用するかについて、体系的な研究はほとんど行われていない。
論文 参考訳(メタデータ) (2026-07-25T00:31:40Z) - K-ABENA: K-Adaptive Backpropagation with Error-based N-exclusion Algorithm : (Compensated Loss-Based Sample Exclusion with Unbiased Gradient Estimation) [0.0]
K-ABENAK-Adaptive Backpropagation with Error-based N-exclusionは選択的な計算フレームワークである。
これは、少量の低損失("ミニ")観測を除外することで、イット当たりの計算トレーニングコストを削減する。
ラベル制限下で0.386の精度(ベースライン:0.832)、極端な不均衡下で0.53のAUCに崩壊する。
論文 参考訳(メタデータ) (2026-07-07T06:58:51Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization [54.749573452394664]
定式化自体が単純である場合でも、インスタンスデータが大きくなるにつれて精度が低下する。
我々は, 数値データを構造化ファイルに外部化する単純な推論時アプローチであるBINDを用いて, モデルがプロンプトプロンプトからではなく, データをバインドする。
我々は,モデルのみをバインディングのみに微調整することで仮説を検証し,3つの構造的に異なる最適化カテゴリにおいて,エンドツーエンドのSFTおよびRLよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-20T21:25:41Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z) - CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification [65.46685389276443]
画像とテキストプロンプトをマッチングすることでゼロショット分類を行うことができる、視覚言語で事前訓練されたエンコーダモデルであるCLIPについて検討する。
次に, 共分散精製プロセス間のKL分散として精製リスクを定式化する。
画像の潜伏ベクトルの確率をモデル化するCLI-Diffと、画像の埋め込みとaの写真とのコサイン類似度をモデル化するCLI-Cosの2つのバリエーションを提案する。
論文 参考訳(メタデータ) (2025-02-25T13:09:34Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。