論文の概要: Joint Semantic Token Selection and Prompt Optimization for Interpretable Prompt Learning
- arxiv url: http://arxiv.org/abs/2605.04425v1
- Date: Wed, 06 May 2026 02:38:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.611128
- Title: Joint Semantic Token Selection and Prompt Optimization for Interpretable Prompt Learning
- Title(参考訳): 解釈可能なプロンプト学習のための共同意味的トークン選択とプロンプト最適化
- Authors: Yating Wang, Yaqi Zhao, Yongshun Gong, Yilong Yin, Haoliang Sun,
- Abstract要約: Interpretable Prompt Learningは、個別の意味トークンの選択と連続的なプロンプト最適化を交互に行うハイブリッドフレームワークである。
我々のフレームワークはプラグイン・アンド・プレイであり、既存の即興学習手法とシームレスに統合できる。
- 参考スコア(独自算出の注目度): 57.91658393667469
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Vision-language models such as CLIP achieve strong visual-textual alignment, but often suffer from overfitting and limited interpretability when adapted through continuous prompt learning. While discrete prompt optimization improves interpretability, it usually depends on large external models, leading to high computational costs and limited scalability. In this paper, we propose Interpretable Prompt Learning (IPL), a hybrid framework that alternates between discrete semantic token selection and continuous prompt optimization. Specifically, IPL formulates semantic token selection as an approximate submodular optimization problem, encouraging tokens that are both human-understandable and semantically diverse. It further adopts an alternating optimization strategy to integrate discrete token selection with continuous prompt tuning, improving interpretability while preserving adaptability to downstream tasks. Our framework is plug-and-play, allowing seamless integration with existing prompt learning methods. Extensive experiments on multiple benchmarks show that IPL consistently improves both interpretability and accuracy across five representative prompt learning methods, providing an effective and scalable extension to existing frameworks.
- Abstract(参考訳): CLIPのような視覚言語モデルは、強い視覚的テキストアライメントを実現するが、連続的なプロンプト学習を通じて適応する場合、過度な適合と限定的な解釈性に悩まされることが多い。
離散的なプロンプト最適化は解釈可能性を改善するが、通常は大きな外部モデルに依存し、高い計算コストと限られたスケーラビリティをもたらす。
本稿では,個別のセマンティックトークン選択と連続的なプロンプト最適化を交互に行うハイブリッドフレームワークであるInterpretable Prompt Learning (IPL)を提案する。
特に、IPLは意味的トークン選択を近似的な部分モジュラー最適化問題として定式化し、人間の理解可能かつ意味的に多様であるトークンを奨励する。
さらに、個別のトークン選択を連続的なプロンプトチューニングに統合し、下流タスクへの適応性を保ちながら解釈性を改善するための交代最適化戦略を採用している。
我々のフレームワークはプラグイン・アンド・プレイであり、既存の即興学習手法とシームレスに統合できる。
複数のベンチマークに関する大規模な実験により、IPLは5つの代表的なプロンプト学習手法の解釈可能性と精度を一貫して改善し、既存のフレームワークを効果的かつスケーラブルに拡張することを示した。
関連論文リスト
- Few-Shot Remote Sensing Image Scene Classification with CLIP and Prompt Learning [0.9558392439655014]
我々は,数ショットのリモートセンシング画像シーン分類のための軽量かつ効率的な適応戦略として,即時学習を探求する。
これらのプロンプト学習手法を,手作りプロンプトを用いたゼロショットCLIPと,凍結したCLIPの特徴を訓練した線形プローブの2つの標準ベースラインに対してベンチマークした。
我々の研究結果は、衛星画像と空中画像の領域ギャップを埋めるスケーラブルで効率的な方法として、迅速な学習を裏付けている。
論文 参考訳(メタデータ) (2025-10-28T11:39:22Z) - Prompt and Parameter Co-Optimization for Large Language Models [35.72638351230096]
LLM(Large Language Models)トレーニングのために,迅速な最適化と微調整を共同で統合する,新しいフレームワークであるMetaTunerを紹介する。
我々のフレームワークは、プロンプトとパラメータの最適な組み合わせを見つけるために最適化されている。
様々なベンチマーク実験により、我々の手法はベースラインを一貫して上回ることがわかった。
論文 参考訳(メタデータ) (2025-09-29T03:38:25Z) - Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors [50.7383184560431]
連続学習(CL)は、破滅的な忘れ込みを避けながら、ディープネットワークが新たな知識を得ることを可能にする。
インクリメンタルなプロンプトチューニングに基づくCLIPのための簡潔なCLアプローチを提案する。
我々の双方向監視戦略は、忘れを減らしながら、新しい知識をより効果的に学習することを可能にする。
論文 参考訳(メタデータ) (2025-05-27T03:51:37Z) - Prompt-OT: An Optimal Transport Regularization Paradigm for Knowledge Preservation in Vision-Language Model Adaptation [5.296260279593993]
CLIPのような視覚言語モデル(VLM)は、強力なパフォーマンスを示すが、下流タスクに適応する際には苦労する。
本稿では,特徴分布の構造的整合性を保つことにより,忘れを軽減できる最適トランスポート(OT)誘導型プロンプト学習フレームワークを提案する。
提案手法は,視覚とテキスト表現の両面に制約を課し,全体的な特徴の整合性を確保する。
論文 参考訳(メタデータ) (2025-03-11T21:38:34Z) - SRA-CL: Semantic Retrieval Augmented Contrastive Learning for Sequential Recommendation [23.050104678143935]
SRA-CL(Semantic Retrieval Augmented Contrastive Learning)という新しい手法を提案する。
SRA-CLはLLMのセマンティック理解と推論機能を活用し、ユーザの好みやアイテムの特徴をキャプチャする表現的な埋め込みを生成する。
SRA-CLはプラグイン・アンド・プレイの設計を採用しており、既存のシーケンシャルレコメンデーションアーキテクチャとシームレスに統合できる。
論文 参考訳(メタデータ) (2025-03-06T07:25:19Z) - Think Beyond Size: Adaptive Prompting for More Effective Reasoning [0.0]
本稿では,動的かつ反復的なフレームワークであるAdaptive Promptingを紹介する。
その結果、Adaptive Promptingは、算術的推論(GSM8K、MultiArithm)、論理的推論、コモンセンスタスクなど、様々な推論ベンチマークのパフォーマンスを著しく向上させることを示した。
提案手法は,計算効率を維持しつつ,GPT-4などの大規模モデルと競合する性能を実現する。
論文 参考訳(メタデータ) (2024-10-10T17:14:36Z) - In-context Demonstration Matters: On Prompt Optimization for Pseudo-Supervision Refinement [71.60563181678323]
大規模言語モデル(LLM)は様々なタスクで大きな成功を収めており、生成品質をさらに向上させるためには微調整が必要である場合もある。
これらの課題に対処する直接的な解決策は、教師なしの下流タスクから高信頼のデータを生成することである。
本稿では,プロンプトと全体的な擬似スーパービジョンを両立させる新しい手法,擬似教師付きデモアライメント・アライメント・アライメント・プロンプト・最適化(PAPO)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-10-04T03:39:28Z) - MaPLe: Multi-modal Prompt Learning [54.96069171726668]
本稿では,視覚と言語分岐の両方を対象としたマルチモーダル・プロンプト・ラーニング(MaPLe)を提案し,視覚と言語表現の整合性を改善する。
最先端のCo-CoOpと比較すると、MaPLeは優れた性能を示し、新規クラスでは3.45%の絶対的な向上を達成している。
論文 参考訳(メタデータ) (2022-10-06T17:59:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。