論文の概要: PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts
- arxiv url: http://arxiv.org/abs/2605.21776v1
- Date: Wed, 20 May 2026 22:10:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-22 20:14:18.496983
- Title: PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts
- Title(参考訳): PromptNCE: LLMとContrastive Estimation Promptのみを用いたポイントワイズ相互情報予測
- Abstract要約: テキストから相互情報を推定するには、通常、タスク固有の批評家を訓練する必要がある。
大規模言語モデルでは、プロンプトと帰納確率のみを用いて、ポイントワイドな相互情報ゼロショットを推定できるかどうかを問う。
我々は,3つの公開データセットに対して,人間由来の地中PMIを用いたベンチマークを導入し,情報理論に基づく5つのプロンプトベース推定手法を評価する。
- 参考スコア(独自算出の注目度): 3.015315464409211
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Estimating mutual information from text usually requires training a task-specific critic, which limits its use in low-data settings. We ask whether large language models can instead estimate pointwise mutual information zero-shot, using only prompts and elicited probabilities. We introduce a benchmark with human-derived ground-truth PMI across three publicly available datasets, and evaluate five information-theoretic prompting-based estimators. Our main method, PromptNCE, frames conditional probability estimation as a contrastive task and augments the candidate set with an explicit OTHER category. We show theoretically that adding OTHER recovers the true conditional P(y | x) rather than just a ranking over listed candidates, turning a contrastive prompt into a general-purpose zero-shot probability estimator. PromptNCE is the best zero-shot method on all three datasets, reaching Spearman correlation up to 0.82 with human-derived PMI. We also present a case study in computer science education showing how these estimators can be used to score student knowledge summaries in a low-data setting.
- Abstract(参考訳): テキストから相互情報を推定するには、通常、タスク固有の批評家を訓練する必要がある。
大規模言語モデルでは、プロンプトと帰納確率のみを用いて、ポイントワイドな相互情報ゼロショットを推定できるかどうかを問う。
我々は,3つの公開データセットに対して,人間由来の地中PMIを用いたベンチマークを導入し,情報理論に基づく5つのプロンプトベース推定手法を評価する。
提案手法であるPromptNCEは、条件付き確率推定をコントラスト的タスクとしてフレーム化し、明示的なOTHERカテゴリで候補集合を拡大する。
理論的には、OTHER の追加は、リストされた候補に対するランキングではなく、真の条件 P(y | x) を復元し、対照的なプロンプトを汎用的なゼロショット確率推定器に変換する。
PromptNCEは3つのデータセットで最高のゼロショット法であり、人間由来のPMIとのSpearman相関は最大0.82に達する。
また、コンピュータサイエンス教育におけるケーススタディとして、これらの推定器を用いて、低データ環境で学生の知識の要約を評価する方法を示す。
関連論文リスト
- Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Leveraging Large Language Models for Predictive Analysis of Human Misery [1.2458057399345226]
本研究では,Large Language Models (LLMs) を用いて,人間に知覚された悲惨なスコアを予測する。
我々は、ゼロショット、固定コンテキスト、検索に基づくプロンプトを含む複数のプロンプト戦略を評価する。
静的評価を超えて,テレビフォーマットに触発された新たなゲーム化フレームワークである"Misery Game Show"を導入する。
論文 参考訳(メタデータ) (2025-08-18T07:02:59Z) - Probabilistic Reasoning with LLMs for k-anonymity Estimation [32.33315973296769]
大規模言語モデルに対する不確実性を考慮した新しい数値推論タスクを提案する。
BRANCHは、与えられた情報と一致する集団の大きさのテキストのk-privacy値を推定する新しい手法である。
実験の結果,k値が73%と推定され,o3-miniとチェーン・オブ・シント推論の13%の増加が確認された。
論文 参考訳(メタデータ) (2025-03-12T17:41:25Z) - Erasing Without Remembering: Implicit Knowledge Forgetting in Large Language Models [81.62767292169225]
我々は,その一般化に着目して,大規模言語モデルにおける知識の忘れについて検討する。
確率摂動に基づく新しいアンラーニングパラダイムであるPerMUを提案する。
TOFU、Harry Potter、ZsRE、WMDP、MUSEなど、さまざまなデータセットで実験が行われている。
論文 参考訳(メタデータ) (2025-02-27T11:03:33Z) - Context is Key: A Benchmark for Forecasting with Essential Textual Information [87.3175915185287]
コンテキスト is Key" (CiK) は、数値データを多種多様なテキストコンテキストと組み合わせた予測ベンチマークである。
我々は,統計モデル,時系列基礎モデル,LLMに基づく予測モデルなど,さまざまなアプローチを評価する。
提案手法は,提案するベンチマークにおいて,他の試験手法よりも優れる簡易かつ効果的なLCMプロンプト法である。
論文 参考訳(メタデータ) (2024-10-24T17:56:08Z) - Semi-supervised Learning For Robust Speech Evaluation [30.593420641501968]
音声評価は、自動モデルを用いて学習者の口頭習熟度を測定する。
本稿では,半教師付き事前学習と客観的正規化を活用することで,このような課題に対処することを提案する。
アンカーモデルは、発音の正しさを予測するために擬似ラベルを用いて訓練される。
論文 参考訳(メタデータ) (2024-09-23T02:11:24Z) - Query Performance Prediction using Relevance Judgments Generated by Large Language Models [53.97064615557883]
自動生成関連判定(QPP-GenRE)を用いた新しいクエリ性能予測(QPP)フレームワークを提案する。
QPP-GenREは、QPPを独立したサブタスクに分解し、ランクリスト内の各項目の関連性を所定のクエリに予測する。
我々は,オープンソースの大規模言語モデル (LLM) を用いて,科学的妥当性を確保することにより,項目の関連性を予測する。
論文 参考訳(メタデータ) (2024-04-01T09:33:05Z) - Prompt Consistency for Zero-Shot Task Generalization [118.81196556175797]
本稿では,ラベルのないデータを用いてゼロショット性能を向上させる手法について検討する。
具体的には,複数のプロンプトを使ってひとつのタスクを指定できることを利用して,プロンプトの一貫性を規則化する手法を提案する。
我々のアプローチは、4つのNLPタスクにまたがる11のデータセットのうち9つにおいて、最先端のゼロショット学習者であるT0を精度で最大10.6の絶対点で上回ります。
論文 参考訳(メタデータ) (2022-04-29T19:18:37Z) - Distant finetuning with discourse relations for stance classification [55.131676584455306]
そこで本研究では,定位分類のモデルとして,原文から銀ラベルでデータを抽出し,微調整する手法を提案する。
また,様々な段階において微調整に用いるデータのノイズレベルが減少する3段階のトレーニングフレームワークを提案する。
NLPCC 2021共有タスクArgumentative Text Understanding for AI Debaterでは,26の競合チームの中で1位にランクインした。
論文 参考訳(メタデータ) (2022-04-27T04:24:35Z) - Self-Supervised Relational Reasoning for Representation Learning [5.076419064097733]
自己教師型学習では、ラベルのないデータに対して代替ターゲットを定義することにより、代理目的を達成することを課題とする。
本稿では,学習者が無ラベルデータに暗黙的な情報から信号をブートストラップできる,新たな自己教師型関係推論法を提案する。
提案手法は,標準データセット,プロトコル,バックボーンを用いて,厳密な実験手順に従って評価する。
論文 参考訳(メタデータ) (2020-06-10T14:24:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。