論文の概要: PrefPO: Pairwise Preference Prompt Optimization
- arxiv url: http://arxiv.org/abs/2603.19311v1
- Date: Fri, 13 Mar 2026 18:13:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:38.777134
- Title: PrefPO: Pairwise Preference Prompt Optimization
- Title(参考訳): PrefPO: Pairwise Preference Prompt Optimization
- Authors: Rahul Singhal, Pradyumna Tambwekar, Karime Maamari,
- Abstract要約: 人間のフィードバック(RLHF)からの強化学習にインスパイアされた最小限の迅速な最適化アプローチであるPrefPOを導入する。
PrefPO は LLM 識別器を用いて、モデル出力よりもペアワイズに好みを表現し、LLM にフィードバックを提供し、反復的に性能を向上する。
既存の方法では、元の長さ14.7倍のプロンプトを生成するか、34%の繰り返しコンテンツを生成する。
- 参考スコア(独自算出の注目度): 3.0433921527861565
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Prompt engineering is effective but labor-intensive, motivating automated optimization methods. Existing methods typically require labeled datasets, which are often unavailable, and produce verbose, repetitive prompts. We introduce PrefPO, a minimal prompt optimization approach inspired by reinforcement learning from human feedback (RLHF). Its preference-based approach reduces the need for labeled data and hyperparameter tuning-only a starting prompt and natural language criteria are needed. PrefPO uses an LLM discriminator to express pairwise preferences over model outputs and provide feedback to an LLM optimizer, iteratively improving performance. We evaluate PrefPO on 9 BIG-Bench Hard (BBH) tasks and IFEval-Hard, a newly-curated, challenging subset of IFEval. PrefPO matches or exceeds SOTA methods, including GEPA, MIPRO, and TextGrad, on 6/9 tasks and performs comparably to TextGrad on IFEval-Hard (82.4% vs 84.5%). Unlike other methods, PrefPO can optimize in both labeled and unlabeled settings. Without labels, PrefPO closely matches its labeled performance on 6/9 tasks, proving effective without ground truth. PrefPO also improves prompt hygiene: we find existing methods produce prompts 14.7x their original length or with 34% repetitive content; PrefPO reduces these issues by 3-5x. Furthermore, both LLM and human judges rate PrefPO's prompts higher than TextGrad's. Finally, we identify prompt hacking in prompt optimizers, where methods game evaluation criteria, and find PrefPO is susceptible at half the rate of TextGrad (37% vs 86%), generating fewer brittle, misaligned prompts.
- Abstract(参考訳): プロンプトエンジニアリングは効果的だが、労働集約的で、自動化最適化手法を動機付けている。
既存の手法では、しばしば利用できないラベル付きデータセットを必要とし、冗長で反復的なプロンプトを生成する。
人間のフィードバック(RLHF)からの強化学習にインスパイアされた,最小限の迅速な最適化手法であるPrefPOを導入する。
その嗜好に基づくアプローチはラベル付きデータの必要性を減らし、ハイパーパラメータチューニングのみをスタートプロンプトとし、自然言語の基準を必要とする。
PrefPOはLLMディスクリミネータを使用して、モデル出力に対するペアワイズな好みを表現し、LLMオプティマイザにフィードバックを提供する。
BIG-Bench Hard (BBH) タスクの PrefPO と IFEval-Hard を新たに作成した IFEval サブセットである IFEval-Hard について検討した。
PrefPO は 6/9 のタスクで GEPA, MIPRO, TextGrad などの SOTA メソッドと一致し, IFEval-Hard 上の TextGrad (82.4% 対 84.5%) と互換性がある。
他の方法とは異なり、PrefPOはラベル付き設定とラベルなしの設定の両方で最適化できる。
PrefPOはラベルなしで、6/9タスクでラベル付けされたパフォーマンスと密に一致し、根拠のない有効性を証明している。
PrefPOはまた、プロンプト衛生の改善も行っている:既存の方法は、元の長さの14.7倍、または34%の繰り返しコンテンツを持つプロンプトを生成する。
さらに、LLMと人間の審査員は、PrefPOのプロンプトをTextGradよりも高く評価する。
最後に、プロンプトオプティマイザにおけるプロンプトハッキングを特定し、ゲーム評価基準が設定されている場合、PrefPOがTextGradの半分の確率で影響を受けており(37%対86%)、不安定で不整合なプロンプトが発生する。
関連論文リスト
- GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer [51.31263673158136]
GFlowPOは、メタプロンプト参照-LMにより正規化される潜在プロンプトに対する後部推論問題としてプロンプトをキャストする。
GFlowPOは、最近の離散的なプロンプト最適化ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-02-03T10:30:03Z) - LLM Prompt Duel Optimizer: Efficient Label-Free Prompt Optimization [15.083370519334219]
大規模言語モデル(LLM)は入力プロンプトに非常に敏感である。
ラベルフリーなプロンプト最適化のためのサンプル効率のよいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-14T22:23:08Z) - APIO: Automatic Prompt Induction and Optimization for Grammatical Error Correction and Text Simplification [5.756837532779593]
APIOは、文法的誤り訂正(GEC)とテキスト単純化(Text Simplification)のタスクに対して、シンプルだが効果的な誘導と最適化のアプローチである。
データ、コード、プロンプト、アウトプットを公開しています。
論文 参考訳(メタデータ) (2025-08-12T22:26:32Z) - Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering [5.568436850698628]
Sem-DPOは意味的一貫性を維持しながら、その単純さと効率を維持するDPOの亜種である。
本研究は,Sem-DPOが原文の有界近傍で学習のプロンプトを継続していることを示す。
3つの標準テキスト-画像のプロンプト-最適化ベンチマークと2つの言語モデルにおいて、Sem-DPOはDPOよりもCLIPの類似度が8-12%高く、5-9%高いHPSv2.1、PickScore)。
論文 参考訳(メタデータ) (2025-07-27T05:20:13Z) - Self-Supervised Prompt Optimization [19.159322848728646]
十分に設計されたプロンプトは、Large Language Model(LLM)推論能力の強化に不可欠である。
既存のプロンプト最適化手法は、地上の真実や人間による外部参照に大きく依存している。
本稿では,閉じたタスクとオープンなタスクの両方に効果的なプロンプトを発見する費用効率のよいフレームワークであるセルフ・スーパービジョン・プロンプト・最適化(SPO)を提案する。
論文 参考訳(メタデータ) (2025-02-07T17:45:16Z) - Prompt Optimization with Human Feedback [69.95991134172282]
人間のフィードバックによる迅速な最適化問題(POHF)について検討する。
我々は自動POHF(Automatic POHF)というアルゴリズムを導入する。
その結果、APOHFは、少数の好みフィードバックインスタンスを用いて、効率的に適切なプロンプトを見つけることができることがわかった。
論文 参考訳(メタデータ) (2024-05-27T16:49:29Z) - PRompt Optimization in Multi-Step Tasks (PROMST): Integrating Human Feedback and Heuristic-based Sampling [20.0605311279483]
マルチステップタスク(PROMST)におけるPRompt Optimizationを導入する。
人間が設計したフィードバックルールを組み込んで、改善のための直接提案を自動的に提供する。
これは、人間工学的なプロンプトと、他のいくつかのプロンプト最適化手法の両方において、11の代表的なマルチステップタスクよりも大幅に優れている。
論文 参考訳(メタデータ) (2024-02-13T16:38:01Z) - Large Language Models as Optimizers [106.52386531624532]
本稿では,大規模言語モデル (LLM) をプロンプトとして活用するためのシンプルで効果的な手法である Prompting (OPRO) を提案する。
各最適化ステップにおいて、LLMは、前述した値を含むプロンプトから新しい解を生成する。
OPROにより最適化された最良のプロンプトは、GSM8Kで最大8%、Big-Bench Hardタスクで最大50%向上することを示した。
論文 参考訳(メタデータ) (2023-09-07T00:07:15Z) - Automatic Prompt Optimization with "Gradient Descent" and Beam Search [64.08364384823645]
大きな言語モデル(LLM)は汎用エージェントとして優れたパフォーマンスを示しているが、その能力はプロンプトに大きく依存している。
この問題に対する単純で非パラメトリックな解である自動プロンプト最適化(APO)を提案する。
APOはデータのミニバッチを使用して、現在のプロンプトを批判する自然言語「段階的」を形成する。
次に、勾配の反対の意味方向のプロンプトを編集することで、勾配をプロンプトに「伝播」する。
論文 参考訳(メタデータ) (2023-05-04T15:15:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。