論文の概要: PE-OPSD: Internalizing Prompt Enhancement into Flow-matching Models via On-Policy Self-Distillation
- arxiv url: http://arxiv.org/abs/2609.36638v1
- Date: Tue, 29 Sep 2026 03:44:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.161866
- Title: PE-OPSD: Internalizing Prompt Enhancement into Flow-matching Models via On-Policy Self-Distillation
- Title(参考訳): PE-OPSD:オンデマンド自己蒸留によるフローマッチングモデルへの内部化プロンプト拡張
- Abstract要約: 本稿では,テキスト・ツー・イメージ・フローマッチングモデルのためのPmpt-Enhanced On-Policy Self-Distillation (PE-OPSD)を提案する。
テキストイメージペアの追加を必要とせず、プロンプトの強化によって引き起こされる振る舞いを生のプロンプトの学生に蒸留する。
複数のモデルファミリ, PE, ベンチマークにおいて, PE-OPSDは評価されたベースラインの中で最強の集合的即効性を達成する。
- 参考スコア(独自算出の注目度): 11.484856718278015
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-to-image users often provide concise and underspecified prompts, whereas generative models benefit from detailed textual conditions for reliable instruction following. Existing systems bridge this gap with Prompt Enhancers (PEs) that rewrite raw prompts at inference time, introducing additional latency and leaving prompt elaboration external to the generator. We instead view enhanced prompts as privileged training information and ask whether their benefits can be internalized. We propose Prompt-Enhanced On-Policy Self-Distillation (PE-OPSD) for text-to-image flow-matching models. During training, a raw-prompt student follows its own generation trajectory, while an enhanced-prompt teacher provides vector-field targets at the states visited by the student. This on-policy supervision distills the behavior induced by enhanced prompts into the raw-prompt student without requiring additional text--image pairs. At inference, both the PE and teacher are removed, and the student generates directly from raw prompts. Across multiple model families, PEs, and benchmarks, PE-OPSD achieves the strongest aggregate prompt fidelity among the evaluated baselines, yields positive aggregate visual appeal gains, and retains the base-model inference efficiency.
- Abstract(参考訳): テキスト・ツー・イメージのユーザは、簡潔で不明確なプロンプトを提供することが多いが、生成モデルは、信頼できる指示に従うための詳細なテキスト条件の恩恵を受ける。
既存のシステムは、推論時に生のプロンプトを書き直し、追加のレイテンシを導入し、ジェネレータの外部にプロンプトのエラボレーションを残すPrompt Enhancers (PE)でこのギャップを埋める。
代わりに、強化されたプロンプトを特権的なトレーニング情報とみなし、それらのメリットを内部化できるかどうかを問う。
本稿では,テキスト・ツー・イメージ・フローマッチングモデルのためのPmpt-Enhanced On-Policy Self-Distillation (PE-OPSD)を提案する。
訓練中、生のプロンプトの学生は、独自の世代軌道を辿り、強化されたプロンプトの教師は、学生が訪れた州でベクトルフィールドのターゲットを提供する。
このオンライン監視は、追加のテキストイメージペアを必要とせず、プロンプトの強化によって生のプロンプトに誘導される振る舞いを蒸留する。
推論では、PEと教師の両方を除去し、学生は生のプロンプトから直接生成する。
複数のモデルファミリ,PE,ベンチマークにわたって,PE-OPSDは評価ベースラインの中で最強の集合的即効性を実現し,正の集合的視覚的魅力ゲインを生成し,ベースモデル推論効率を維持する。
関連論文リスト
- dOPSD: On-Policy Self-Distillation for Diffusion Language Models [52.60302464420127]
拡散大言語モデルは、マスキングシーケンスを反復的に復調することでテキストを生成する。
監督された微調整は非政治的であり、露出バイアスに悩まされる一方、強化学習はわずかにシーケンスレベルの報酬しか与えない。
On-policy Self-distillation (OPSD)は、学生と教師の両方に1つのモデルを用いて、有望な代替手段を提供する。
論文 参考訳(メタデータ) (2026-07-05T17:47:29Z) - TRPrompt: Bootstrapping Query-Aware Prompt Optimization from Textual Rewards [9.107586166322923]
本稿では,テキストフィードバックをプロンプトモデルのトレーニングに組み込むことでアプローチを統一する,テキスト・リワード・プロンプト・フレームワーク(TRPrompt)を紹介する。
我々のフレームワークは、事前のデータセット収集を必要とせず、生成されたプロンプトに対するフィードバックによって反復的に改善されている。
LLMの能力と結合して「良い」プロンプトとは何かという概念を内包すると、テキスト報酬によって提供される高分解能信号は、最先端のクエリ固有のプロンプトを生成するプロンプトモデルを訓練することができる。
論文 参考訳(メタデータ) (2025-07-24T17:54:44Z) - RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning [88.14234949860105]
RePromptは、強化学習による迅速な強化プロセスに明示的な推論を導入する、新しいリプロンプトフレームワークである。
提案手法は,人手による注釈付きデータなしでエンドツーエンドのトレーニングを可能にする。
論文 参考訳(メタデータ) (2025-05-23T06:44:26Z) - The Devil is in the Prompts: Retrieval-Augmented Prompt Optimization for Text-to-Video Generation [40.73687553764341]
RAPO(Retrieval-Augmented Prompt Optimization framework)を紹介する。
RAPOは、ユーザのプロンプトを2つの最適化ブランチを通じて洗練し、T2V生成の優れたプロンプトを選択する。
大規模な実験により、RAPOは生成されたビデオの静的次元と動的次元の両方を効果的に拡張できることが示された。
論文 参考訳(メタデータ) (2025-04-16T03:33:25Z) - Auto-Prompt Generation is Not Robust: Prompt Optimization Driven by Pseudo Gradient [50.15090865963094]
PertBenchは、幅広い入力摂動を含む包括的なベンチマークデータセットである。
我々の分析は、既存の即時生成戦略における重大な脆弱性を明らかにしている。
PGOは、摂動型を擬似次数次信号として活用する、勾配のないプロンプト生成フレームワークである。
論文 参考訳(メタデータ) (2024-12-24T06:05:08Z) - Revisiting Prompt Pretraining of Vision-Language Models [13.888505919946578]
本稿では、RPP(Revisiting Prompt Pretraining)と呼ばれる一般的なフレームワークを提案する。
RPPは、フィッティングと一般化能力の改善を、迅速な構造と迅速な監督という2つの側面から目標としている。
また,事前訓練されたコントラスト言語画像事前学習(CLIP)教師モデルによって提供されるゼロショット確率予測から得られたソフトラベルを利用する。
論文 参考訳(メタデータ) (2024-09-10T02:36:13Z) - Dynamic Prompt Optimizing for Text-to-Image Generation [63.775458908172176]
テキストから画像への生成モデルを改善するために,textbfPrompt textbfAuto-textbfEditing (PAE)法を導入する。
我々は、各単語の重みと射出時間ステップを探索するために、オンライン強化学習戦略を採用し、動的微調整プロンプトを導いた。
論文 参考訳(メタデータ) (2024-04-05T13:44:39Z) - Optimizing Prompts for Text-to-Image Generation [97.61295501273288]
よく設計されたプロンプトは、テキストから画像へのモデルをガイドし、素晴らしい画像を生成する。
しかし、パフォーマンスプロンプトはモデル固有であり、ユーザ入力と不一致であることが多い。
本稿では,モデル優先のプロンプトにオリジナルのユーザ入力を自動的に適応するフレームワークであるpromise adaptを提案する。
論文 参考訳(メタデータ) (2022-12-19T16:50:41Z) - RLPrompt: Optimizing Discrete Text Prompts With Reinforcement Learning [84.75064077323098]
本稿では、強化学習(RL)を用いた離散的高速最適化手法RLPromptを提案する。
RLPromptは、マスク付きジベリッシュ(例:grammaBERT)や左から右へのモデル(例:GPT)など、様々な種類のLMに柔軟に適用可能である。
少数ショット分類と教師なしテキストスタイル転送の実験は、既存のファインタニングやプロンプト手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2022-05-25T07:50:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。