論文の概要: PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2607.24353v1
- Date: Mon, 27 Jul 2026 12:31:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.417291
- Title: PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation
- Title(参考訳): PRISM:テキスト・ツー・イメージ・ジェネレーションのための画像グラウンド・セルフ・リワード機構によるプロンプト・リファインメント
- Abstract要約: PRISM(Prompt Refinement optimization framework)を提案する。
PRISMは、生成した画像を構造化された視覚診断で解釈することで、プロンプトイメージフィードバックループを閉じる。
実験により、PRISMは全体像の品質と微粒なセマンティックアライメントを改善することが示された。
- 参考スコア(独自算出の注目度): 6.601249008729316
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image generation models can synthesize high-quality images from natural language descriptions, but their performance remains highly sensitive to prompt formulation. Existing prompt optimization methods mainly rely on text-side rewriting, prompt expansion, or external reward signals, offering limited image-grounded diagnosis and weak support for learning reusable optimisation policies. In this paper, we propose PRISM, a Prompt Refinement framework via Image-grounded Self-rewarding Mechanism. PRISM closes the prompt-image-feedback loop by interpreting generated images with structured visual diagnosis and scoring them along semantic consistency, aesthetic quality, and human preference alignment. It first initializes a unified VLM through multi-task supervised fine-tuning, and then improves the prompt policy via self-rewarding optimization with a hybrid ideal-point and Chebyshev reward. Extensive experiments show that PRISM improves holistic image quality and fine-grained semantic alignment, while providing interpretable feedback for targeted prompt refinement. The code is available at https://anonymous.4open.science/r/PRISM-FF81.
- Abstract(参考訳): テキスト・ツー・イメージ生成モデルは、自然言語記述から高品質な画像を合成することができるが、その性能は、迅速な定式化に非常に敏感である。
既存のプロンプト最適化手法は、主にテキスト側の書き換え、即時拡張、または外部報酬信号に依存しており、画像基底診断が限定され、再利用可能な最適化ポリシーを学習するための弱いサポートを提供する。
本稿では,PRISMを提案する。PRISMはイメージグラウンド・セルフ・リワード機構によるプロンプト・リファインメント・フレームワークである。
PRISMは、生成した画像を構造化された視覚的診断で解釈し、セマンティック一貫性、美的品質、人間の嗜好アライメントに沿って評価することで、即時フィードバックループを閉じる。
まずマルチタスク制御による微調整により統一VLMを初期化し、その後、ハイブリッドイデアルポイントとチェビシェフの報酬で自己回帰最適化によりプロンプトポリシーを改善する。
広汎な実験により、PRISMは全体像の品質と細粒度のセマンティックアライメントを改善し、ターゲットの即時改善のための解釈可能なフィードバックを提供する。
コードはhttps://anonymous.4open.science/r/PRISM-FF81で公開されている。
関連論文リスト
- PROVE: Training-Free Prompt Recovery using Verifiable Evidence [5.5813258856679555]
本稿では,PROVE(Prompt Recovery with Verified Evidence)を導入した。
トークンシーケンスを最適化するのではなく、検証可能なシーン記述を構成することでプロンプトを再構築する。
得られたプロンプトは完全に監査可能で、回収された全てのクレームは明示的な画像証拠に基づいている。
論文 参考訳(メタデータ) (2026-08-13T18:08:00Z) - HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection [52.11418741192251]
本稿では,カテゴリ中心を微粒な画像の手がかりと整合させて調整する非対称なプロンプトフレームワークを提案する。
具体的には、一貫した代表パターンをキャプチャする一組のプロンプトを導入し、実際のコンテンツの統一アンカーとして機能する。
2)偽のカテゴリでは,サンプル適応型プロンプトを構築し,異なるサンプルから多様な手がかりを抽出し,偽画像の変動を適応的にモデル化する。
論文 参考訳(メタデータ) (2026-05-26T01:20:18Z) - CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning [65.10059440725041]
視覚言語モデル(VLM)は画像キャプション、視覚的質問応答、視覚的推論において顕著な進歩を遂げている。
ヴィジュアル言語を誤用する傾向があり、しばしば過度に汎用的あるいは幻覚的な記述を生み出している。
既存のアプローチでは、コストがかかる大規模アノテートデータセットのインストラクションチューニングと、キャプションリファインメントのための複雑なテストタイムフレームワークによって、この問題に対処している。
本研究では,サイクル一貫性のレンズを用いて,画像テキストのアライメントを再考する。
論文 参考訳(メタデータ) (2026-03-18T20:57:31Z) - PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization [42.698386517788606]
本稿では,簡単なプロンプトを与えられた場合,事前学習したテキスト・画像拡散モデルにおける審美的品質改善のための新しいアプローチを提案する。
Prompt Embedding Optimization (PEO) と呼ばれる本手法は,事前学習したテキスト・画像拡散モデルをバックボーンとして活用する。
我々は、生成した画像の美的忠実度を改善し、最適化されたテキストの埋め込みを確実にし、初期プロンプトから最小限のばらつきを確保する三部構成の目的関数によりこれを達成した。
論文 参考訳(メタデータ) (2025-10-02T22:12:36Z) - VisualPrompter: Prompt Optimization with Visual Feedback for Text-to-Image Synthesis [15.392482488365955]
VisualPrompterはトレーニングフリーのプロンプトエンジニアリングフレームワークで、ユーザー入力をモデル優先の文に洗練する。
本フレームワークは,テキスト画像アライメント評価のための複数のベンチマーク上で,最先端性能を実現する。
論文 参考訳(メタデータ) (2025-06-29T08:24:39Z) - AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment [74.47138661595584]
我々は、パーソナライズされた画像生成のためのクロスモーダル優先アライメント機構であるAlignGenを提案する。
AlignGenは、既存のゼロショットメソッドよりも優れており、一般的なテスト時間最適化アプローチを超えています。
論文 参考訳(メタデータ) (2025-05-28T02:57:55Z) - FRAP: Faithful and Realistic Text-to-Image Generation with Adaptive Prompt Weighting [18.708185548091716]
FRAPは、トーケン毎のプロンプト重量を適応的に調整することに基づく、単純で効果的なアプローチである。
FRAPは、複雑なデータセットからのプロンプトに対して、プロンプト画像のアライメントが著しく高い画像を生成する。
また, FRAPとLPMの即時書き直しを併用して, 劣化した即時画像のアライメントを復元する方法について検討した。
論文 参考訳(メタデータ) (2024-08-21T15:30:35Z) - Prompt Recovery for Image Generation Models: A Comparative Study of Discrete Optimizers [57.62831463679979]
本稿では,近年の離散最適化手法の突発的逆転問題に対する直接比較について述べる。
逆プロンプトと基底真理画像とのCLIP類似性に着目し, 逆プロンプトが生成する画像と基底真理画像との類似性について検討した。
論文 参考訳(メタデータ) (2024-08-12T21:35:59Z) - Batch-Instructed Gradient for Prompt Evolution:Systematic Prompt Optimization for Enhanced Text-to-Image Synthesis [3.783530340696776]
本研究では,テキスト・画像生成モデルの入力プロンプトを最適化するマルチエージェントフレームワークを提案する。
プロのプロンプトデータベースは、命令修飾子を高精細なプロンプトを生成するためのベンチマークとして機能する。
予備的アブレーション研究は、様々なシステムコンポーネントの有効性を強調し、今後の改善の分野を提案する。
論文 参考訳(メタデータ) (2024-06-13T00:33:29Z) - Dynamic Prompt Optimizing for Text-to-Image Generation [63.775458908172176]
テキストから画像への生成モデルを改善するために,textbfPrompt textbfAuto-textbfEditing (PAE)法を導入する。
我々は、各単語の重みと射出時間ステップを探索するために、オンライン強化学習戦略を採用し、動的微調整プロンプトを導いた。
論文 参考訳(メタデータ) (2024-04-05T13:44:39Z) - Iterative Prompt Learning for Unsupervised Backlit Image Enhancement [86.90993077000789]
そこで本研究では,CLIP-LITと略称される,非教師なしのバックライト画像強調手法を提案する。
オープンワールドのCLIPはバックライト画像と well-lit 画像の区別に有効であることを示す。
提案手法は,学習フレームワークの更新と,学習結果を視覚的に満足するまでのネットワークの強化を交互に行う。
論文 参考訳(メタデータ) (2023-03-30T17:37:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。