論文の概要: Personalized Image Generation with Reasoning and Reflection
- arxiv url: http://arxiv.org/abs/2610.00737v1
- Date: Wed, 30 Sep 2026 21:30:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.773696
- Title: Personalized Image Generation with Reasoning and Reflection
- Title(参考訳): 推論と反射によるパーソナライズされた画像生成
- Abstract要約: ユーザ履歴からパーソナライズされた画像生成のための最初の統一されたベンチマークを導入する。
このベンチマークは、2つの補完タスクと、目標の忠実度、視覚的品質、ユーザ識別性、ユーザ履歴とのセマンティックアライメント、タスク固有のユーティリティを評価するマルチアクセント評価プロトコルから構成される。
差分データ報酬に最適化されたインターリーブ・リフレクタループにおいて,マルチモーダル推論器と凍結画像生成器を結合するPEARLを提案する。
- 参考スコア(独自算出の注目度): 100.4359405603136
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Personalized image generation has remained narrowly focused on conditional synthesis from curated visual exemplars, rather than capturing who a user is. In practice, however, a user's personal context is much richer, comprising reviews, posts, images, captions, and metadata accumulated over time. A truly personalized generator should leverage this history to produce images aligned with the user's lifestyle and aesthetic preferences. To this end, we introduce the first unified benchmark for personalized image generation from user histories. The benchmark comprises two complementary tasks and a multi-axis evaluation protocol that assesses target fidelity, visual quality, user distinguishability, semantic alignment with the user's history, and task-specific utility. Grounded in real-world e-commerce and social media settings, the benchmark includes: (1) Personalized Scene Generation, which places a given object in a scene that reflects a user's preferences and lifestyle, motivated by personalized product presentation; and (2) Personalized Creative Generation, which generates a novel image on a specified topic that is faithful to a user's aesthetic and visual identity, motivated by social media content creation. We further propose PEARL, which couples a multimodal reasoner with a frozen image generator in an interleaved reason-reflect loop optimized with differential data reward. Across both tasks, PEARL outperforms strong baselines, achieving an average improvement of 15% across personalization metrics.
- Abstract(参考訳): パーソナライズされた画像生成は、ユーザーが誰であるかを捉えるのではなく、キュレートされた視覚的見本から条件付き合成に焦点を絞ったままである。
しかし実際には、ユーザの個人的なコンテキストはよりリッチになり、レビュー、投稿、画像、キャプション、メタデータが時間とともに蓄積される。
真のパーソナライズされたジェネレータは、この履歴を利用して、ユーザのライフスタイルや美的好みに合わせて画像を生成するべきです。
この目的のために、ユーザ履歴からパーソナライズされた画像生成のための最初の統一されたベンチマークを導入する。
このベンチマークは、2つの補完タスクと、目標の忠実度、視覚的品質、ユーザ識別性、ユーザ履歴とのセマンティックアライメント、タスク固有のユーティリティを評価するマルチアクセント評価プロトコルから構成される。
1)ユーザの好みやライフスタイルを反映したシーンに特定のオブジェクトを配置するパーソナライズされたシーン生成,2)ユーザの美的・視覚的アイデンティティに忠実な特定のトピックに新たなイメージを生成するパーソナライズされた創造生成,である。
さらに、差分データ報酬に最適化されたインターリーブされた推論ループにおいて、マルチモーダルな推論器と凍結画像生成器を結合するPEARLを提案する。
両方のタスクでPEARLは強力なベースラインを上回り、パーソナライズメトリクスの平均15%の改善を実現している。
関連論文リスト
- Personalized Reward Modeling for Text-to-Image Generation [9.780251969338044]
ユーザ条件付き評価次元を動的に生成し,CoT推論による画像評価を行うパーソナライズされた報酬モデルであるPIGRewardを提案する。
PIGRewardは、ユーザ固有のプロンプト最適化を促進するパーソナライズされたフィードバックを提供する。
大規模な実験により、PIGRewardは精度と解釈可能性の両方において既存の手法を超越していることが示された。
論文 参考訳(メタデータ) (2025-11-21T12:04:24Z) - RAGAR: Retrieval Augmented Personalized Image Generation Guided by Recommendation [15.042729128202982]
我々は、レコメンデーション(RAGAR)でガイドされた検索機能拡張パーソナライズされた画像ジェネレーションを提案する。
提案手法では,参照項目との類似性に応じて,異なる重み付けを過去の項目に割り当てるための検索機構を用いる。
RAGARは、パーソナライゼーションとセマンティックメトリクスの両方において、5つのベースラインに比べて大幅に改善されている。
論文 参考訳(メタデータ) (2025-05-03T02:20:30Z) - DRC: Enhancing Personalized Image Generation via Disentangled Representation Composition [69.10628479553709]
大規模マルチモーダルモデル(LMM)を拡張した新しいパーソナライズされた画像生成フレームワークであるDRCを紹介する。
DRCは、履歴画像と参照画像から、ユーザスタイルの好みと意味的な意図をそれぞれ明示的に抽出する。
本研究は2つの重要な学習段階を包含する。1) スタイルと意味的特徴を明確に分離するために二重解離型学習を用い,難易度を考慮した再構成駆動型パラダイムを用いて最適化し,2) パーソナライズド・パーソナライズド・パーソナライズド・ジェネレーションを効果的に適用するパーソナライズド・モデリング。
論文 参考訳(メタデータ) (2025-04-24T08:10:10Z) - ViPer: Visual Personalization of Generative Models via Individual Preference Learning [11.909247529297678]
本稿では,画像生成プロセスのパーソナライズを,ユーザの汎用的な嗜好を1回に分けて行うことを提案する。
これらのコメントに基づいて、ユーザの構造化された好き嫌いや視覚的属性を推測する。
これらの属性は、個々のユーザの視覚的嗜好に合わせて調整された画像を生成するために、テキスト・ツー・イメージ・モデルを導くために使用される。
論文 参考訳(メタデータ) (2024-07-24T15:42:34Z) - Stellar: Systematic Evaluation of Human-Centric Personalized
Text-to-Image Methods [52.806258774051216]
我々は,個々のイメージを入力し,生成プロセスの基盤となるテキストと,所望の視覚的コンテキストを記述したテキストに焦点をあてる。
我々は,既存の関連するデータセットよりも桁違いの大きさの個人画像と,リッチなセマンティックな接地真実アノテーションが容易に利用できるパーソナライズされたプロンプトを含む標準化データセット(Stellar)を紹介した。
被験者ごとにテストタイムの微調整を必要とせず,新しいSoTAを定量的かつ人為的に設定した,シンプルで効率的でパーソナライズされたテキスト・ツー・イメージのベースラインを導出する。
論文 参考訳(メタデータ) (2023-12-11T04:47:39Z) - MyStyle: A Personalized Generative Prior [38.3436972491162]
MyStyleはパーソナライズされたディープジェネレーティブで、個人を数枚のショットで訓練する。
MyStyleは、特定の人の画像を再構成、拡張、編集することができる。
論文 参考訳(メタデータ) (2022-03-31T17:59:19Z) - User-Guided Personalized Image Aesthetic Assessment based on Deep
Reinforcement Learning [64.07820203919283]
本稿では,新しいユーザガイド型画像美観評価フレームワークを提案する。
深部強化学習(DRL)に基づく審美評価のためのユーザインタラクションを活用して画像のリタッチとランク付けを行う
パーソナライズされた審美分布は、異なるユーザの審美的嗜好とより一致している。
論文 参考訳(メタデータ) (2021-06-14T15:19:48Z) - Generating Person Images with Appearance-aware Pose Stylizer [66.44220388377596]
本稿では,人物のポーズや外見に基づいてリアルな人物画像を生成する,新しいエンドツーエンドフレームワークを提案する。
本フレームワークのコアとなるのは、ターゲットポーズと条件付き人物の外観を段階的に結合して人体画像を生成する、APS(Appearance-aware Pose Stylizer)と呼ばれる新しいジェネレータである。
論文 参考訳(メタデータ) (2020-07-17T15:58:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。