論文の概要: PortraitAes: Intent-Conditioned Structured Portrait Aesthetics Assessment
- arxiv url: http://arxiv.org/abs/2610.05010v1
- Date: Sun, 04 Oct 2026 07:08:51 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:21:17.692888
- Title: PortraitAes: Intent-Conditioned Structured Portrait Aesthetics Assessment
- Title(参考訳): PortraitAes:Intent-Conditioned Structured Portrait Aesthetics Assessment
- Abstract要約: ポートレートの美的評価は、人間中心の画像が写真の意図をいかに効果的に満たすかに応じて、同等のスコアを割り当てる。
既存の方法は、1つの美的スコアを予測したり、写真意図を考慮せずに汎用MLLMを使用するのが一般的である。
11KスケールのベンチマークであるPortraitAes-Benchを導入する。
- 参考スコア(独自算出の注目度): 19.108580300924572
- License:
- Abstract: Portrait aesthetic assessment assigns comparable scores according to how effectively human-centered images fulfill their photographic intent. These scores support data filtering, candidate selection, and preference modeling in image-generation pipelines. Existing methods typically predict a single aesthetic score or use general-purpose MLLMs without conditioning on photographic intent. This omission matters because the same blur, pose, lighting, or framing choice may serve one photographic intent but undermine another. These models thus learn context-agnostic aesthetic priors and yield inconsistent, inaccurate, misleading judgments for portraits with distinct photographic objectives. We introduce PortraitAes-Bench, an 11K-scale benchmark that decomposes this task into intent-conditioned subjudgments. Expert-authored rubrics define nine photographic intents, six first-level dimensions, and 22 secondary criteria. They support a structured pipeline for intent routing, specialist assessment, verification, and score fusion. Following this structure, we train PortraitAes with multi-task supervision. We then improve score comparability through Gaussian score calibration and within-dimension cross-image ranking. On the standard benchmark, PortraitAes achieves a Pearson correlation of 0.924 and a Spearman rank correlation of 0.934. On the hard-case set, its Pearson correlation is 0.829 and its Spearman rank correlation is 0.795. Across both sets, PortraitAes outperforms the evaluated general-purpose MLLMs and specialized aesthetic baselines.
- Abstract(参考訳): ポートレートの美的評価は、人間中心の画像が写真の意図をいかに効果的に満たすかに応じて、同等のスコアを割り当てる。
これらのスコアは、画像生成パイプラインにおけるデータフィルタリング、候補選択、選好モデリングをサポートする。
既存の方法は、1つの美的スコアを予測したり、写真意図を考慮せずに汎用MLLMを使用するのが一般的である。
この省略は、同じぼやけた写真、ポーズ、照明、フレーミングの選択肢が、一つの写真意図に役立ち、別の写真を損なう可能性があるため重要である。
これらのモデルは、文脈に依存しない美学の先行を学習し、異なる写真的目的を持つ肖像画に対する不一致、不正確、誤った判断をもたらす。
11KスケールのベンチマークであるPortraitAes-Benchを導入する。
専門家が作成したルーリックは、9つの写真意図、6つの第一級次元、22の二次基準を定義している。
インテントルーティング、スペシャリストアセスメント、検証、スコア融合のための構造化パイプラインをサポートする。
この構造に続き、マルチタスクでPortraitAesを訓練します。
次にガウスのスコアキャリブレーションと次元内クロスイメージランキングによりスコアコンパラビリティを向上させる。
標準ベンチマークでは、PortraitAes は Pearson の 0.924 の相関と Spearman の 0.934 の相関を達成している。
ハードケースでは、ピアソンの相関は0.829、スピアマンの相関は0.795である。
どちらのセットでも、PortraitAesは評価された汎用MLLMと専門的な審美的ベースラインよりも優れています。
関連論文リスト
- Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty? [59.923111838399144]
本稿では,視覚的審美性ベンチマーク (VAB) を提案する。
VABには400のタスクと1,195のイメージが芸術、写真、イラストに含まれており、ラベルはタスクごとに10人の独立した専門家審査員のコンセンサスから導かれる。
最強のシステムは、人間の専門家が達成した68.9%よりもはるかに低い26.5%のタスクで、候補順の3つのランダムな順で、最良の画像と最悪の画像の両方を正しく識別する。
論文 参考訳(メタデータ) (2026-05-12T19:33:28Z) - Computational Framework for Estimating Relative Gaussian Blur Kernels between Image Pairs [0.0]
本稿では,モデルをリアルタイムアプリケーションで実現するための,ゼロトレーニングフォワード計算フレームワークを提案する。
提案手法は, 平均絶対誤差(MAE)を1.7%以下で推定する。
論文 参考訳(メタデータ) (2026-01-26T03:21:26Z) - Beyond MOS: Subjective Image Quality Score Preprocessing Method Based on Perceptual Similarity [2.290956583394892]
ITU-R BT.500、ITU-T P.910、ITU-T P.913は、当初の世論点をクリアするために標準化されている。
PSPは画像間の知覚的類似性を利用して、より注釈の少ないシナリオにおける主観的バイアスを軽減する。
論文 参考訳(メタデータ) (2024-04-30T16:01:14Z) - ImagenHub: Standardizing the evaluation of conditional image generation
models [48.51117156168]
本稿では,条件付き画像生成モデルの推論と評価を標準化するワンストップライブラリであるImagenHubを提案する。
本研究では,感性一貫性と知覚品質という2つの評価スコアと,生成した画像を評価するための包括的なガイドラインを設計する。
人間の評価は,0.4以上の値を持つ76%のモデル上で,クリッペンドルフのαに対する高い労働者間合意を達成する。
論文 参考訳(メタデータ) (2023-10-02T19:41:42Z) - Introspective Deep Metric Learning for Image Retrieval [80.29866561553483]
良好な類似性モデルは、より堅牢なトレーニングのために曖昧なイメージをよりよく扱うように注意しながら、意味的な相違を考慮すべきである、と我々は主張する。
本稿では,画像の意味的特徴とあいまいさを記述した,意味的埋め込みだけでなく,付随する不確実性埋め込みを用いて画像を表現することを提案する。
提案したIDMLフレームワークは,不確実性モデリングによるディープメトリック学習の性能向上を実現し,広く使用されているCUB-200-2011,Cars196,Stanford Online Productsデータセットの最先端結果を得る。
論文 参考訳(メタデータ) (2022-05-09T17:51:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。