論文の概要: Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment
- arxiv url: http://arxiv.org/abs/2606.05778v1
- Date: Thu, 04 Jun 2026 07:07:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-05 22:39:44.611058
- Title: Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment
- Title(参考訳): 絶対スコアを超えて: 一般的な画像美的評価のための相対的編集による違い
- Authors: Qifei Jia, Xintong Yao, Minghao Li, Yajie Chai, Qiming Lu, Baoyue Shen, Yasen Zhang, Runyu Shi, Ying Huang, Yue Zhang,
- Abstract要約: 本稿では,人間の美的推論過程をシミュレートするリレーティブ編集による差分美学(RED-Aes)を提案する。
RED-Aesは絶対スコア分布を適合させる代わりに、美的変化を引き起こす視覚的要因を明示的に学習する。
RED-Aesは、複数の公開ベンチマークで最先端のパフォーマンスを達成し、より優れた一般化能力を示すことを示す実験である。
- 参考スコア(独自算出の注目度): 7.510816222411201
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Traditional Image Aesthetic Assessment (IAA) methods mainly rely on regressing absolute Mean Opinion Scores (MOS). However, such a paradigm overlooks the inherently dynamic nature of human aesthetic perception, which relies on subconscious comparison against implicit visual references. Consequently, the lack of causal reasoning regarding aesthetic differences prevents models from learning generalizable aesthetic principles, thus limiting their generalization across diverse scenarios. In this work, we rethink the IAA task and propose Relative Edit-induced Difference Aesthetic learning (RED-Aes), a novel framework that leverages controllable image editing models to simulate the human aesthetic reasoning process. Instead of fitting absolute score distributions, RED-Aes explicitly learns the visual factors that drive aesthetic changes. To support this paradigm, we construct the RED-20k dataset, which comprises editing-based image pairs, quantitative aesthetic differences, and Chain-of-Thought (CoT) reasoning. Furthermore, we introduce a three-stage training strategy guided by a relative ranking consistency reward, optimizing the model solely via relative supervision. Extensive experiments demonstrate that RED-Aes achieves state-of-the-art performance on multiple public benchmarks, exhibiting superior generalization capabilities.
- Abstract(参考訳): 従来の画像美的評価法(IAA)は主に絶対平均オピニオンスコア(MOS)の回帰に依存する。
しかし、このようなパラダイムは人間の審美的知覚の本質的にダイナミックな性質を見落とし、暗黙の視覚的参照に対する意識的な比較に依存している。
その結果、審美的相違に関する因果的推論の欠如は、モデルが一般化可能な審美的原則を学習することを妨げるため、様々なシナリオにおけるそれらの一般化を制限することができる。
本研究では,AIA タスクを再考し,人間の美的推論過程をシミュレートするために,制御可能な画像編集モデルを活用する新しいフレームワークである Relative Edit-induced Difference Aesthetic Learning (RED-Aes) を提案する。
RED-Aesは絶対スコア分布を適合させる代わりに、美的変化を引き起こす視覚的要因を明示的に学習する。
このパラダイムをサポートするために、編集ベースの画像ペア、定量的な審美的差異、CoT(Chain-of-Thought)推論を含むRED-20kデータセットを構築した。
さらに、相対的なランクの整合性報酬によって導かれる3段階のトレーニング戦略を導入し、相対的な監督のみでモデルを最適化する。
RED-Aesは、複数の公開ベンチマークで最先端のパフォーマンスを達成し、より優れた一般化能力を示す。
関連論文リスト
- Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks [26.53088863857899]
画像美学評価(IAA)は、コンテンツ作成、アルバム管理、レコメンデーションシステムに広く応用されている。
最先端のIAAモデルは一般に粗い粒度の評価のために設計されている。
相対ランクから識別的美的スコアを学習する新しいIAAフレームワークであるFGAesQを提案する。
論文 参考訳(メタデータ) (2026-03-04T10:13:27Z) - Unsupervised Synthetic Image Attribution: Alignment and Disentanglement [55.853285140682665]
そこで我々は,アライメント・アンド・ディスタングルメント(Alignment and Disentanglement)という,シンプルで効果的な教師なしの手法を提案する。
具体的には、コントラッシブな自己教師あり学習を用いて基本的な概念アライメントを実行することから始める。
次に、Infomax損失による表現のゆがみを促進することにより、モデルの属性能力を高める。
論文 参考訳(メタデータ) (2026-01-30T07:31:53Z) - Unlocking the Essence of Beauty: Advanced Aesthetic Reasoning with Relative-Absolute Policy Optimization [63.169050703903515]
強化学習(RL)を用いた包括的審美的推論フレームワークAes-R1を提案する。
Aes-R1はパイプライン、AesCoTを統合し、高品質なチェーン・オブ・プリーティングデータの構築とフィルタリングを行う。
実験により、Aes-R1は背骨の平均PLCC/SRCCを47.9%/34.8%改善することが示された。
論文 参考訳(メタデータ) (2025-09-26T04:55:00Z) - MiCo: Multi-image Contrast for Reinforcement Visual Reasoning [72.81576836419373]
CoT(Chain-of-Thought)推論は、複数の画像に視覚的手がかりをリンクするために使用することができる。
視覚言語モデル(VLM)の規則に基づく強化学習に適応する
提案手法は,マルチイメージ推論ベンチマークにおいて大幅な改善を実現し,汎用視覚タスクにおいて高い性能を示す。
論文 参考訳(メタデータ) (2025-06-27T17:59:27Z) - On the Role of Individual Differences in Current Approaches to Computational Image Aesthetics [38.85583529536269]
画像アセスメント(IAA)は、画像の多様性とユーザの主観性によって複雑なタスクである画像美学を評価する。
ジェネリックIAA(GIAA)モデルは平均麻酔スコアを推定し、パーソナライズIAA(PIAA)モデルは転送学習を用いてGIAAを適応し、ユーザ主観性を取り入れる。
この研究はIAAの理論的基盤を確立し、個々の特性を分布形式にエンコードする統一モデルを提案し、個人とグループの両方で評価する。
論文 参考訳(メタデータ) (2025-02-27T21:01:19Z) - A Survey on All-in-One Image Restoration: Taxonomy, Evaluation and Future Trends [67.43992456058541]
画像復元(IR)は、ノイズ、ぼかし、圧縮、悪天候など幅広い要因によって生じる劣化した観察から高品質な画像の復元を目指している。
従来のIR法は、個々の劣化タイプを対象とすることで顕著な進歩を遂げてきたが、それらの特殊化は、しばしば一般化のコストがかかる。
オールインワンのイメージ復元パラダイムが最近登場し、複数の劣化タイプに順応的に対処する統一されたフレームワークを提供している。
論文 参考訳(メタデータ) (2024-10-19T11:11:09Z) - ALL-E: Aesthetics-guided Low-light Image Enhancement [45.40896781156727]
我々は、新しいパラダイム、すなわち美学誘導低光画像強調(ALL-E)を提案する。
LLEに美的嗜好を導入し、美的報酬を伴う強化学習フレームワークでのトレーニングを動機付けている。
様々なベンチマークの結果は、最先端手法よりもall-Eの方が優れていることを示している。
論文 参考訳(メタデータ) (2023-04-28T03:34:10Z) - VILA: Learning Image Aesthetics from User Comments with Vision-Language
Pretraining [53.470662123170555]
ユーザからのコメントから画像美学を学習し、マルチモーダルな美学表現を学習するための視覚言語事前学習手法を提案する。
具体的には、コントラスト的および生成的目的を用いて、画像テキストエンコーダ-デコーダモデルを事前訓練し、人間のラベルなしでリッチで汎用的な美的意味学を学習する。
以上の結果から,AVA-Captionsデータセットを用いた画像の美的字幕化において,事前学習した美的視覚言語モデルよりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2023-03-24T23:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。