論文の概要: CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference
- arxiv url: http://arxiv.org/abs/2605.12545v1
- Date: Sat, 09 May 2026 10:21:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.56541
- Title: CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference
- Title(参考訳): CROP: コンポジション推論と最適化によるエキスパート指向のイメージクロップ
- Abstract要約: 美的画像トリミングは、空間的トリミングによってその構成を改善することにより、画像の美的品質を高めることを目的としている。
以前の手法は、しばしばサリエンシ予測や検索の強化に依存しており、タスクの中核的な要件である構成と美学の深い理解を無視している。
本稿では, 美学におけるVLMの分析・理解能力の活性化を目的とした, マルチモーダル推論タスクとして, 審美的作付けを再構築する新しいパラダイムを提案する。
- 参考スコア(独自算出の注目度): 8.129228105494434
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aesthetic image cropping aims to enhance the aesthetic quality of an image by improving its composition through spatial cropping. Previous methods often rely on saliency prediction or retrieval augmentation, ignoring the task's core requirement: a deep understanding of composition and aesthetics. Consequently, saliency-based methods struggle to make compositional trade-offs in complex scenes, while retrieval-based methods blindly refer to similar cases, lacking adaptive reasoning for unique scenes. Both approaches fail to align their automated cropping results with those of human experts. To address the above issues, we propose a novel paradigm that reformulates aesthetic cropping as a multimodal reasoning task, aiming to activate the VLM's analytical and comprehension capabilities in aesthetics. We design a Compositional Reasoning and Optimizing Preference method (CROP) that directs the VLM to think like a professional photographer. It deconstructs a complex and subjective aesthetic problem into an "analysis-proposal-decision" process, reasoning step by step through the analysis of scene elements and compositional principles. Meanwhile, our expert preference alignment module makes the model's decision consistent with human expert aesthetics. Extensive experiments across multiple datasets validate our method's superiority and component effectiveness.
- Abstract(参考訳): 美的画像トリミングは、空間的トリミングによってその構成を改善することにより、画像の美的品質を高めることを目的としている。
以前の手法は、しばしばサリエンシ予測や検索の強化に依存しており、タスクの中核的な要件である構成と美学の深い理解を無視している。
その結果,サリエンシに基づく手法は複雑な場面で構成上のトレードオフを起こすのに苦労する一方で,検索に基づく手法は類似の事例を盲目的に参照し,ユニークな場面に対する適応的推論を欠いている。
どちらのアプローチも、自動化された収穫結果と人間の専門家の成果の一致に失敗する。
以上の課題に対処するため,本論文では,美学におけるVLMの分析・理解能力の活性化を目的とした,マルチモーダル推論タスクとして,審美的トリミングを再構築する新しいパラダイムを提案する。
我々は、VLMをプロの写真家のように考えるよう指示する合成推論と最適化選好法(CROP)を設計する。
複雑で主観的な美的問題を「分析・韻律決定」プロセスに分解し、シーン要素と構成原理の分析を通じて段階的に推論する。
一方、我々の専門家選好アライメントモジュールは、モデルの判断を人間の専門家の美学と一致させる。
複数のデータセットにわたる大規模な実験は、我々の方法の優越性とコンポーネントの有効性を検証する。
関連論文リスト
- Advancing Aesthetic Image Generation via Composition Transfer [57.624601729777986]
Composerは、意味に依存しない方法で構成をモデル化するように設計されたフレームワークである。
参照画像からキー合成認識表現を抽出することにより、合成転送をサポートする。
また、大規模視覚言語モデルのコンテキスト内学習機能を活用することで、テーマ駆動型合成検索もサポートする。
論文 参考訳(メタデータ) (2026-05-06T07:56:16Z) - Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment [51.40989269202702]
審美的品質評価タスクは,AIGCの定量的評価システムの開発に不可欠である。
本研究では,記述生成による美的次元の分離を図った芸術的画像の美的評価フレームワークであるArtQuantを提案する。
提案手法は,従来のトレーニングの33%しか必要とせず,いくつかのデータセット上での最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-29T12:18:26Z) - AesCrop: Aesthetic-driven Cropping Guided by Composition [4.402109574578595]
AesCropは、VMambaイメージエンコーダを統合し、新しいMambaコンポジションアテンションバイアス(MCAB)を付加した合成対応ハイブリッド画像カッピングモデルである。
MCABは、コンポジションキューをアテンション機構にエンコードし、AesCropに最も構成的に健全な領域にフォーカスするよう指示する。
大規模な実験は、AesCropが現在の最先端の手法より優れており、優れた量的指標を提供し、質的により喜ばしい作物を提供することを示した。
論文 参考訳(メタデータ) (2025-10-26T04:30:02Z) - ProCrop: Learning Aesthetic Image Cropping from Professional Compositions [57.949730056500634]
ProCropは、プロの写真を利用して収穫決定を導く検索方式である。
プロ画像のアウトペイントによって生成された242Kの弱い注釈付き画像の大規模データセットを提示する。
この合成対応データセット生成は、美学原理で導かれる多様な高品質な作物提案を提供する。
論文 参考訳(メタデータ) (2025-05-28T15:38:44Z) - Photography Perspective Composition: Towards Aesthetic Perspective Recommendation [22.780632515229286]
伝統的な写真合成アプローチは2次元の収穫法によって支配されている。
プロの写真家は、しばしば3D再構成の形で視点調整を用いる。
従来の収穫法を超越した写真視点合成(PPC)を提案する。
論文 参考訳(メタデータ) (2025-05-27T03:04:48Z) - FreeCompose: Generic Zero-Shot Image Composition with Diffusion Prior [50.0535198082903]
我々は,複数の入力イメージを単一のコヒーレントなイメージに統合する,新しい画像合成手法を提案する。
本稿では, 大規模事前学習拡散モデルに内在する強力な生成的前駆体を利用して, 汎用画像合成を実現する可能性を示す。
論文 参考訳(メタデータ) (2024-07-06T03:35:43Z) - Cones 2: Customizable Image Synthesis with Multiple Subjects [50.54010141032032]
本研究では,特定の対象を効率的に表現する方法と,異なる対象を適切に構成する方法について検討する。
クロスアテンションマップ内のアクティベーションを修正することにより、レイアウトはイメージ内の異なる被写体の位置を指定して分離する。
論文 参考訳(メタデータ) (2023-05-30T18:00:06Z) - Personalizing image enhancement for critical visual tasks: improved
legibility of papyri using color processing and visual illusions [0.0]
方法: ユーザ体験実験において, 色処理と視覚錯覚に基づく新しい拡張アルゴリズムを古典的手法と比較する。
ユーザは、パーソナリティや社会的条件、タスクとアプリケーションドメイン、専門レベルと画質、ソフトウェア、ハードウェア、インターフェースの余裕などの影響を受けながら、幅広い行動スペクトルを示しました。
論文 参考訳(メタデータ) (2021-03-11T23:48:17Z) - Adversarial Image Composition with Auxiliary Illumination [53.89445873577062]
本稿では,現実的な画像合成を実現するためのAIC-Netを提案する。
影の発生と前景の移動を両立させる新しい分岐生成機構を提案する。
歩行者と自動車のコンポジションタスクに関する実験により,提案したAIC-Netが優れたコンポジション性能を実現することを示す。
論文 参考訳(メタデータ) (2020-09-17T12:58:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。