論文の概要: COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping
- arxiv url: http://arxiv.org/abs/2608.07570v1
- Date: Tue, 04 Aug 2026 03:02:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.440865
- Title: COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping
- Title(参考訳): COMEX: 説明可能な美的イメージクロップのためのコンポジション型ベンチマークと学習フレームワーク
- Abstract要約: 我々は、構造化された作物構成・説明問題として、説明可能な美的画像トリミングを再構成する。
COMEXはイメージ拡張とIO-リバーサルパイプラインによって構築された新しいベンチマークである。
本稿では,2段階のSFT+GRPOフレームワークを提案する。
- 参考スコア(独自算出の注目度): 24.08383579847306
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Explainable aesthetic image cropping requires not only localizing a visually pleasing crop but also explaining why it is preferred. Existing crop-and-explain methods largely treat explanation as post-hoc text generation and overlook composition, a key aesthetic factor that links crop decisions with interpretable reasoning. In this paper, we reformulate explainable aesthetic image cropping as a structured crop-composition-explanation problem. To support this setting, we introduce COMEX, a new benchmark built through image expansion and an IO-reversal pipeline. COMEX contains 33,161 quadruples, each consisting of an expanded image, a crop box, a composition category, and a composition-grounded explanation, enabling joint learning of crop localization, composition understanding, and explanation generation. We further propose a two-stage SFT+GRPO framework, where supervised fine-tuning establishes the structured output protocol and basic cropping ability, and GRPO further improves crop quality, composition prediction, and explanation faithfulness. We benchmark 15 large vision-language models and existing cropping methods on COMEX, establishing a comprehensive testbed for composition-grounded explainable aesthetic cropping. Experiments on both COMEX and prior benchmarks demonstrate the effectiveness and transferability of our framework, with strong performance across evaluation metrics.
- Abstract(参考訳): 説明可能な美的画像の収穫には、視覚的に喜ぶ作物の局在だけでなく、それが好まれる理由も説明する必要がある。
既存の作物と説明法は、作物の決定と解釈可能な推論を結びつける重要な美的要因である、ポストホックテキスト生成と見落とし合成としての説明を主に扱う。
本稿では,構造的作物構成・説明問題として,説明可能な美的イメージトリミングを再構築する。
この設定をサポートするために、イメージ拡張とIO-リバーサルパイプラインによって構築された新しいベンチマークであるCOMEXを紹介する。
COMEXは、拡大された画像、作物箱、合成カテゴリ、および合成地上説明からなる33,161個の四重対を含み、作物の局在化、構成理解、説明生成の合同学習を可能にする。
さらに,2段階のSFT+GRPOフレームワークを提案し,構造化された生産プロトコルと基本収穫能力を確立し,GRPOは作物の品質,構成予測,説明忠実性をさらに向上させる。
COMEX上では15の大規模視覚言語モデルと既存の作付け手法をベンチマークし, 合成地による説明可能な美的作付けのための包括的テストベッドを構築した。
COMEXと以前のベンチマークの両方の実験では、評価指標間で高いパフォーマンスで、フレームワークの有効性と転送性を示しました。
関連論文リスト
- ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions [26.108311837437583]
textbfTriple-Shot compositions (TSC) は、単一の人中心画像から3ショットセットを生成する合成タスクである。
TSCを専門的なアノテーションで学習するために,3段階のトレーニングプロセスを行う textbfShotCrop を導入する。
ShotCropは、ショットローカライゼーション精度において、GPT-5よりもtextbf2.82倍の平均的な改善を実現している。
論文 参考訳(メタデータ) (2026-06-04T03:01:12Z) - Advancing Aesthetic Image Generation via Composition Transfer [57.624601729777986]
Composerは、意味に依存しない方法で構成をモデル化するように設計されたフレームワークである。
参照画像からキー合成認識表現を抽出することにより、合成転送をサポートする。
また、大規模視覚言語モデルのコンテキスト内学習機能を活用することで、テーマ駆動型合成検索もサポートする。
論文 参考訳(メタデータ) (2026-05-06T07:56:16Z) - AesCrop: Aesthetic-driven Cropping Guided by Composition [4.402109574578595]
AesCropは、VMambaイメージエンコーダを統合し、新しいMambaコンポジションアテンションバイアス(MCAB)を付加した合成対応ハイブリッド画像カッピングモデルである。
MCABは、コンポジションキューをアテンション機構にエンコードし、AesCropに最も構成的に健全な領域にフォーカスするよう指示する。
大規模な実験は、AesCropが現在の最先端の手法より優れており、優れた量的指標を提供し、質的により喜ばしい作物を提供することを示した。
論文 参考訳(メタデータ) (2025-10-26T04:30:02Z) - CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback [58.27353205269664]
最先端のT2Iモデルは、テキストプロンプトによって高解像度の画像を生成することができる。
しかし、複数の対象、属性、空間的関係を規定する構成的なシーンを正確に描写することは困難である。
我々は3次元空間的関係の描写を評価することに焦点を当てた、挑戦的なベンチマークであるCompAlignを紹介する。
論文 参考訳(メタデータ) (2025-05-16T12:23:58Z) - ComAlign: Compositional Alignment in Vision-Language Models [2.3250871476216814]
コンポジションアライメント(ComAlign)を導入し、テキストと画像コンポーネントのより正確な対応を見出す。
本手法は, テキストのモダリティから抽出した構成構造も画像のモダリティに残さなければならないことを強調する。
私たちは、小さなデータセットを使用して、既存のビジュアルおよび言語エンコーダの上に横たわる軽量ネットワークをトレーニングします。
論文 参考訳(メタデータ) (2024-09-12T16:46:41Z) - T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation [55.16845189272573]
T2I-CompBench++は、合成テキスト・画像生成のための拡張ベンチマークである。
8000のコンポジションテキストプロンプトは、属性バインディング、オブジェクト関係、生成数、複雑なコンポジションの4つのグループに分類される。
論文 参考訳(メタデータ) (2023-07-12T17:59:42Z) - Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal
Structured Representations [70.41385310930846]
マルチモーダルな構造表現を強化するためのエンドツーエンドフレームワークであるStructure-CLIPを提案する。
シーングラフを用いてセマンティックなネガティブな例の構築をガイドし、その結果、構造化された表現の学習に重点を置いている。
知識エンハンス(KEE)は、SGKを入力として活用し、構造化表現をさらに強化するために提案される。
論文 参考訳(メタデータ) (2023-05-06T03:57:05Z) - Bridging Component Learning with Degradation Modelling for Blind Image
Super-Resolution [69.11604249813304]
視覚障害者のためのコンポーネント分解・協調最適化ネットワーク(CDCN)を提案する。
CDCNは入力LR画像を特徴空間の構造と詳細成分に分解する。
本稿では,HR画像の細部と構造復元過程を協調的に監督する,劣化駆動型学習戦略を提案する。
論文 参考訳(メタデータ) (2022-12-03T14:53:56Z) - ComCLIP: Training-Free Compositional Image and Text Matching [19.373706257771673]
コントラスト言語-画像事前訓練は画像とテキストのマッチングに優れたゼロショット性能を示した。
我々は新しいtextbftextittraining-free compositional CLIP model (ComCLIP) を提案する。
ComCLIPは、入力された画像を被写体、オブジェクト、アクションのサブイメージに切り離し、CLIPのビジョンエンコーダとテキストエンコーダを構成して、合成テキスト埋め込みとサブイメージ埋め込みに対する進化的なマッチングを実行する。
論文 参考訳(メタデータ) (2022-11-25T01:37:48Z) - StyleT2I: Toward Compositional and High-Fidelity Text-to-Image Synthesis [52.341186561026724]
構成性の欠如は、堅牢性と公正性に深刻な影響を及ぼす可能性がある。
テキスト対画像合成の合成性を改善するための新しいフレームワークであるStyleT2Iを導入する。
その結果,StyleT2Iは入力テキストと合成画像との整合性という点で従来の手法よりも優れていた。
論文 参考訳(メタデータ) (2022-03-29T17:59:50Z) - Image-to-Image Translation with Text Guidance [139.41321867508722]
本研究の目的は,制御可能な因子,すなわち自然言語記述を生成的敵ネットワークを用いた画像から画像への変換に組み込むことである。
提案する4つのキーコンポーネントは,(1)非意味的単語をフィルタリングする部分音声タグの実装,(2) 異なるモダリティテキストと画像特徴を効果的に融合するアフィン結合モジュールの採用,(3) 識別器の差分能力と生成器の整形能力を高めるための改良された多段階アーキテクチャである。
論文 参考訳(メタデータ) (2020-02-12T21:09:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。