論文の概要: GenScale: A Benchmark for Relative Object Scale in Image Generation and Editing
- arxiv url: http://arxiv.org/abs/2609.00525v1
- Date: Tue, 01 Sep 2026 00:47:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.176913
- Title: GenScale: A Benchmark for Relative Object Scale in Image Generation and Editing
- Title(参考訳): GenScale:イメージ生成と編集における相対的オブジェクトスケールのベンチマーク
- Authors: Lingxiao Li, Max Whitton, Ledell Wu, Boqing Gong,
- Abstract要約: GenScaleは、画像生成と編集における実世界の相対オブジェクトスケールのベンチマークおよび評価プロトコルである。
Rescaleは、ソースジェネレータを変更することなく、局所的なスケール補正を行うモデルに依存しない後処理エージェントである。
- 参考スコア(独自算出の注目度): 26.740329922720065
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern image generation and editing systems can produce photorealistic, prompt-aligned images, but still often render familiar objects at implausible relative sizes. To measure this failure mode, we introduce GenScale, a benchmark and evaluation protocol for real-world relative object scale in image generation and editing. GenScale contains 900 image-level entries and 1,643 pairwise anchor-target scale relations across common-object generation, human-product generation with metric dimensions, and scale correction from failed generations. We further design a human-calibrated ordinal judge for scalable pairwise scale evaluation. Last but not the least, we introduce Rescale, a model-agnostic post-processing agent for localized scale correction without modifying the source generator. Experiments reveal that state-of-the-art image generators and editors cannot reliably observe relative scale yet, while Rescale consistently improves scale plausibility across generated and edited images. Together, GenScale establishes relative object scale as a distinct, measurable, and actionable capability for image generation systems.
- Abstract(参考訳): 現代の画像生成および編集システムは、フォトリアリスティックで、プロンプトに整列した画像を生成することができるが、それでもよく知られたオブジェクトを、不可解な相対的なサイズでレンダリングすることが多い。
この障害モードを測定するために、画像生成と編集における実世界の相対オブジェクトスケールのベンチマークおよび評価プロトコルであるGenScaleを導入する。
GenScaleには900のイメージレベルエントリと1,643のペアワイドアンカー-ターゲットスケール関係があり、共通オブジェクト生成、計量次元を持つ製品生成、失敗した世代からのスケール修正が含まれている。
我々はさらに、スケーラブルなペアワイズスケール評価のための人間校正順序判定器を設計する。
最後に、ソースジェネレータを変更することなく、局所化スケール補正のためのモデルに依存しない後処理エージェントであるRescaleを紹介する。
実験によると、最先端の画像生成装置とエディターはまだ相対的なスケールを確実に観察できないが、Rescaleは生成および編集された画像間でのスケールの妥当性を一貫して改善している。
GenScaleは、画像生成システムにおいて、相対オブジェクトスケールを区別され、測定可能で、実行可能な機能として確立している。
関連論文リスト
- Learn Your Scales: Towards Scale-Consistent Generative Novel View Synthesis [23.967904337714234]
生成的新規なビュー合成法を訓練する際に, スケールあいまいさの影響を理解し, 対処する方法を模索する。
GNVSでは、シーンやオブジェクトの新たなビューは、単一のイメージによって最小限に合成することができ、したがって制限されない。
GNVSにおけるシーンスケールのあいまいさが単一画像からサンプル化した場合の効果について,その効果をモデル上で分離することによって検討した。
論文 参考訳(メタデータ) (2025-03-19T16:56:03Z) - Benchmarking Counterfactual Image Generation [22.573830532174956]
ジェネレーティブAIは、視覚コンテンツ編集に革命をもたらし、画像やビデオの編集に力を入れている。
自然画像や医用画像などの領域で現実的な編集を行うには、因果関係を尊重しなければならない。
本稿では,反実画像生成手法の徹底的なベンチマークを行うための比較フレームワークを提案する。
論文 参考訳(メタデータ) (2024-03-29T16:58:13Z) - ImagenHub: Standardizing the evaluation of conditional image generation
models [48.51117156168]
本稿では,条件付き画像生成モデルの推論と評価を標準化するワンストップライブラリであるImagenHubを提案する。
本研究では,感性一貫性と知覚品質という2つの評価スコアと,生成した画像を評価するための包括的なガイドラインを設計する。
人間の評価は,0.4以上の値を持つ76%のモデル上で,クリッペンドルフのαに対する高い労働者間合意を達成する。
論文 参考訳(メタデータ) (2023-10-02T19:41:42Z) - Dual Pyramid Generative Adversarial Networks for Semantic Image
Synthesis [94.76988562653845]
セマンティック画像合成の目標は、セマンティックラベルマップからフォトリアリスティック画像を生成することである。
しかし、現在の最先端のアプローチは、さまざまなスケールで画像で現実的なオブジェクトを生成するのに依然として苦労している。
本研究では,空間適応型正規化ブロックの条件付けを各スケールで同時に学習するDual Pyramid Generative Adversarial Network (DP-GAN)を提案する。
論文 参考訳(メタデータ) (2022-10-08T18:45:44Z) - Arbitrary-Scale Image Synthesis [149.0290830305808]
位置エンコーディングにより、1つの敵ネットワークをトレーニングし、異なるスケールの画像を生成することができる。
生成器の変換層に不変なスケール一貫性のある位置符号化の設計を提案する。
画像合成のための様々な一般的なデータセットに対して,連続したスケールの競合結果を示す。
論文 参考訳(メタデータ) (2022-04-05T15:10:43Z) - ScaleNet: A Shallow Architecture for Scale Estimation [25.29257353644138]
我々は、画像間のスケールを予測するために、拡張畳み込みと自己および相互相関レイヤを利用する新しいアーキテクチャであるScaleNetを設計する。
本研究では, カメラポーズ推定, 3次元再構成, あるいは密度幾何マッチングを改善するために, 局所的特徴と密接な通信網を組み合わせる方法を示す。
論文 参考訳(メタデータ) (2021-12-09T11:32:01Z) - Object-Centric Image Generation from Layouts [93.10217725729468]
複数のオブジェクトを持つ複雑なシーンを生成するレイアウト・ツー・イメージ生成法を開発した。
本手法は,シーン内のオブジェクト間の空間的関係の表現を学習し,レイアウトの忠実度の向上につながる。
本稿では,Fr'echet Inception Distanceのオブジェクト中心適応であるSceneFIDを紹介する。
論文 参考訳(メタデータ) (2020-03-16T21:40:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。