論文の概要: Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator
- arxiv url: http://arxiv.org/abs/2608.04821v1
- Date: Wed, 05 Aug 2026 13:23:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.937997
- Title: Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator
- Title(参考訳): アテンションガイドとグローバルアライズされたクロップ評価器を用いたグローバルアテンション融合画像クロッピング
- Authors: Haotian Yang, Zhile Yang, Kin-Man Lam, Patrick Le Callet, Xin Sun,
- Abstract要約: GAFIC(Global Attention-Fused Image Cropping)は、AGFF(Attention-Guided Feature Fusion)とGACE(Global-Aligned Evaluator)である。
AGFFは、画像構造と局所的な詳細の両方をキャプチャするグローバルな表現を構築するために、局所的な領域の重要性を集約する。
GACEは、候補作物の特徴をこのグローバルな表現と整合させ、作物の評価を境界変化に敏感に維持する。
- 参考スコア(独自算出の注目度): 30.007885907715515
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Image cropping aims to improve image aesthetics by preserving important content within an appropriately composed region. However, most existing methods focus primarily on salient regions and therefore have limited sensitivity to the global relationships among the main image components. To address this limitation, we propose Global Attention-Fused Image Cropping (GAFIC), which consists of an Attention-Guided Feature Fusion (AGFF) and a Global-Aligned Crop Evaluator (GACE). AGFF aggregates the importance of local regions to construct a global representation that captures both image structure and local details. GACE aligns candidate crop features with this global representation, enabling crop evaluation to remain sensitive to boundary changes. We further combine three ranking losses across multiple scales to obtain accurate and stable crop scores. Extensive experiments on the GAIC and CPC datasets demonstrate that GAFIC outperforms existing image-cropping methods, particularly in terms of accuracy and stability. Unlike pixel-level retargeting methods such as seam carving, inpainting, and diffusion-based synthesis, GAFIC does not synthesize or modify the retained pixels; instead, it selects an aesthetically preferred crop from the source image, making it suitable for scenarios where pixel integrity and efficient batch processing are important. The source code is available at https://github.com/AIVRC/GAFIC.git.
- Abstract(参考訳): 画像トリミングは、適切に構成された領域内で重要なコンテンツを保存することにより、画像の美学を改善することを目的としている。
しかし、既存のほとんどの手法は、主に正常な領域に焦点をあてており、それゆえ、主要画像成分間のグローバルな関係に限定的な感度を持つ。
この制限に対処するため,GAFIC (Global Attention-Fused Image Cropping) を提案し,AGFF (Attention-Guided Feature Fusion) とGlobal-Aligned Crop Evaluator (GACE) から構成される。
AGFFは、画像構造と局所的な詳細の両方をキャプチャするグローバルな表現を構築するために、局所的な領域の重要性を集約する。
GACEは、候補作物の特徴をこのグローバルな表現と整合させ、作物の評価を境界変化に敏感に維持する。
さらに、複数のスケールで3つのランキングの損失を組み合わせ、正確で安定した作物のスコアを得る。
GAICとCPCデータセットの大規模な実験は、GAFICが既存の画像クロッピング法、特に精度と安定性で優れていることを示した。
シーム彫刻、塗布、拡散ベース合成などの画素レベルの再ターゲティング法とは異なり、GAFICは保持された画素を合成・修正せず、画像から美学的に好まれる作物を選択し、画素の完全性と効率的なバッチ処理が重要であるシナリオに適している。
ソースコードはhttps://github.com/AIVRC/GAFIC.gitで入手できる。
関連論文リスト
- Dual-Stage Global and Local Feature Framework for Image Dehazing [7.536829470604261]
我々はStreamlined Global and Local Features Combinator(SGLC)と呼ばれる新しいフレームワークを提案する。
我々のアプローチは、Global Features Generator(GFG)とLocal Features Enhancer(LFE)の2つの主要コンポーネントで構成されています。
高分解能データセットによる実験結果から,SGLCを用いた場合のピーク信号-雑音比(PSNR)の大幅な改善が示された。
論文 参考訳(メタデータ) (2025-08-28T09:03:48Z) - Rethinking the Spatial Inconsistency in Classifier-Free Diffusion Guidance [17.29693696084235]
テキストと画像の拡散モデルにおいて,異なる意味単位に対して指導度をカスタマイズする新しい手法を提案する。
我々は,各意味領域のCFG尺度を適応的に調整し,テキスト誘導度を均一なレベルに再スケールする。
実験は、様々なテキスト・画像拡散モデルにおける元のCFG戦略よりもS-CFGの方が優れていることを示す。
論文 参考訳(メタデータ) (2024-04-08T10:45:29Z) - Progressive Feature Self-reinforcement for Weakly Supervised Semantic
Segmentation [55.69128107473125]
Weakly Supervised Semantic (WSSS) のイメージレベルラベルを用いたシングルステージアプローチを提案する。
我々は、画像内容が決定論的領域(例えば、自信ある前景と背景)と不確実領域(例えば、オブジェクト境界と誤分類されたカテゴリ)に適応的に分割して、別々の処理を行う。
そこで我々は,これらの自信のある領域と同一のクラスラベルを持つ拡張画像とのセマンティック一貫性を制約する補完的な自己強調手法を提案する。
論文 参考訳(メタデータ) (2023-12-14T13:21:52Z) - I2F: A Unified Image-to-Feature Approach for Domain Adaptive Semantic
Segmentation [55.633859439375044]
意味的セグメンテーションのための教師なしドメイン適応(UDA)は、重いアノテーション作業から人々を解放する有望なタスクである。
この問題に対処する主要なアイデアは、画像レベルと特徴レベルの両方を共同で実行することである。
本稿では,画像レベルと特徴レベルを統一したセマンティックセグメンテーションのための新しいUDAパイプラインを提案する。
論文 参考訳(メタデータ) (2023-01-03T15:19:48Z) - Local-Aware Global Attention Network for Person Re-Identification Based on Body and Hand Images [0.0]
本稿では,身体画像と手動画像の両面から,人物Re-Idに対するエンドツーエンドの識別的深層特徴学習のための複合的アプローチを提案する。
提案手法は既存の最先端手法よりも一貫して優れている。
論文 参考訳(メタデータ) (2022-09-11T09:43:42Z) - Inter-Image Communication for Weakly Supervised Localization [77.2171924626778]
弱教師付きローカライゼーションは、画像レベルの監督のみを使用して対象対象領域を見つけることを目的としている。
我々は,より正確な物体位置を学習するために,異なる物体間の画素レベルの類似性を活用することを提案する。
ILSVRC検証セット上でトップ1のローカライズ誤差率45.17%を達成する。
論文 参考訳(メタデータ) (2020-08-12T04:14:11Z) - A U-Net Based Discriminator for Generative Adversarial Networks [86.67102929147592]
GAN(Generative Adversarial Network)のための代替U-Netベースの識別器アーキテクチャを提案する。
提案アーキテクチャにより,合成画像のグローバルコヒーレンスを維持しつつ,画素単位の詳細なフィードバックを生成元に提供することができる。
斬新な判別器は、標準分布と画像品質の指標の観点から、最先端の技術を向上する。
論文 参考訳(メタデータ) (2020-02-28T11:16:54Z) - Image Fine-grained Inpainting [89.17316318927621]
拡張畳み込みの密結合を利用してより大きく効果的な受容場を得る一段階モデルを提案する。
この効率的なジェネレータをよく訓練するために、頻繁に使用されるVGG特徴整合損失を除いて、新しい自己誘導回帰損失を設計する。
また、局所的・グローバルな分枝を持つ識別器を用いて、局所的・グローバルな内容の整合性を確保する。
論文 参考訳(メタデータ) (2020-02-07T03:45:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。