論文の概要: Learning visual representations for compositional analysis of artworks and photographs
- arxiv url: http://arxiv.org/abs/2608.06142v1
- Date: Thu, 06 Aug 2026 15:11:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.780267
- Title: Learning visual representations for compositional analysis of artworks and photographs
- Title(参考訳): 美術品と写真の構成解析のための視覚表現の学習
- Abstract要約: 合成分析のための並列パラダイムとして,知覚的グループ化を基礎としたヒューマンインスパイアされた手法と,近年の大規模合成データセットによって実現された微調整基礎モデルを比較した。
凍結エンコーダでは、人間にインスパイアされた方法は解釈可能のまま競争性能を達成する。
十分なデータによって微調整が可能となると、大規模な自己教師付きモデルの性能は大幅に向上するが、解釈可能性やドメイン間一般化のコストがかかる。
- 参考スコア(独自算出の注目度): 40.190936097282275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Composition, the deliberate arrangement of visual elements, is central to how meaning, emotion, and aesthetic quality are conveyed in artwork, yet it remains among the least formalized dimensions of visual understanding. Prior work highlights a persistent gap in learning meaningful compositional representations, attributing it to semantic bias and suggesting that human-inspired approaches may be key. We compare two parallel paradigms for composition analysis: a human-inspired method grounded in perceptual grouping, and fine-tuned foundation models enabled by recent large-scale compositional datasets. The human-inspired approach uses object-centric models for region-level decomposition and a graph attention network to capture spatial relationships between elements. Both paradigms are evaluated on composition score/category prediction, compositional image retrieval, and visual saliency detection. With frozen encoders, the human-inspired method achieves competitive performance while remaining interpretable. When sufficient data enables fine-tuning, large self-supervised models outperform significantly, but at the cost of interpretability and cross-domain generalization.
- Abstract(参考訳): 視覚要素の意図的な配置である構成は、どのように意味、感情、美的品質がアートワークで伝達されるかの中心であるが、視覚的理解の最もフォーマルな側面の1つである。
先行研究は、意味のある構成表現を学習する際の永続的なギャップを強調し、それが意味的バイアスに寄与し、人間に触発されたアプローチが鍵であるかもしれないことを示唆している。
合成分析のための並列パラダイムとして,知覚的グループ化を基礎としたヒューマンインスパイアされた手法と,近年の大規模合成データセットによって実現された微調整基礎モデルを比較した。
人間にインスパイアされたアプローチは、領域レベルの分解のためのオブジェクト中心モデルと、要素間の空間的関係をキャプチャするグラフアテンションネットワークを使用する。
両パラダイムは、合成スコア/カテゴリ予測、合成画像検索、視覚的相性検出に基づいて評価される。
凍結エンコーダでは、人間にインスパイアされた方法は解釈可能のまま競争性能を達成する。
十分なデータによって微調整が可能となると、大規模な自己教師付きモデルの性能は大幅に向上するが、解釈可能性やドメイン間一般化のコストがかかる。
関連論文リスト
- Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment [51.40989269202702]
審美的品質評価タスクは,AIGCの定量的評価システムの開発に不可欠である。
本研究では,記述生成による美的次元の分離を図った芸術的画像の美的評価フレームワークであるArtQuantを提案する。
提案手法は,従来のトレーニングの33%しか必要とせず,いくつかのデータセット上での最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-29T12:18:26Z) - Through the PRISm: Importance-Aware Scene Graphs for Image Retrieval [6.804414686833417]
PRISmは2つの新しいコンポーネントを通して画像と画像の検索を促進するマルチモーダルフレームワークである。
Importance Prediction Moduleは、イメージ内で最も重要なオブジェクトとリレーショナルトリガを特定し、保持する。
Edge-Aware Graph Neural Networkは、リレーショナル構造を明示的にエンコードし、グローバルな視覚的特徴を統合して、セマンティックなインフォメーション画像の埋め込みを生成する。
論文 参考訳(メタデータ) (2025-12-20T15:57:46Z) - Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models [26.525531111141717]
ビジョンランゲージモデルは、テキストと画像の共有機能空間を学習し、異なるモードの入力の比較を可能にする。
画像領域における構成性について検討し、合成特性の分析は視覚データのノイズと空間性によって挑戦される。
本稿では,GDE(Geodesically Decomposable Embeddings)と呼ばれるフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-21T13:46:53Z) - Exploiting Contextual Uncertainty of Visual Data for Efficient Training of Deep Models [0.65268245109828]
アクティブラーニングCDALにおける文脈多様性の概念を導入する。
モデルバイアスを低減するために、文脈的に公正なデータをキュレートするデータ修復アルゴリズムを提案する。
我々は、野生生物カメラトラップ画像の画像検索システムと、質の悪い農村道路に対する信頼性の高い警告システムの開発に取り組んでいる。
論文 参考訳(メタデータ) (2024-11-04T09:43:33Z) - Human-Object Interaction Detection Collaborated with Large Relation-driven Diffusion Models [65.82564074712836]
テキストと画像の拡散モデルに光を流す新しいHOI検出器であるDIFfusionHOIを紹介する。
まず、埋め込み空間における人間と物体の関係パターンの表現をインバージョンベースで学習する戦略を考案する。
これらの学習された関係埋め込みはテキストのプロンプトとして機能し、スタイア拡散モデルが特定の相互作用を記述する画像を生成する。
論文 参考訳(メタデータ) (2024-10-26T12:00:33Z) - Bridging Neural and Symbolic Representations with Transitional Dictionary Learning [4.326886488307076]
本稿では,記号的知識を暗黙的に学習できる新しいトランジショナル辞書学習(TDL)フレームワークを提案する。
本稿では,期待最大化法(EM)アルゴリズムで学習した辞書を用いて,入力を視覚部分へ分解するゲーム理論拡散モデルを提案する。
3つの抽象的な合成視覚オブジェクトデータセットを用いて実験を行った。
論文 参考訳(メタデータ) (2023-08-03T19:29:35Z) - Perceptual Grouping in Contrastive Vision-Language Models [59.1542019031645]
画像内の物体の位置を視覚言語モデルで理解し,画像の視覚的関連部分をグループ化する方法について述べる。
本稿では,意味情報と空間情報の両方を一意に学習するモデルとして,最小限の修正を提案する。
論文 参考訳(メタデータ) (2022-10-18T17:01:35Z) - Self-Supervised Visual Representation Learning with Semantic Grouping [50.14703605659837]
我々は、未ラベルのシーン中心のデータから視覚表現を学習する問題に取り組む。
本研究では,データ駆動型セマンティックスロット,すなわちSlotConによる協調型セマンティックグルーピングと表現学習のためのコントラスト学習を提案する。
論文 参考訳(メタデータ) (2022-05-30T17:50:59Z) - DRG: Dual Relation Graph for Human-Object Interaction Detection [65.50707710054141]
人-物間相互作用(HOI)検出の課題に対処する。
既存の方法は、人間と物体の対の相互作用を独立に認識するか、複雑な外観に基づく共同推論を行う。
本稿では,抽象的空間意味表現を活用して,各対象対を記述し,二重関係グラフを用いてシーンの文脈情報を集約する。
論文 参考訳(メタデータ) (2020-08-26T17:59:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。