論文の概要: ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing
- arxiv url: http://arxiv.org/abs/2608.13974v1
- Date: Fri, 14 Aug 2026 05:34:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.290106
- Title: ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing
- Title(参考訳): ProFocus: プログレッシブな視覚に焦点を当てた芸術的イメージの感情的体験を解釈する
- Abstract要約: ProFocusは、プログレッシブ・ビジュアル・フォーカスによる芸術的イメージの感情体験をモデル化する新しいフレームワークである。
ProFocusは感情認識と感情的説明の両方において、最先端の手法を一貫して上回っている。
- 参考スコア(独自算出の注目度): 17.533802550951346
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Interpreting the emotional responses triggered by images is central to achieving emotional intelligence. Compared with natural images, visual art is intentionally created to elicit emotional responses from its viewers through abstract concepts and visual metaphors, making affective interpretation particularly challenging. However, most existing methods rely on general-purpose visual embeddings (e.g., CLIP), failing to capture the nuanced cues underlying artistic emotion. To address this gap, we propose \textbf{ProFocus}, a novel framework that models affective experience in artistic images via progressive visual focusing. The key idea is to model visual representation learning inspired by a hierarchical cognitive theory of human aesthetic appreciation. Technically, ProFocus contains two core components: a Hierarchical Art Critic (HAC) and a Progressive Hint Fusion (PHF) module. HAC leverages multimodal large language models to generate structured linguistic priors at three cognitive levels--atmospheric style, narrative subjects, and concrete details--thereby translating artistic perception into coherent semantic guidance. Building upon these priors, PHF departs from conventional cross-modal fusion by sequentially injecting the hierarchical hints into visual features, enabling a progressive focusing process that mirrors human perception. This design allows the model to capture subtle affective cues and produce more faithful explanations. Extensive experiments on the ArtEmis v1.0 and v2.0 datasets demonstrate that ProFocus consistently outperforms state-of-the-art methods in both emotion recognition and affective explanation. Project page: https://github.com/Zhang-Zhiyan/ProFocus.
- Abstract(参考訳): イメージによって引き起こされる感情的な反応を解釈することは、感情的な知性を達成することの中心である。
自然画像と比較すると、視覚芸術は、抽象的な概念や視覚的メタファーを通じて、視聴者から感情的な反応を引き出すために意図的に作られ、感情的な解釈を特に困難にしている。
しかし、既存のほとんどの手法は汎用的な視覚埋め込み(例えばCLIP)に依存しており、芸術的感情の根底にあるニュアンスな手がかりを捉えていない。
このギャップに対処するために,プログレッシブ・ビジュアル・フォーカスによる芸術的イメージの感情体験をモデル化する新しいフレームワークである「textbf{ProFocus}」を提案する。
鍵となる考え方は、人間の美的評価の階層的認知理論にインスパイアされた視覚表現学習をモデル化することである。
技術的には、ProFocusは階層的アート批判(HAC)とプログレッシブ・ヒント・フュージョン(PHF)モジュールの2つのコアコンポーネントを含んでいる。
HACは多モーダルな大言語モデルを活用して、3つの認知レベルで構造化された言語前駆体を生成する - 雰囲気的スタイル、物語的主題、具体的詳細 - は、芸術的知覚をコヒーレントな意味指導に翻訳する。
これらの先行技術に基づいて、PHFは、階層的なヒントを視覚的特徴に順次注入することにより、人間の知覚を反映するプログレッシブ・フォーカス・プロセスを可能にする。
この設計により、モデルは微妙な感情的な手がかりを捉え、より忠実な説明を生み出すことができる。
ArtEmis v1.0とv2.0データセットの大規模な実験は、ProFocusが感情認識と感情的説明の両方において、最先端の手法を一貫して上回っていることを示している。
プロジェクトページ: https://github.com/Zhang-Zhiyan/ProFocus.com
関連論文リスト
- Exploring Cognitive and Aesthetic Causality for Multimodal Aspect-Based Sentiment Analysis [34.100793905255955]
マルチモーダル・アスペクトベースの感情分類(MASC)は,ソーシャル・プラットフォーム上でのユーザ生成型マルチモーダル・コンテンツの増加による新たな課題である。
既存のMASCにおける多大な努力と重要な成果にもかかわらず、細かな視覚的内容の理解には大きなギャップが残っている。
本稿では,認知的・審美的感情因果理解フレームワークであるChimeraについて述べる。
論文 参考訳(メタデータ) (2025-04-22T12:43:37Z) - Impressions: Understanding Visual Semiotics and Aesthetic Impact [66.40617566253404]
画像のセミオティックスを調べるための新しいデータセットであるImpressionsを提示する。
既存のマルチモーダル画像キャプションと条件付き生成モデルは、画像に対する可視的応答をシミュレートするのに苦労していることを示す。
このデータセットは、微調整と少数ショット適応により、画像の印象や美的評価をモデル化する能力を大幅に改善する。
論文 参考訳(メタデータ) (2023-10-27T04:30:18Z) - StyleEDL: Style-Guided High-order Attention Network for Image Emotion
Distribution Learning [69.06749934902464]
StyleEDLと呼ばれる画像感情分布学習のためのスタイル誘導型高次アテンションネットワークを提案する。
StyleEDLは視覚内容の階層的スタイリスティック情報を探索することにより、画像のスタイリスティックな表現を対話的に学習する。
さらに、コンテンツ依存の感情表現を動的に生成するスタイリスティックなグラフ畳み込みネットワークを導入する。
論文 参考訳(メタデータ) (2023-08-06T03:22:46Z) - SOLVER: Scene-Object Interrelated Visual Emotion Reasoning Network [83.27291945217424]
画像から感情を予測するために,SOLVER(Scene-Object Interrelated Visual Emotion Reasoning Network)を提案する。
異なるオブジェクト間の感情関係を掘り下げるために、まずセマンティックな概念と視覚的特徴に基づいて感情グラフを構築します。
また、シーンとオブジェクトを統合するScene-Object Fusion Moduleを設計し、シーンの特徴を利用して、提案したシーンベースのアテンションメカニズムでオブジェクトの特徴の融合プロセスを導出する。
論文 参考訳(メタデータ) (2021-10-24T02:41:41Z) - Stimuli-Aware Visual Emotion Analysis [75.68305830514007]
本稿では,刺激選択,特徴抽出,感情予測の3段階からなる刺激認識型視覚感情分析(VEA)手法を提案する。
我々の知る限りでは、エンド・ツー・エンドのネットワークでVEAに刺激選択プロセスを導入するのは初めてです。
実験により、提案手法は、4つの公的な視覚的感情データセットに対する最先端のアプローチよりも一貫して優れていることが示された。
論文 参考訳(メタデータ) (2021-09-04T08:14:52Z) - Affective Image Content Analysis: Two Decades Review and New
Perspectives [132.889649256384]
我々は,過去20年間の情緒的イメージコンテンツ分析(AICA)の発展を包括的にレビューする。
我々は、感情的ギャップ、知覚主観性、ラベルノイズと欠如という3つの主要な課題に関して、最先端の手法に焦点を当てる。
画像の内容やコンテキスト理解,グループ感情クラスタリング,ビューアーとイメージのインタラクションなど,今後の課題や研究の方向性について論じる。
論文 参考訳(メタデータ) (2021-06-30T15:20:56Z) - ArtEmis: Affective Language for Visual Art [46.643106054408285]
我々は視覚アートワークによって引き起こされる情緒体験に焦点を当てる。
ある画像に対して感じている支配的な感情を示すために、注釈を付けます。
これにより、目的コンテンツとイメージの感情的影響の両方に対して、リッチな信号セットが導かれる。
論文 参考訳(メタデータ) (2021-01-19T01:03:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。