論文の概要: AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis
- arxiv url: http://arxiv.org/abs/2604.05900v1
- Date: Tue, 07 Apr 2026 14:05:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-08 17:42:09.870053
- Title: AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis
- Title(参考訳): AICA-Bench: 映像コンテンツ分析におけるVLMの能力に関する理論的検討
- Authors: Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin,
- Abstract要約: AICA-Benchは、感情理解(EU)、感情推論(ER)、感情誘導コンテンツ生成(EGCG)の3つのコアタスクからなる総合的なベンチマークである。
我々は23個の視覚言語モデル(VLM)を評価し、弱い強度のキャリブレーションと浅い記述の2つの大きな限界を同定する。
本研究では,視覚的足場と階層的推論を組み合わせた学習自由フレームワークであるグラウンドド・アフェクティブ・ツリー(GAT)・プロンプティングを提案する。
- 参考スコア(独自算出の注目度): 8.975964277140223
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) have demonstrated strong capabilities in perception, yet holistic Affective Image Content Analysis (AICA), which integrates perception, reasoning, and generation into a unified framework, remains underexplored. To address this gap, we introduce AICA-Bench, a comprehensive benchmark with three core tasks: Emotion Understanding (EU), Emotion Reasoning (ER), and Emotion-Guided Content Generation (EGCG). We evaluate 23 VLMs and identify two major limitations: weak intensity calibration and shallow open-ended descriptions. To address these issues, we propose Grounded Affective Tree (GAT) Prompting, a training-free framework that combines visual scaffolding with hierarchical reasoning. Experiments show that GAT reduces intensity errors and improves descriptive depth, providing a strong baseline for future research on affective multimodal understanding and generation.
- Abstract(参考訳): VLM(Vision-Language Models)は、知覚において強力な能力を示すが、知覚、推論、生成を統一されたフレームワークに統合する包括的イメージコンテンツ分析(AICA)はいまだに未熟である。
AICA-Benchは、感情理解(EU)、感情推論(ER)、感情誘導コンテンツ生成(EGCG)の3つのコアタスクからなる包括的なベンチマークである。
我々は23個のVLMを評価し、弱い強度のキャリブレーションと浅いオープンエンド記述の2つの大きな限界を特定した。
これらの問題に対処するために、視覚的な足場と階層的推論を組み合わせたトレーニング不要のフレームワークであるGunded Affective Tree (GAT) Promptingを提案する。
実験の結果,GATは強度誤差を低減し,記述深度を向上し,将来の情緒的マルチモーダル理解・生成研究の基盤となることが明らかとなった。
関連論文リスト
- EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models [62.3977734456669]
マルチモーダル大規模言語モデル(MLLM)の感情的推論能力を高めるためのフレームワークとして,情緒的推論のための反射強化学習(EMO-R3)を提案する。
構造化された感情的思考を導入し、構造化された解釈可能な方法で段階的に感情的推論を行い、そのモデルが視覚的テキストの一貫性と感情的コヒーレンスに基づいてその推論を再評価できる反射的感情的回帰を設計する。
EMO-R3はMLLMの解釈可能性と感情的インテリジェンスの両方を大幅に改善し、複数の視覚的感情理解ベンチマークにおいて優れた性能を達成する。
論文 参考訳(メタデータ) (2026-02-27T08:42:52Z) - Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities? [61.533560295383786]
Unified Multimodal Large Language Models (U-MLLM) は、単一のアーキテクチャ内で理解と生成を統合する。
我々は,U-MLLMが画像のモダリティにおいて同じ結果をレンダリングするために必要な場合,意味的等価性を維持することができないことを観察する。
VGUBenchは、推論ロジックを生成の忠実性から切り離すためのフレームワークである。
論文 参考訳(メタデータ) (2026-02-27T06:23:56Z) - Toward Cognitive Supersensing in Multimodal Large Language Model [67.15559571626747]
我々は,MLLMに人間のような視覚的特徴を付与する訓練パラダイムであるCognitive Supersensingを紹介する。
実験では、CogSense-BenchでCognitive Supersensingを訓練したMLLMが、最先端のベースラインを大きく上回った。
私たちはCogSense-Benchとモデルウェイトをオープンソースにします。
論文 参考訳(メタデータ) (2026-02-02T02:19:50Z) - Intention-Guided Cognitive Reasoning for Egocentric Long-Term Action Anticipation [52.6091162517921]
INSIGHTは、エゴセントリックなアクション予測のための2段階のフレームワークである。
最初の段階では、INSIGHTは手動オブジェクトの相互作用領域から意味的にリッチな特徴を抽出することに焦点を当てている。
第2段階では、明示的な認知的推論をシミュレートする強化学習ベースのモジュールを導入する。
論文 参考訳(メタデータ) (2025-08-03T12:52:27Z) - MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs [33.73249122449025]
MMAFFBenは多言語マルチモーダル感情分析のためのオープンソースのベンチマークである。
MMAFFBenは、感情極性、感情強度、感情分類、感情強度の4つの主要な感情分析タスクをカバーしている。
MMAFFLM-3b と MMAFFLM-7b は,感情分析タスクを微調整するための MMAFFIn データセットの構築と,それに基づく MMAFFLM-3b と MMAFFLM-7b の開発を行う。
論文 参考訳(メタデータ) (2025-05-30T10:02:15Z) - KEVER^2: Knowledge-Enhanced Visual Emotion Reasoning and Retrieval [35.77379981826482]
感情推論と検索のための知識強化フレームワークである textbfK-EVERtextsuperscript2 を提案する。
本手法では,視覚的感情の意味的構造を定式化し,マルチモーダルアライメントを通じて外部の情緒的知識を統合する。
Emotion6、EmoSet、M-Disasterの3つの代表的なベンチマークで、ソーシャルメディアの画像、人間中心のシーン、災害状況について検証した。
論文 参考訳(メタデータ) (2025-05-30T08:33:32Z) - From Gaze to Insight: Bridging Human Visual Attention and Vision Language Model Explanation for Weakly-Supervised Medical Image Segmentation [48.45209969191245]
視覚言語モデル(VLM)は、テキスト記述を通して意味的コンテキストを提供するが、説明精度は欠如している。
本稿では,その補完的強みを活かし,視線と言語指導を統合した教師教育フレームワークを提案する。
本手法は,8.78%,80.53%,84.22%のDiceスコアをそれぞれ達成し,アノテーション負担を増大させることなく視線ベースラインよりも3.5%向上した。
論文 参考訳(メタデータ) (2025-04-15T16:32:15Z) - A Cognitive Paradigm Approach to Probe the Perception-Reasoning Interface in VLMs [3.2228025627337864]
本稿では,視覚言語モデル(VLM)における知覚推論インタフェースを識別するための構造化評価フレームワークを提案する。
本稿では,人間の問題解決戦略を反映した3つの評価パラダイムを提案する。
このフレームワークを適用したCAは、リッチで独立に生成された記述を推論するために強力な言語モデルを活用し、新しい最先端(SOTA)パフォーマンスを実現することを実証する。
論文 参考訳(メタデータ) (2025-01-23T12:42:42Z) - Affective Image Content Analysis: Two Decades Review and New
Perspectives [132.889649256384]
我々は,過去20年間の情緒的イメージコンテンツ分析(AICA)の発展を包括的にレビューする。
我々は、感情的ギャップ、知覚主観性、ラベルノイズと欠如という3つの主要な課題に関して、最先端の手法に焦点を当てる。
画像の内容やコンテキスト理解,グループ感情クラスタリング,ビューアーとイメージのインタラクションなど,今後の課題や研究の方向性について論じる。
論文 参考訳(メタデータ) (2021-06-30T15:20:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。