論文の概要: How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space
- arxiv url: http://arxiv.org/abs/2608.27121v1
- Date: Thu, 27 Aug 2026 13:34:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.417464
- Title: How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space
- Title(参考訳): AIがアートをいかに経験するか: 自己監督型マルチモーダル埋め込み空間における創発的美的構造
- Authors: Corey D. C. Heath,
- Abstract要約: 我々は、AIモデルが、明示的なラベルやクロスモーダルな監督なしに、人為的なメディアの審美的分類を形成する方法を示す。
256次元の埋め込み空間に4つのモード(テキスト,音声,画像,ビデオ)を投影する自己教師型フレームワークを提案する。
弱教師付きマルチモーダルデータセット上で、AI生成クラスタ割り当てと人間の感情的レジスタラベルのばらつきについて論じる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Aesthetics are an important part of the symbolism of artistic works. Although subjective, humans categorize art based on the emotion evoked regardless of modality. What remains under-explored is how AI models form their own aesthetic categorization of human-produced media without explicit labels or cross-modal supervision. We present a self-supervised framework that projects four modalities (text, audio, image and video) into a shared 256-dimensional embedding space and applies iterative clustering to discover aesthetic structure. We discuss the divergence between AI-generated cluster assignments and human affective register labels on a weakly supervised multimodal dataset. This work has applications in understanding how AI structures cross-modal similarity, organizing heterogeneous media collections for Retrieval-Augmented Generation (RAG), and automated data labeling.
- Abstract(参考訳): 美学は芸術作品の象徴として重要な部分である。
人間は主観的ではあるが、モダリティに関係なく誘発される感情に基づいて芸術を分類する。
解明されていないのは、AIモデルが明示的なラベルや横断的な監督なしに、人為的なメディアの審美的分類を形成する方法だ。
256次元の埋め込み空間に4つのモダリティ(テキスト,音声,画像,映像)を投影し,反復的クラスタリングを用いて美的構造を探索する自己教師型フレームワークを提案する。
弱教師付きマルチモーダルデータセット上で、AI生成クラスタ割り当てと人間の感情的レジスタラベルのばらつきについて論じる。
この研究は、AIがモーダル類似性をどのように構成するかを理解し、レトリーバル拡張生成(RAG)のための異種メディアコレクションを整理し、自動データラベリングを行う。
関連論文リスト
- Hierarchical Compositionality for An Assistive AI Agent [9.152759278163954]
AIエージェントは、さまざまなアプリケーションで人間を支援するために、ますます開発されている。
これらの手法は印象的な予測器であるが、資源不足であり、不透明であり、新しい状況において任意の決定を下すことが知られている。
我々の研究は、AIの初期のパイオニアにさかのぼるコア原則に基づいて、そのようなAIエージェントのためのアーキテクチャの設計を探究することを目的としています。
論文 参考訳(メタデータ) (2026-08-11T00:17:56Z) - Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition [56.650820426231284]
マルチモーダル感情認識は、人間の感情状態を理解するためにテキスト、音声、ビデオソースを統合することを目的としている。
大規模言語モデルは多モーダル推論において優れているが、感情カテゴリーを独立したラベルとして扱うのが一般的である。
本稿では,bftextHyperEmo-RAGを提案する。
論文 参考訳(メタデータ) (2026-05-16T10:04:48Z) - Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning [56.24016465596292]
視覚的メタファーは、抽象概念をインパクトのある視覚的レトリックに変換するために、クロスドメインなセマンティックフュージョンを用いて、人間の創造性の高階形式を構成する。
本稿では,参照画像から「創造的本質」を自律的に分離し,その抽象論理をユーザ特定対象に再物質化する,視覚メタファー伝達(VMT)の課題を紹介する。
提案手法は, メタファーの整合性, アナロジーの適切性, 視覚的創造性においてSOTAのベースラインを著しく上回り, 広告・メディアにおける高度にインパクトのある創造的アプリケーションを自動化するための道を開いた。
論文 参考訳(メタデータ) (2026-02-01T17:01:36Z) - Bridging Cognitive Gap: Hierarchical Description Learning for Artistic Image Aesthetics Assessment [51.40989269202702]
審美的品質評価タスクは,AIGCの定量的評価システムの開発に不可欠である。
本研究では,記述生成による美的次元の分離を図った芸術的画像の美的評価フレームワークであるArtQuantを提案する。
提案手法は,従来のトレーニングの33%しか必要とせず,いくつかのデータセット上での最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-12-29T12:18:26Z) - SOHES: Self-supervised Open-world Hierarchical Entity Segmentation [101.64232919592017]
この研究は、人間のアノテーションを必要としない新しいアプローチであるSOHES(Self-supervised Open World Hierarchical Entities)を提示する。
視覚的特徴クラスタリングにより高品質な擬似ラベルを生成し,教師同士の学習によって擬似ラベルの雑音を補正する。
学習データとして生画像を用いることにより,自己監督型オープンワールドセグメンテーションにおける前例のない性能を実現する。
論文 参考訳(メタデータ) (2024-04-18T17:59:46Z) - Unsupervised Segmentation in Real-World Images via Spelke Object
Inference [44.79376336842088]
興奮抑制セグメンション抽出ネットワーク(EISEN)は、光学フロー推定から学習し、静的シーンのペア親和性グラフを抽出する。
EISENは、合成および実世界のロボット画像データセットに挑戦する上で、自己教師付きセグメンテーションのための技術の現状を大幅に改善することを示す。
論文 参考訳(メタデータ) (2022-05-17T17:39:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。