論文の概要: What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
- arxiv url: http://arxiv.org/abs/2604.11374v1
- Date: Mon, 13 Apr 2026 12:15:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.522101
- Title: What Do Vision-Language Models Encode for Personalized Image Aesthetics Assessment?
- Title(参考訳): パーソナライズされた画像美学評価のための視覚言語モデル
- Authors: Koki Ryu, Hitomi Yanaka,
- Abstract要約: 視覚言語モデル(VLM)を解析し、リッチでマルチレベルな美的属性の存在と分布について検討する。
解析の結果,VLMは言語デコーダ層に伝播する多様な美的特性をコードしていることがわかった。
本研究は, 主観的, 個別の美的嗜好をモデル化するために, VLMをいかに活用できるかについての知見を提供する。
- 参考スコア(独自算出の注目度): 16.394933051332657
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personalized image aesthetics assessment (PIAA) is an important research problem with practical real-world applications. While methods based on vision-language models (VLMs) are promising candidates for PIAA, it remains unclear whether they internally encode rich, multi-level aesthetic attributes required for effective personalization. In this paper, we first analyze the internal representations of VLMs to examine the presence and distribution of such aesthetic attributes, and then leverage them for lightweight, individual-level personalization without model fine-tuning. Our analysis reveals that VLMs encode diverse aesthetic attributes that propagate into the language decoder layers. Building on these representations, we demonstrate that simple linear models can perform PIAA effectively. We further analyze how aesthetic information is transferred across layers in different VLM architectures and across image domains. Our findings provide insights into how VLMs can be utilized for modeling subjective, individual aesthetic preferences. Our code is available at https://github.com/ynklab/vlm-latent-piaa.
- Abstract(参考訳): パーソナライズドイメージ美学評価(PIAA)は実世界の応用において重要な研究課題である。
視覚言語モデル(VLM)に基づく手法はPIAAの候補として期待されているが、効果的パーソナライゼーションに必要なリッチでマルチレベルな美的属性を内部的にエンコードするかどうかは不明だ。
本稿では,まずVLMの内部表現を分析し,美的属性の存在と分布を調査し,それをモデル微調整なしで軽量で個人レベルのパーソナライズに活用する。
解析の結果,VLMは言語デコーダ層に伝播する多様な美的特性をコードしていることがわかった。
これらの表現に基づいて、単純な線形モデルがPIAAを効果的に実行できることを実証する。
さらに、異なるVLMアーキテクチャの層間および画像領域間の美的情報の伝達方法を分析する。
本研究は, 主観的, 個別の美的嗜好をモデル化するために, VLMをいかに活用できるかについての知見を提供する。
私たちのコードはhttps://github.com/ynklab/vlm-latent-piaa.comで公開されています。
関連論文リスト
- Attention Guided Alignment in Efficient Vision-Language Models [56.20286899428444]
VLM(Large Vision-Language Models)は、事前訓練された視覚エンコーダとLLM(Large Language Models)の効果的なマルチモーダルアライメントに依存している。
本稿では,効率的なVLMにおける注意パターンの包括的解析について述べる。
本稿では,Attention-Guided Efficient Vision-Language Models (AGE-VLM)を紹介する。
論文 参考訳(メタデータ) (2025-11-21T21:36:48Z) - Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models [9.24989979549793]
VLM(Vision-Language Models)は、様々な現実世界のタスクにおいて顕著なパフォーマンスを示す。
これらのモデルは通常、画像のシリアライズによって視覚情報を処理する。
本稿では,デコード効率を向上させるために,プラグアンドプレイ型ビジュアルデコーダに基づく命令非依存のトークン圧縮アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-09-23T16:07:18Z) - Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms [91.19304518033144]
検索システムにおける視覚モデルと人間の審美基準の整合を図る。
本研究では、視覚モデルと人間の美学をよりよく整合させるために、視覚モデルを微調整する嗜好に基づく強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-06-13T17:59:20Z) - AesExpert: Towards Multi-modality Foundation Model for Image Aesthetics Perception [74.11069437400398]
我々は,21,904の多様なソースイメージと88Kの人間の自然言語フィードバックを備えたコーパスリッチな審美的批評データベースを開発した。
AesExpertと呼ばれる、マルチモダリティのAesthetic Expertモデルを実現するために、オープンソースの一般基盤モデルを微調整します。
実験により、提案したAesExpertモデルは、最先端のMLLMよりもはるかに優れた審美的知覚性能を提供することが示された。
論文 参考訳(メタデータ) (2024-04-15T09:56:20Z) - Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models [73.40350756742231]
視覚条件付き言語モデル(VLM)は、視覚対話、シーン理解、ロボットタスク計画などのアプリケーションに採用されている。
新しいリリースの量は多いが、イメージ前処理、アーキテクチャ、最適化に関する重要な設計決定は未調査である。
論文 参考訳(メタデータ) (2024-02-12T18:21:14Z) - Unveiling The Factors of Aesthetic Preferences with Explainable AI [0.0]
本研究では,機械学習(ML)モデルを用いて,新しい視点を開拓する。
我々のモデルはこれらの属性を入力として処理し、画像の美的スコアを予測する。
本研究の目的は,画像における審美的嗜好の複雑な性質をMLを通して明らかにし,審美的判断に影響を及ぼす属性をより深く理解することである。
論文 参考訳(メタデータ) (2023-11-24T11:06:22Z) - VILA: Learning Image Aesthetics from User Comments with Vision-Language
Pretraining [53.470662123170555]
ユーザからのコメントから画像美学を学習し、マルチモーダルな美学表現を学習するための視覚言語事前学習手法を提案する。
具体的には、コントラスト的および生成的目的を用いて、画像テキストエンコーダ-デコーダモデルを事前訓練し、人間のラベルなしでリッチで汎用的な美的意味学を学習する。
以上の結果から,AVA-Captionsデータセットを用いた画像の美的字幕化において,事前学習した美的視覚言語モデルよりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2023-03-24T23:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。