論文の概要: How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning
- arxiv url: http://arxiv.org/abs/2606.29672v1
- Date: Mon, 29 Jun 2026 00:39:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.002177
- Title: How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning
- Title(参考訳): LLMが創造性をどう見ているか:解釈可能な推論による視覚的創造性のゼロショットスコーリング
- Authors: William Orwig, Roger E. Beaty,
- Abstract要約: マルチモーダル大言語モデル(LLM)は、視覚的創造性をゼロショットで判断する。
以上の結果から,マルチモーダル LLM は人間の視覚的創造性判断に適合する可能性が示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating the originality of visual images poses enduring challenges for creativity assessment. Automated scoring using AI models has proven effective in the verbal domain, yet key questions remain about evaluating visual creativity and understanding how models arrive at their ratings. The present research asks whether multimodal large language models (LLMs) can serve as judges of visual creativity zero-shot (without any fine-tuning or examples of human ratings) and whether their "reasoning" output offers an interpretable window into their evaluation process. We tested six multimodal LLMs (Gemini 3 Flash, Gemma 4 31B IT, GPT-5.4 Mini, GLM-5v Turbo, Kimi K2.5, and Qwen 3.6 Plus) on 992 AI-generated images (based on human-written prompts) and 1,500 hand-drawn sketches scored for creativity by human raters. In Study 1, all models showed substantial alignment with human creativity ratings on both datasets (r = .57-.68 on AI-generated images; r = .29-68 on sketches). In Study 2, we analyzed the step-by-step reasoning processes of three LLMs evaluating the same images and drawings. Although reasoning made model evaluations interpretable -- showing what they attend to, how they balance originality vs. quality, and how they justify their ratings -- reasoning did not improve alignment with human ratings. In sum, our findings indicate that multimodal LLMs can match human judgments of visual creativity without any additional training, and that their reasoning reveals how AI models evaluate creativity. An open scoring app implementing this pipeline is available at https://review-visual-eval-scoring.hf.space.
- Abstract(参考訳): 視覚画像の独創性を評価することは、創造性評価に永続的な課題をもたらす。
AIモデルを用いた自動スコアリングは、言語領域では有効であることが証明されているが、視覚的創造性を評価し、モデルが評価にどのように到着するかを理解する上で重要な疑問が残る。
本研究では,マルチモーダルな大規模言語モデル (LLM) が視覚的創造性をゼロショットで判断できるかどうかを問うとともに,その「推論」出力が評価プロセスに解釈可能な窓を提供するかどうかを問う。
我々は、992個のAI生成画像(人手によるプロンプトに基づく)と1500個の手描きスケッチを用いて、6つのマルチモーダルLCM(Gemini 3 Flash, Gemma 4 31B IT, GPT-5.4 Mini, GLM-5v Turbo, Kimi K2.5, Qwen 3.6 Plus)を試験した。
研究1では、すべてのモデルが両方のデータセットで人間の創造性評価とかなり一致している(r = 57-.68、r = .29-68、スケッチ)。
研究2では、3つのLCMのステップ・バイ・ステップの推論過程を解析し、同じ画像と図面を評価した。
推論はモデル評価を解釈可能とした -- 彼らが何を出席しているか、独自性と品質のバランス、そして評価を正当化する方法を示すが、推論は人間の評価との整合性を改善するには至らなかった。
まとめると、我々の研究結果は、マルチモーダル LLM が視覚的創造性の人間の判断と、追加のトレーニングなしで一致できることを示し、それらの推論は、AIモデルが創造性を評価する方法を明らかにしている。
このパイプラインを実装するオープンスコアリングアプリはhttps://review-visual-eval-scoring.hf.spaceで公開されている。
関連論文リスト
- SketchVLM: Vision language models can annotate images to explain thoughts and guide users [16.25722200375932]
SketchVLMは、視覚言語モデルが入力画像上に非破壊的かつ編集可能なオーバーレイを生成し、その答えを視覚的に説明できる、学習不要でモデルに依存しないフレームワークである。
シングルターン生成はすでに高い精度とアノテーションの品質を実現しており、マルチターン生成は人間とAIのコラボレーションのさらなる機会を開く。
論文 参考訳(メタデータ) (2026-04-23T22:33:15Z) - Fine-Tuning a Large Vision-Language Model for Artwork's Scoring and Critique [11.787232686718367]
視覚言語モデルQwen2-VL-7Bをマルチタスク学習で微調整し,人間の絵画の自動創造性評価のための枠組みを提案する。
私たちのデータセットには、1-100スケールで収集された1000枚の人造絵画が含まれており、短い人間による記述と組み合わせられている。
実験ではPearson r > 0.97 となり、100点スケールで約3.95 となる。
論文 参考訳(メタデータ) (2026-02-09T19:52:16Z) - MentisOculi: Revealing the Limits of Reasoning with Mental Imagery [63.285794947638614]
視覚的解決が可能な多段階推論問題の組である MentisOculi を開発した。
遅延トークンから明示的な生成画像まで,視覚的戦略を評価すると,一般的にはパフォーマンス向上に失敗する。
以上の結果から,視覚的思考がモデル推論の恩恵を受けていないことが示唆された。
論文 参考訳(メタデータ) (2026-02-02T18:49:06Z) - Simple Lines, Big Ideas: Towards Interpretable Assessment of Human Creativity from Drawings [18.09092203643732]
図面からの自動的かつ解釈可能な創造性評価のためのデータ駆動型フレームワークを提案する。
6]で提案された認知的エビデンスにより、創造性は、引き出されたもの(コンテンツ)と引き出されたもの(スタイル)の両方から生ずることができ、創造性スコアをこれら2つの相補的な次元の関数として再解釈する。
論文 参考訳(メタデータ) (2025-11-17T02:16:01Z) - GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning [62.775721264492994]
GRADEOは、最初に設計されたビデオ評価モデルの1つである。
説明可能なスコアと評価のためにAIが生成したビデオを、多段階の推論によって評価する。
実験の結果,本手法は既存手法よりも人的評価に適合していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T07:04:55Z) - Leveraging Large Models to Evaluate Novel Content: A Case Study on Advertisement Creativity [25.460598990334077]
ビジュアル広告の創造性を非定型性と独創性に分解しようと試みる。
このような主観的な問題に特化して,一連のタスクを提案する。
また,提案したベンチマークを用いて,最先端(SoTA)ビジョン言語モデル(VLM)と人間との整合性を評価する。
論文 参考訳(メタデータ) (2025-02-26T04:28:03Z) - VHELM: A Holistic Evaluation of Vision Language Models [75.88987277686914]
視覚言語モデル(VHELM)の全体的評価について述べる。
VHELMは、視覚的知覚、知識、推論、バイアス、公平性、多言語性、堅牢性、毒性、安全性の9つの側面の1つ以上をカバーするために、さまざまなデータセットを集約する。
私たちのフレームワークは軽量で自動で、評価の実行が安価で高速に行えるように設計されています。
論文 参考訳(メタデータ) (2024-10-09T17:46:34Z) - GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation [103.3465421081531]
VQAScoreは、VQAモデルが画像がプロンプトを正確に描写しているとみなす可能性を測定するメトリクスである。
VQAScoreによるランク付けは、PickScore、HPSv2、ImageRewardなどの他のスコアリング方法よりも2倍から3倍効果的である。
我々は、同じプロンプトから生成されたランキング画像のスコアを評価するために、4万以上の人間格付けを備えたGenAI-Rankベンチマークを新たにリリースした。
論文 参考訳(メタデータ) (2024-06-19T18:00:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。