論文の概要: The Limits of Automatic Evaluation of Creativity in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.23705v2
- Date: Thu, 27 Aug 2026 07:20:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 14:16:51.724604
- Title: The Limits of Automatic Evaluation of Creativity in Large Language Models
- Title(参考訳): 大規模言語モデルにおける創造性の自動評価の限界
- Abstract要約: 大きな言語モデル(LLM)は、創造性を必要とする領域における人間のパフォーマンスに挑戦するテキストを生成する能力がますます高まっている。
本研究では,現在の自動評価手法が人間の創造性判断を確実に捉えることができるかどうかを考察する。
自動評価と人的評価の相違が明らかとなった。
- 参考スコア(独自算出の注目度): 46.669028290459856
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) are increasingly capable of generating text that challenges human performance in domains requiring creativity, yet evaluating creativity in LLM-generated content remains a significant challenge. Here, we investigate whether current automatic evaluation methods can reliably capture human judgments of creativity. We collect human evaluations of human- and AI-generated short stories from the WritingPrompts dataset across 11 dimensions of creativity, and compare these judgments with automated objective metrics and LLM-as-a-Judge evaluations. Our experiments reveal substantial misalignment between automatic evaluations and human assessments. In particular, LLM-based judges exhibit a systematic preference for AI-generated stories, consistently favoring their stylistic characteristics over the unpredictability and other qualities of human-authored texts. Furthermore, correlation analyses show that widely used automatic metrics exhibit near-zero alignment with human judgments across both human- and AI-generated stories, suggesting that they fail to capture important dimensions of creativity. These findings highlight fundamental limitations in current approaches to the automatic evaluation of creative text and underscore the difficulty of reducing the multidimensional and subjective nature of creativity to computational metrics.
- Abstract(参考訳): 大規模言語モデル(LLM)は、創造性を必要とする領域において人間のパフォーマンスに挑戦するテキストを生成する能力がますます高まっているが、LLM生成コンテンツにおいて創造性を評価することは大きな課題である。
本稿では,現在の自動評価手法が人間の創造性判断を確実に捉えることができるかどうかを考察する。
我々は,11次元のクリエイティビティにまたがるBingPromptsデータセットから人間とAIが生成した短編の人間評価を収集し,これらの判断を自動客観的指標とLCM-as-a-Judge評価と比較する。
自動評価と人的評価の相違が明らかとなった。
特に、LLMベースの審査員は、AIが生成する物語を体系的に選好し、予測不能性や人間によるテキストの他の品質よりも、そのスタイル的特徴を一貫して好んでいる。
さらに、相関分析により、広く使われている自動メトリクスは、人間とAIが生成する物語の両方で人間の判断とほぼゼロの一致を示しており、創造性の重要な次元を捉えていないことが示唆されている。
これらの知見は、創造的テキストの自動評価に対する現在のアプローチの基本的な限界を浮き彫りにして、創造性の多次元的・主観的な性質を計算量に還元することの難しさを浮き彫りにしている。
関連論文リスト
- Automated Creativity Evaluation of Language Models Across Open-Ended Tasks [3.6948012022450776]
大規模言語モデル(LLM)は言語理解、推論、生成において顕著な進歩を遂げた。
オープンなタスク間でLCMの創造性を定量化する,ドメインに依存しない自動化フレームワークを導入する。
提案手法は,創造的なタスク自体から計測装置を分離し,スケーラブルでタスクに依存しない評価を可能にする。
論文 参考訳(メタデータ) (2026-06-10T07:37:06Z) - CreativityPrism: A Holistic Benchmark for Large Language Model Creativity [64.18257552903151]
創造性はしばしば人間の知能の目印と見なされる。
さまざまなシナリオにまたがってクリエイティビティを評価するための総合的なフレームワークはまだ存在しません。
本稿では,創造性を質,新規性,多様性の3次元に分解する評価分析フレームワークであるCreativePrismを提案する。
論文 参考訳(メタデータ) (2025-10-23T00:22:10Z) - Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations [48.57816792550401]
クリエイティビティ指標,パープレキシティ,構文テンプレート,LCM-as-a-Judgeなどのクリエイティビティ指標について検討した。
分析の結果、これらの指標は限定的な一貫性を示し、創造性の異なる次元を捉えていることがわかった。
論文 参考訳(メタデータ) (2025-08-07T15:11:48Z) - Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator [26.89750429841565]
大規模言語モデル(LLM)の創造性評価は依然として挑戦的なフロンティアである
本稿では,テキストの創造性を評価するためのペアワイズ比較フレームワークを提案する。
CreataSetのトレーニングを通じて, CrEvalというLCMに基づく評価器を開発した。
論文 参考訳(メタデータ) (2025-05-25T17:25:23Z) - Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach [32.654673913638426]
本稿では,創造性を製品として評価するTorance Test of Creative Writing (TTCW)に基づく自動評価手法を提案する。
提案手法は、高品質な参照テキストに対して生成されたクリエイティブテキストをスコアリングする参照ベースのLikertスタイルのアプローチを用いる。
論文 参考訳(メタデータ) (2025-04-22T10:52:23Z) - AI-generated Essays: Characteristics and Implications on Automated Scoring and Academic Integrity [13.371946973050845]
我々は、人気のある大言語モデル(LLM)によって生成されるエッセイの特徴と品質を検証し、ベンチマークする。
本研究は,既存の自動スコアリングシステムの限界を強調し,改善すべき領域を特定した。
LLMの多種多様さがAI生成エッセイの検出の可能性を損なう可能性があるという懸念にもかかわらず、我々の研究結果は、あるモデルから生成されたエッセイに基づいて訓練された検出器が、高い精度で他人のテキストを識別できることをしばしば示している。
論文 参考訳(メタデータ) (2024-10-22T21:30:58Z) - Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation [52.76508734756661]
Auto-PREはピアレビュープロセスにインスパイアされた自動評価フレームワークである。
人間のアノテーションに依存する従来のアプローチとは異なり、Auto-PREは自動的に3つのコア特性に基づいて評価子を選択する。
要約,非ファクトイドQA,対話生成を含む3つの代表的なタスクの実験は,Auto-PREが最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2024-10-16T06:06:06Z) - What Makes a Good Story and How Can We Measure It? A Comprehensive Survey of Story Evaluation [57.550045763103334]
ストーリーを評価することは、他の世代の評価タスクよりも難しい場合があります。
まず、テキスト・トゥ・テキスト、ビジュアル・トゥ・テキスト、テキスト・トゥ・ビジュアルといった既存のストーリーテリングタスクを要約する。
本研究では,これまで開発されてきた,あるいはストーリー評価に応用可能な評価指標を整理する分類法を提案する。
論文 参考訳(メタデータ) (2024-08-26T20:35:42Z) - Can AI Be as Creative as Humans? [84.43873277557852]
理論的には、AIは人間の創造者によって生成されたデータに適切に適合できるという条件の下で、人間と同じくらい創造的になれることを証明しています。
AIの創造性に関する議論は、十分な量のデータに適合する能力の問題に縮小されている。
論文 参考訳(メタデータ) (2024-01-03T08:49:12Z) - Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks [65.69651759036535]
大規模言語モデル(LLM)が人間にとって信頼できる代替手段であるかどうかを解析する。
本稿では、従来のタスク(例えば、ストーリー生成)とアライメントタスク(例えば、数学推論)の両方について検討する。
LLM評価器は不要な基準を生成したり、重要な基準を省略することができる。
論文 参考訳(メタデータ) (2023-10-30T17:04:35Z) - Automated Evaluation of Personalized Text Generation using Large
Language Models [38.2211640679274]
生成したテキストの3つの主要な意味的側面(パーソナライズ、品質、関連性)を抽出し、これらの側面を自動的に測定する新しい評価手法であるAuPELを提案する。
既存の評価指標と比較して、AuPELはパーソナライズ能力に基づいてモデルの識別とランク付けを行うだけでなく、このタスクに対する信頼できる一貫性と効率を示す。
論文 参考訳(メタデータ) (2023-10-17T21:35:06Z) - Large Language Models are Diverse Role-Players for Summarization
Evaluation [82.31575622685902]
文書要約の品質は、文法や正しさといった客観的な基準と、情報性、簡潔さ、魅力といった主観的な基準で人間の注釈者によって評価することができる。
BLUE/ROUGEのような自動評価手法のほとんどは、上記の次元を適切に捉えることができないかもしれない。
目的と主観の両面から生成されたテキストと参照テキストを比較し,総合的な評価フレームワークを提供するLLMに基づく新しい評価フレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-27T10:40:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。