論文の概要: AGC-Bench: Measuring Artificial General Creativity
- arxiv url: http://arxiv.org/abs/2607.01152v1
- Date: Wed, 01 Jul 2026 16:31:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.993238
- Title: AGC-Bench: Measuring Artificial General Creativity
- Title(参考訳): AGC-Bench: 汎用的創造性の測定
- Authors: Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky,
- Abstract要約: AGC-Benchは、AIクリエイティビティの文献の体系的なレビューから構築された、人工的な一般的なクリエイティビティベンチマークである。
AGC-Judgeは、トレーニングされていない新しいクリエイティビティベンチマークをしっかりとスコアするオープンウェイトモデルです。
AGC-Benchには、AIの創造性を大規模に測定するためのオープンインフラストラクチャとして、公開のリーダボード、AGC-Judge、人間データが含まれています。
- 参考スコア(独自算出の注目度): 9.708124805504578
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Creativity research has debated whether creativity is domain-specific (e.g., visual, writing, science), and if it is psychometrically separable from general intelligence. Both questions now apply to LLMs, but a unified benchmark of AI creativity remains elusive. We introduce AGC-Bench, an artificial general creativity benchmark built from a systematic review of the AI creativity literature (3,101 papers screened, 497 benchmarks identified), paired with an agentic harness that converts idiosyncratic codebases into HELM-standardized benchmarks. The first release covers 78 datasets spanning brainstorming, problem solving, STEM, narrative, figurative language, and humor. To address bias in LLM-as-judge, we apply Judge Response Theory -- a psychometric calibration of judge leniency/severity; we then fine-tune Qwen3-30B on the bias-corrected ratings of three frontier LLMs to produce AGC-Judge, an open-weight model that robustly scores new creativity benchmarks it was not trained on. Results reveal frontier models at the top of the AGC-Bench leaderboard, with open models close behind. LLMs show different creative strengths, ranking higher on some domains (e.g., writing) than others (e.g., scientific ideation). Extensive experiments yield three main findings. First, applying factor analysis across 83 LLMs, we recover a single creativity factor 'c', analogous to the 'g' factor of general intelligence, that explains 81.5% of variance, related to but separable from general knowledge/reasoning. Second, we show that prompting models to "be creative" boosts their performance far more than enabling reasoning, evidence that the benchmark tracks creativity over general ability. Third, on a human-matched subset, we find the top human still leads the top LLM on creativity. We release AGC-Bench with a public leaderboard, AGC-Judge, and human data as open infrastructure for measuring AI creativity at scale.
- Abstract(参考訳): 創造性の研究は、創造性が領域固有のもの(例えば、視覚、執筆、科学)なのか、そしてそれが一般知性から精神学的に分離可能かどうかについて議論している。
どちらの質問もLLMには当てはまるが、AIクリエイティビティの統一されたベンチマークはいまだ解明されていない。
AGC-BenchはAIクリエイティビティの文献を体系的にレビューし(3,101論文がスクリーニングされ、497ベンチマークが特定されている)、慣用的なコードベースをHELM標準化されたベンチマークに変換するエージェントハーネスと組み合わせた、人工的な総合的なクリエイティビティベンチマークである。
最初のリリースでは、ブレインストーミング、問題解決、STEM、物語、図形言語、ユーモアにまたがる78のデータセットがカバーされた。
LLM-as-judgeのバイアスに対処するために、審査員の怠慢/重大さの心理学的校正である判断応答理論を適用します。そして、3つのフロンティアLCMのバイアス補正された評価についてQwen3-30Bを微調整して、トレーニングされていない新しい創造性ベンチマークをしっかりとスコアするオープンウェイトモデルであるAGC-Judgeを作成します。
結果は、AGC-Benchのリーダーボードの上部にあるフロンティアモデルを明らかにし、その背後にオープンモデルがある。
LLMは異なる創造力を示し、いくつかのドメイン(例:書き込み)で他のドメイン(例:科学的思考)よりも上位にランクされる。
大規模な実験は3つの主要な発見をもたらす。
第一に、83 LLMの因子分析を適用し、一般知能の「g」因子に類似した単一の創造性因子「c」を復元し、81.5%の分散を説明できるが、一般知識/推論とは分離可能である。
第二に、モデルに“創造的になる”よう促すことは、推論よりもはるかにパフォーマンスを高めることを示し、ベンチマークが一般的な能力よりも創造性を追跡していることを示す。
第3に、人間のマッチしたサブセットでは、創造性においてトップの人間はまだトップのLLMを率いています。
AGC-Benchには、AIの創造性を大規模に測定するためのオープンインフラストラクチャとして、公開のリーダボード、AGC-Judge、人間データが含まれています。
関連論文リスト
- The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability [3.3707422585608953]
大規模言語モデル(LLM)は、ナレッジエンハンサーまたはゼロショットローダとしてそれらを使用することでレコメンデーションシステム(RecSys)の可能性を示している。
重要な課題は、LLMとRecSysの間に大きな意味的ギャップがあり、前者は言語の世界知識を、後者はパーソナライズされた行動の世界を捉えている。
広範に使用されている推奨データセットから,38K以上の高品質なサンプルと23Mトークンを慎重にコンパイルし,生成するLRWorldというベンチマークを提案する。
論文 参考訳(メタデータ) (2025-12-19T09:44:19Z) - Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation [106.17986469245302]
大きな言語モデル(LLM)は、人間のような思考を反映する印象的な推論能力を示している。
既存の推論ベンチマークでは、ドメイン固有の知識(結晶化インテリジェンス)に焦点を当てるか、解釈可能性に欠ける。
階層的認知フレームワークを基盤とした動的推論評価ベンチマークであるDRE-Benchを提案する。
論文 参考訳(メタデータ) (2025-06-03T09:01:08Z) - Creation-MMBench: Assessing Context-Aware Creative Intelligence in MLLM [58.42678619252968]
Creation-MMBenchはマルチモーダル大言語モデルの創造性を評価するために設計されたベンチマークである。
ベンチマークは、51のきめ細かいタスクにまたがる765のテストケースで構成されている。
実験結果から,オープンソースのMLLMは,クリエイティブタスクにおけるプロプライエタリなモデルに比べて著しく性能が劣っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-03-18T17:51:34Z) - A Causality-aware Paradigm for Evaluating Creativity of Multimodal Large Language Models [100.16387798660833]
オオギリゲーム(オオギリゲーム)は、ユーモアと連想的思考を必要とする創造的な仕事である。
LoTbenchはインタラクティブで因果性を考慮した評価フレームワークである。
その結果、ほとんどのLLMは制約された創造性を示すが、LLMと人間の間の性能格差は克服できないことがわかった。
論文 参考訳(メタデータ) (2025-01-25T09:11:15Z) - Benchmarking Language Model Creativity: A Case Study on Code Generation [39.546827184857754]
本研究では,LLMの創造性を定量化するフレームワークを提案する。
生成した創造的応答における収束的思考と発散的思考の両方を定量化する計量であるNEOGAUGEを定義する。
我々はCodeforcesの問題に関する提案されたフレームワークをテストする。これは、タスクをコーディングするための自然なデータセットと、先行する人間のソリューションのコレクションの両方に役立ちます。
論文 参考訳(メタデータ) (2024-07-12T05:55:22Z) - MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration [98.18244218156492]
大規模言語モデル(LLM)は、非常に高度な自然言語処理を持つ。
アプリケーションがマルチエージェント環境に拡大するにつれて、包括的な評価フレームワークの必要性が生じる。
この研究は、マルチエージェント設定内でLLMを評価するための新しい競合ベースのベンチマークフレームワークを導入している。
論文 参考訳(メタデータ) (2023-11-14T21:46:27Z) - On the Creativity of Large Language Models [2.4555276449137042]
大規模言語モデル(LLM)は、人工知能のいくつかの領域に革命をもたらしている。
本稿では、まず、創造性理論のレンズ下でのLCMの開発について分析する。
そして、私たちは、製品、プロセス、プレス、そして人という、異なる古典的な視点を考えます。
最後に、創造産業に焦点をあてて、これらの技術の社会的影響について検討する。
論文 参考訳(メタデータ) (2023-03-27T18:00:01Z) - Putting GPT-3's Creativity to the (Alternative Uses) Test [0.0]
我々はOpen AIの生成自然言語モデルであるGPT-3を試験に投入した。
我々はGPT-3の創造性をギルフォードの代替利用試験で評価した。
クリエイティブなアウトプットに関しては、現在人間はGPT-3を上回っている。
論文 参考訳(メタデータ) (2022-06-10T15:36:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。