論文の概要: The Human Creativity Benchmark
- arxiv url: http://arxiv.org/abs/2606.30561v1
- Date: Mon, 29 Jun 2026 16:59:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.343227
- Title: The Human Creativity Benchmark
- Title(参考訳): 人間の創造性ベンチマーク
- Abstract要約: 創造的な領域では、専門家の意見の相違は、測定誤差ではなく、味の真の相違を反映している。
創造的なAIを評価するには、収束と分散という2つの異なるシグナルを保存する必要がある、と私たちは主張する。
この分離を運用するベンチマークであるHuman Creativity Benchmark(HCB)を紹介する。
- 参考スコア(独自算出の注目度): 37.190673682910536
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern AI evaluation frameworks treat evaluator disagreement as noise to be resolved. In creative domains, professional disagreement reflects genuine differences in taste, not measurement error. We argue that evaluating creative AI requires preserving two distinct signals: convergence, where professionals align around shared best practices, and divergence, where individual taste legitimately varies. We present the Human Creativity Benchmark (HCB), a benchmark that operationalizes this separation by collecting pairwise preferences, scalar ratings on prompt adherence, usability, and visual appeal, and qualitative rationale from domain professionals. Across 15,000 professional judgments spanning five creative domains and three workflow phases (ideation, mockup, refinement), we find that convergence concentrates on verifiable dimensions like technical correctness and visual hierarchy, while divergence concentrates on taste-driven dimensions like aesthetic direction and conceptual risk. No model excels uniformly across all phases. Collapsing these signals into a single quality metric discards the most actionable information: where models must be correct versus where they should remain steerable.
- Abstract(参考訳): 現代のAI評価フレームワークは、評価者の不一致を解決すべきノイズとして扱う。
創造的な領域では、専門家の意見の相違は、測定誤差ではなく、味の真の相違を反映している。
我々は、創造的なAIを評価するためには、2つの異なるシグナルを保存する必要があると論じている。
提案するHuman Creativity Benchmark(HCB)は、この分離を運用するベンチマークであり、ペアの選好、迅速な順応性、ユーザビリティ、視覚的魅力に関するスカラー評価、ドメインの専門家からの質的な論理的根拠を収集する。
5つの創造的ドメインと3つのワークフローフェーズ(イデオロギー、モックアップ、洗練)にまたがる15,000の専門的判断では、収束は技術的正しさや視覚的階層といった検証可能な次元に集中し、分岐は美的方向や概念的リスクのような味覚駆動の次元に集中している。
どのモデルも全てのフェーズで一様に排他することはない。
これらの信号を単一の品質メトリクスにまとめると、最も実行可能な情報は捨てられる。
関連論文リスト
- PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception [75.70273182182397]
PerceptionRubricsはルーブリックベースの評価フレームワークである。
飽和ベンチマークスコアと現実世界の脆さのギャップに対処する。
1,038枚のインフォメーションセンス画像と12,000個以上のインスタンス固有のルーリックをペアリングする。
論文 参考訳(メタデータ) (2026-06-26T17:59:15Z) - Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment [1.974820485832244]
我々は,人間の知覚障害のスペクトルとしてOODの度合いを再定義する,人間中心の枠組みを提案する。
我々はこの枠組みをオブジェクト認識に適用し、ディープラーニングアーキテクチャ全体にわたるユニークな、状況に依存したモデル-ヒューマンアライメントのランキングとプロファイルを明らかにする。
論文 参考訳(メタデータ) (2026-03-08T04:51:39Z) - CreativityPrism: A Holistic Benchmark for Large Language Model Creativity [64.18257552903151]
創造性はしばしば人間の知能の目印と見なされる。
さまざまなシナリオにまたがってクリエイティビティを評価するための総合的なフレームワークはまだ存在しません。
本稿では,創造性を質,新規性,多様性の3次元に分解する評価分析フレームワークであるCreativePrismを提案する。
論文 参考訳(メタデータ) (2025-10-23T00:22:10Z) - SONA: Learning Conditional, Unconditional, and Mismatching-Aware Discriminator [54.562217603802075]
帰納的バイアスを伴う最終層において,自然性(美容性)とアライメントを別々に投影するSONA(Sum of Naturalness and Alignment)を導入する。
クラス条件生成タスクの実験により、SONAは最先端の手法に比べて優れたサンプル品質と条件アライメントを達成することが示された。
論文 参考訳(メタデータ) (2025-10-06T08:26:06Z) - Curiosity-Driven LLM-as-a-judge for Personalized Creative Judgment [4.334576480811837]
本稿では,創造的文章評価のための新しい好奇心駆動型LCM-as-a-judgeを提案する。
本手法は,全アノテータが互いに一致しない主観評価において特に有用である。
論文 参考訳(メタデータ) (2025-10-01T04:29:36Z) - RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark [71.3555284685426]
本稿では,双方向機能相乗効果を評価するためのベンチマークであるRealUnifyを紹介する。
RealUnifyは、10のカテゴリと32のサブタスクにまたがる、細心の注意を払ってアノテートされた1000のインスタンスで構成されている。
現在の統一モデルは、効果的な相乗効果を達成するのに依然として苦労しており、アーキテクチャの統一だけでは不十分であることを示している。
論文 参考訳(メタデータ) (2025-09-29T15:07:28Z) - Modeling Beyond MOS: Quality Assessment Models Must Integrate Context, Reasoning, and Multimodality [45.34252727738116]
平均オピニオンスコア(MOS)は、もはやマルチメディア品質評価モデルのための唯一の監督信号として不十分である。
品質評価を文脈的、説明可能、マルチモーダルなモデリングタスクとして再定義することで、より堅牢で、人間らしく、信頼性の高い評価システムへのシフトを触媒することを目指している。
論文 参考訳(メタデータ) (2025-05-26T08:52:02Z) - Democratizing Reward Design for Personal and Representative Value-Alignment [10.1630183955549]
本稿では,対話型対話アライメント(Interactive-Reflective Dialogue Alignment)について紹介する。
本システムは,言語モデルに基づく嗜好誘導を通じて個々の価値定義を学習し,パーソナライズされた報酬モデルを構築する。
本研究は, 価値整合行動の多様な定義を示し, システムによって各人の独自の理解を正確に捉えることができることを示す。
論文 参考訳(メタデータ) (2024-10-29T16:37:01Z) - Exploring the Trade-off between Plausibility, Change Intensity and
Adversarial Power in Counterfactual Explanations using Multi-objective
Optimization [73.89239820192894]
自動対物生成は、生成した対物インスタンスのいくつかの側面を考慮すべきである。
本稿では, 対実例生成のための新しい枠組みを提案する。
論文 参考訳(メタデータ) (2022-05-20T15:02:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。