論文の概要: QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability
- arxiv url: http://arxiv.org/abs/2605.25955v1
- Date: Mon, 25 May 2026 15:29:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:20.437637
- Title: QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability
- Title(参考訳): QUIET: LLM生成能力のためのマルチブランクカスケードストーリークローズベンチマーク
- Authors: Bo Zou, Chao Xu,
- Abstract要約: 本稿では,大規模言語モデルの診断ベンチマークであるQUIETを提案する。
QUIETは、ストーリー内のN個の空白(10〜20)を完全な構造で設定し、各空白には明示的な内容制約が伴う。
満足」は、空白の充満がコンテンツ制約をどの程度満足させるかを測定する。
サプライズ」は制約が満たされているため、驚きの度合いを測る。
- 参考スコア(独自算出の注目度): 10.071691304378065
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) face a dual challenge in creative capability evaluation: existing benchmarks (e.g., Story Cloze Test, HellaSwag) measure models' discriminative ability over narrative continuation using multiple-choice recognition paradigms, rather than directly measuring creative generation capability; rubric-based scoring and LLM-as-Judge methods rely on subjective dimension assessment or natural language model outputs, and cannot provide objective, automated scoring mechanisms. This paper proposes QUIET (Quality Understanding via Interlocked Evaluation Testing), a diagnostic benchmark for LLM creative capability based on multi-blank cascaded story cloze. QUIET sets N blanks (10-20) in a story with complete structure, with each blank accompanied by an explicit content constraint, and cascade dependency relationships between blanks -- the content filled into earlier blanks constrains the feasible solution space for later blanks. The evaluated model (or human participants) fills all blanks in open-ended generation mode; the results are scored by an information-theoretic automated scoring protocol without human grading. The scoring protocol directly operationalizes the "calibrated surprise" theoretical framework (Zou & Xu, 2026a). For each blank k, a composite score is computed: score = satisfy * (1 + lambda * surprise), where lambda = 1.0. Here, "satisfy" measures how well the blank filling satisfies the content constraint (objective logical reasoning judgment, not subjective aesthetic scoring), and "surprise" measures the degree of surprise given that the constraint is satisfied. Creative answers that do not satisfy the constraint score zero; answers that satisfy the constraint but are mediocre score low; answers that satisfy the constraint and are surprising score high.
- Abstract(参考訳): 既存のベンチマーク(例えば、ストーリークローゼテスト、HellaSwag)は、創造的生成能力を直接測定するのではなく、複数の選択認識パラダイムを用いて、物語継続よりも差別的なモデルの能力を測定する。
本稿では,マルチブランク・ケースド・ストーリー・クローゼに基づくLCM創造能力の診断ベンチマークであるQUIET(Quality Understanding via Interlocked Evaluation Testing)を提案する。
QUIET は N 個の空白 (10-20) を完全な構造で設定し、各空白には明示的な内容制約と空白間のカスケード依存性の関係が伴う。
評価されたモデル(または人間の参加者)は、オープンエンド生成モードですべての空白を埋める。
スコアリングプロトコルは "calibrated surprise" 理論フレームワークを直接運用する(Zou & Xu, 2026a)。
スコア = satisfy * (1 + lambda * surprise) ここで lambda = 1.0 となる。
ここでは、空白充填が内容制約(主観的美的評価ではなく、客観的論理的推論判断)をどの程度満足するかを「満足」が測定し、「サプライズ」は制約が満足していることから、驚きの度合いを測定する。
制約スコア0を満たさない創造的な回答、制約を満足するが、中間的なスコアが低い回答、制約を満足し、驚きのスコアが高い回答。
関連論文リスト
- HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing [84.84959282480641]
テキスト評価において,LLM-as-a-judgeがすべてのサブフィーチャを集約する場合にしばしば発生する暗黙の矛盾を解決するために,Tree-of-Writing(ToW)を提案する。
また、3つのタスクカテゴリにまたがる12のジャンルと1302の命令を含む大規模な中国語書記ベンチマークであるHowToBenchについても紹介する。
論文 参考訳(メタデータ) (2026-04-21T04:26:39Z) - Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks [38.058215007885096]
大規模言語モデル(LLM)の自己評価は高い計算オーバーヘッドをもたらし、本質的なバイアスによる過信問題を引き起こす。
本稿では、軽量で効果的な自己改善を目的とした、検証不能なタスクに対する新しい自己評価自由アプローチを提案する。
論文 参考訳(メタデータ) (2025-09-27T02:44:05Z) - GUM-SAGE: A Novel Dataset and Approach for Graded Entity Salience Prediction [12.172254885579706]
格付けされたエンティティサリエンス(英語版)は、テキストにおける相対的な重要性を反映したエンティティスコアを割り当てる。
両アプローチの強みを組み合わせた,格付けされたエンティティ・サリエンスのための新しいアプローチを提案する。
提案手法は,人間の要約やアライメントに基づくスコアとの相関が強く,既存の手法よりも優れていた。
論文 参考訳(メタデータ) (2025-04-15T01:26:14Z) - SPARC: Score Prompting and Adaptive Fusion for Zero-Shot Multi-Label Recognition in Vision-Language Models [74.40683913645731]
Zero-shot Multi-label Recognition (MLR) with Vision-Language Models (VLMs) は、トレーニングデータ、モデルチューニング、アーキテクチャの変更なしに重要な課題に直面している。
我々の研究は、VLMをブラックボックスとして扱い、トレーニングデータや地上の真実を使わずにスコアを活用する新しいソリューションを提案する。
これらのプロンプトスコアの分析により、VLMバイアスとAND'/OR信号の曖昧さが明らかになり、特に、最高スコアは2番目に高いスコアに比べて驚くほど低い。
論文 参考訳(メタデータ) (2025-02-24T07:15:05Z) - Localizing Factual Inconsistencies in Attributable Text Generation [74.11403803488643]
本稿では,帰属可能なテキスト生成における事実の不整合をローカライズするための新しい形式であるQASemConsistencyを紹介する。
QASemConsistencyは、人間の判断とよく相関する事実整合性スコアを得られることを示す。
論文 参考訳(メタデータ) (2024-10-09T22:53:48Z) - The Ability of Large Language Models to Evaluate Constraint-satisfaction in Agent Responses to Open-ended Requests [0.6249768559720121]
我々は,新しいArithmetic Constraint-Satisfaction(ACS)ベンチマークデータセットを開発し,リリースする。
このデータセットは、対応する制約を持つ複雑なユーザリクエスト、エージェント応答、応答における各制約の満足度を示すヒューマンラベルで構成されている。
ほとんどのモデルにはまだ改善のための重要なヘッドルームがあることを示し、エラーは主に推論の問題に起因する。
論文 参考訳(メタデータ) (2024-09-22T09:27:42Z) - Evaluating Generative Language Models in Information Extraction as Subjective Question Correction [49.729908337372436]
本稿では,新しい評価手法SQC-Scoreを提案する。
主観的質問訂正の原則に着想を得て,新しい評価手法SQC-Scoreを提案する。
3つの情報抽出タスクの結果から,SQC-Scoreは基準値よりもアノテータの方が好ましいことが示された。
論文 参考訳(メタデータ) (2024-04-04T15:36:53Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。