論文の概要: StoryAlign: Evaluating and Training Reward Models for Story Generation
- arxiv url: http://arxiv.org/abs/2605.04831v1
- Date: Wed, 06 May 2026 12:28:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.808276
- Title: StoryAlign: Evaluating and Training Reward Models for Story Generation
- Title(参考訳): StoryAlign: ストーリー生成のためのリワードモデルの評価とトレーニング
- Abstract要約: ストーリー嗜好に関する報酬モデルを評価するための最初のベンチマークであるStoryRMBを紹介する。
我々は、このデータセットでトレーニングされたストーリー優先のための高度な報酬モデルであるStoryRewardを開発する。
StoryRewardはStoryRMB上での最先端(SoTA)のパフォーマンスを達成し、はるかに大きなモデルより優れています。
- 参考スコア(独自算出の注目度): 52.44891270363296
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Story generation aims to automatically produce coherent, structured, and engaging narratives. Although large language models (LLMs) have significantly advanced text generation, stories generated by LLMs still diverge from human-authored works regarding complex narrative structure and human-aligned preferences. A key reason is the absence of effective modeling of human story preferences, which are inherently subjective and under-explored. In this work, we systematically evaluate the modeling of human story preferences and introduce StoryRMB, the first benchmark for assessing reward models on story preferences. StoryRMB contains $1,133$ high-quality, human-verified instances, each consisting of a prompt, one chosen story, and three rejected stories. We find existing reward models struggle to select human-preferred stories, with the best model achieving only $66.3\%$ accuracy. To address this limitation, we construct roughly $100,000$ high-quality story preference pairs across diverse domains and develop StoryReward, an advanced reward model for story preference trained on this dataset. StoryReward achieves state-of-the-art (SoTA) performance on StoryRMB, outperforming much larger models. We also adopt StoryReward in downstream test-time scaling applications for best-of-n (BoN) story selection and find that it generally chooses stories better aligned with human preferences. We will release our dataset, model, and code to facilitate future research. Related code and data are available at https://github.com/THU-KEG/StoryReward.
- Abstract(参考訳): ストーリー生成は、一貫性があり、構造化され、魅力的な物語を自動生成することを目的としている。
大規模言語モデル (LLM) はテキスト生成が著しく進歩しているが、LLMによって生成された物語は、複雑な物語構造や人間に沿った嗜好に関する人間によって書かれた作品とは相容れない。
主な理由は、人間のストーリー嗜好の効果的なモデリングがないことである。
本研究では,人間のストーリー嗜好のモデル化を体系的に評価し,ストーリー選好に対する報酬モデルを評価するための最初のベンチマークであるStoryRMBを紹介する。
StoryRMBには、133ドルの高品質な人間認証インスタンスが含まれており、それぞれがプロンプト、1つの選択されたストーリー、3つの拒否されたストーリーで構成されている。
既存の報酬モデルでは、人間が好むストーリーを選択するのに苦労しており、最高のモデルは6.3\%の精度しか達成していない。
この制限に対処するため、さまざまなドメインにまたがる高品質なストーリー嗜好ペアを約10万ドルで構築し、このデータセットでトレーニングされたストーリー選好の高度な報奨モデルであるStoryRewardを開発する。
StoryRewardはStoryRMB上での最先端(SoTA)のパフォーマンスを達成し、はるかに大きなモデルより優れています。
また、Best-of-n(BoN)ストーリー選択のためのダウンストリームテストタイムスケーリングアプリケーションにもStoryRewardを採用しています。
将来の研究を促進するために、データセット、モデル、コードをリリースします。
関連コードとデータはhttps://github.com/THU-KEG/StoryReward.comで公開されている。
関連論文リスト
- StoryWriter: A Multi-Agent Framework for Long Story Generation [53.80343104003837]
長いストーリー生成は、既存の大きな言語モデルにとって依然として課題である。
本稿では,3つの主要モジュールから構成されるマルチエージェント・ストーリー生成フレームワークであるStoryWriterを提案する。
StoryWriterは、ストーリーの品質と長さの両方において、既存のストーリー生成ベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2025-06-19T16:26:58Z) - Learning to Reason for Long-Form Story Generation [84.09733333295338]
一般的なストーリー生成タスク(Next-Chapter Prediction)と報酬定式化(Completion Likelihood Improvementによる検証リワード)を提案する。
私たちは、物語の凝縮した情報を推論し、次の章の詳細な計画を作成することを学びます。
私たちの推論は、ストーリージェネレータ作成を支援する章を通じて評価され、トレーニングされていない、教師なしの微調整(SFT)ベースラインと比較されます。
論文 参考訳(メタデータ) (2025-03-28T18:48:26Z) - Generating Visual Stories with Grounded and Coreferent Characters [63.07511918366848]
本稿では,一貫した接地的・中核的な特徴を持つ視覚的ストーリーを予測できる最初のモデルを提案する。
我々のモデルは、広く使われているVISTベンチマークの上に構築された新しいデータセットに基づいて微調整されています。
また、物語における文字の豊かさとコア参照を測定するための新しい評価指標を提案する。
論文 参考訳(メタデータ) (2024-09-20T14:56:33Z) - TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling [14.15543866199545]
クロスモーダルなタスクとして、視覚的なストーリーテリングは、順序付けられた画像シーケンスのためのストーリーを自動的に生成することを目的としている。
視覚的ストーリーテリングのための新しい手法,Topic Aware Reinforcement Network(TARN-VIST)を提案する。
特に,視覚的,言語的両面から,物語の話題情報を事前に抽出した。
論文 参考訳(メタデータ) (2024-03-18T08:01:23Z) - The Next Chapter: A Study of Large Language Models in Storytelling [51.338324023617034]
大規模言語モデル(LLM)を用いたプロンプトベース学習の適用は,自然言語処理(NLP)タスクにおいて顕著な性能を示した。
本稿では,LLMのストーリー生成能力と最近のモデルを比較するために,自動評価と人的評価の両方を利用した総合的な調査を行う。
その結果、LLMは他のストーリー生成モデルと比較して、非常に高い品質のストーリーを生成することがわかった。
論文 参考訳(メタデータ) (2023-01-24T02:44:02Z) - Robust Preference Learning for Storytelling via Contrastive
Reinforcement Learning [53.92465205531759]
制御された自動ストーリ生成は、自然言語批判や嗜好から制約を満たす自然言語ストーリを生成することを目指している。
対照的なバイエンコーダモデルをトレーニングし、ストーリーを人間の批評と整合させ、汎用的な嗜好モデルを構築する。
我々はさらに、ストーリー生成の堅牢性を高めるために、プロンプトラーニング技術を用いて、対照的な報酬モデルを微調整する。
論文 参考訳(メタデータ) (2022-10-14T13:21:33Z) - Guiding Neural Story Generation with Reader Models [5.935317028008691]
本稿では、読者モデルを用いてストーリーを推論するフレームワークであるReader Models(StoRM)によるストーリー生成について紹介する。
実験により、我々のモデルは、プロットの可視性やトピックの継続など、次元のベースラインをはるかに上回り、コヒーレントでオントピー的なストーリーを生み出すことが示された。
論文 参考訳(メタデータ) (2021-12-16T03:44:01Z) - STORIUM: A Dataset and Evaluation Platform for Machine-in-the-Loop Story
Generation [48.56586847883825]
我々は、オンラインのコラボレーティブなストーリーテリングコミュニティであるSTORiumから構築されたデータセットと評価プラットフォームを紹介した。
データセットには6Kの長編記事と、各物語に散在する詳細な自然言語アノテーションが含まれています。
我々は、STORiumにそれらを統合することで、データセット上で微調整された言語モデルを評価し、実際の著者は提案されたストーリーの継続をモデルに問い合わせ、編集することができる。
論文 参考訳(メタデータ) (2020-10-04T23:26:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。