論文の概要: Generating Constructive Feedback on Stories via Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2609.04824v1
- Date: Fri, 04 Sep 2026 07:26:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.960814
- Title: Generating Constructive Feedback on Stories via Reinforcement Learning
- Title(参考訳): 強化学習による物語の構成的フィードバックの生成
- Abstract要約: 構成的フィードバックは、創造的な作家がストーリーテリング能力を洗練させることに不可欠である。
人間の専門家からのフィードバックは費用がかかり時間もかかることが多いため、大規模言語モデル(LLM)はスケーラブルで効率的な代替手段を提供する。
提案手法は,LLMを操り,地道フィードバックを必要とせずに建設的フィードバックを生成するための強化学習手法である。
- 参考スコア(独自算出の注目度): 17.493071928687993
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Constructive feedback is crucial for creative writers to refine their storytelling abilities. Since receiving feedback from human experts is often costly and time-intensive, large language models (LLMs) offer a scalable and efficient alternative as automatic writing assistants. Despite their potential, research indicates that LLM-generated feedback is often generic, lacks actionability, and fails to identify which writing issue is most critical. To address these limitations, we present a reinforcement learning approach that steers LLMs to generate constructive feedback without the need for ground-truth feedback. We train our model using group relative policy optimization (GRPO) with a novel multi-component reward function aiming at constructiveness: it prioritizes feedback that is uniquely tailored to the story, helps to improve story quality, and addresses the most critical writing issue. In automatic and human evaluation across three story corpora, our approach outperforms state-of-the-art LLMs (including Gemini) and competitive baselines. We find that providing actionable suggestions is the main driver of feedback constructiveness.
- Abstract(参考訳): 構成的フィードバックは、創造的な作家がストーリーテリング能力を洗練させることに不可欠である。
人間の専門家からのフィードバックは費用がかかり時間もかかることが多いため、大規模言語モデル(LLM)は自動書込みアシスタントとしてスケーラブルで効率的な代替手段を提供する。
その可能性にもかかわらず、LLMが生成するフィードバックは多くの場合汎用的であり、実行可能性に欠けており、どの書き込み問題が最も重要かを特定するのに失敗している。
これらの制約に対処するために,LLMを操る強化学習手法を提案する。
我々は,グループ相対政策最適化(GRPO)を用いて,構成性を重視した新たな多成分報酬関数を用いて,ストーリに特有のフィードバックを優先し,ストーリの品質向上を支援するとともに,最も重要な書き込み問題に対処するモデルを訓練する。
3つのストーリーコーパスにまたがる自動的および人的評価において、我々のアプローチは最先端のLCM(ジェミニを含む)と競争ベースラインを上回っている。
実用的な提案を提供することが、フィードバック構築性の主要な要因であることに気付きました。
関連論文リスト
- Personalized and Constructive Feedback for Computer Science Students Using the Large Language Model (LLM) [0.8409304328108455]
本稿では,学生評価における言語モデル(LLM)の性能について,事前に定義されたルーリックとマーキング基準を用いて検討する。
我々は,既存のLCMによるマーキングアセスメント,追跡,評価(LLM-MATE)の力を活用して,学生の学習を促進することを目的としている。
論文 参考訳(メタデータ) (2025-10-13T15:59:30Z) - Help Me Write a Story: Evaluating LLMs' Ability to Generate Writing Feedback [57.200668979963694]
我々は1,300のストーリーからなる新しいテストセットを提示し、故意に執筆問題を紹介した。
本研究では,この作業においてよく用いられるLCMの性能を,自動評価と人的評価の両方を用いて検討する。
論文 参考訳(メタデータ) (2025-07-21T18:56:50Z) - The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement [61.00950725408354]
大規模言語モデル(LLM)は、最近、テキストベースのアシスタントから、計画、推論、反復的な行動改善が可能な自律エージェントへと変化した。
本研究では,環境を探索するアクターモデルと,詳細な自然言語フィードバックを生成する批評家モデルからなる,新しい2人プレイヤフレームワークであるCGIを紹介する。
論文 参考訳(メタデータ) (2025-03-20T10:42:33Z) - Closing the Loop: Learning to Generate Writing Feedback via Language Model Simulated Student Revisions [6.216542656489173]
本稿では,LM シミュレーションによる学生のリビジョンの学習を通じてフィードバックを生成できる ProF を提案する。
本稿では,PROFの有効性を実証的に検証し,本手法が学生の筆跡改善に有効であることを示す。
論文 参考訳(メタデータ) (2024-10-10T15:52:48Z) - Exploring LLM Prompting Strategies for Joint Essay Scoring and Feedback Generation [13.854903594424876]
大規模言語モデル(LLM)は、一貫性と文脈に関連のあるテキストを生成する上で、強力な性能を示している。
本研究は,LLMをベースとしたゼロショットと数発のエッセイフィードバックの促進戦略について検討する。
Chain-of-Thoughtのプロンプトにインスパイアされた私たちは、自動エッセイスコア(AES)が生成したフィードバックの品質にどのような影響を及ぼすか、その程度について調査する。
論文 参考訳(メタデータ) (2024-04-24T12:48:06Z) - Improving the Validity of Automatically Generated Feedback via Reinforcement Learning [46.667783153759636]
強化学習(RL)を用いた正当性と整合性の両方を最適化するフィードバック生成フレームワークを提案する。
具体的には、直接選好最適化(DPO)によるトレーニングのための拡張データセットにおいて、GPT-4のアノテーションを使用してフィードバックペアよりも好みを生成する。
論文 参考訳(メタデータ) (2024-03-02T20:25:50Z) - Constructive Large Language Models Alignment with Diverse Feedback [76.9578950893839]
本稿では,大規模言語モデルのアライメント向上のための新しい手法として,コンストラクティブ・ディバース・フィードバック(CDF)を導入する。
我々は,簡単な問題に対する批判的フィードバック,中級問題に対する改善的フィードバック,難題に対する選好的フィードバックを利用する。
このような多様なフィードバックでモデルをトレーニングすることで、トレーニングデータの少ない使用でアライメント性能を向上させることができる。
論文 参考訳(メタデータ) (2023-10-10T09:20:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。