論文の概要: SWIM: Student Writing Simulation via Proficiency-Conditioned Generation
- arxiv url: http://arxiv.org/abs/2609.03215v1
- Date: Wed, 02 Sep 2026 23:10:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.868317
- Title: SWIM: Student Writing Simulation via Proficiency-Conditioned Generation
- Title(参考訳): SWIM:習熟世代による学生の筆記シミュレーション
- Authors: Heejin Do, Jakub Kontak, Mrinmaya Sachan,
- Abstract要約: この研究は、言語モデルが学生の文章を現実的にシミュレートし、SWIMを導入することができるかどうかを考察する。
我々は、プロファイルアライメントの尺度として自動エッセイスコアを用いたシミュレーションのプロンプト、教師付き微調整、強化学習手法の評価を行った。
以上の結果から,明示的監督は単独で行うよりもプロファイルアライメントを著しく向上させるが,信頼性の低い筆記法では再現が困難であることが示唆された。
- 参考スコア(独自算出の注目度): 54.69949380133243
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Writing proficiency manifests in how students develop content, organize ideas, choose words, and use language. Despite growing interest in LLM-based student simulation, whether LLMs can reproduce such multidimensional variation in extended writing remains largely unexplored. In this work, we explore if language models can realistically simulate student writing, and introduce SWIM, a task that formulates Student Writing sIMulation as proficiency-conditioned essay generation. We evaluate prompting, supervised fine-tuning (SFT), and reinforcement learning (RL) methods for writing simulation using automated essay scoring as a measure of profile alignment. Extensive experiments reveal that prompting provides limited proficiency control, even for strong proprietary LLMs with rubric-grounded strategies. In particular, while models can adjust content-oriented traits, they struggle to reproduce the lexical, grammatical, and organizational variation in different proficiency levels. SFT substantially improves alignment, while RL with the proposed proficiency-alignment reward yields further gains across all writing traits and essay prompts. Our findings suggest that explicit supervision enables substantially stronger profile alignment than prompting alone, while authentic low-proficiency writing remains challenging to reproduce.
- Abstract(参考訳): 文章の習熟度は、学生がコンテンツを開発し、アイデアを組織し、言葉を選択し、言語を使う方法に現れます。
LLMを用いた学生シミュレーションへの関心が高まっているが、LLMがこのような多次元の変動を再現できるかどうかはまだ明らかになっていない。
本研究では,言語モデルが学生の文章を現実的にシミュレートできるかどうかを考察し,熟練度条件付きエッセイ生成として学生の文章をシミュレートするタスクであるSWIMを紹介する。
我々は、プロファイルアライメントの尺度として自動エッセイスコアを用いたシミュレーションのプロンプト、教師付き微調整(SFT)、強化学習(RL)手法の評価を行った。
広範囲な実験により、プロンプトは、ルーリックグラウンド戦略を持つ強力なプロプライエタリなLLMに対しても、限られた習熟度制御を提供することが明らかになった。
特に、モデルはコンテンツ指向の特質を調整できるが、語彙的、文法的、組織的な変化を異なる習熟度で再現することは困難である。
SFTはアライメントを大幅に改善する一方、提案された熟練度アライメント報酬のRLは、すべての筆記特性やエッセイプロンプトをさらに向上させる。
以上の結果から,明示的監督は単独で行うよりもプロファイルアライメントを著しく向上させるが,真の低能率筆記法では再現が困難であることが示唆された。
関連論文リスト
- CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text [15.007368492314308]
大規模言語モデル(LLM)のアウトプットにおける創造性を評価することは、創造性が多次元で人間中心であるため、依然として困難である。
低リソース言語であるペルシャ語における短い文学的文章をLLMがいかに確実に評価するかを検討する。
TTCTによる構造的特性,例えばオリジン性, フルーエンシ, 実験ではアライメントが強いが, より主観的な次元, 特に感情や魅力には弱いことが判明した。
この次元に依存した振る舞いを動機として、構造化された創造性次元をシンプルで解釈可能なプロキシメトリクスで近似できるかどうかを考察する。
論文 参考訳(メタデータ) (2026-08-31T13:22:20Z) - The Crutch or the Ceiling? How Different Generations of LLMs Shape EFL Student Writings [0.26097841018267615]
本研究では,外国語(EFL)学生の文章作成作業を支援するために,Large Language Models (LLMs) の範囲と限界について検討する。
以上の結果から,LLMは低習熟度学習者に対する評価スコアと語彙の多様性を高めることが示唆された。
AI支援の実践を真の学習に転換するためには、教育はアウトプットの品質から学習プロセスの検証へとシフトする必要がある。
論文 参考訳(メタデータ) (2026-04-16T18:19:46Z) - Intention-Adaptive LLM Fine-Tuning for Text Revision Generation [0.70303436819479]
大規模言語モデル(LLM)は、コンテキストベースのテキスト生成タスクにおいて印象的な機能を達成した。
Intention-Tuning - 意図適応型レイヤワイドLLM微調整フレームワークを提案する。
Intention-Tuningは小さなリビジョンコーパスに対して効果的かつ効果的であることを示す。
論文 参考訳(メタデータ) (2026-01-31T03:01:09Z) - LangSuitE: Planning, Controlling and Interacting with Large Language Models in Embodied Text Environments [70.91258869156353]
テキストエンボディの世界における6つの代表的具体的タスクを特徴とする多目的・シミュレーション不要なテストベッドであるLangSuitEを紹介する。
以前のLLMベースのテストベッドと比較すると、LangSuitEは複数のシミュレーションエンジンを使わずに、多様な環境への適応性を提供する。
具体化された状態の履歴情報を要約した新しいチェーン・オブ・ソート(CoT)スキーマであるEmMemを考案する。
論文 参考訳(メタデータ) (2024-06-24T03:36:29Z) - CLOMO: Counterfactual Logical Modification with Large Language Models [109.60793869938534]
本稿では,新しいタスク,CLOMO(Counterfactual Logical Modification)と高品質な人間アノテーションベンチマークを紹介する。
このタスクでは、LLMは所定の論理的関係を維持するために、与えられた議論的テキストを順応的に変更しなければなりません。
LLMの自然言語出力を直接評価する革新的な評価指標である自己評価スコア(SES)を提案する。
論文 参考訳(メタデータ) (2023-11-29T08:29:54Z) - AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations [52.43593893122206]
Alignedcotは、大規模言語モデルを呼び出すためのコンテキスト内学習技術である。
ゼロショットシナリオでは、一貫した正しいステップワイズプロンプトを達成する。
数学的推論とコモンセンス推論の実験を行う。
論文 参考訳(メタデータ) (2023-11-22T17:24:21Z) - AI Text-to-Behavior: A Study In Steerability [0.0]
大規模言語モデル(LLM)の操舵性に関する研究
我々は,OCEANと呼ばれる行動心理学の枠組みを用いて,モデルが調整されたプロンプトに対する応答性を定量的に測定した。
以上の結果から,GPTの汎用性と,ニュアンス命令の識別と適応能力が評価された。
論文 参考訳(メタデータ) (2023-08-07T18:14:24Z) - RLPrompt: Optimizing Discrete Text Prompts With Reinforcement Learning [84.75064077323098]
本稿では、強化学習(RL)を用いた離散的高速最適化手法RLPromptを提案する。
RLPromptは、マスク付きジベリッシュ(例:grammaBERT)や左から右へのモデル(例:GPT)など、様々な種類のLMに柔軟に適用可能である。
少数ショット分類と教師なしテキストスタイル転送の実験は、既存のファインタニングやプロンプト手法よりも優れた性能を示す。
論文 参考訳(メタデータ) (2022-05-25T07:50:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。