論文の概要: Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.22996v1
- Date: Sat, 25 Jul 2026 02:21:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.959828
- Title: Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning
- Title(参考訳): 直接回答を超えて:ヒューリスティック強化学習によるソクラティックガイドとしての教育用LCM
- Abstract要約: HeuristicEduは、2相パイプラインで、Qwen2.5-7Bをソクラテスのチューリングに合わせる。
訓練はソクラティック・エドゥ(SoccraticEdu)を使い、797人の中国人児童の科学対話をライブプラットフォームから再構築する。
- 参考スコア(独自算出の注目度): 7.657318367266143
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) deployed in educational settings often behave as direct answerers: they disclose target concepts in the opening turn instead of guiding students through progressive inquiry, as Socratic pedagogy prescribes. We present HeuristicEdu, a two-phase pipeline that aligns Qwen2.5-7B toward Socratic tutoring via supervised warm-up and Group Relative Policy Optimization (GRPO). Training uses SocraticEdu, 797 multi-turn Chinese children's science dialogues reconstructed from a live platform, with a heuristic reward over cognitive depth (R_cog), curiosity engagement (R_eng), and directness (R_dir), together with a K_query correction for student-introduced terms. We introduce Scaffolding Effectiveness (SE) and Conversation Depth (CD) to evaluate outcomes beyond surface fluency. On 30 held-out questions, the best GRPO variant improves SE from 30.0% to 63.3% and lowers keyword leakage from 30.0% to 13.3%. Notably, this best variant omits the directness penalty during optimization, suggesting that explicit anti-leakage terms can conflict with gradient-based behavioral alignment. An unaligned Qwen-72B baseline reaches 0% SE and 96.7% leakage, showing that scale alone does not induce Socratic behavior.
- Abstract(参考訳): 大きな言語モデル(LLM)は、しばしば直接の回答者として振る舞う:彼らは、ソクラテス教育が規定しているように、進歩的な調査を通じて学生を導くのではなく、オープニングターンでターゲット概念を開示する。
We present HeuristicEdu, a two-phase pipeline that handles Qwen2.5-7B to Socratic tutoring through supervised warm-up and Group Relative Policy Optimization (GRPO)。
SocraticEduは、797人の中国人児童の科学対話をライブプラットフォームから再構築し、認知深度(R_cog)、好奇心エンゲージメント(R_eng)、指向性(R_dir)に対するヒューリスティックな報酬と、学生が導入した用語に対するK_query補正を併用する。
本研究では,表面流速を超える結果を評価するために,Scaffolding Effectiveness (SE) と Conversation Depth (CD) を導入する。
30の質問に対して、最高のGRPOはSEを30.0%から63.3%に改善し、キーワードリークを30.0%から13.3%に下げる。
特に、この最良の変種は最適化中の直性ペナルティを省略し、明示的な反推論項は勾配に基づく行動アライメントと矛盾する可能性があることを示唆している。
不整合Qwen-72Bベースラインは0%のSEと96.7%のリークに達し、スケールだけでソクラテス的な振る舞いを誘発しないことを示している。
関連論文リスト
- On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning [36.32246019820315]
自己回帰は、人間の学習における信用割り当ての強力なメカニズムである。
本稿では,この機能を内包するフレームワークである自己回帰政策最適化(SRPO)を提案する。
我々はSRPOが数学的推論と長期エージェントベンチマークで最先端の性能を達成することを実証した。
論文 参考訳(メタデータ) (2026-08-24T16:55:09Z) - EviSD: Evidence-Conditioned Self-Distillation for Search-Augmented Agents [28.95182429824442]
我々はエビデンス条件の自己蒸留フレームワークであるEviSDを提案する。
検索アクションや黄金の回答のための特権情報として、インスタンスレベルのサポートエビデンスを使用している。
EviSDは、評価されたすべての設定において、マクロ平均のExact Matchを最高に達成する。
論文 参考訳(メタデータ) (2026-08-02T16:22:27Z) - EduGuard: A Safe RAG-Based LLM Tutor for Programming Education [1.2999518604217852]
ジェネレーティブAI(GenAI)は、プログラミングの説明、デバッグ、代入サポートに学生によってますます利用されている。
本稿では,提案プログラムのための安全な検索強化世代(RAG)学習フレームワークであるEduGuardについて述べる。
EduGuardは、クエリ理解、インストラクターが承認したコース検索、教育戦略選択、ルーリック・アウェア生成、クレームレベルの検証、オーバー信頼制御を統合している。
論文 参考訳(メタデータ) (2026-07-17T08:18:18Z) - TREK: Distill to Explore, Reinforce to Refine [25.02150919466995]
我々は, 模擬ではなく, 探索支援拡張のための蒸留法であるTREK(Teacher-Routed Exploration via Forward KL)を提案する。
検証された出力軌跡しか消費しないため、TREKは外部のブラックボックスの教師、ホワイトボックスの教師、または追加の推論時間コンテキストを持つ同じモデルを使用することができる。
エージェントタスクでは、ALFWorldの成功率は75.8から82.8に、ScienceWorldの成功率は12.5から26.7に上昇する。
論文 参考訳(メタデータ) (2026-07-06T17:21:16Z) - Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients [89.89504265663057]
近親政策最適化ゾーン(ZPPO)は、ヴィゴツキーの近親開発ゾーンに触発されたものである。
ZPPOは1つの正しい教師の反応と1つの間違った学生の反応を、生徒が識別しなければならない匿名候補としてペアリングする。
プロンプト再生バッファは、生徒の平均ロールアウト精度が半分に達するか、FIFOが削除されるまで、各難問を再循環する。
論文 参考訳(メタデータ) (2026-06-16T17:46:02Z) - Mitigating Scaffolding Collapse in Socratic Tutors via Representation Alignment [27.27113272044142]
大規模言語モデル(LLM)に基づくソクラテスの家庭教師は、多ターン質問を通じて学生をガイドする傾向にある。
持続的な学生圧力の下で、教師は徐々に指導的調査を放棄し、解決策を直接明らかにする。
教師付き微調整でソクラテス教師を温める2段階のフレームワークであるScaffold-Preserving Representation Alignmentを提案する。
論文 参考訳(メタデータ) (2026-06-15T07:55:09Z) - On-Policy Distillation with Curriculum Turn-level Guidance for Multi-turn Agents [50.78688247330029]
オン・ポリシィ蒸留(On-Policy Distillation、OPD)は、小規模の学生にその能力を伝達するための自然なレシピである。
本稿では,教師と生徒が生成するターンを各ロールアウトに混在させるシンプルなアルゴリズムであるGuided-OPD(Guided-OPD)を提案する。
Guided-OPDは、平均してバニラOPDよりも21.1%、成功率25.5%向上している。
論文 参考訳(メタデータ) (2026-06-14T16:41:45Z) - Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions [80.33276868889341]
Z-Rewardは効率的な報酬展開から推論と重大な判断を分離する。
Z-Reward はテキスト・画像の最適化のための識別可能な報酬信号として機能することを示す。
論文 参考訳(メタデータ) (2026-06-08T06:20:12Z) - SocraticPO: Policy Optimization via Interactive Guidance [64.7524628699057]
大規模言語モデルのための強化学習(RL)は通常、二項正当性のようなスカラー結果の報酬を伴う推論を監督する。
我々は、ソクラティックスタイルの自然言語ガイダンスでRLロールアウトを強化する政策最適化フレームワークであるtextbf SocraticPO(Socratic Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-03T09:08:29Z) - Self-Distilled Policy Gradient [51.95967256628261]
都市の自己蒸留は、スパース・リワード強化学習のための密集した監督源として有望である。
SDPGは,グループ相対検証の利点と正規化標準偏差を組み合わせた,自己蒸留型政策段階のフレームワークである。
論文 参考訳(メタデータ) (2026-06-02T02:31:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。