論文の概要: Sherpa: Teaching LLMs to Teach Adaptively
- arxiv url: http://arxiv.org/abs/2610.08778v1
- Date: Tue, 06 Oct 2026 17:58:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.162709
- Title: Sherpa: Teaching LLMs to Teach Adaptively
- Title(参考訳): Sherpa: LLMを適応的に教える
- Abstract要約: 大規模言語モデル(LLM)は、ますます有能な問題解決者になりつつあるが、問題を解くことは、それを教えることと同じではない。
異なる学習嗜好に基づいてLLMを用いて学生の古型をインスタンス化する強化学習フレームワークであるSherpaを紹介する。
シェルパで教育を受けた教師のLLMは、すべての古型に対して平均20.5ポイントの成績を指導した。
- 参考スコア(独自算出の注目度): 60.9784720634019
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have become increasingly capable problem solvers, but being able to solve a problem is not the same as being able to teach it. Existing approaches to training LLMs as teachers rely on demonstrations, preference data, or predefined pedagogical criteria that specify what good teaching looks like. However, these signals are often not grounded in individual student learning outcomes, where effective teaching strategies can vary substantially across learners. To address this, we introduce Sherpa, a multi-turn reinforcement learning framework that instantiates multiple student archetypes with LLMs conditioned on distinct learning preferences and trains a teacher model to adapt its instruction by directly maximizing their learning outcomes. Teacher LLMs trained with Sherpa improve instructed students' performance across all archetypes by an average of 20.5 percentage points. Under MathTutorBench's evaluation, Sherpa raises the overall pedagogy score from 52.5% to 79.2%, indicating better teaching responses. Our human studies show that the trained teacher is preferred over the base model in 79.6% of pairwise comparisons. Together, Sherpa trains LLM teachers to adapt to diverse simulated students and become better aligned with human teachers, paving the road towards AI tutors teaching real students.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ますます有能な問題解決者になりつつあるが、問題を解くことは、それを教えることと同じではない。
教師としてLLMをトレーニングするための既存のアプローチは、実演、選好データ、あるいは良い教えがどのようなものかを示す事前に定義された教育基準に依存している。
しかし、これらのシグナルは、学習者間で効果的な教育戦略が著しく異なる、個々の学習結果に基づかないことが多い。
これを解決するために、Sherpaというマルチターン強化学習フレームワークを導入し、異なる学習嗜好に基づいて複数の学生アーチタイプをLLMでインスタンス化し、学習結果を直接最大化して教師モデルに適応するよう訓練する。
シェルパで教育を受けた教師のLLMは、すべての古型に対して平均20.5ポイントの成績を指導した。
MathTutorBenchの評価のもと、Sherpaは教育成績を52.5%から79.2%に引き上げ、より良い教育効果を示している。
我々の人間による研究によると、教師はペア比較の79.6%でベースモデルよりも好まれている。
シェルパはLLMの教師を訓練し、多様なシミュレーションされた学生に適応させ、人間の教師とより良く連携できるようにし、本物の学生を教えるAI家庭教師への道を歩む。
関連論文リスト
- Synchronizing Beliefs with Second-Order Theory-of-Mind in Human-Autonomy Teams (Extended Version) [3.248039323542496]
嗜好に基づく報奨学習は、学習者が生成したクエリに応答する受動的オラクルとして、人間の教師を形容する。
ターゲットを知っている教師は、学習者主導の獲得戦略よりも効率的にトレーニング例を構築することができる。
選好学習は、人間と自律のチームが2つの行動モデルを結合する問題であると再認識する。
論文 参考訳(メタデータ) (2026-07-29T18:44:01Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - Do Large Language Models Mentalize When They Teach? [15.991054959432269]
我々は、シミュレーション教師として様々なLSMを実行し、試行錯誤の選択を人間と同じ認知モデルに適合させる。
ほとんどのLSMは良好に動作し、試行よりも戦略がほとんど変化せず、グラフ・バイ・グラフの性能は人間のものと類似している。
論文 参考訳(メタデータ) (2026-04-02T04:04:20Z) - PATS: Personality-Aware Teaching Strategies with Large Language Model Tutors [66.56586559631516]
大型言語モデル (LLM) は教育教師としての可能性を秘めている。
しかし、異なる学習戦略は、異なる学生の個性に利益をもたらす。
それにもかかわらず、現在のLLM教育システムは生徒の性格特性を考慮に入れていない。
論文 参考訳(メタデータ) (2026-01-13T10:17:26Z) - Can Large Language Models Match Tutoring System Adaptivity? A Benchmarking Study [0.0]
大規模言語モデル(LLM)は動的命令補助として約束を守る。
しかし、LLMが知的チューリングシステム(ITS)の適応性を再現できるかどうかは不明である。
論文 参考訳(メタデータ) (2025-04-07T23:57:32Z) - Iterative Teacher-Aware Learning [136.05341445369265]
人間の教育において、教師と学生はコミュニケーション効率を最大化するために適応的に交流することができる。
本稿では,教師の協調意図を可能性関数に組み込むことができる,勾配最適化に基づく教師認識学習者を提案する。
論文 参考訳(メタデータ) (2021-10-01T00:27:47Z) - Self-Training with Differentiable Teacher [80.62757989797095]
自己学習は、様々な半教師付きおよび弱教師付き学習タスクで大きな成功を収める。
この手法は、教師が擬似ラベルを生成し、生徒が予測を行う教師学生の枠組みとして解釈できる。
そこで我々は,教師学生をStackelbergゲームとして扱う,差別化可能な自己学習法を提案する。
論文 参考訳(メタデータ) (2021-09-15T02:06:13Z) - Learning by Teaching, with Application to Neural Architecture Search [10.426533624387305]
学習による学習(LBT)と呼ばれる新しいMLフレームワークを提案する。
lbtでは、教師モデルが生徒モデルにうまく学ぶように教えることで自己改善する。
バリデーションデータセットで生徒がどのように振る舞うかに基づいて、教師はモデルを再学習し、生徒が優れたバリデーション性能に達するまで再指導する。
論文 参考訳(メタデータ) (2021-03-11T23:50:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。