論文の概要: Anticipating the Consequences of Curriculum Decisions with Large Language Models
- arxiv url: http://arxiv.org/abs/2610.04604v1
- Date: Sat, 03 Oct 2026 15:45:17 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:31:40.97928
- Title: Anticipating the Consequences of Curriculum Decisions with Large Language Models
- Title(参考訳): 大規模言語モデルによるカリキュラム決定結果の予測
- Abstract要約: 我々は、逐次的な意思決定問題として、自動カリキュラム学習を解析する。
本研究では,Large Language Models (LLMs) が,カリキュラム決定の結果をよりよく予測するために,学習問題に関する豊富な情報を活用できるかどうかを検討する。
- 参考スコア(独自算出の注目度): 12.686437088494413
- License:
- Abstract: Automatic curriculum learning can improve the effectiveness of reinforcement learning by selecting the training experiences presented to the agent over time. Predicting the consequences of such decisions can, however, be difficult. We analyze automatic curriculum learning as a sequential decision-making problem, highlighting a gap between the quantities that determine the value of curriculum decisions and the information captured by local learning signals commonly used to guide them. We then investigate whether Large Language Models (LLMs) can exploit richer information about the learning problem to better anticipate the consequences of curriculum decisions. We introduce a method that combines online learning-progress estimates with LLM-informed estimates of (i) the potential downstream benefits of learning on each task and (ii) whether direct training on a task is currently likely to produce progress. We evaluate the approach on a custom benchmark of 256 textual goals in Craftax under different curriculum objectives. We observe the strongest gains when optimizing for individual target tasks. When optimizing across the full task set, the benefits vary across learners with different mechanisms for cross-task transfer, ranging from modest improvements in learning speed to larger gains that persist through the end of training.
- Abstract(参考訳): 自動カリキュラム学習は、時間とともにエージェントに提示されたトレーニング経験を選択することにより、強化学習の有効性を向上させることができる。
しかし、そのような決定の結果を予測することは困難である。
自動カリキュラム学習を逐次意思決定問題として分析し、カリキュラム決定の価値を決定する量と、それらを導くのによく使用されるローカル学習信号によって取得される情報とのギャップを浮き彫りにする。
次に,Large Language Models (LLMs) が学習問題の豊富な情報を活用して,カリキュラム決定の結果をよりよく予測できるかどうかを検討する。
オンライン学習過程推定とLLMインフォームド推定を組み合わせた手法を提案する。
一 各課題における学習の下流利益の可能性及び
(二)現在、タスクの直接訓練が進歩する可能性が高いかどうか。
我々は、異なるカリキュラムの目的の下でCraftaxの256のテキスト目標のカスタムベンチマークに対するアプローチを評価した。
個々の目標タスクを最適化する際の最強の利得を観察する。
タスクセット全体を最適化する場合は、学習速度の緩やかな改善から、トレーニングの終了まで続く大きなゲインまで、クロスタスク転送のメカニズムが異なる学習者によってメリットが異なります。
関連論文リスト
- Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals [0.0]
教師なし事前学習は、強化学習エージェントに事前知識を付与し、下流タスクでの学習を加速することができる。
本稿では,文脈内学習者と対向目標生成戦略を組み合わせた教師なしメタ学習手法ULEEを提案する。
論文 参考訳(メタデータ) (2026-01-27T17:10:29Z) - Self-Evolving Curriculum for LLM Reasoning [96.10277986436172]
自己進化カリキュラム(Self-Evolving Curriculum, SEC)は、RLファインチューニングプロセスと並行してカリキュラムポリシーを学習する自動カリキュラム学習手法である。
実験により、SECはモデルの推論能力を大幅に改善し、より困難で配布外のテスト問題へのより良い一般化を可能にした。
論文 参考訳(メタデータ) (2025-05-20T23:17:15Z) - Enhancing LLM Knowledge Learning through Generalization [73.16975077770765]
我々は,LLMが様々な言い換えの文脈に与えられた同じ事実的知識トークンを継続的に予測する能力は,質問応答によってその知識を抽出する能力と正の相関性を示す。
そこで本稿では,LLMの知識獲得能力を高めるための2つの戦略を提案する。
論文 参考訳(メタデータ) (2025-03-05T17:56:20Z) - Diverse Distributions of Self-Supervised Tasks for Meta-Learning in NLP [39.457091182683406]
非ラベルテキストから自動的に提案される自己教師型タスクを考慮し,メタラーニングのためのタスク分布の提供を目指す。
分析の結果,これらすべての要因がタスク分布を有意に変化させることが示され,メタ学習モデルの下流における数ショット精度の大幅な改善がもたらされた。
論文 参考訳(メタデータ) (2021-11-02T01:50:09Z) - Targeted Active Learning for Bayesian Decision-Making [15.491942513739676]
サンプルを逐次取得する際には,学習と意思決定を分離することが準最適である。
本稿では,ダウン・ザ・ライン決定問題を考慮に入れた,新たなアクティブな学習戦略を提案する。
具体的には、最適決定の後続分布における期待情報ゲインを最大化する、新しい能動的学習基準を導入する。
論文 参考訳(メタデータ) (2021-06-08T09:05:43Z) - Automatic Curriculum Learning through Value Disagreement [95.19299356298876]
新しい未解決タスクを継続的に解決することが、多様な行動を学ぶための鍵です。
エージェントが複数の目標を達成する必要があるマルチタスク領域では、トレーニング目標の選択はサンプル効率に大きな影響を与える可能性がある。
そこで我々は,エージェントが解決すべき目標のための自動カリキュラムを作成することを提案する。
提案手法は,13のマルチゴールロボットタスクと5つのナビゲーションタスクにまたがって評価し,現在の最先端手法よりも高い性能を示す。
論文 参考訳(メタデータ) (2020-06-17T03:58:25Z) - Accelerating Reinforcement Learning for Reaching using Continuous
Curriculum Learning [6.703429330486276]
我々は、強化学習(RL)訓練の加速と、多目標到達タスクの性能向上に重点を置いている。
具体的には、トレーニングプロセス中に要件を徐々に調整する精度ベースの継続的カリキュラム学習(PCCL)手法を提案する。
このアプローチは、シミュレーションと実世界のマルチゴールリーチ実験の両方において、ユニバーサルロボット5eを用いてテストされる。
論文 参考訳(メタデータ) (2020-02-07T10:08:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。