論文の概要: StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?
- arxiv url: http://arxiv.org/abs/2609.00787v1
- Date: Tue, 01 Sep 2026 06:33:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.417834
- Title: StudyBench: Can Self-Evolution Squeeze Textbooks for Olympiad Capability?
- Title(参考訳): StudyBench: 自己進化型スクイーズ教科書はオリンピックの能力向上に有効か?
- Authors: Yinghao Chen, Zixi Chen, Bingxiang He, Ziqing Qiao, Huan-ang Gao, Yinuo Xu, Yuxin Zuo, Zeyuan Liu, Yuhao Zhan, Chaojun Xiao,
- Abstract要約: 理想的な自己進化法は, 伝達可能な問題解決能力のために, 原材料から自律的に学習する, 同じ特性を共有すべきである。
本研究では,自己進化法が学習教材をいかに効率よく能力に変換するかを測定するベンチマークであるStudioBenchを紹介する。
- 参考スコア(独自算出の注目度): 16.693252821550395
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Humans need to study only a handful of well-written textbooks to master a discipline and attempt its hardest problems. We argue that an ideal self-evolution method should share the same property, that is autonomously learning from raw training material for transferable problem-solving capability. However, we still lack a direct measurement for it. We introduce StudyBench, a controlled physics benchmark that directly measures how efficiently a self-evolution method converts training material into capability. We organise the test set into an Application Set, consisting of difficult textbook problems and evaluating absorption ability, and a Transfer Set, consisting of olympiad-level problems and evaluating transfer ability. Benchmarking representative self-evolution methods across three base models, we find that improvements on the Application Set rarely translate to the harder Transfer Set. A guidance ablation exposes a Guidance Gap: even the strongest method closes only a small fraction of what the same material unlocks when supplied as in-context guidance. Besides, every method hits a Compute Plateau, saturating well before exhausting its compute budget. The remaining gap is therefore a method problem rather than a data or compute problem. By offering a clean and controlled benchmark, StudyBench turns self-evolution progress from an open-ended pursuit into a measurable target for future research. Our code is released at https://github.com/thunlp/StudyBench.
- Abstract(参考訳): 人間は、規律を習得し、最も難しい問題を試すために、わずかによく書かれた教科書を勉強する必要がある。
我々は,移動可能な問題解決能力を実現するために,原材料から自律的に学習する理想的な自己進化手法が,同じ特性を共有するべきであると論じる。
しかし、まだ直接測定することができない。
本研究では,自己進化法が学習材料をいかに効率よく能力に変換するかを直接測定する制御物理ベンチマークであるStudioBenchを紹介する。
我々は,テストセットを,難解な教科書問題と吸収能力評価からなるアプリケーションセットと,オリンピックレベルの問題と伝達能力評価からなるトランスファーセットに編成する。
3つのベースモデルにまたがって代表的な自己進化手法をベンチマークすると、アプリケーションセットの改善が難しい転送セットに変換されることは滅多にありません。
ガイダンスアブレーションは、ガイダンスギャップを露出する:最強の方法でさえ、コンテキスト内ガイダンスとして供給されると、同じ素材がアンロックする部分のごく一部を閉じる。
さらに、すべてのメソッドがCompute Plateauにヒットし、計算予算を浪費する前に飽和する。
残りのギャップは、データや計算の問題よりもメソッドの問題である。
クリーンでコントロールされたベンチマークを提供することで、StudioBenchは、オープンエンドの追跡からの自己進化の進歩を、将来の研究のための測定可能なターゲットに変える。
私たちのコードはhttps://github.com/thunlp/StudyBench.comでリリースされています。
関連論文リスト
- On the Generalization Gap in Self-Evolving Language Model Reasoning [16.207017999660653]
統合オフライン自己進化フレームワークにおける4つの代表的な戦略を解析する。
自己進化はベースモデルよりも一貫して改善されるが、過剰なトレーニング計算の後に高原が投資される。
Gemma 12Bはオラクルの教師付きトレーニングにほぼ一致するので,大規模モデルによるマルチターン批評家のリビジョンは,強力な自己進化性能に達することが判明した。
論文 参考訳(メタデータ) (2026-05-31T07:43:19Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Scaling Self-Play with Self-Guidance [62.13619253976748]
Self-Guided Self-Play (SGS)は、Conjecturerをジェネラシーから遠ざけるセルフプレイアルゴリズムである。
SGSは80ラウンド未満のセルフプレイで、最強のベースラインの解決率を上回っています。
論文 参考訳(メタデータ) (2026-04-22T05:50:23Z) - SE-Bench: Benchmarking Self-Evolution with Knowledge Internalization [52.635237306338574]
我々は,NumPyライブラリとそのAPIドキュメントをランダムな識別子を持つ擬似ノーベルパッケージに難読化する診断環境であるSE-Benchを紹介する。
エージェントはこのパッケージを内部化するように訓練され、ドキュメントにアクセスせずに単純なコーディングタスクで評価される。
本研究は,(1)参考資料を用いた学習が保持を阻害するオープンブックパラドックス,(2)知識圧縮を重みに強制する「クローズドブックトレーニング」,(2)標準RLがPPOクリッピングと負の勾配によって新たな知識を完全に内部化するのに失敗するRLギャップ,(3)内部化,証明モデルのためのセルフプレイの実現可能性,の3つの知見を明らかにする。
論文 参考訳(メタデータ) (2026-02-04T17:58:32Z) - Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability [25.507069397981194]
本稿では,2段階のメタRLを実現することで,事前学習したモデルの潜在能力を高めて,学習を疎開し,二段階の報奨を得られることを示す。
以上の結果から, 有用なステップ石を生成できる能力は, 実際に難解な問題を解く能力を必要としないことが示唆された。
論文 参考訳(メタデータ) (2026-01-26T18:46:56Z) - Can Large Reasoning Models Self-Train? [51.0277533541394]
多数決投票を簡単な自己フィードバック機構として利用し、強化学習において自己学習が持続できるかどうかを検討する。
この基本的なアプローチは、モデルの推論性能だけでなく、次のRLイテレーションでより良い品質フィードバックを生成する能力も改善します。
しかし、我々の分析では、このような自己学習パラダイムの限界も明らかにしています - 自己回帰の長いRLは、報酬のハッキングにつながるため、突然、そして完全なパフォーマンスが崩壊します。
論文 参考訳(メタデータ) (2025-05-27T17:16:00Z) - Entropy-Based Adaptive Weighting for Self-Training [15.089334734753677]
自己学習のためのエントロピーに基づく適応重み付け(EAST)を提案する。
EASTは、自己学習中に不確実なデータを優先順位付けするために設計された適応的な重み付け戦略である。
我々はGSM8KおよびMATHベンチマークに対するアプローチを評価する。
論文 参考訳(メタデータ) (2025-03-31T10:04:35Z) - Test-Time Adaptation for Combating Missing Modalities in Egocentric Videos [92.38662956154256]
現実のアプリケーションは、プライバシの懸念、効率性の必要性、ハードウェアの問題により、不完全なモダリティを伴う問題に直面することが多い。
再トレーニングを必要とせずに,テスト時にこの問題に対処する新しい手法を提案する。
MiDlは、欠落したモダリティをテスト時にのみ扱う、自己管理型のオンラインソリューションとしては初めてのものだ。
論文 参考訳(メタデータ) (2024-04-23T16:01:33Z) - Partial Is Better Than All: Revisiting Fine-tuning Strategy for Few-shot
Learning [76.98364915566292]
一般的なプラクティスは、まずベースセット上でモデルをトレーニングし、その後、微調整によって新しいクラスに移行することである。
本稿では,基本モデル内の特定の層を凍結あるいは微調整することにより,部分的知識の伝達を提案する。
提案手法の有効性を実証するために, CUB と mini-ImageNet の広範な実験を行った。
論文 参考訳(メタデータ) (2021-02-08T03:27:05Z) - Episodic Self-Imitation Learning with Hindsight [7.743320290728377]
エピソード自己像学習は、軌道選択モジュールと適応的損失関数を備えた新しい自己像アルゴリズムである。
更新の各エピソードから不正なサンプルをフィルタリングするために選択モジュールが導入された。
エピソード自己イメージ学習は、連続的な行動空間を持つ実世界の問題に適用できる可能性がある。
論文 参考訳(メタデータ) (2020-11-26T20:36:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。