論文の概要: Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation
- arxiv url: http://arxiv.org/abs/2607.08255v1
- Date: Thu, 09 Jul 2026 09:00:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.477022
- Title: Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation
- Title(参考訳): AIのフロンティア教師がプログラミングの学生をイミュレーションを超えて改善するための検証可能なカリキュラムを開発
- Abstract要約: 我々は,4人のフロンティアAI教師が,実行ベースの審査員によって真っ向からランク付けされる,コンペティションThen-Collaborateフレームワークを紹介した。
検証可能な報酬(RLVR)環境を備えた強化学習として、同じ共同カリキュラムを使用することで、学生は改善される。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models increasingly serve as teachers generating training data for smaller students. Prior multi-teacher knowledge distillation methods merge outputs without determining which frontier model teaches best, often relying on an LLM judge biased toward its own outputs. We introduce a compete-then-collaborate framework where four frontier AI teachers (Claude, Codex-GPT, Grok, Gemini) are ranked head-to-head by an execution-based judge (unit tests and stdin-stdout checks) with fairness controls, and then collaborate to build a verifiable curriculum for a student (Qwen2.5-Coder). We report three findings. (1) Under execution verification, all teachers solve standard problems near-perfectly after self-correction (99-100%) due to a saturation effect, but harder competition problems separate them (Gemini 77% > Claude 69% = Codex 69% > Grok 50%); however, the robust student-side results do not depend on teacher ranking. (2) Imitation (SFT) on verified solutions does not improve, and can degrade, an already-competent student at 7B and 32B (e.g., from 76.7% to 72.7% on MBPP-test, and 5.9% to 2.9% on competition problems). (3) Using the same collaborative curriculum as a reinforcement learning with verifiable rewards (RLVR) environment improves the student (from 5.9% to 8.8% peak on competition problems, a +49% relative gain), reversing SFT's direction. The value of AI-teacher collaboration lies not in pooling answers to imitate, but in jointly constructing a verifiable environment where the student learns by doing. We release a reproducible on-prem pipeline (NVIDIA GB10) with framework patches for running GRPO on a bleeding-edge stack.
- Abstract(参考訳): 大規模な言語モデルは、より小規模な学生のためのトレーニングデータを生成する教師としての役割をますます高めている。
従来のマルチ教師の知識蒸留手法は、どのフロンティアモデルが最も良いかを判断することなく、出力をマージする。
我々は,4人のフロンティアAI教師(Claude,Codex-GPT,Grok,Gemini)が,公平性制御を備えた実行ベースの審査員(ユニットテストとスティンドアウトチェック)によって直接ランク付けされ,学生のための検証可能なカリキュラム(Qwen2.5-Coder)の構築に協力する,コンペティション・コラボレーション・フレームワークを紹介した。
我々は3つの発見を報告した。
1) 実施検証では,全教員が飽和効果により自己補正後(99~100%)にほぼ完璧に解決するが,厳しい競争問題(Gemini 77% > Claude 69% = Codex 69% > Grok 50%)が分離される。
2) 検証ソリューションの模倣(SFT)は改善せず、7Bおよび32B(例えば、MBPPテストでは76.7%から72.7%、競争問題では5.9%から2.9%)で既に有能な学生を退学させることができる。
3) 検証可能な報酬(RLVR)環境による強化学習と同様の協調カリキュラムを使用することで,SFTの方向性を逆転させ,学生(競争問題の5.9%から8.8%のピーク,+49%の相対利得)が向上する。
AI-Teacherコラボレーションの価値は、回答をプールして模倣することではなく、学生が実行することによって学習する検証可能な環境を共同で構築することにある。
最先端スタック上でGRPOを実行するためのフレームワークパッチを備えた再現可能なオンプレミスパイプライン(NVIDIA GB10)をリリースする。
関連論文リスト
- Data-free On-policy Distillation [49.537587070291444]
オンライン蒸留(OPD)は、フロンティア・ポストトレーニングパイプラインの標準コンポーネントとなっている。
しかし、そのトレーニングデータが実際にどれだけ貢献するかは、ほとんど検討されていない。
データフリーオン政治蒸留(DF-OPD)の限界に着目する。
DF-OPDは実際のデータと一致し、さらにそのデータを生成する質問は、教師自身のポストトレーニングデータを追跡する。
論文 参考訳(メタデータ) (2026-09-12T23:51:35Z) - Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold [4.090731563364332]
我々は、強化学習ポリシーをマルチベース推論解多様体の局所的なプローブと見なすべきであると主張する。
本稿では,教師が多教師政策の蒸留で構築する拡張型圧縮フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-30T07:05:37Z) - OPOD: On-Policy Omni Distillation [55.440058537827134]
プール化されたマルチモーダルデータ上で単一のモデルをトレーニングすることは、個々のモダリティに特化したモデルにマッチしないことが多い。
本報告では,オムニ蒸留法(Omni Distillation,OPD)について述べる。
OPDは各スケールで最高のスコアを獲得し、70.8、51.7、46.2に達した。
論文 参考訳(メタデータ) (2026-07-23T04:55:04Z) - EduGuard: A Safe RAG-Based LLM Tutor for Programming Education [1.2999518604217852]
ジェネレーティブAI(GenAI)は、プログラミングの説明、デバッグ、代入サポートに学生によってますます利用されている。
本稿では,提案プログラムのための安全な検索強化世代(RAG)学習フレームワークであるEduGuardについて述べる。
EduGuardは、クエリ理解、インストラクターが承認したコース検索、教育戦略選択、ルーリック・アウェア生成、クレームレベルの検証、オーバー信頼制御を統合している。
論文 参考訳(メタデータ) (2026-07-17T08:18:18Z) - Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition [0.0]
We build a Chain-of-Thought training corpus through a dual-agent framework。
このデータセットは、Apple Siliconハードウェア上でLow-Rank Adaptation (LoRA)を使用して、学生モデルを微調整するために使用される。
論文 参考訳(メタデータ) (2026-06-30T02:34:45Z) - AcademiClaw: When Students Set Challenges for AI Agents [69.70303995121154]
AcademiClaw(アカデミクロー)は、大学生の実際の学術的切断から直接引き出された80の複雑な長い水平タスクのベンチマークである。
最高のモデルでさえ、55%のパスレートしか達成できないことを示す。
AcademiClawとそのオープンソースデータとコードが、OpenClawコミュニティにとって有用なリソースになることを願っています。
論文 参考訳(メタデータ) (2026-05-04T14:40:42Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - GATES: Self-Distillation under Privileged Context with Consensus Gating [89.62339954332248]
我々は、監督が信頼できない環境で自己蒸留を研究する。
非対称な文脈で回答する文書に焦点をあてる。
複数の文書ベース推論トレースをサンプリングすることにより、教師のコンセンサスからオンラインでの監督を導出する。
論文 参考訳(メタデータ) (2026-02-24T05:56:20Z) - Conservative Bias in Multi-Teacher Learning: Why Agents Prefer Low-Reward Advisors [0.0]
本稿では,対話型強化学習(IRL)における予期せぬ現象を明らかにする。
異なる報酬構造を持つ教師の選択肢が与えられると、学習エージェントは保守的で低報酬の教師を圧倒的に好んでいる。
論文 参考訳(メタデータ) (2025-12-19T02:38:04Z) - BD at BEA 2025 Shared Task: MPNet Ensembles for Pedagogical Mistake Identification and Localization in AI Tutor Responses [0.7475784495279183]
本稿では,AIを活用したチュータの教育能力評価に関するBEA 2025共有タスクについて紹介する。
我々のシステムは、BERTとXLNetの事前学習の利点を組み合わせたトランスフォーマーベースの言語モデルMPNet上に構築されている。
提案手法は両トラックにおいて, 一致マクロF1スコアが約0.7110, ミステイク同定が約0.5543, 公式テストセットが0.5543であった。
論文 参考訳(メタデータ) (2025-06-02T15:57:49Z) - J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning [54.85131761693927]
意思決定前にLLM審査員に思考を教えるための強化学習フレームワークであるJ1を紹介する。
私たちのコアコントリビューションは、検証不可能で検証可能なプロンプトのすべての判断タスクを、検証可能な報酬を持った統一フォーマットに変換することです。
次に、RLを用いて8B、32B、70Bのスケールで思考判断を訓練し、彼らが最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2025-05-15T14:05:15Z) - Learning to Love Edge Cases in Formative Math Assessment: Using the AMMORE Dataset and Chain-of-Thought Prompting to Improve Grading Accuracy [0.0]
本稿では,Rori による 53,000 個の質問応答対の新たなデータセットである AMMORE を紹介する。
2つの実験により,大規模言語モデル(LLM)を用いて,難解な学生の回答を段階的に評価する。
論文 参考訳(メタデータ) (2024-09-26T14:51:40Z) - Unbiased Teacher for Semi-Supervised Object Detection [50.0087227400306]
SS-OD(Semi-Supervised Object Detection)を再検討し,SS-ODにおける擬似ラベルバイアス問題を特定する。
学生と徐々に進歩する教師を相互に利益ある方法で共同で訓練するシンプルで効果的なアプローチであるUnbiased Teacherを紹介します。
論文 参考訳(メタデータ) (2021-02-18T17:02:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。