論文の概要: The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation
- arxiv url: http://arxiv.org/abs/2607.09709v1
- Date: Tue, 23 Jun 2026 13:47:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-19 21:54:20.380983
- Title: The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation
- Title(参考訳): The Verifier is the Curriculum: Execution-Gated Self-Distillation for Cross-Family Game Generation
- Abstract要約: 学習した判断に対してコードジェネレータをトレーニングした後、アーティファクトを改善することなくスコアを上げるプロキシ機能を最適化することができる。
逆の信号:決定論的、判断自由、ゲーム不可能なフィルタについて検討する。
- 参考スコア(独自算出の注目度): 5.864346468963738
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training a code generator against a learned judge can optimize proxy features that raise the score without improving the artifact. We study the opposite signal: a deterministic, judge-free, ungameable filter -- whether a generated project launches cleanly under a headless engine (strict-launch). Under this gate, rejection-sampling self-distillation compounds out-of-family generalization. On GameCraft-Bench (mapping a natural-language brief to a complete Godot project), a 14B model (Qwen3-14B+LoRA) distilled under strict-launch raises clean generation on four unseen game families from 8.8% to 42.2% per-candidate and best-of-K coverage from 18/25 to 25/25 (the gold ceiling) over three rounds, each a significant gain (p=0.0019, p<1e-4, p<1e-4). The gain is not from merely adding data: an exactly-matched gold-duplication control regresses below the base model (5.6% vs. 8.8%, p=0.019), while a count-matched decomposition splits the round-1-to-2 jump into comparable quality (+8.8pp) and quantity (+8.5pp) channels. Most directly, rerunning the loop with only the filter swapped -- the lenient BUILD check, which passes 99.9% of generations, in place of the launch gate -- erases the gain entirely (back to base, p=1e-3 vs. the launch-gated round), isolating verifier precision rather than the optimizer. A second ungameable signal, headless execution grounding, rises monotonically across rounds and yields far more grounded candidates than gold-duplication at a matched budget (16 vs. 5), confirming the gains are functional, not launch-but-empty. Game generation is a verifiable testbed for one lesson: the verifier is the curriculum -- what it certifies is what the model learns.
- Abstract(参考訳): 学習した判断に対してコードジェネレータをトレーニングした後、アーティファクトを改善することなくスコアを上げるプロキシ機能を最適化することができる。
決定論的で、判断不能で、ゲーム不可能なフィルタ - 生成されたプロジェクトが、ヘッドレスエンジン(制限付き発射)の下でクリーンに起動するかどうか。
この門の下では、拒絶サンプリング型自己蒸留化合物が家族外一般化される。
GameCraft-Bench(英語版)では14Bモデル(Qwen3-14B+LoRA)が厳格に発売され、18/25から25/25(金の天井)の3ラウンドで4つの未確認ゲームファミリを8.8%から42.2%にクリーンに生成する(p=0.0019、p<1e-4、p<1e-4、p<1e-4)。
正確に整合した金の複製制御がベースモデルより下にある(5.6%対8.8%、p=0.019)のに対し、カウント整合分解はラウンド-1-to-2のジャンプを同等の品質(+8.8pp)と量(+8.5pp)のチャネルに分割する。
最も直接的に、ループを交換されたフィルタのみで再実行する -- 発射ゲートの代わりに、99.9%の世代を経過する、寛大なBUILDチェック -- は、ゲインを完全に消し去り(ベース、p=1e-3、発射ゲートラウンド)、オプティマイザよりも検証精度を分離する。
第2のゲーム不能信号(ヘッドレス実行基底)は、ラウンド全体で単調に上昇し、一致した予算(16対5)で金の複製よりもはるかに基礎的な候補を獲得し、ゲインが機能し、発射対空ではないことを確認します。
ゲーム生成は1つのレッスンのための検証可能なテストベッドである。検証者はカリキュラムである。
関連論文リスト
- Harness-agnostic detection and immunization of reward hacking in self-evolving language models [13.567977595150772]
HackProbeは、2つのブラックボックスフックを通して任意の自己進化ループにアタッチするモニターだ。
シークレットで分散修正された比較コアを保持しており、フリーズされたディストリビューションは、その機能プロキシを世代間で比較する。
インジェクトされた4つのハッキングチャンネルを持つ制御されたプロンプトレベルのホストでは、HackProbeは0.763 AUROCに達し、最強のベースラインは0.663である。
論文 参考訳(メタデータ) (2026-09-04T02:57:34Z) - On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability [57.03393882933515]
Qwen3.8-Flash-Nextは125Bパラメータ、トークンあたり6Bアクティベートされ、加速器から保持されるn-gram埋め込みテーブルの51Bパラメータを持つスパースミックス・オブ・エキスパートモデルである。
トレーニング前の14のベンチマークでは、このモデルは前モデルの397B-A17Bを8点、残りを少なくとも2.6ポイント、アクティベートされたパラメータが1/3、トレーニングトークンが1/3、トレーニング用FLOPが1/9であった。
論文 参考訳(メタデータ) (2026-08-31T06:35:07Z) - PROOF-Gen: From Optimized Data to Better Distillation [6.158612515104146]
ツール呼び出しエージェントを駆動するポストトレーニングパイプラインは、毎日または毎週のケイデンスでこのステージを再実行し、フロンティアと教師の費用を各サイクルに支払う。
2ベンチでは、教員試験の57%が失敗し、その3分の2がほぼミスである。
本稿では,これらの故障からゴールデントラジェクトリを回復するPROOF-Genを,シナリオごとのプロンプト最適化により導入する。
論文 参考訳(メタデータ) (2026-08-24T23:33:56Z) - LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts [0.0]
数学的推論のための検証可能な報酬(RLVR)からの強化学習は、構造的な盲点に悩まされる。
損失勾配を回復するサンプリング時間機構であるLSPO(LoRA Scaffolded Policy Optimization)を導入する。
DeepSeek-R1-Distill-Qwen-1.5Bを用いたDeepMath-103Kでは、腕1本あたりのn=5対の種子に対してLSPOの5シードの平均値が一致し、全16細胞でDAPOベースラインを打ち負かす。
論文 参考訳(メタデータ) (2026-07-30T07:21:34Z) - Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution [6.908637308550535]
SEVAは、エビデンスアライメント、ステップバイステップの推論チェーン、キャリブレーションされた信頼度、6カテゴリのエラー診断を発行する構造化検証エージェントである。
ClearFacts では、SEVA-3B は GPT-4o-mini (69.0 vs. 69.8 F1) と一致し、よりリッチで監査可能な出力を生成する。
論文 参考訳(メタデータ) (2026-06-29T02:37:13Z) - DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models [6.628401122676601]
ルールベースの論理解法は、ベンチマークの全インスタンスを50マイクロ秒未満で100%精度で解決する。
データセットと生成パイプラインであるDeFAb(Defeasible Abduction Benchmark)を紹介します。
論文 参考訳(メタデータ) (2026-06-17T00:13:40Z) - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short [51.667769734342635]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
本研究では,非多変量報酬群を判定システムにルーティングする適応学習フレームワークであるReasoning Arenaを提案する。
我々は、Reasoning Arenaが、競争数学やコーディングベンチマークにおいて、RLVRベースラインを平均で7.6%上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-08T11:57:17Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning [1.3011345529764784]
モデル推論は、社内ですでに約束している答えを合理化します。
ProFILは、コミット後の劇場を**11--100%*で減らし、忠実な違反を引き起こす(例えば、独立のクロード3.7ソンネット判事の下でLiveCodeBenchで+24pp)。
ProFILはまた、一致した長さのペナルティGRPOベースラインを破り、チェイン圧縮よりもセマンティックなコミットメント検出としてゲインを分離する。
論文 参考訳(メタデータ) (2026-05-12T03:30:23Z) - Gemma 4, Phi-4, and Qwen3: Accuracy-Efficiency Tradeoffs in Dense and MoE Reasoning Language Models [6.396911723204044]
Mixture-of-experts (MoE)言語モデルは、高密度モデルよりも優れた品質と効率のトレードオフをもたらすことがしばしば期待されている。
そこで本研究では,高密度および高密度なMoE設計にまたがる7つの推論指向命令調整モデルのベンチマークを示す。
論文 参考訳(メタデータ) (2026-04-08T12:50:52Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。