論文の概要: NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research
- arxiv url: http://arxiv.org/abs/2606.26671v1
- Date: Thu, 25 Jun 2026 07:03:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-26 18:46:32.189893
- Title: NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research
- Title(参考訳): NebulaExp-8B:フルスケールアブレーション研究による実験的な後試験パイプライン
- Abstract要約: トレーニング後のアライメントは、大きな言語モデルの能力に従って、推論と人間の好みを決定する。
この研究は、Qwen3-8Bベース上に構築された完全に透明でアブレーション駆動のポストトレーニングパイプラインであるNebulaExpを提示する。
- 参考スコア(独自算出の注目度): 5.287668610154937
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training alignment determines the reasoning and human preference following capabilities of large language models, yet most existing works withhold detailed data construction, filtering rules and training recipes, which hinders community reproducibility and lightweight model optimization. This work presents NebulaExp, a fully transparent, ablation-driven post-training pipeline built on Qwen3-8B-base, covering two orthogonal model branches: general instruct model and complex reasoning-specialized model. We curate a raw corpus of 3.84M multi-source SFT samples and a 200K verifiable RL candidate pool, and design an end-to-end data processing stack including response distillation, multi-dimensional cross-verification filtering, fine-grained difficulty grading, task classification and diversity-aware sampling. For the Instruct branch, our three-stage optimized supervised fine-tuning approach NebulaExp-Ins-SFT improves the average benchmark score from the 55.01 baseline of Qwen3-8B-nothink to 60.99. GRPO reinforcement learning then further elevates the average score to 61.85. For the Reasoning branch, medium-difficulty GRPO RL improves average reasoning score from 73.88 to 75.17. To address RL's dependency on task verifiers, we systematically investigate single-teacher and multi-teacher OPD (MOPD): utilizing merely 4K instruction-following samples and outperforms RL baseline by 3.26 points on IFEval with +4.43 average overall gain; MOPD fuses four domain-specialist teachers with merely 10K samples, lifting average performance by 4.18 over the base model. This report provides a fully reproducible empirical post-training recipe for 8B-scale LLMs, and comprehensively dissects the capability trade-offs among instruction adherence, mathematical reasoning, code generation and general knowledge.
- Abstract(参考訳): トレーニング後のアライメントは、大規模な言語モデルの能力に続く推論と人間の嗜好を決定するが、既存のほとんどの研究は、詳細なデータ構築、フィルタリングルール、トレーニングレシピを保ち、コミュニティの再現性と軽量モデル最適化を妨げる。
この研究は、Qwen3-8Bベース上に構築された完全に透明でアブレーション駆動のポストトレーニングパイプラインであるNebulaExpを紹介し、一般的なインストラクションモデルと複雑な推論特化モデルという2つの直交モデルブランチをカバーしている。
我々は、3.84Mの多ソースSFTサンプルと200Kの検証可能なRL候補プールの生コーパスをキュレートし、応答蒸留、多次元相互検証フィルタリング、きめ細かい難易度評価、タスク分類、多様性認識サンプリングを含むエンドツーエンドのデータ処理スタックを設計する。
Instructブランチでは、3段階最適化された微調整アプローチであるNebulaExp-Ins-SFTが平均ベンチマークスコアをQwen3-8B-nothinkの55.01ベースラインから60.99に改善します。
GRPO強化学習は平均スコアを61.85に引き上げる。
推論ブランチでは、中分散GRPO RLは平均推論スコアを73.88から75.17に改善する。
タスク検証器へのRLの依存に対処するため、単教師と複数教師のPD(MOPD)を体系的に調査し、単に4Kの指示追従サンプルを用いてRLベースラインを+4.43の平均的なゲインで3.26ポイント向上させ、MOPDは10Kサンプルだけでドメイン専門教師4人を融合させ、ベースモデル上で平均性能を4.18ポイント向上させる。
本報告では,8BスケールLLMの完全再現可能な実験後学習レシピを提供し,命令順守,数学的推論,コード生成,一般知識のトレードオフを包括的に識別する。
関連論文リスト
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD [91.71050339479261]
本稿では,Ascend NPU SuperPODにおけるエンドツーエンド最適化手法を提案する。
モデルレベルの並列性、計算通信オーケストレーション、低レベルのカーネル実行にまたがる階層的最適化フレームワークを開発した。
その結果、34.22%のモデルFLOP(Model FLOP)利用が達成され、オープンソースのベースラインレシピよりも2.93倍改善された。
論文 参考訳(メタデータ) (2026-07-22T13:49:17Z) - fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum [11.537163059885687]
FG-ExPOは,Frontier-Guided Exploration-Prioritized Policy Optimizationの略である。
精度制御KLスケーリング(AKL)は、バッチ平均精度のスムーズな非線形関数により、KLのペナルティ強度を調整する。
我々は6つの主要な数学的推論ベンチマークでDeepSeek-R1-Distill-Qwen-1.5BとQwen3-8B-Baseの評価を行った。
論文 参考訳(メタデータ) (2026-05-12T01:48:48Z) - expo: Exploration-prioritized policy optimization via adaptive kl regulation and gaussian curriculum sampling [11.537163059885687]
2つの軽量プラグインモジュールを用いたExploration-Prioritized Policy Optimization (EXPO)を提案する。
我々は6つの数学的推論ベンチマークでDeepSeek-R1-Distill-Qwen-1.5BとQwen3-8B-Baseの実験を行った。
AIME 2025 pass@32では13.34で、63.33パーセントから76.67パーセントに上昇し、8Bモデルでは平均2.66でパス@32が改善されている。
論文 参考訳(メタデータ) (2026-05-11T03:19:04Z) - Scaling Trends for Multi-Hop Contextual Reasoning in Mid-Scale Language Models [0.0]
大規模言語モデルにおけるマルチホップ文脈推論の制御に関する研究について述べる。
マルチエージェントシステムは逆パターンを示し、ルールベースのメソッドが失敗する推論タスクを最大80%達成する。
論文 参考訳(メタデータ) (2026-01-06T20:18:55Z) - DiffusionNFT: Online Diffusion Reinforcement with Forward Process [99.94852379720153]
Diffusion Negative-aware FineTuning (DiffusionNFT) は、フローマッチングを通じて前方プロセス上で直接拡散モデルを最適化する新しいオンラインRLパラダイムである。
DiffusionNFTは、CFGフリーのFlowGRPOよりも25倍効率が高い。
論文 参考訳(メタデータ) (2025-09-19T16:09:33Z) - Revolutionizing Reinforcement Learning Framework for Diffusion Large Language Models [49.911784762244814]
TraceRLは拡散言語モデル(DLM)のための軌道対応強化学習フレームワークである
我々は最先端の拡散言語モデル、すなわち TraDo を導出する。
TraDo-8B-InstructはQwen2.5-7B-Instructで6.1%、Llama3.1-8B-Instructで51.3%の精度向上を実現している。
論文 参考訳(メタデータ) (2025-09-08T17:58:06Z) - Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code [76.80306464249217]
本稿では,LLMにより良い理性を教えることを目的としたTeaRを提案する。
TeaRは、注意深いデータキュレーションと強化学習を活用して、コード関連のタスクを通じて最適な推論パスを発見するモデルをガイドする。
我々は、2つのベースモデルと3つの長いCoT蒸留モデルを用いて広範な実験を行い、モデルのサイズは15億から32億のパラメータから、Math、Knowledge、Code、Logical Reasoningにまたがる17のベンチマークにまたがる。
論文 参考訳(メタデータ) (2025-07-10T07:34:05Z) - Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs [51.21041884010009]
Ring-liteは、強化学習(RL)により最適化されたMixture-of-Experts(MoE)ベースの大規模言語モデルである
我々のアプローチは、挑戦的なベンチマーク上でのSOTA(State-of-the-art)の小規模推論モデルの性能と一致する。
論文 参考訳(メタデータ) (2025-06-17T17:12:34Z) - Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback [59.078756231841574]
Critique-GRPOは、自然言語と数値フィードバックを統合して効果的なポリシー最適化を行うオンラインRLフレームワークである。
批判-GRPOは、教師付き学習とRLに基づく微調整法を8つの難解な数学、STEM、一般的な推論タスクで一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-06-03T17:39:02Z) - R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning [23.795932850992816]
R1-Code-Interpreterは,マルチターン制御微調整(SFT)と強化学習(RL)によって訓練されたテキストのみの大規模言語モデル(LLM)の拡張である。
144種類の多種多様な推論・計画タスクにまたがる汎用コードインタープリタのトレーニングは,タスクの不均一性や有効サンプルの不足による重大な課題を呈している。
最終モデルであるR1-CI-14Bは、37のテストタスクの平均精度を44.1%から72.4%に改善し、テキストのみのGPT-4o (58.6%) と GPT-4o with Code Interpreter (70.9%) を上回りました。
論文 参考訳(メタデータ) (2025-05-27T18:47:33Z) - From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning [31.95005389919542]
データスケールとモデルサイズは、大規模言語モデルの性能向上に有効であることが証明されている。
本稿では,教師付きファインチューニングパラダイムであるAggregation Fine-Tuning(AFT)を紹介する。
ベンチマークデータセットの実証評価では、AFT訓練されたモデルは標準のSFTよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-01-21T04:11:59Z) - Advancing LLM Reasoning Generalists with Preference Trees [119.57169648859707]
推論に最適化された大規模言語モデル(LLM)のスイートであるEulusを紹介する。
Eurusモデルは、様々なベンチマークでオープンソースのモデルの間で最先端の結果を得る。
論文 参考訳(メタデータ) (2024-04-02T16:25:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。