論文の概要: ForgeTrain: Forging Production-Grade Training Frameworks via Harness-Driven AI Development
- arxiv url: http://arxiv.org/abs/2609.13645v1
- Date: Sat, 12 Sep 2026 01:47:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 07:15:05.431646
- Title: ForgeTrain: Forging Production-Grade Training Frameworks via Harness-Driven AI Development
- Title(参考訳): ForgeTrain: ハーネス駆動AI開発によるプロダクショングレードトレーニングフレームワークのフォーク
- Abstract要約: 大型モデルのトレーニングは依然としてMegatron-LMのような汎用フレームワークに依存している。
各シナリオに対してスクラッチから専用の実装を構築する。
フレームワークをトレーニングするためのこのパラダイムを、信頼できるフレームワークを黄金の参照として保持するForgeTrainとしてインスタンス化する。
- 参考スコア(独自算出の注目度): 31.93593134525649
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Training large models still relies on general-purpose frameworks such as Megatron-LM, whose generality tax constrains scenario-specific optimization and adds runtime overhead through accumulated abstraction. AI code generation reduces the cost of building a framework, and makes it affordable to forge one per scenario. We propose Forge Engineering: building a dedicated implementation from scratch for each scenario and iteratively optimizing it toward peak performance under correctness and usability constraints. Dedicated implementations inherit no abstraction boundaries, so they can integrate optimizations across the stack and reach a higher performance ceiling. We instantiate this paradigm for training frameworks as ForgeTrain, which holds a trusted framework as a golden reference and relaxes equivalence monotonically from Bit-for-Bit to Surpass. Experiments across multiple model--hardware configurations show that ForgeTrain consistently produces correct training engines and improves MFU over established training frameworks by 4.7--33.2%. To our knowledge this is the first production-grade training framework forged end-to-end by AI to match or surpass its human reference.
- Abstract(参考訳): 大規模モデルのトレーニングはまだMegatron-LMのような汎用フレームワークに依存している。
AIコード生成は、フレームワーク構築のコストを低減し、シナリオ毎にフレームワークをフォークするコストを安くする。
各シナリオに対してスクラッチから専用の実装を構築し、正確性とユーザビリティの制約の下でピークパフォーマンスに向けて反復的に最適化する。
デリゲートされた実装は抽象化境界を継承しないため、スタック全体にわたって最適化を統合することができ、より高いパフォーマンスの天井に達することができる。
我々は、このパラダイムを、Bit-for-BitからSurpassへの同値性を単調に緩和する、信頼されたフレームワークを黄金の参照として保持するForgeTrainとして、トレーニングフレームワーク用にインスタンス化する。
複数のモデル-ハードウェア構成の実験により、ForgeTrainは一貫して正しいトレーニングエンジンを生産し、既存のトレーニングフレームワークよりも4.7-33.2%MFUを改善した。
われわれの知る限り、これはAIによるエンドツーエンドの製品レベルのトレーニングフレームワークとしては初めてのもので、人間の参照と一致するか、超えるかのどちらかだ。
関連論文リスト
- ClawGym II: Exploring Black-Box RL on Agent Harness [82.92963070856416]
エージェントハーネスは、エージェントと環境との相互作用を調整することで、長期タスクの性能を大幅に改善した。
複雑なハーネスによる汎用エージェントの安定かつスケーラブルな最適化のための統合ブラックボックスRLフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-17T16:53:03Z) - Self-Evolving Embodied Agents via Skill-Harness Evolution [53.307052568223945]
身体的エージェントは、ファンデーションモデルを中心としたシステムとして、ますます構築されている。
教師付き微調整と強化学習はエージェントを新しい環境に適応させることができるが、追加のデータ、報酬、トレーニングの実行が必要である。
SHAPERは,モデルパラメータの凍結を保ちつつ,列車不要な態様適応のための自己進化型フレームワークである。
論文 参考訳(メタデータ) (2026-08-11T18:55:58Z) - PithTrain: A Compact and Agent-Native MoE Training System [27.857461550954337]
PithTrainは、コンパクトでエージェントネイティブなMoEトレーニングフレームワークです。
ATE-Benchでは,エージェントタスクの効率が向上し,エージェントターンが最大62%,アクティブGPUタイムが64%向上した。
論文 参考訳(メタデータ) (2026-05-29T15:52:58Z) - Rollback-Free Stable Brick Structures Generation [51.856925926010184]
既存のアプローチでは、リジェクションサンプリングとブロック・バイ・ブロックのロールバックを行うために、推論中に外部物理シミュレータに依存している。
本稿では,身体的妥当性をテスト時間補正からトレーニング時間ポリシー最適化にシフトさせる強化学習パラダイムを提案する。
実験結果から,提案手法は予測速度を桁違いに向上させつつ,最先端の生成品質を実現することを示す。
論文 参考訳(メタデータ) (2026-05-07T21:06:44Z) - Grouter: Decoupling Routing from Representation for Accelerated MoE Training [10.767613437794537]
Grouterは、完全に訓練されたMoEモデルから高品質な構造を蒸留し、ターゲットモデルの固定ルータとして機能するプリエンプティブルーティング手法である。
実験により、Grouterはより優れたパフォーマンスと効率を実現し、事前トレーニングデータの利用を4.28倍にし、最大で33.5%のスループット加速を実現している。
論文 参考訳(メタデータ) (2026-02-22T06:09:57Z) - DiRL: An Efficient Post-Training Framework for Diffusion Language Models [54.405206032785706]
Diffusion Language Models (dLLMs) はAuto-Regressive(AR)モデルに代わる有望な代替品として登場した。
既存の手法は、訓練と推論の間の計算の非効率性と客観的なミスマッチに悩まされている。
我々は,FlexAttention-accelerated blockwise trainingとLMDeploy-timized inferenceを密接に統合した,効率的なポストトレーニングフレームワークであるDiRLを紹介した。
論文 参考訳(メタデータ) (2025-12-23T08:33:19Z) - A Multi-Level Framework for Accelerating Training Transformer Models [5.268960238774481]
大規模ディープラーニングモデルの訓練は、コンピューティングパワーに対する前例のない需要をもたらしている。
本稿では,Coalescing, De-Coalescing, Interpolation に基づく,加速度のトレーニングのためのマルチレベルフレームワークを提案する。
提案手法は,BERT/GPT-Baseモデルのトレーニングにおいて約20%,BERT-Largeモデルのトレーニングにおいて最大51.6%のコスト削減を実現する。
論文 参考訳(メタデータ) (2024-04-07T03:04:34Z) - Slapo: A Schedule Language for Progressive Optimization of Large Deep
Learning Model Training [17.556432199389615]
Slapoは、テンソルレベルの演算子の実行をその算術的定義から切り離すスケジュール言語である。
SlapoはNVIDIA V100 GPUを8台搭載した1台のマシンで最大2.92倍のトレーニングスループットを向上できることを示す。
論文 参考訳(メタデータ) (2023-02-16T00:34:53Z) - Adversarial Self-Attention for Language Understanding [89.265747130584]
本稿では,textitAdversarial Self-Attention Mechanism (ASA)を提案する。
ASAはトランスフォーマーの注意を逆向きに再構築し、汚染されたモデル構造からのモデルトレーニングを促進する。
微調整の場合、ASAを動力とするモデルは、一般化とロバスト性の両方を考慮すると、単純モデルよりも常に大きなマージンで勝る。
論文 参考訳(メタデータ) (2022-06-25T09:18:10Z) - DSEE: Dually Sparsity-embedded Efficient Tuning of Pre-trained Language
Models [152.29364079385635]
事前訓練されたモデルが大きくなればなるほど、微調整のプロセスは時間がかかり、計算コストがかかる可能性がある。
本稿では,重み更新と最終モデルの重み付けに先立って,疎度を活用することで,資源・パラメータ効率の微調整を行うフレームワークを提案する。
提案するフレームワークは,Dually Sparsity-Embeded Efficient Tuning (DSEE)と呼ばれ,パラメータ効率のよい微調整とリソース効率の推論という2つの重要な目標を達成することを目的としている。
論文 参考訳(メタデータ) (2021-10-30T03:29:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。