論文の概要: Training a Language Model End-to-End in Rust: An Experience Report
- arxiv url: http://arxiv.org/abs/2609.25008v1
- Date: Mon, 27 Jul 2026 08:37:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.83026
- Title: Training a Language Model End-to-End in Rust: An Experience Report
- Title(参考訳): Rustで言語モデルをエンドツーエンドにトレーニングする - エクスペリエンスレポート
- Abstract要約: 私はRustのエンドツーエンドの言語モデルを、レンタルされたGPU時間で164ドルで事前トレーニングしました。
私はCandleの欠陥を5つ文書化しています。
私はまた、Bengaliスクリプトでトークン化-妊婦の罠を報告します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: I pretrained a language model end-to-end in Rust - alone, with no team, no PyTorch, and no Python in the training path - for $164 in rented GPU time. I report that as an achievement, not a recommendation: the more useful contribution is a measured failure taxonomy of the two leading Rust ML frameworks, Candle and Burn, as training (not inference) backends in 2026. I document five Candle defects, including fused kernels that silently produce no gradient, and three Burn defects, including a backward pass at roughly 3% of theoretical GPU throughput and a kernel-fusion path that segfaults mid-training at multi-billion-parameter scale. Every one passed ordinary loss-curve inspection; none announced itself. I describe the verification discipline that caught six such silent failures, centered on a gradient-flow arbiter: a test that runs one forward/backward pass and asserts every trainable parameter receives a finite, nonzero gradient, generalizable to any framework. The trained model (roughly 0.4B parameters, Bangla-first) shows strong Bangla language-modeling signal - a per-token negative log-likelihood of 0.93 against 12.60 for a random-initialized twin - while scoring at chance on English commonsense multiple-choice, the expected outcome of a deliberately small, Bangla-weighted budget (about 2 billion tokens, 54.6 hours, one rented H100). I also report a tokenizer-fertility trap in Bengali script: naive byte-level tokenization collapsed Bangla to roughly 1.4 characters per token against English's 3.9, silently inverting the corpus's language balance; fixing it reached roughly 4.1. To my knowledge, this is among the first documented end-to-end LM pretraining runs in pure Rust. After this run I moved training to PyTorch and kept Rust for on-device serving: in my hands, Rust is not yet a competitive place to train a language model, though it may be a good place to serve one.
- Abstract(参考訳): 私はRustでエンドツーエンドの言語モデル(チームなし、PyTorchなし、トレーニングパスなし)を164ドルでトレーニングしました。
より有用な貢献は、2026年のトレーニング(推論ではなく)バックエンドとして、主要なRust MLフレームワークであるCandleとBurnの2つの失敗分類である、と報告しています。
私は5つのキャンドル欠陥を文書化しています。その中には、無秩序に勾配を生じない融合カーネルと、理論的GPUスループットの約3%の後方パスと、マルチビリオンパラメータスケールでトレーニング中のカーネル融合パスを含む3つのバーン欠陥が含まれています。
誰もが通常の損失曲線検査に合格したが、それ自身は発表されなかった。
1つの前方/後方のパスを実行し、トレーニング可能なすべてのパラメータが、任意のフレームワークに一般化可能な有限な非ゼロの勾配を受け取る、というテストです。
トレーニングされたモデル(約0.4Bパラメータ、バングラファースト)は、ランダムな初期化双生児に対して1対0.93対12.60という強いバングラ語モデリング信号を示すが、イングランドのコモンセンス多重選択では、意図的な小さなバングラ重み付き予算(約20億トークン、54.6時間、1レンタルH100)の結果が期待される。
ネイティブバイトレベルのトークン化は、Banglaを英語の3.9に対して1トークンあたり約1.4文字に崩壊させ、コーパスの言語バランスを静かに反転させ、約4.1に修正しました。
私の知る限り、これは純粋にRustで実行された、ドキュメント化されたエンドツーエンドのLMプリトレーニングのうちの1つです。
この実行の後、トレーニングをPyTorchに移行し、デバイス上のサービスとしてRustを維持しました。
関連論文リスト
- Manacá-1B: An Open, Reproducible Brazilian-Portuguese Language Model and a Tokenizer-Aware, Paired Evaluation [0.0]
Manac-1Bはブラジルのポルトガル語でトレーニングされた12億のパラメータからなるオープンデコーダのみのモデルです。
1つのハーネスでポルトガルの4つのベンチマークで9つのオープンベースラインに対してモデルを評価した。
論文 参考訳(メタデータ) (2026-08-31T01:00:14Z) - Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer [0.0]
我々は150Bのバイリンガル・イングリッシュ・ネパリ文字のトークンにスクラッチから事前訓練された高密度トランスフォーマーArkiosを提示する。
アルキオスは、訓練トークンの桁数が桁違いであるにもかかわらず、3つの比較可能な大きさのオープンモデル(Pythia-1.4B、TinyLlama-1.1B、OLMo-1B)を超える。
論文 参考訳(メタデータ) (2026-08-30T23:39:44Z) - What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations [0.0]
我々はコードに対して回答し、最近導入された概念回路抽出法を2x2の設計に拡張する。
全4細胞において、文法概念の完全な在庫を同一に測定する。
専用回路を稼ぐものはタスクによって設定されます。
層をまたいだ回路の成長もモデルによって設定される。
論文 参考訳(メタデータ) (2026-07-23T16:34:14Z) - Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation [0.8602553195689513]
大きな言語モデルは、PythonやJavaのような高リソース言語に対して強力なコード生成を実現しますが、Juliaのような低リソースプログラミング言語(LRPL)では、パフォーマンスが急落します。
本稿では,アルゴリズム推論から構文獲得を分離することで,このトリレンマを解消する3相パイプラインを提案する。
Qwen3-8Bを適用すると、私たちのパイプラインは、MultiPL-Eで+7.6ポイント、JuliaでAgnostics LiveCodeBenchで+14.2ポイント、パス@1を改善します。
論文 参考訳(メタデータ) (2026-07-08T09:18:56Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z) - No Language Left Behind: Scaling Human-Centered Machine Translation [69.28110770760506]
低レベルの言語と高レベルの言語のパフォーマンスギャップを狭めるためのデータセットとモデルを作成します。
何千ものタスクをトレーニングしながらオーバーフィッティングに対処するために,複数のアーキテクチャとトレーニングの改善を提案する。
本モデルでは,従来の最先端技術と比較して,BLEUの44%の改善を実現している。
論文 参考訳(メタデータ) (2022-07-11T07:33:36Z) - Quark: Controllable Text Generation with Reinforced Unlearning [68.07749519374089]
大規模言語モデルは、しばしばユーザの期待に合わない振る舞いを学ぶ。
本稿では,(不必要な)特性を定量化する報酬関数を最適化するアルゴリズムQuarkを紹介する。
未学習の毒性、ネガティブな感情、反復について、我々の実験はQuarkが強いベースラインと最先端の強化学習法の両方より優れていることを示している。
論文 参考訳(メタデータ) (2022-05-26T21:11:51Z) - AmericasNLI: Evaluating Zero-shot Natural Language Understanding of
Pretrained Multilingual Models in Truly Low-resource Languages [75.08199398141744]
我々は、XNLI(Conneau et al)の拡張である AmericasNLI を提示する。
は、アメリカ大陸の10の原住民の言語である。
XLM-Rで実験を行い、複数のゼロショットおよび翻訳ベースのアプローチをテストします。
XLM-Rのゼロショット性能は全10言語で低調であり、平均性能は38.62%である。
論文 参考訳(メタデータ) (2021-04-18T05:32:28Z) - Emergent Communication Pretraining for Few-Shot Machine Translation [66.48990742411033]
我々は、参照ゲームからの創発的コミュニケーションを介してニューラルネットワークを事前訓練する。
私たちの重要な前提は、実世界の環境の粗悪な近似として、画像に基づくコミュニケーションを基盤にすることで、帰納的に自然言語学習のモデルに偏りが生じる、ということです。
論文 参考訳(メタデータ) (2020-11-02T10:57:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。