論文の概要: Zephon: Elastic Determinism for Online, Stateful Foundation Model Data Loading Pipelines
- arxiv url: http://arxiv.org/abs/2610.03087v1
- Date: Fri, 02 Oct 2026 10:06:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.319032
- Title: Zephon: Elastic Determinism for Online, Stateful Foundation Model Data Loading Pipelines
- Title(参考訳): Zephon: オンラインでステートフルなファンデーションモデルデータロードパイプラインのためのElastic Determinism
- Abstract要約: Zephonは、オンラインでステートフルなパイプラインをサポートする基礎モデルのデータローダである。
グローバルストリームをトポロジ非依存レーンに分割し、順序決定をシリアライズするとともに、交換可能なバックエンド上でステートレスな作業を並列化する。
既存のローダがオンラインのステートフルパイプラインに対して提供していない保証の組み合わせを提供しながら、競争力のスループットを達成する。
- 参考スコア(独自算出の注目度): 12.431362260170268
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deterministic data loading is important for foundation model development: model researchers need confidence that differences they observe across costly ablations are caused by the parameter they changed rather than non-determinism in the training data sequence. The data loader must provide elastic determinism, i.e., a deterministic sequence of global training data batches despite changes to the GPU topology across runs (e.g., due to GPU scarcity), frequent checkpoint-resume cycles, and different data processing execution backends. Achieving this is difficult because modern foundation model data pipelines tokenize, pack, and mix samples online, introducing stateful n-to-m transformations that break sample indexing. Existing data loaders largely assume indexable 1-to-1 pipelines, and the common workaround of offline materialization is expensive and, for some modalities such as video, infeasible. We present Zephon, a data loader for foundation models that supports online, stateful pipelines while providing elastic determinism and efficient resumption from checkpoints. It partitions the global stream into topology-independent lanes, serializes ordering decisions while parallelizing stateless work on interchangeable backends, and checkpoints only bounded in-flight state so recovery cost does not grow with training progress. We evaluate Zephon on text and vision-language workloads and show that it achieves competitive throughput while providing a combination of guarantees that no existing loader offers for online, stateful pipelines.
- Abstract(参考訳): モデル研究者は、コストのかかる改善によって観察される違いは、トレーニングデータシーケンスの非決定性ではなく、変化したパラメータによって引き起こされる、という自信が必要です。
データローダは、実行中のGPUトポロジの変更(GPU不足による)、頻繁なチェックポイント・リストアサイクル、さまざまなデータ処理実行バックエンドに関わらず、グローバルなトレーニングデータバッチの決定論的シーケンスを弾性決定性で提供しなければならない。
最新の基盤モデルデータパイプラインは、サンプルをオンラインでトークン化し、パックし、混合し、サンプルインデックスを壊すステートフルなn-to-m変換を導入するため、この達成は難しい。
既存のデータローダはインデックス可能な1対1パイプラインをほとんど前提としており、オフラインの物質化の一般的な回避策は高価であり、ビデオのようないくつかのモダリティでは実現不可能である。
私たちは、オンラインでステートフルなパイプラインをサポートしながら、弾力的な決定性とチェックポイントからの効率的な再消費を提供する基礎モデルのためのデータローダであるZephonを紹介します。
グローバルストリームをトポロジ非依存のレーンに分割し、整列決定をシリアライズし、交換可能なバックエンド上でステートレスな作業を並列化する。
我々は、テキストとビジョン言語によるワークロードでZephonを評価し、既存のローダがオンラインのステートフルパイプラインに対して提供していない保証の組み合わせを提供しながら、競争的なスループットを実現していることを示す。
関連論文リスト
- FlowPipe: LLM-Enhanced Conditional Generative Flow Networks for Data Preparation Pipeline Construction [43.791981476558384]
データ準備パイプラインは、生のテーブルを学習可能なデータに変換することによって、機械学習におけるデータ品質を改善する。
既存の最先端(SOTA)マルチDQNメソッドは3つの重要な制限に直面している。
有向非巡回グラフ上での条件付き確率フロー生成としてパイプライン合成を定式化する統合フレームワークであるFlowPipeを提案する。
論文 参考訳(メタデータ) (2026-06-23T15:10:00Z) - DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams [48.434767119224375]
本稿ではエージェントデータ処理へのパラダイムシフトを提案する。
このような高次の能力をトレーニングする際のデータ不足のボトルネックを克服するために、2段階のパイプラインを設計する。
$textDataClaw_0$-9B モデルは、グループ相対ポリシー最適化によるスーパービジョンファインチューニングをシナジする。
論文 参考訳(メタデータ) (2026-06-19T11:31:43Z) - Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods [30.96121293915128]
ADAPTは動的オンラインフレームワークで、類似性に基づく品質信号によって導かれる適応的なサンプル単位の学習率でトレーニングサンプルを再重み付けする。
ADAPTはオフラインの選択/ミキシングと先行のオンライン手法を一貫して上回り、同じFLOPの下でより強力なクロスベンチマークの一般化を実現している。
論文 参考訳(メタデータ) (2026-04-19T14:23:23Z) - GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL [64.8155693023222]
オープンソースのネイティブGUIエージェントは、長い水平ナビゲーションタスクのクローズドソースシステムに遅れを取っている。
このギャップは、高品質でアクション整合性のある推論データが不足していることに起因している。
GUI-Libraは、これらの課題に対処する調整されたトレーニングレシピです。
論文 参考訳(メタデータ) (2026-02-25T18:34:57Z) - Nimbus: A Unified Embodied Synthetic Data Generation Framework [51.55989844555466]
データボリュームと多様性のスケーリングは、インボディードインテリジェンスを一般化するために重要である。
我々は、異種ナビゲーションと操作パイプラインを統合するために設計された統合合成データ生成フレームワークであるNimbusを紹介する。
評価の結果,Nimbusは最適化されていないベースラインに比べてエンドツーエンドのスループットが2~3倍向上していることがわかった。
論文 参考訳(メタデータ) (2026-01-29T09:27:31Z) - Causify DataFlow: A Framework For High-performance Machine Learning Stream Computing [0.0]
我々は、無制限の時系列データ上に機械学習システムを構築し、テストし、デプロイするための計算フレームワークであるDataFlowを紹介する。
従来のデータサイエンスは有限データセットを前提としており、バッチプロトタイプからストリーミングプロダクションシステムに移行する際には、かなりの再実装が必要である。
DataFlowは、ポイント・イン・タイムの理想性を持つ非循環グラフに基づいて、これらの問題を統一された実行モデルで解決する。
論文 参考訳(メタデータ) (2025-12-30T04:24:04Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z) - SOLIS -- The MLOps journey from data acquisition to actionable insights [62.997667081978825]
本稿では,基本的なクロスプラットフォームテンソルフレームワークとスクリプト言語エンジンを使用しながら,すべての要件をサポートする統合デプロイメントパイプラインとフリー・ツー・オペレートアプローチを提案する。
しかし、このアプローチは、実際のプロダクショングレードシステムに機械学習機能を実際にデプロイするために必要な手順やパイプラインを提供していない。
論文 参考訳(メタデータ) (2021-12-22T14:45:37Z) - Tracking Performance of Online Stochastic Learners [57.14673504239551]
オンラインアルゴリズムは、大規模なバッチにデータを保存したり処理したりすることなく、リアルタイムで更新を計算できるため、大規模な学習環境で人気がある。
一定のステップサイズを使用すると、これらのアルゴリズムはデータやモデル特性などの問題パラメータのドリフトに適応し、適切な精度で最適解を追跡する能力を持つ。
定常仮定に基づく定常状態性能とランダムウォークモデルによるオンライン学習者の追跡性能の関連性を確立する。
論文 参考訳(メタデータ) (2020-04-04T14:16:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。