論文の概要: Atompack: A Storage and Distribution Layer for Read-Heavy Atomistic ML Training Datasets
- arxiv url: http://arxiv.org/abs/2606.29975v1
- Date: Mon, 29 Jun 2026 08:50:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.136079
- Title: Atompack: A Storage and Distribution Layer for Read-Heavy Atomistic ML Training Datasets
- Title(参考訳): Atompack: リードヘビーなAtomistic MLトレーニングデータセットのためのストレージ層と分散層
- Abstract要約: 私たちは、単純なワークロードを中心に設計された追加指向のストレージフォーマットと分散層であるAtompackを紹介します。
Atompackはデータセットの構築中にレコードを効率的に追加し、イミュータブルなインデックスをコミットし、メモリマップされたパスを通じてレコードを提供する。
代表的な64原子のワークロードでは、トレーニングスタイルの読み込みでLMDBよりも96倍高速で、アーティファクトは約79%小さい。
- 参考スコア(独自算出の注目度): 41.40600185116783
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Atomistic machine learning datasets are increasingly used for training: large immutable snapshots are read repeatedly, shuffled across epochs, staged across clusters' storage systems, and republished as reusable scientific artifacts. This workload differs from interactive scientific curation, where mutable records and ad hoc inspection are often more important than random indexed throughput. We present Atompack, an append-oriented storage format and distribution layer designed around a simple workload: training pipelines usually consume complete molecular records, while the order of records is randomized by the learning algorithm. Atompack appends records efficiently during dataset construction, then commits an immutable index and serves records through a memory-mapped read path optimized for training. We compare Atompack with HDF5, LMDB, and ASE baselines representing array stores, key-value records, serialized records, and object-oriented databases. The benchmarks measure sequential reads, shuffled reads, shared-filesystem behavior, write throughput, and artifact size. On a representative 64-atom workload, Atompack is 96x faster than ASE LMDB on shuffled training-style reads while producing artifacts about 79\% smaller. The results indicate that serving complete molecule records, rather than field chunks or reconstructed objects, improves shuffled training throughput while keeping artifacts compact enough for public distribution.
- Abstract(参考訳): 大規模な不変スナップショットが繰り返し読み出され、エポックを越えてシャッフルされ、クラスタのストレージシステムにまたがってステージングされ、再利用可能な科学的アーティファクトとして再発行される。
この作業負荷は、ランダムなインデックス付きスループットよりも、可変レコードとアドホックインスペクションが重要である、インタラクティブな科学的キュレーションとは異なる。
トレーニングパイプラインは通常、完全な分子レコードを消費するが、レコードの順序は学習アルゴリズムによってランダム化される。
Atompackはデータセット構築中にレコードを効率的に追加し、イミュータブルなインデックスをコミットし、トレーニング用に最適化されたメモリマップされた読み取りパスを通じてレコードを提供する。
私たちはAtompackをHDF5、LMDB、ASEベースラインと比較し、配列ストア、キー値レコード、シリアライズされたレコード、オブジェクト指向データベースを示します。
ベンチマークはシーケンシャル読み込み、シャッフル読み込み、共有ファイルシステムの振る舞い、書き込みスループット、アーティファクトサイズを測定する。
代表的64原子ワークロードでは、Atompackは、シャッフルされたトレーニングスタイルの読み込みにおいてASE LMDBよりも96倍高速で、アーティファクトは約79倍小さい。
以上の結果から,フィールドチャンクや再構成対象ではなく,完全な分子記録を提供することで,公共分布に十分コンパクトなアーティファクトを保ちながら,シャッフルトレーニングのスループットを向上させることが示唆された。
関連論文リスト
- Requential Coding: Pushing the Limits of Model Compression with Self-Generated Training Data [55.04392122319273]
本稿では,教師モデルが生徒自身の分布から抽出した学習サンプルを選択するための逐次符号化手法を提案する。
結果として得られるコード長は、パラメータカウントとデータエントロピーとは独立しており、多くの場合、先行するコード長よりも桁違いに短い。
論文 参考訳(メタデータ) (2026-07-13T17:58:50Z) - A Parametric Memory Head for Continual Generative Retrieval [52.66674234249913]
生成情報検索(GenIR)は、検索を単一のニューラルモデルに統合し、クエリから直接ドキュメント識別子(ドシデント)をデコードする。
逐次適応は、新たに追加された文書の検索を改善するが、以前のスライスの性能は著しく低下することを示す。
本稿では,モジュール型パラメトリックメモリヘッドで適応モデルを拡張するメモリのみの安定化ステージである,後適応メモリチューニング(PAMT)を提案する。
論文 参考訳(メタデータ) (2026-04-25T17:38:51Z) - Panini: Continual Learning in Token Space via Structured Memory [4.979820180013486]
言語モデルは、トレーニングされていないコンテンツを推論するために、ますます使われています。
一般的なアプローチは検索拡張生成(RAG)であり、これは動詞の文書を(チャンクとして)外部に保存し、推論時に関連するサブセットのみを取得する。
本稿では,基本モデルを固定したままで,新たな経験を外部セマンティックメモリ状態に統合することで学習を行う,人間のような非パラメトリック連続学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-16T19:58:03Z) - Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts [68.79341332280062]
長いコンテキストでの大規模言語モデル(LLM)のトレーニングは、トレーニング時間ではなく、GPUメモリの異常なオーバーヘッドによって厳しく制限される。
この障壁に直面するメモリ効率の高いトレーニングシステムOOMBを紹介します。
本手法では,オンザフライアクティベーション・リコンピュテーションを備えたチャンク・リカレント・トレーニング・フレームワークを用いて,一定のアクティベーションメモリフットプリントを維持する。
論文 参考訳(メタデータ) (2026-02-02T13:52:40Z) - Rethinking Memory in AI: Taxonomy, Operations, Topics, and Future Directions [55.19217798774033]
メモリは、大規模言語モデル(LLM)ベースのエージェントを支える、AIシステムの基本コンポーネントである。
本稿ではまず,メモリ表現をパラメトリックおよびコンテキスト形式に分類する。
次に、コンソリデーション、更新、インデックス付け、フォッティング、検索、圧縮の6つの基本的なメモリ操作を紹介します。
論文 参考訳(メタデータ) (2025-05-01T17:31:33Z) - Refining Packing and Shuffling Strategies for Enhanced Performance in Generative Language Models [2.002276960776527]
シャッフルの最適原子径について検討し,その性能と効率を比較検討した。
その結果, 原子サイズとMSLとのマッチングにより, 両方のパッキング法の性能が最適化された。
このトレードオフは、トレーニング言語モデルにおけるパッキングメソッドの選択を通知する。
論文 参考訳(メタデータ) (2024-08-19T00:26:53Z) - Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum [30.46329559544246]
大規模言語モデル(LLM)は、固定長トークンシーケンスからなるデータセットで一般的に訓練される。
最近の注目実装では、クロスドキュメントの注意を隠蔽し、トークンの塊の有効長を削減している。
本稿では,新しい可変シーケンス長トレーニング手法であるデータセット分解を導入する。
論文 参考訳(メタデータ) (2024-05-21T22:26:01Z) - MAP: Memory-aware Automated Intra-op Parallel Training For Foundation
Models [15.256207550970501]
我々は PyTorch 上に構築された MAP を紹介した。
MAPは既存の手法と比較して、任意のPyTorchモデルのメモリおよび計算統計を生成するのに使いやすいシンボリックプロファイラを提供する。
論文 参考訳(メタデータ) (2023-02-06T07:22:49Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z) - Deep Indexed Active Learning for Matching Heterogeneous Entity
Representations [20.15233789156307]
本稿では,ブロッキングのリコールとブロックペアのマッチング精度を最大化するために,組込みを共同で学習するスケーラブルなアクティブラーニング手法であるdiardを提案する。
5つのベンチマークデータセットと多言語レコードマッチングデータセットの実験は、精度、リコール、実行時間の観点から、我々のアプローチの有効性を示している。
論文 参考訳(メタデータ) (2021-04-08T18:00:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。