論文の概要: OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research
- arxiv url: http://arxiv.org/abs/2607.16669v1
- Date: Sat, 18 Jul 2026 06:55:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.223192
- Title: OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research
- Title(参考訳): OpenLanguageModel:教育と研究のための可読かつ構成可能な小型言語モデル準備
- Authors: Tavish Mankash, Vardhaman Kalloli, Keshava Prasad, Deepan Muthirayan,
- Abstract要約: OpenLanguageModel (OLM)は、小さな言語モデルの構築と事前学習のためのオープンソースのPyTorchライブラリである。
このパッケージには、9つの親しみのあるモデルファミリにわたる27のプリセットと、LMの基礎からアーキテクチャ研究まで進歩したドキュメントが含まれている。
- 参考スコア(独自算出の注目度): 1.1654568410166084
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: OpenLanguageModel (OLM) is an open-source PyTorch library for building and pretraining small language models while keeping their machinery visible. In OLM, model code reads like the architecture: components are ordinary modules, while Block, Residual, Repeat, and Parallel describe how they are wired. The resulting model can move unchanged from a teaching notebook to a complete pretraining run or a research ablation. OLM connects this readable model layer to tokenizers, local and streaming datasets, optimization, mixed precision, callbacks, checkpoints, and hardware-aware CPU, single-GPU, and single-node multi-GPU execution. We demonstrate the full path by tracing GPT-2 from diagram to code, launching a FineWeb-Edu training script, replacing one attention component, and letting AutoTrainer configure the available machine. The package includes 27 presets across nine familiar model families and documentation that progresses from LM fundamentals to architecture research. Validation shows close agreement with independent reference implementations, 90.6% four-GPU weak-scaling efficiency for a 348M-parameter workload, compact architecture edits, and positive early usability results. OLM is MIT-licensed and available through PyPI, GitHub, and its documentation site.
- Abstract(参考訳): OpenLanguageModel (OLM)は、小さな言語モデルの構築と事前学習のためのオープンソースのPyTorchライブラリである。
コンポーネントは通常のモジュールであり、Block、Residual、Repeat、Parallelはそれらがどのように配線されているかを記述する。
得られたモデルは、教示ノートから完全な事前学習実行または研究アブレーションに変化しないことができる。
OLMはこの可読性モデルレイヤをトークン処理器、ローカルおよびストリーミングデータセット、最適化、混合精度、コールバック、チェックポイント、ハードウェア対応CPU、シングルGPU、シングルノードマルチGPU実行に接続する。
我々は、GPT-2をダイアグラムからコードにトレースし、FineWeb-Eduトレーニングスクリプトを起動し、1つの注意コンポーネントを置き換え、AutoTrainerが利用可能なマシンを設定することで、完全なパスを実証する。
このパッケージには、9つの親しみのあるモデルファミリにわたる27のプリセットと、LMの基礎からアーキテクチャ研究まで進歩したドキュメントが含まれている。
検証は、独立したリファレンス実装との密接な一致を示し、90.6%の4GPUの弱いスケーリング効率が348Mパラメータのワークロード、コンパクトなアーキテクチャの編集、ポジティブな早期使用性の結果を示している。
OLMはMITライセンスで、PyPI、GitHub、およびドキュメントサイトを通じて利用できる。
関連論文リスト
- Less is More: Making Smaller Language Models Competent Subgraph Retrievers for Multi-hop KGQA [51.3033125256716]
本研究では,小言語モデルで処理される条件生成タスクとして,サブグラフ検索タスクをモデル化する。
2億2千万のパラメータからなる基本生成部分グラフ検索モデルでは,最先端モデルと比較して競合検索性能が向上した。
LLMリーダを接続した最大の3Bモデルは、WebQSPとCWQベンチマークの両方で、SOTAのエンドツーエンドパフォーマンスを新たに設定します。
論文 参考訳(メタデータ) (2024-10-08T15:22:36Z) - KerasCV and KerasNLP: Vision and Language Power-Ups [9.395199188271254]
KerasCVとKerasNLPはコンピュータビジョンと自然言語処理のためのKeras APIの拡張である。
これらのドメインパッケージは、使いやすさとパフォーマンスを重視した高速な実験を可能にするように設計されている。
ライブラリは完全にオープンソース(Apache 2.0ライセンス)で、GitHubから入手できる。
論文 参考訳(メタデータ) (2024-05-30T16:58:34Z) - OpenELM: An Efficient Language Model Family with Open Training and Inference Framework [26.741510071520658]
私たちは最先端のオープン言語モデルであるOpenELMをリリースします。
パラメータ予算は約10億のパラメータで、OpenELMはOLMoに比べて精度が2.36%向上している。
論文 参考訳(メタデータ) (2024-04-22T23:12:03Z) - Language Models are Universal Embedders [45.8316643119292]
大きな言語モデル(LLM)革命において、埋め込みは様々なシステムの重要な構成要素である。
組込み機を構築するための戦略を提案し,ユニバーサル評価ベンチマークを導入する。
実験結果から,学習モデルは言語やタスクにまたがる優れた埋め込みを生成するのに長けていることがわかった。
論文 参考訳(メタデータ) (2023-10-12T11:25:46Z) - Pink: Unveiling the Power of Referential Comprehension for Multi-modal
LLMs [49.88461345825586]
本稿では,MLLMの微細な画像理解能力を高めるための新しい枠組みを提案する。
本稿では,既存のデータセットのアノテーションを活用して,命令チューニングデータセットを低コストで構築する手法を提案する。
本研究では,Qwen-VLよりも5.2%精度が向上し,Kosmos-2の精度が24.7%向上したことを示す。
論文 参考訳(メタデータ) (2023-10-01T05:53:15Z) - Prompt2Model: Generating Deployable Models from Natural Language
Instructions [74.19816829003729]
大規模言語モデル(LLM)により、システムビルダーはプロンプトによって有能なNLPシステムを作成することができる。
言い換えれば、LSMは従来の特殊目的のNLPモデルとは逆のステップである。
本稿では,LLMに提供されるプロンプトのように自然言語によるタスク記述を行う汎用手法であるPrompt2Modelを提案する。
論文 参考訳(メタデータ) (2023-08-23T17:28:21Z) - Paraphrastic Representations at Scale [134.41025103489224]
私たちは、英語、アラビア語、ドイツ語、フランス語、スペイン語、ロシア語、トルコ語、中国語の訓練されたモデルをリリースします。
我々はこれらのモデルを大量のデータでトレーニングし、元の論文から大幅に性能を向上した。
論文 参考訳(メタデータ) (2021-04-30T16:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。