論文の概要: Index SLM Technical Report
- arxiv url: http://arxiv.org/abs/2607.09885v1
- Date: Fri, 10 Jul 2026 18:19:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.23699
- Title: Index SLM Technical Report
- Title(参考訳): Index SLM Technical Report
- Authors: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li,
- Abstract要約: Index-1.9Bは、Bilibiliで開発された一連のオープンな小言語モデルである。
シリーズは4つのモデルで構成されている: Index-1.9B-Base, 1.9億のパラメータが2.8兆の中国語と英語のトークンで事前訓練された基礎モデル, Index-1.9B-Pure, 同一のレシピで訓練されているが、コーパスから厳密にフィルタリングされたすべての命令のようなデータを持つ制御モデル, Index-1.9B-Character。
- 参考スコア(独自算出の注目度): 11.17580009715777
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Index-1.9B, a series of open small language models developed at Bilibili. The series comprises four models: Index-1.9B-Base, a foundation model with 1.9 billion non-embedding parameters pre-trained on 2.8 trillion predominantly Chinese and English tokens; Index-1.9B-Pure, a control variant trained with an identical recipe but with all instruction-like data strictly filtered from the corpus; Index-1.9B-Chat, aligned from the base model with supervised fine-tuning and direct preference optimization; and Index-1.9B-Character, which augments the chat model with retrieval-augmented generation for few-shot role-playing customization. Pre-training employs a Warmup-Stable-Decay learning-rate schedule in which the concentration of curated data is raised substantially during the decay phase, together with a Norm-Head output layer that stabilizes training under large learning rates. On a suite of standard benchmarks covering examination, reasoning, mathematics, and code, Index-1.9B-Base attains an average score of 64.92, competitive with or exceeding open models of several times its size. We further report controlled studies on model depth, learning-rate magnitude and scheduling, the interaction between learning-rate decay and data quality, and the effect of including instruction data during pre-training, and we document an unexplained surge in benchmark performance midway through the constant-learning-rate phase. All models, together with evaluation code, are released at https://github.com/bilibili/Index-1.9B.
- Abstract(参考訳): Index-1.9Bは、Bilibiliで開発された一連のオープンな小言語モデルである。
シリーズは、4つのモデルで構成されている: Index-1.9B-Base, 1.9億の非埋め込みパラメータが2.8兆の中国語と英語のトークンで事前訓練された基礎モデル、 Index-1.9B-Pure, 同一のレシピで訓練されたが、コーパスから厳密にフィルタリングされた全ての命令のようなデータを持つ制御モデル、 Index-1.9B-Chat, 教師付き微調整と直接的選好最適化を備えたベースモデル、 Index-1.9B-Character。
事前トレーニングでは、学習率の高いトレーニングを安定化するNorm-Head出力層とともに、崩壊フェーズ中にキュレートされたデータの集中が実質的に上昇するワームアップ・安定・デカイ学習率スケジュールを採用している。
試験、推論、数学、コードをカバーする一連の標準ベンチマークにおいて、Index-1.9B-Baseは平均スコア64.92に達し、数倍の大きさのオープンモデルと競合する。
さらに、モデル深度、学習速度の規模とスケジューリング、学習速度の減衰とデータ品質の相互作用、事前学習中に指導データを含めることの効果に関する制御研究を報告する。
全てのモデルは評価コードとともにhttps://github.com/bilibili/Index-1.9Bでリリースされる。
関連論文リスト
- TabH2O: A Unified Foundation Model for Tabular Prediction [12.882141870947706]
本研究では,テキスト内学習による1つの前方パスの分類と回帰を行うモデルであるTabH2Oを提案する。
我々はTALENTベンチマークでTabH2O v1(29.2Mパラメータ)を評価し、6つの評価手法のうち平均2.55のランクを達成した。
論文 参考訳(メタデータ) (2026-05-18T13:27:54Z) - How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining [22.50461083222824]
高品質なデータを活用するための自然なアプローチはカリキュラムベースの事前トレーニングであり、品質基準によって決定された品質の上位順にソートされたデータに基づいてモデルを訓練する。
この研究は、これらの手法を制約する重要な要因、すなわち、上昇するデータ品質の順序と減衰する学習率のスケジュールの不整合性を特定する。
論文 参考訳(メタデータ) (2025-11-24T09:03:49Z) - Approximating Language Model Training Data from Weights [70.08614275061689]
モデル重みからデータ近似の問題を定式化し、いくつかのベースラインとメトリクスを提案する。
そこで我々は,大規模公開テキストコーパスから最高のマッチングデータを選択する勾配に基づく手法を開発した。
真のトレーニングデータがない場合でも、我々の方法では、公開Webドキュメントの小さなサブセットを見つけることができる。
論文 参考訳(メタデータ) (2025-06-18T15:26:43Z) - Pretraining Language Models to Ponder in Continuous Space [50.52734567589996]
単一のトークン生成ステップ内で,前処理を繰り返し呼び出すことによって,この思考プロセスを言語モデルに導入する。
人間のアノテーションを使わずに、自己教師付き学習を通じて、この方法でモデルを学習できることが示される。
論文 参考訳(メタデータ) (2025-05-27T03:47:33Z) - WorldPM: Scaling Human Preference Modeling [130.23230492612214]
我々は、このスケーリングの可能性を強調するために、World Preference Modeling$ (WorldPM)を提案する。
多様なユーザコミュニティをカバーする公開フォーラムから選好データを収集する。
1.5Bから72Bパラメータの範囲で15Mスケールのデータを用いて広範囲なトレーニングを行う。
論文 参考訳(メタデータ) (2025-05-15T17:38:37Z) - Privacy-Preserved Automated Scoring using Federated Learning for Educational Research [1.2556373621040728]
本稿では,教育評価の自動評価のための統合学習(FL)フレームワークを提案する。
我々は,2つの最先端FL手法と集中学習ベースラインに対して,我々のモデルをベンチマークする。
その結果,本モデルが最も精度が高い(94.5%)ことが示唆された。
論文 参考訳(メタデータ) (2025-03-12T19:06:25Z) - Drift-Resilient TabPFN: In-Context Learning Temporal Distribution Shifts on Tabular Data [39.40116554523575]
In-Context Learning with a Prior-Data Fitted Network に基づく新しいアプローチである Drift-Resilient TabPFN を提案する。
先行した合成データセットのベイズ推定を近似することを学ぶ。
精度は0.688から0.744に向上し、OC AUCは0.786から0.832に向上し、キャリブレーションも強化された。
論文 参考訳(メタデータ) (2024-11-15T23:49:23Z) - The Languini Kitchen: Enabling Language Modelling Research at Different
Scales of Compute [66.84421705029624]
本稿では,アクセル時間で測定された等価計算に基づくモデル比較を可能にする実験的プロトコルを提案する。
私たちは、既存の学術的ベンチマークを上回り、品質、多様性、文書の長さで上回る、大規模で多様で高品質な書籍データセットを前処理します。
この研究は、GPT-2アーキテクチャから派生したフィードフォワードモデルと、10倍のスループットを持つ新しいLSTMの形式でのリカレントモデルという2つのベースラインモデルも提供する。
論文 参考訳(メタデータ) (2023-09-20T10:31:17Z) - Universal Domain Adaptation from Foundation Models: A Baseline Study [58.51162198585434]
基礎モデルを用いた最先端UniDA手法の実証的研究を行った。
CLIPモデルからターゲット知識を抽出するためのパラメータフリーな手法であるtextitCLIP 蒸留を導入する。
単純な手法ではあるが、ほとんどのベンチマークタスクでは従来の手法よりも優れている。
論文 参考訳(メタデータ) (2023-05-18T16:28:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。