論文の概要: Scaling Point-in-Time Language Models
- arxiv url: http://arxiv.org/abs/2607.11889v2
- Date: Fri, 17 Jul 2026 09:32:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.99615
- Title: Scaling Point-in-Time Language Models
- Title(参考訳): ポイント・イン・タイム言語モデルのスケーリング
- Abstract要約: ポイント・イン・タイムの言語モデルは、各カレンダーの日付まで利用可能なテキストにのみ訓練される。
この性能ギャップはスケールによって著しく狭められることを示す。
我々は、ポイント・イン・タイム言語モデリングを可能にするデータセット構築を含む完全なパイプラインをリリースする。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models trained on unrestricted internet corpora inevitably embed information from the future, introducing lookahead bias that compromises the validity of backtests and causal inference in finance and the social sciences. Point-in-time language models--trained exclusively on text available up to each calendar date--eliminate this leakage by construction, but existing efforts typically produce models that lag substantially behind their unconstrained counterparts. We show that this performance gap can be substantially narrowed through scale. Training decoder-only transformers with up to 4 billion parameters on 1 trillion chronologically filtered tokens from FineWeb, we construct a sequence of monthly model checkpoints spanning 2013-2024. Across a range of common-sense reasoning and language understanding benchmarks, our models approach the performance of leading open-weight models of comparable size (e.g., Gemma-3-4B and LLaMA-7B) trained on temporally unrestricted data, although a performance gap remains on several tasks. Instruction fine-tuning via LoRA further improves downstream usability. We release the complete pipeline--including dataset construction, training infrastructure, and evaluation code--to enable reproducible point-in-time language modeling and to support research applications that require strict temporal validity.
- Abstract(参考訳): 制限のないインターネットコーパスでトレーニングされた大規模な言語モデルは、未来からの情報を必然的に埋め込んで、バックテストの妥当性を損なうルックアヘッドバイアスや、金融や社会科学における因果推論を導入する。
ポイント・イン・タイムの言語モデルは、各カレンダーの日付まで利用可能なテキストにのみトレーニングされている。
この性能ギャップはスケールによって著しく狭められることを示す。
最大40億のパラメータを持つデコーダのみのトランスフォーマーをFineWebからトレーニングし,2013-2024年にまたがる月次モデルチェックポイントのシーケンスを構築した。
一般的な推論と言語理解のベンチマークの範囲で、我々のモデルは、時間的制約のないデータに基づいてトレーニングされた最大サイズのオープンウェイトモデル(例えば、Gemma-3-4B、LLaMA-7B)のパフォーマンスにアプローチするが、パフォーマンスのギャップはいくつかのタスクに留まる。
LoRAによるインストラクションの微調整により、下流のユーザビリティがさらに向上する。
我々は、データセットの構築、トレーニングインフラ、評価コードを含む完全なパイプラインをリリースし、再現可能なポイントインタイム言語モデリングを可能にし、厳密な時間的妥当性を必要とする研究アプリケーションをサポートする。
関連論文リスト
- LiFT: Does Instruction Fine-Tuning Improve In-Context Learning for Longitudinal Modelling by Large Language Models? [15.417461558991832]
縦方向のNLPタスクは、人間の行動や意見の持続性や変化を検出するために、時間的に順序付けられたテキストの推論を必要とする。
本稿では,多種多様な縦方向モデリングタスクを共有命令スキーマの下で統合する,縦方向命令微調整フレームワークLiFTを紹介する。
論文 参考訳(メタデータ) (2026-03-25T20:54:12Z) - BEDTime: A Unified Benchmark for Automatically Describing Time Series [8.466823017204641]
我々は、成功したマルチモーダルモデルは時系列の言語記述を認識し、区別し、生成することができるべきだと論じる。
次に、各タスクのモデルを評価する最初のベンチマークデータセットであるBEDTimeを作成します。
BEDTimeを用いて、13の最先端モデルを評価し、専用時系列基礎モデルの性能が著しく低下していることを見出した。
論文 参考訳(メタデータ) (2025-09-05T16:18:20Z) - PBEBench: A Multi-Step Programming by Examples Reasoning Benchmark inspired by Historical Linguistics [5.645098175233682]
我々は,Large Language Models (LLMs) の帰納的推論能力を評価する新しいタイプのベンチマークに貢献する。
本稿では,制御不能な問題を生成し,推論モデルの評価を可能にする完全自動パイプラインを提案する。
実験により、テストタイム計算やLCoT(ロングチェーンオブ思想)推論を利用するモデルと、そうでないモデルの間には、かなりのパフォーマンスギャップが明らかになる。
論文 参考訳(メタデータ) (2025-05-29T05:51:16Z) - DATETIME: A new benchmark to measure LLM translation and reasoning capabilities [0.0]
本稿では,日時における大規模言語モデル(LLM)の翻訳と推論能力を評価するために設計された,新しい高品質なベンチマークであるDATETIMEを紹介する。
日時は直感的で、人間が処理するのは簡単ですが、LLMには大きな課題があります。
実験の結果,現状のモデルでは,日時における推論に関わる作業が困難であることが示唆された。
論文 参考訳(メタデータ) (2025-04-22T17:52:04Z) - Pretraining Language Models for Diachronic Linguistic Change Discovery [8.203894221271302]
本手法は,手作業による検査を容易にするため,コーパス上で有効なモデルを生成することができることを示す。
我々は,10万ワードスライス5件の時間分割データセットを得るために,新しい日付属性パイプラインを用いる。
事前訓練されたモデルは、微調整されたベースラインよりも訓練が早いこと、そして、私たちのコーパスの歴史的区分をより尊重していることが分かりました。
論文 参考訳(メタデータ) (2025-04-07T21:51:32Z) - Lag-Llama: Towards Foundation Models for Probabilistic Time Series
Forecasting [54.04430089029033]
本稿では,デコーダのみの変換器アーキテクチャに基づく時系列予測のための汎用基礎モデルであるLag-Llamaを提案する。
Lag-Llamaは、複数のドメインからの多様な時系列データの大規模なコーパスで事前訓練され、強力なゼロショット一般化能力を示す。
このような未確認データセットの比較的小さな部分で微調整を行うと、Lag-Llamaは最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2023-10-12T12:29:32Z) - Time-LLM: Time Series Forecasting by Reprogramming Large Language Models [110.20279343734548]
時系列予測は多くの実世界の力学系において重要な意味を持つ。
時系列予測のための大規模言語モデルを再利用するための再プログラミングフレームワークであるTime-LLMを提案する。
Time-LLMは、最先端の特殊な予測モデルよりも優れた、強力な時系列学習者である。
論文 参考訳(メタデータ) (2023-10-03T01:31:25Z) - The Languini Kitchen: Enabling Language Modelling Research at Different
Scales of Compute [66.84421705029624]
本稿では,アクセル時間で測定された等価計算に基づくモデル比較を可能にする実験的プロトコルを提案する。
私たちは、既存の学術的ベンチマークを上回り、品質、多様性、文書の長さで上回る、大規模で多様で高品質な書籍データセットを前処理します。
この研究は、GPT-2アーキテクチャから派生したフィードフォワードモデルと、10倍のスループットを持つ新しいLSTMの形式でのリカレントモデルという2つのベースラインモデルも提供する。
論文 参考訳(メタデータ) (2023-09-20T10:31:17Z) - Large Language Models with Controllable Working Memory [64.71038763708161]
大規模言語モデル(LLM)は、自然言語処理(NLP)の一連のブレークスルーをもたらした。
これらのモデルをさらに切り離すのは、事前訓練中に内在する膨大な量の世界的知識だ。
モデルの世界知識が、文脈で提示された事実情報とどのように相互作用するかは、まだ解明されていない。
論文 参考訳(メタデータ) (2022-11-09T18:58:29Z) - Efficient Nearest Neighbor Language Models [114.40866461741795]
非パラメトリックニューラルネットワークモデル(NLM)は、外部データストアを用いてテキストの予測分布を学習する。
比較性能を維持しながら、推論速度の最大6倍の高速化を実現する方法を示す。
論文 参考訳(メタデータ) (2021-09-09T12:32:28Z) - Pitfalls of Static Language Modelling [41.76918612574081]
現状のトランスフォーマーモデルは、訓練期間を超えて、将来の発話を予測する現実的なセットアップにおいて、さらに悪化することを示す。
私たちは、静的言語モデリング評価プロトコルを再考するのは、今が正しい時だと論じています。
論文 参考訳(メタデータ) (2021-02-03T09:01:49Z) - Unsupervised Paraphrasing with Pretrained Language Models [85.03373221588707]
教師なし環境で,事前学習した言語モデルを用いて高品質なパラフレーズを生成する訓練パイプラインを提案する。
提案手法は,タスク適応,自己スーパービジョン,動的ブロッキング(Dynamic Blocking)という新しい復号アルゴリズムから構成される。
提案手法は,Quora Question PairとParaNMTの両方のデータセット上で,最先端の性能を達成できることを示す。
論文 参考訳(メタデータ) (2020-10-24T11:55:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。