論文の概要: Pre-carved Niches: The Formation Dynamics of Modular Task Partitions in Early LLM Training
- arxiv url: http://arxiv.org/abs/2609.01170v1
- Date: Tue, 01 Sep 2026 12:47:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.662812
- Title: Pre-carved Niches: The Formation Dynamics of Modular Task Partitions in Early LLM Training
- Title(参考訳): 移植前ニッチ:初期LSMトレーニングにおけるモジュール状タスク分割の形成ダイナミクス
- Authors: Guangqi Li, Yongxin Li,
- Abstract要約: 大きな言語モデルは、人間の脳のよく研究された機能的ネットワークを反映するモジュラー内部組織を示す。
我々は、Pythia-410Mモデルをスクラッチ(2つのトラジェクトリ、bf16、fp32)からトレーニングし、各ステップで属性パッチを実行する。
基板からの逸脱は、学習されるドメインにのみ現れ、モジュラリティが学習を追跡するという仮説と一致する。
- 参考スコア(独自算出の注目度): 2.446942686520097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models exhibit a modular internal organization that mirrors well-studied functional networks of the human brain, but how this organization forms during training is unknown: prior work has characterized finished models, not the formation process. We track formation step by step: we train a Pythia-410M model from scratch (two trajectories, bf16 and fp32) and run attribution patching at every step, alongside probes for gradient norms, effective updates, weight norms, and first-order loss decomposition across 14 tasks in four cognitive domains. Three findings. First, the modular map is pre-carved: before any learning, the dominant task pair already overlaps at ~3.6x the attribution substrate (a task-independent baseline), and its layer-0 concentration is an architecture-level constant on this model family. Second, the partition locks in through two sharp jumps whose amplitudes do not track the learning-rate schedule (the second reaching 20.4 sigma quiet-window / 6.2 sigma global), accompanied by gradient-level relative deprivation--winners receive 2.25->2.73x the loser's gradient supply, 9.5-11.5 standard deviations below a random control--that does not propagate to updates or weights. Third, deviation from the substrate appears only in the domain being learned, consistent with the hypothesis that modularity tracks learning. We close by separating the feature-level account we can defend from the mechanistic questions we cannot, and we pre-register the scale-threshold hypothesis behind our ongoing 2.8B experiments.
- Abstract(参考訳): 大きな言語モデルは、人間の脳のよく研究された機能的ネットワークを反映するモジュール化された内部組織を示すが、この組織がトレーニング中にどのように形成されるかは不明である。
我々はPythia-410Mモデルをスクラッチからトレーニングし(2つのトラジェクトリ、bf16、fp32)、各ステップで属性パッチを実行する。
3つの発見。
まず、モジュラー写像は事前に彫られている:任意の学習の前に、支配的なタスクペアは帰属基板(タスクに依存しないベースライン)の3.6倍に既に重なり、その層-0濃度はこのモデルファミリーのアーキテクチャレベル定数である。
第2に、ディフェンスは2つの急激なジャンプでロックされ、その振幅は学習速度のスケジュール(第2位は20.4シグマ・サイレント・ウインドウ/6.2シグマ・グローバル)をトラックしない。
第三に、基板からの逸脱は、学習されるドメインにのみ現れ、モジュラリティが学習を追跡するという仮説と一致する。
我々は,現在進行中の2.8B実験の背後にあるスケールスレッショルド仮説を事前に登録する。
関連論文リスト
- Dynamic Mixture of Latent Memories for Self-Evolving Agents [57.20419419302731]
MoLEMは、動的混合(MoE)に基づく潜在メモリフレームワークの生成混合物である。
我々は、数学、科学、コードドメインにまたがる連続的な学習シーケンスに基づいて、このフレームワークを訓練する。
連続学習を完了した後、Vanilla事前学習ベースラインよりも平均精度を10.40%向上させる。
論文 参考訳(メタデータ) (2026-05-21T03:35:10Z) - TabH2O: A Unified Foundation Model for Tabular Prediction [12.882141870947706]
本研究では,テキスト内学習による1つの前方パスの分類と回帰を行うモデルであるTabH2Oを提案する。
我々はTALENTベンチマークでTabH2O v1(29.2Mパラメータ)を評価し、6つの評価手法のうち平均2.55のランクを達成した。
論文 参考訳(メタデータ) (2026-05-18T13:27:54Z) - Forgetting That Sticks: Quantization-Permanent Unlearning via Circuit Attribution [3.6704226968275253]
量子化を乗り越える手法はモデルにほとんど変化しないが, 圧縮条件下では, 有意義な忘れ方を実現するための勾配に基づく手法を示す。
因果回路の属性を組み合わせることで両モードを解消し,最小限の差分集合部分グラフを分離するMANSUを提案する。
さらに,構造的消去と行動抑制を区別する機構的検証尺度であるCircuit Attribution Divergence(CAD)を導入する。
論文 参考訳(メタデータ) (2026-05-14T17:44:10Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - MERGETUNE: Continued fine-tuning of vision-language models [77.8627788911249]
微調整視覚言語モデル(VLM)は、しばしば事前訓練された知識を破滅的に忘れてしまう。
ゼロショットモデルに適応した後に事前学習した知識を回復するための新しいパラダイムである連続微調整(CFT)を導入する。
論文 参考訳(メタデータ) (2026-01-15T15:15:53Z) - Deconstructing Pre-training: Knowledge Attribution Analysis in MoE and Dense Models [37.90956602792573]
Mixture-of-Experts (MoE)アーキテクチャは、モデルキャパシティをトーケン毎の計算から分離する。
本稿では,MoEおよび高密度アーキテクチャにおける知識獲得ダイナミクスの時間分解比較について述べる。
10つの重要なMoEアテンションヘッドのマスキングは、密度モデルの50%に比べて、リレーショナルHIT@10を10%削減する。
論文 参考訳(メタデータ) (2026-01-13T09:44:00Z) - T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling [52.34735382627312]
大規模言語モデル(LLM)は複雑な推論タスクにおいて顕著な能力を示した。
既存のアプローチは主に、効果的なテストタイムスケーリングを達成するために、模倣学習と苦労に依存しています。
我々は、探索を奨励し、推論スケーリングを理解することで、強化学習をスケールするためにT1を提案する。
論文 参考訳(メタデータ) (2025-01-20T18:33:33Z) - Efficient Stagewise Pretraining via Progressive Subnetworks [53.00045381931778]
一般的な見方では、レイヤのドロップのような段階的なドロップ戦略は、スタック方式のアプローチと比べて効果がない。
本稿では, 適切な設計で, 戦略の廃止は, 積み重ね手法よりも競争力があることを示すことによって, この概念に挑戦する。
本稿では,各ステップでランダムサブネットワークのみを選択し,訓練し,段階的に拡大するランダムパートトレーニング(RAPTR)を提案する。
論文 参考訳(メタデータ) (2024-02-08T18:49:09Z) - Improved Convergence Guarantees for Shallow Neural Networks [91.3755431537592]
勾配降下法により訓練された深度2ニューラルネットの収束度を世界最小とする。
我々のモデルには、二次損失関数による回帰、完全連結フィードフォワードアーキテクチャ、RelUアクティベーション、ガウスデータインスタンス、逆ラベルといった特徴がある。
彼らは、少なくとも我々のモデルでは、収束現象がNTK体制をはるかに超越していることを強く示唆している」。
論文 参考訳(メタデータ) (2022-12-05T14:47:52Z) - Unifying Language Learning Paradigms [96.35981503087567]
データセットやセットアップ全体にわたって普遍的に有効である事前学習モデルのための統一的なフレームワークを提案する。
本研究では, 事前学習対象を相互に配置し, 異なる対象間の補間を効果的に行う方法を示す。
また,テキスト内学習において,ゼロショットSuperGLUEで175B GPT-3,ワンショット要約でT5-XXLの性能を3倍に向上させた。
論文 参考訳(メタデータ) (2022-05-10T19:32:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。