論文の概要: Wiring Beats Blending: What Transfers Between Transformer Sizes -- and What Doesn't
- arxiv url: http://arxiv.org/abs/2608.02829v1
- Date: Mon, 03 Aug 2026 19:44:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.926667
- Title: Wiring Beats Blending: What Transfers Between Transformer Sizes -- and What Doesn't
- Title(参考訳): Wiring Beats: トランスフォーマーサイズの違いと、そうでないこと
- Authors: Ravi Satya Durga Prasad Yenugula,
- Abstract要約: 我々は Pythia family の 1.4B->410M 変換を特徴付ける。
最小二乗補償と分散保存再スケールの2つの独立レバーに分解する。
補償は普遍的よりもトークン効率が高く低予算の勝利である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Model families train every size from scratch. Can a pretrained large model be converted into a smaller sibling? We characterize the 1.4B->410M conversion in the Pythia family end-to-end: (i) representations align strongly across sizes (ridge R^2=0.84) while parameters align weakly; (ii) dense weight projection is functionally destructive -- provably not an assembly artifact -- because basis mixing breaks rotary, per-head, GELU, and LayerNorm structure; (iii) after the best-fit linear operator, weight residuals are statistically indistinguishable from noise under shuffle controls; (iv) conversion value therefore lives in initialization. In matched-budget continued pre-training we decompose conversion into two independent levers -- least-squares compensation (function: best zero-shot) and variance-preserving rescale (dynamics: best endpoints). Compensation is a token-efficient, low-budget win rather than a universal one: at 30M tokens it beats the strongest subcloning variant on both a width-reduced pair (84.0 +/- 1.8 vs. 89.7 +/- 3.7, 3/3 seeds) and a held-out depth-reduced pair (109.3 vs. 117.9, 3/3 seeds), reaching a given quality with fewer tokens; at a 33x larger budget the two converge to parity (40.0 vs. 40.0), both far ahead of from-scratch, which transfer initialization always beats -- by up to 18x at low budget, the margin narrowing at convergence and at the largest scale. We further map the method's boundary: at ~5x the donor scale (6.9B->1.4B) stacking both levers over-corrects, which we trace to ill-conditioning of the compensation solve at large width, pointing to dimension-aware regularization as the fix. Code, checkpoints, and the frozen evaluation corpus are released.
- Abstract(参考訳): モデルファミリーは、スクラッチからあらゆるサイズをトレーニングします。
事前訓練された大型モデルは、より小さな兄弟に変換できるのか?
我々は Pythia family の 1.4B->410M 変換を特徴付ける。
(i)表現はサイズ(リッジR^2=0.84)に強く整合する一方、パラメータは弱に整合する。
(II)重み投射は機能的に破壊的であり(おそらく組立工芸品ではない)、ベースミキシングは回転、頭当たり、GELU、レイヤーノーム構造を破る。
三 最適線形演算子の後、重量残余は、シャッフル制御下の騒音と統計的に区別できない。
(iv)変換値は初期化中である。
一致した予算による事前トレーニングでは、変換を2つの独立したレバーに分解します -- 最小二乗補正(関数: ベストゼロショット)と分散保存再スケール(動的: ベストエンドポイント)です。
30Mトークンは幅還元対 (84.0 +/- 1.8 vs. 89.7 +/- 3.7, 3/3 シード) とホールドアウト深度還元対 (109.3 vs. 117.9, 3/3 シード) の両方で最強のサブクローニング変種を破り、少ないトークンで与えられた品質に到達し、33倍の予算で2つのパリティに収束する(40.0 対 40.0 対 40.0 対 40.0 対)。
ドナースケール (6.9B->1.4B) は両レバーのオーバーコレクトを積み重ねたもので、補償解を広い範囲で条件付けし、固定として次元認識正規化を指している。
コード、チェックポイント、凍結した評価コーパスがリリースされる。
関連論文リスト
- DepthART: Scaling Foundation Monocular Depth to Tiny Models [51.10174763031444]
DepthARTは、様々なシーンにまたがるデバイス上のデプロイメントのためのコンパクトなMDEモデルである。
ゼロショット一般化とメートル法精度の両方において、DepthARTが従来の小さなベースラインを一貫して上回っていることを示す。
また、GTX A6000で347/245 FPS (strict FP32)、Orin NX 8GBで2242/4482ドル、102 FPS (TF32)、Jetson Nano 4GBで15 FPS (FP32) に達したスケーラブルなモデルファミリも提供しています。
論文 参考訳(メタデータ) (2026-07-19T06:54:52Z) - Cross-Layer Error Compensation and Finite-Sample Feature-Statistics Matching for Extreme Low-Bit Quantization of Large Language Models [0.0]
すべてのレイヤの離散コードとスケールに対する共同最適化として量子化を定式化する。
FP16教師に対して,誤差補償のみのパープレキシティ比が9.56+/-0.15に達することを示す。
Qwen2.5-1.5B で 1.125 ビットのグループバイナリの重みを持つ場合、誤差補償だけで FP16 の教師に対して 9.56 +/- 0.15 のパープレキシティ比に達する。
論文 参考訳(メタデータ) (2026-07-16T06:47:52Z) - No Subspace to Track: Non-Identifiability and Optimizer State in Low-Rank Training [0.0]
GaLoreのようなメモリ効率は、ランク-r部分空間に勾配を投影することで、大きな言語モデルを訓練する。
私たちは、小さな再現可能なコアを超えて、そのようなオブジェクトは存在しないことを示します。
論文 参考訳(メタデータ) (2026-07-07T06:06:04Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - Normalized Architectures are Natively 4-Bit [49.13186675123547]
重みと隠れ表現を単位超球面に制限するアーキテクチャであるnGPTは、本質的に低精度算術よりも堅牢である。
本手法は,最大3B/30Bパラメータの1.2B密度モデルとハイブリッド(Mamba-Transformer)MoEモデルの両方で検証する。
論文 参考訳(メタデータ) (2026-05-07T11:54:07Z) - Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales [0.0]
スペクトル圧縮,ブロックレベル関数置換,回転ベース量子化,アクティベーション幾何,適応早期出口について検討した。
圧縮に関連する5つの構造特性を同定する。
論文 参考訳(メタデータ) (2026-04-22T15:31:46Z) - Geometric Properties of the Voronoi Tessellation in Latent Semantic Manifolds of Large Language Models [0.0]
Qwen3.5-4B-Base上での表現多様体上のボロノイテッセルレーション
ヴォロノワ・テッセルレーションはマージンリファインメント法により緩和可能であることを示す。
論文 参考訳(メタデータ) (2026-04-08T07:36:04Z) - SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing [77.91660464664615]
Diffusion Transformers (DiTs) はビデオ生成において主要なバックボーンとなっているが、その二次的注意コストは依然として大きなボトルネックとなっている。
本稿では,不足しているコントリビューションをトレーニングなしで回収できることを示す。
パラメータフリーな線形補償分岐であるSVG-EARを導入する。
論文 参考訳(メタデータ) (2026-03-09T22:15:31Z) - Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization [6.908972852063454]
時間的行動の局所化は、正確な境界検出と計算効率の両方を必要とする。
我々は、境界距離回帰(BDR)と適応時間制限(ATR)という2つの補完的なイノベーションを通じてこの問題に対処する。
THUMOS14では、ActionFormer++ (55.7% mAP@0.7 at 235G) よりも36%少ないFLOPを用いて、151GのFLOPで56.5% mAP@0.7を達成する。
論文 参考訳(メタデータ) (2025-11-06T00:41:54Z) - KrADagrad: Kronecker Approximation-Domination Gradient Preconditioned
Stochastic Optimization [69.47358238222586]
第2の順序付けにより、パラメータのステップサイズと方向を変更でき、損失曲率に適応できる。
最近、シャンプーはこれらの要求を減らすためにクローネッカーファクター付きプレコンディショナーを導入した。
不条件行列の逆行列根を取る。
これは64ビットの精度が必要で、ハードウェアの制約が強い。
論文 参考訳(メタデータ) (2023-05-30T21:15:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。