論文の概要: Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
- arxiv url: http://arxiv.org/abs/2607.08186v1
- Date: Thu, 09 Jul 2026 07:37:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.443089
- Title: Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
- Title(参考訳): 大規模デコード - 大規模言語モデルの潜在計算スケーリング
- Authors: Aiwei Liu, Cheng Shi, Chuhan Wu, Ci Lei, Di Lu, Donald He, Fan Zhang, Fanhao Kong, Feifei Zhang, Guan Wang, Haicheng Wang, Haoyu Liu, Houjin Yu, Jiachen Ding, Jiayi Feng, Jie Zhou, Jijun Chi, Jindi Shi, Jing Lei, Junjie Zhang, Laiyi Li, Le Tian, Linhao Zhang, Miao Fan, Sijun Zhang, Wei Jia, Weiwei Shi, Wenhan Li, Wentao Zhao, Wenteng Liang, Xiao Zhou, Xiaojin Zhou, Xihuai Wang, Xinyu Gao, Xuanliang Wang, Xuyang Ao, Yang Yu, Yangxiu You, Yinuo Zhao, Yufei Kuang, Yufei Wang, Yuan Liu, Yuan Liu, Yuwen Chen, Zhencong Tian, Zhongyin Zhao, Zilin Yu, Zitao Wang,
- Abstract要約: トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
継続事前学習中に適用されたシーケンス長スケーリング手法であるHidden Decodingを提案する。
- 参考スコア(独自算出の注目度): 75.80275843320511
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Scaling Large Language Models (LLMs) has been driven mainly by enlarging the Transformer backbone, but for an already-strong model this requires another round of costly pretraining. We study whether an existing backbone can keep improving by allocating more computation to each token while leaving the Transformer backbone fixed. Depth-recurrent (looped) Transformers pursue this goal but are hard to scale, because looped computation does not fit naturally with the pipeline parallelism used to train the largest models. We add computation along the sequence-length dimension, where the extra computation is simply a longer input and stays compatible with standard large-model training. We propose Hidden Decoding, a sequence-length scaling method applied during continued pretraining (CPT). It expands each token into n streams with independent embedding tables and keeps the intermediate streams' key-value cache as context, so each token performs more internal computation without adding or widening Transformer layers. To keep this affordable at scale, we introduce Stream-Factorized Attention, in which most layers attend only within each stream and only a few layers mix across streams, reducing the attention cost from quadratic to roughly linear in n. Experiments support two scaling results. At frontier scale, we train WeLM-HD4-80B and WeLM-HD4-617B at n=4 and improve their matched non-HD baselines, making Hidden Decoding the first demonstrated sequence-length scaling method at the 100B+ MoE scale. Across expansion factors, the gains grow as n increases, showing that sequence-length expansion is a practical fixed-backbone scaling path for frontier-scale LLMs.
- Abstract(参考訳): 大規模言語モデル(LLM)のスケーリングは,主にTransformerのバックボーンの拡大によって実現されている。
トランスフォーマーのバックボーンを固定したまま、各トークンにより多くの計算を割り当てることで、既存のバックボーンが改善を続けることができるかどうかを検討する。
ループ再帰(ループ化)トランスフォーマーはこの目標を追求するが、ループ計算は最大のモデルのトレーニングに使用されるパイプライン並列性に自然に適合しないため、スケールが難しい。
列長の次元に沿って計算を追加し、余分な計算は単により長い入力であり、通常の大モデルトレーニングと互換性が保たれる。
本稿では,CPT(Continuous Pretraining)中に適用されるシーケンス長スケーリング手法であるHidden Decodingを提案する。
それぞれのトークンを独立した埋め込みテーブルでnストリームに拡張し、中間ストリームのキー値キャッシュをコンテキストとして保持する。
これにより、ほとんどのレイヤが各ストリームにのみ参加し、ほんの数層のレイヤがストリームに混在することになり、注意コストが2次からほぼ線形になる。
実験は2つのスケーリング結果をサポートする。
また,フロンティアスケールでは,WLM-HD4-80BとWLM-HD4-617Bをn=4でトレーニングし,マッチングされた非HDベースラインを改善した。
拡張係数全体では、nが増加するにつれてゲインが増加し、フロンティアスケールのLLMにとって、シーケンス長の展開が実用的な固定バックボーンスケーリングパスであることが示される。
関連論文リスト
- Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling [9.458812631271009]
線形$Q/K/VプロジェクションをNexus-Rank層に置き換えるNexusformerを導入する。
新しい容量は、事前訓練された知識を保持するゼロdブロックを介して2つの軸に沿って注入することができる。
言語モデリングと推論の実験は、NexusformerがTokenformerのパープレキシティベンチマークと一致していることを示している。
論文 参考訳(メタデータ) (2026-04-21T06:54:16Z) - From Projection to Prediction: Beyond Logits for Scalable Language Models [0.28647133890966986]
大規模言語モデル(LLM)のトレーニングは通常、出力層で2段階のパイプラインを伴います。
隠れ状態とターゲットトークンの損失を直接計算することにより、当社のアプローチは明示的なロジットの実体化をバイパスする。
論文 参考訳(メタデータ) (2025-11-18T02:23:47Z) - SCOUT: Toward Sub-Quadratic Attention via Segment Compression for Optimized Utility in Transformers [15.142822497807236]
固定サイズセグメント内でトークンを局所的に圧縮し,これらの圧縮表現にのみ注目するハイブリッドアーキテクチャであるSCOUTを提案する。
SCOUTは、計算コストとメモリコストを大幅に削減しつつ、完全な注意の表現力を保っている。
SCOUTの計算とメモリ効率を解析し、長文言語モデリングおよび推論タスクで経験的に評価する。
論文 参考訳(メタデータ) (2025-08-31T17:08:33Z) - StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs [8.960494482210919]
本稿では,StreamBP と呼ばれるメモリ効率の高いバックプロパゲーション手法を提案する。
StreamBPは、シーケンス次元に沿ったチェーンルールを階層的に線形分解する。
勾配チェックポイントと比較して、StreamBPはBPの最大シーケンス長を2.8-5.5倍にスケールアップする。
論文 参考訳(メタデータ) (2025-06-03T16:54:15Z) - DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme
Long Sequence Transformer Models [34.74093040678323]
我々は,高度に効率的かつスケーラブルなLDMトレーニングを実現するための,新しい,ポータブルで効果的な方法論であるDeepSpeed-Ulyssesを紹介した。
DeepSpeed-Ulyssesは、そのコアでシーケンス次元に沿って入力データを分割し、効率的なオール・ツー・オールの集合通信を用いて注意を払っている。
実験の結果、DeepSpeed-Ulyssesは既存のSOTAベースラインの4倍のシーケンス長で2.5倍高速であることがわかった。
論文 参考訳(メタデータ) (2023-09-25T20:15:57Z) - Winner-Take-All Column Row Sampling for Memory Efficient Adaptation of Language Model [89.8764435351222]
分散を低減した行列生成のために, WTA-CRS と呼ばれる新しい非バイアス推定系を提案する。
我々の研究は、チューニング変換器の文脈において、提案した推定器が既存のものよりも低い分散を示すという理論的および実験的証拠を提供する。
論文 参考訳(メタデータ) (2023-05-24T15:52:08Z) - CloudAttention: Efficient Multi-Scale Attention Scheme For 3D Point
Cloud Learning [81.85951026033787]
この作業にトランスフォーマーをセットし、それらを形状分類と部分およびシーンセグメンテーションのための階層的なフレームワークに組み込む。
また、各イテレーションにおけるサンプリングとグループ化を活用して、効率的でダイナミックなグローバルなクロスアテンションを計算します。
提案した階層モデルは,最先端の形状分類を平均精度で達成し,従来のセグメンテーション法と同等の結果を得る。
論文 参考訳(メタデータ) (2022-07-31T21:39:15Z) - Funnel-Transformer: Filtering out Sequential Redundancy for Efficient
Language Processing [112.2208052057002]
本稿では,隠れ状態の列を短く圧縮するFunnel-Transformerを提案する。
Funnel-TransformerはFLOPに匹敵する数が少ないため、様々なシーケンスレベルの予測タスクにおいて標準のTransformerよりも優れている。
論文 参考訳(メタデータ) (2020-06-05T05:16:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。