論文の概要: Harmonic: Hierarchical State Space Models for Efficient Long-Context Language Modeling
- arxiv url: http://arxiv.org/abs/2606.24650v1
- Date: Sat, 30 May 2026 07:39:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.320225
- Title: Harmonic: Hierarchical State Space Models for Efficient Long-Context Language Modeling
- Title(参考訳): Harmonic: 効率的な長期言語モデリングのための階層的状態空間モデル
- Authors: Petr Nyoma,
- Abstract要約: 本稿では、言語モデリングのための階層状態空間モデル(SSM)であるHarmonicを紹介する。
enwiki8では、同等のトークン予算を持つハーモニックは、1Kトークンで+1.4%、8Kトークンで+6.7%、32Kトークンで+11.4%で同等のトランスフォーマー(28Mパラム)を上回っている。
64Kトークンでは、マンバとトランスフォーマーは80GB H100でメモリが切れ、ハーモニックの列車は6.169bptに達した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Harmonic, a hierarchical state space model (SSM) for language modeling. The architecture stacks three recurrent levels at progressively slower timescales; each level receives the prediction error of the level below as input, rather than its raw hidden state. On enwiki8 with equal token budgets, Harmonic outperforms a comparable Transformer (28M params) by +1.4% at 1K tokens, +6.7% at 8K tokens, and +11.4% at 32K tokens (bpt, lower is better). It also outperforms Mamba at every tested length by 0.7--1.8%. At 64K tokens, both Mamba and Transformer run out of memory on an 80GB H100; Harmonic trains successfully, reaching 6.169 bpt. Results replicate on WikiText-103 (H-TF gap +1.7% to +7.2% across 1K--32K). At 1B parameter scale, replacing all attention layers in TinyLlama 1.1B with HarmonicBlock eliminates the RoPE positional encoding limit: the resulting Hallamonic model maintains stable loss across sequence lengths 1K--8K on two independent clean benchmarks (Lambada and fineweb-edu held-out), while TinyLlama degrades catastrophically past its 2K-token RoPE limit (gap: +9.4 bpt at seq=8K on Lambada). Compute is O(L) per forward pass vs. O(L^2) for attention. Logs: https://github.com/Omibranch/harmonic-logs.
- Abstract(参考訳): 本稿では、言語モデリングのための階層状態空間モデル(SSM)であるHarmonicを紹介する。
アーキテクチャは、徐々に遅い時間スケールで3つの繰り返しレベルを積み重ねる。各レベルは、生の隠れ状態ではなく、入力として下のレベルの予測エラーを受け取る。
enwiki8では、同等のトークン予算を持つハーモニックは、1Kトークンで+1.4%、8Kトークンで+6.7%、32Kトークンで+11.4%(bpt,low is better)で同等のトランスフォーマー(28Mパラム)を上回っている。
また、マンバを0.7--1.8%上回る。
64Kトークンでは、マンバとトランスフォーマーは80GB H100でメモリが切れ、ハーモニックの列車は6.169bptに達した。
1Bパラメータスケールでは、TinyLlama 1.1Bのすべての注目層をHarmonicBlockに置き換えて1Bパラメータスケールでは、RoPEの位置エンコーディング制限を廃止する: 結果のハラメニックモデルは、2つの独立したクリーンベンチマーク(Lambadaと fineweb-edu held-out)でシーケンス長1K--8Kを安定的に損失し、TinyLlamaは2K-token RoPEの制限を破滅的に超過する(gap: +9.4 bpt at seq=8K on Lambada)。
演算はフォワードパスあたりO(L)であり、注意のためにO(L^2)である。
ログ:https://github.com/Omibranch/harmonic-logs。
関連論文リスト
- Llamion Technical Report [17.983567146196254]
我々はOrion-14Bを標準化されたLlamaファミリーアーキテクチャに変換する。
ラミオンは、H6、MT-Bench、KoMMLU上のオリオンの挙動を回復し、A100のトークンはわずか123Mで4日で回復する。
論文 参考訳(メタデータ) (2026-05-25T10:27:07Z) - Kaczmarz Linear Attention [11.650692583508663]
リニアリカレントモデルはコンテキストを固定サイズの状態に圧縮し、情報を忘れ、書き、編集するルールを中心的な設計問題とする。
Gated DeltaNet (GDN) は、ゲート状態崩壊とデルタルール残差書き込みを結合し、学習可能な係数を用いて、忘れと更新の規模をバランスさせる。
状態形状,ゲート,リニアリカレンス,チャンクワイズ並列アルゴリズムを保存するGDNの1スカラー修正であるKaczmarz Linear (KLA)を提案する。
論文 参考訳(メタデータ) (2026-05-09T01:07:01Z) - TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference [0.0]
TIDEは、定期的なチェックポイント層とルータで学習した小さなレイヤを推論時にアタッチするポストトレーニングシステムであり、トークン毎に隠れた状態が収束した最初期のレイヤを選択する。
DeepSeek R1 Distill 8BのNVIDIA A100では、TIDEは100%プリフィルの終了率(11層でトークンの5%、31層で残るもの)を達成し、プリフィルのレイテンシを7.2%削減し、シングルバッチスループットを6.6%向上させた。
論文 参考訳(メタデータ) (2026-03-22T18:58:07Z) - Chronicals: A High-Performance Framework for LLM Fine-Tuning with 3.51x Speedup over Unsloth [0.0]
Unsloth上で3.5倍のスピードアップを実現したオープンソースのトレーニングフレームワークであるCentralsを紹介します。
オンラインのソフトマックスの正しさ、FlashAttention IO complexity O(N2 d2 M-1)、LoRA+学習速度勾配近似など、完全な数学的基礎を提供する。
論文 参考訳(メタデータ) (2026-01-06T00:00:55Z) - LoLA: Low-Rank Linear Attention With Sparse Caching [33.39181779121562]
本稿では,リフレッシュなリコールを促進するリニアアテンションのための学習自由化であるLoLAを提案する。
パスキー検索タスクでは、LoLAはベースモデルの精度を0.6%から97.4%に改善している。
LoLAは、ゼロショットコモンセンス推論タスクにおいて、他の1Bおよび8Bパラメータのサブクワッドラティックモデルよりも優れている。
論文 参考訳(メタデータ) (2025-05-29T17:12:42Z) - 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float [52.079202872069835]
大規模言語モデル(LLM)や拡散モデル(DM)といった大規模AIモデルは急速に成長している。
圧縮フレームワークであるDynamic-Length Float (DFloat11) を導入し, LLM と DM サイズを30%削減した。
論文 参考訳(メタデータ) (2025-04-15T22:38:38Z) - Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling [70.94320930424331]
選択状態空間モデル(SSM)であるMambaとSliding Window Attention(SWA)を組み合わせた単純なハイブリッドアーキテクチャであるSambaを提案する。
Sambaは特定のシーケンスを選択的にリカレントなシークレット状態に圧縮し、最近の記憶をアテンション機構で正確にリコールする能力を維持している。
私たちはSambaを3.8Bのパラメータに拡張し、3.2Tのトレーニングトークンを使用し、様々なベンチマークで最先端モデルよりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2024-06-11T17:50:51Z) - Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length [112.75694077842604]
文脈長無制限の効率的なシーケンスモデリングのためのニューラルネットワークであるMegalodonを紹介する。
Llama2と比較して、Megalodonは70億のパラメータと2兆のトレーニングトークンのスケールでTransformerよりも効率が良い。
論文 参考訳(メタデータ) (2024-04-12T20:28:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。