論文の概要: Long-Context Fine-Tuning with Limited VRAM
- arxiv url: http://arxiv.org/abs/2607.15105v2
- Date: Fri, 17 Jul 2026 10:34:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.557843
- Title: Long-Context Fine-Tuning with Limited VRAM
- Title(参考訳): 限定VRAMを用いた長期微調整
- Authors: Vladimir Fedosov, Aleksandr Sazhin, Artemiy Grinenko, Frank Woernle,
- Abstract要約: 階層的グローバルアテンションとセグメントワイドバックプロパゲーションと結合KVストレージを組み合わせる。
Dense attention は、学習結果を測定し、標準生成フレームワークと互換性を保つために、主要な品質比較と検索比較に使用される。
- 参考スコア(独自算出の注目度): 39.146761527401424
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Parameter-efficient fine-tuning reduces model and optimizer memory, but dense attention still makes long training sequences expensive. We combine Hierarchical Global Attention (HGA) with segment-wise backpropagation and tiered KV storage. Only the active segment remains differentiable in VRAM; older KV is detached into RAM or NVMe, and HGA loads a bounded set of exact historical tokens for each query block. On Qwen3-8B with 4-bit QLoRA and PG19, dense training on a 16 GB Quadro RTX 5000 fits 2,048 tokens but fails at 4,096, whereas HGA reaches 16,384 tokens with 15.28 GB peak VRAM. Under evaluation the same adapter runs through 131,072 tokens on this card; VRAM is not constant but grows gently with the resident chunk summaries, so RAM and NVMe capacity set the practical limit beyond these lengths. At the shared 2K training length, HGA-trained and dense-trained adapters obtain 2.7405 and 2.7383 nat under the same dense-attention readout, while the stock model obtains 2.9541. At this boundary HGA training is already marginally faster (217.75 vs. 207.02 tokens/s), and the HGA-to-dense throughput ratio improves from 1K to 2K; because HGA keeps the attended historical set per token approximately constant while dense work per token grows, we expect this lead to widen as context grows. Dense attention is used for the main quality and retrieval comparisons so that they measure the learned weights and remain compatible with standard generation frameworks. HGA can also be used for retrieval and generation; an optimized production-grade serving implementation is under development.
- Abstract(参考訳): パラメータ効率のよい微調整はモデルとオプティマイザメモリを削減しますが、注意の集中は長いトレーニングシーケンスを高価にします。
階層的グローバルアテンション(HGA)とセグメントワイドバックプロパゲーションとタイテッドKVストレージを組み合わせる。
アクティブセグメントのみがVRAMで微分可能であり、古いKVはRAMまたはNVMeに切り離され、HGAはクエリブロックごとに正確な履歴トークンの束をロードする。
4ビットQLoRAとPG19のQwen3-8Bでは、16GBのQuadro RTX 5000の高密度トレーニングは2,048トークンに適合するが4,096トークンで失敗し、HGAは16,384トークンと15.28GBのピークVRAMに達した。
評価では、同じアダプタがこのカード上の131,072のトークンを通り抜ける。VRAMは一定ではないが、常駐するチャンクサマリーと優しく成長するので、RAMとNVMeのキャパシティは、これらの長さを超える実用的な制限を設定できる。
共有2Kトレーニング長では、HGAトレーニングされた高密度のアダプタは同じ密度のリードアウトで2.7405および2.7383ナットを取得し、ストックモデルは2.9541を得る。
この境界では、HGAトレーニングは、すでにわずかに速く(217.75 vs. 207.02トークン/s)、HGAのスループット比は1Kから2Kに改善されている。
Dense attentionは、学習した重みを計測し、標準生成フレームワークと互換性を保つために、主要な品質比較と検索比較に使用される。
HGAは検索と生成にも利用でき、最適化されたプロダクショングレードのサービス実装が開発中である。
関連論文リスト
- Mixture-of-Parallelisms: Towards Memory-Efficient Training Stack for Mixture-of-Experts Models [67.17268530365189]
本稿では,Mixture-of-Experts(MoE)モデルのためのメモリ効率のトレーニングスタックを紹介する。
さまざまなレイヤやMoEモデルのトレーニングパイプラインのステージにおいて、さまざまな既存および新しい並列処理テクニックを組み合わせて、特殊化する。
論文 参考訳(メタデータ) (2026-07-02T08:06:57Z) - Hierarchical Global Attention (HGA) [0.0]
階層的グローバルアテンション(Hierarchical Global Attention, HGA)は、事前訓練された長文変換器における深い因果的注意の代替である。
HGAは64Kトークンのコンテキストに適用され、トークンレベルのK/Vストレージはこのハードウェアでは実現不可能である。
結果: 経路的注意は, 約0.01$--0.02$ナット内に留まり, 空間的注意は3%程度である。
論文 参考訳(メタデータ) (2026-06-29T16:20:35Z) - FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention [77.12062766962815]
Lookahead Sparse Attention (LSA)は、DeepSeek-V4アーキテクチャ上に構築されたNeural Memory Indexerを利用している。
このアーキテクチャをバックボーンフリーの非結合なトレーニング戦略でインスタンス化する。
FM-DS-V4は、物理KVキャッシュのフットプリントを、フルコンテキストベースラインのわずか13.5%まで圧縮することを示した。
論文 参考訳(メタデータ) (2026-06-08T06:25:54Z) - A Persistent-State Dataflow Accelerator for Memory-Bound Linear Attention Decode on FPGA [10.452946241750562]
Gated DeltaNet(GDN)は、成長するKVキャッシュを固定サイズのリカレントステートに置き換える線形アテンションメカニズムである。
このボトルネックはアルゴリズムではなくアーキテクチャであることが示され、全てのサブクワッド列モデルはデコード時に 1 FLOP/B 未満の演算強度を示す。
オンチップBRAMにおいて,フル2MBのリカレント状態を持続的に保持することにより,このボトルネックを解消するFPGAアクセラレータを提案する。
論文 参考訳(メタデータ) (2026-03-06T06:03:38Z) - Profiling LoRA/QLoRA Fine-Tuning Efficiency on Consumer GPUs: An RTX 4060 Case Study [0.0]
LoRA や QLoRA のようなパラメータ効率のよい手法で微調整された大規模言語モデルは、控えめなハードウェアの適応を可能にしている。
本稿では,1台のNVIDIA GTX 4060上でのQwen2.5-1.5B-Instructモデルを用いたLoRA/QLoRAファインチューニングの制御プロファイリングについて述べる。
その結果,bf16はfp16と比較して効率が低下するのに対し,ページドではスループットが25%向上した(628 tok/s,500 tok/s)。
論文 参考訳(メタデータ) (2025-09-07T21:41:14Z) - CommVQ: Commutative Vector Quantization for KV Cache Compression [50.37946553931796]
本稿では,長期LLM推論におけるメモリ使用量を大幅に削減するために,CommVQ(CommVQ)を提案する。
まず、KVキャッシュを圧縮するための軽量エンコーダとコードブックを用いた加算量子化を導入する。
提案手法は,RoPE-commutative codebook を用いた加算量子化と低オーバーヘッド化により高い精度を実現する。
論文 参考訳(メタデータ) (2025-06-23T17:50:11Z) - HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading [79.38548165722229]
HEADINFERはKVキャッシュをCPURAMにオフロードするが、GPU上のトランスフォーマー層のKVキャッシュを完全に保存する必要はない。
HEADINFERはメモリフットプリントを大幅に削減し,計算効率を向上することを示した。
論文 参考訳(メタデータ) (2025-02-18T06:26:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。