論文の概要: LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
- arxiv url: http://arxiv.org/abs/2607.14952v2
- Date: Mon, 20 Jul 2026 05:47:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 14:24:57.664693
- Title: LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
- Title(参考訳): LongStraw: 固定GPU予算下で200万トークンを超える長期RL
- Authors: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin,
- Abstract要約: LongStrawは、GPU予算を固定した100万のRLポストトレーニングのための、客観的かつアーキテクチャを意識したシステムである。
Qwen3.6-27Bでは、LongStrawはコンパクトなGDN状態、CP8シャーディングKVページ、正確なアテンション合成、リバースブロック再生を組み合わせた。
GLM-5.2では、CPU常駐のMLA/DSA状態、IndexShare対応の選択、CP32/EP32上のネイティブトップ8 MoEリプレイを組み合わせた。
- 参考スコア(独自算出の注目度): 23.770886960293286
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A widening gap separates million-token inference from RL post-training, which remains at 256K tokens or below. The gap matters for AI agents, whose observations, tool outputs, documents, and decisions accumulate over long trajectories. Unlike inference, GRPO scores and backpropagates through multiple responses conditioned on one history, making attention and long-lived backward state a primary GPU-memory barrier. We present LongStraw, an objective- and architecture-aware system for million-token RL post-training under a fixed GPU budget. Resident state retains only model-native prompt state needed by later tokens, not the full graph. Response replay restores that state, scores graph-free old/reference branches, rebuilds one policy response under autograd, backpropagates, and pops to the prompt boundary. Distributed, model-native execution assigns state and gradients to context and expert owners. State is shared within a group and recaptured or reused under a measured refresh policy after an update. For Qwen3.6-27B, LongStraw combines compact GDN state, CP8-sharded KV pages, exact attention composition, and reverse block replay. For GLM-5.2, it combines CPU-resident MLA/DSA state, IndexShare-aware selection, and native top-8 MoE replay over CP32/EP32. On eight H20 GPUs, Qwen completes exact-attention response-only GRPO at 2,097,152 positions for G=2 and G=8; a 4,456,448-position prefix supports eight G=8 cycles (64 replays) at 83.894 GB per rank. On 32 H20 GPUs, GLM completes deterministic 2M execution and two 78-layer backward passes; archived external integrations provide preliminary validation of the real vLLM-DAPO-Tinker/Megatron loop. Practical training context is set by resident-state lifetime, replay, and distributed ownership rather than attention kernels alone. The measured objective is response-only execution, not full-sequence gradient equivalence.
- Abstract(参考訳): 拡張ギャップは、256Kトークン以下のRLポストトレーニングから100万トークンの推論を分離する。
このギャップは、観察、ツール出力、ドキュメント、決定が長い軌道上に蓄積するAIエージェントにとって重要である。
推論とは異なり、GRPOのスコアとバックプロパゲーションは、1つの履歴に条件付けされた複数のレスポンスを通じて行われる。
固定GPU予算の下で100万のRLポストトレーニングを行うための,客観的かつアーキテクチャを意識したシステムであるLongStrawを提案する。
居住者状態は、完全なグラフではなく、後のトークンで必要とされるモデル固有のプロンプト状態のみを保持する。
レスポンスリプレイはその状態を復元し、グラフのない古い/参照ブランチをスコアし、オートグレードの下で1つのポリシーレスポンスを再構築し、バックプロパゲートし、即時境界にポップアップする。
分散されたモデルネイティブな実行は、状態と勾配をコンテキストとエキスパートオーナに割り当てる。
状態はグループ内で共有され、更新後に測定されたリフレッシュポリシーの下で再取得または再利用される。
Qwen3.6-27Bでは、LongStrawはコンパクトなGDN状態、CP8シャーディングKVページ、正確なアテンション合成、リバースブロック再生を組み合わせた。
GLM-5.2では、CPU常駐のMLA/DSA状態、IndexShare対応の選択、CP32/EP32上のネイティブトップ8 MoEリプレイを組み合わせた。
8つのH20 GPU上では、QwenはG=2とG=8の2,097,152位置でGRPOを完了し、4,456,448ポジションプレフィックスは8つのG=8サイクル(64リプレイ)を83.894GBでサポートしている。
32 H20 GPUでは、GLMは決定論的2M実行と2つの78層の後方パスを完了し、アーカイブされた外部統合は、実際のvLLM-DAPO-Tinker/Megatronループの予備検証を提供する。
実際のトレーニングコンテキストは、アテンションカーネルのみではなく、常駐状態のライフタイム、リプレイ、分散オーナシップによって設定される。
測定対象は応答のみの実行であり、全列勾配同値ではない。
関連論文リスト
- CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents [46.180980184707416]
本研究では,長期エージェントLLMをコンテキスト圧縮で学習するための強化学習戦略であるCompactionRLを提案する。
我々はオープンモデル上でCompactionRLを訓練し、エージェントコーディングタスクにおける一貫したパフォーマンス向上を観察する。
GLM-4.7-Flash (30B-A3B) をベースとして、CompactionRLはPass@1を5.5と6.8ポイント改善し、SWEベンチ認証では56.4%、ターミナルベンチ2.0では20.2%に達した。
論文 参考訳(メタデータ) (2026-07-06T17:55:12Z) - PersistentKV: Page-Aware Decode Scheduling for Long-Context LLM Serving on Commodity GPUs [0.8460698440162889]
本稿では,ブロックテーブル型デコードアテンションエンジンPersistentKVとページ認識スケジューリング研究について述べる。
Per Per PersistentKVマップはKVヘッドグループによって動作し、ネイティブページテーブル上で直接実行される。
5つのホールドアウト種子は、バイモーダル、均一、Zipfライクなワークロードにおいて、平均壁の復号化スループットを1.04xから1.08x改善することを示した。
論文 参考訳(メタデータ) (2026-06-25T06:56:43Z) - EndPrompt: Efficient Long-Context Extension via Terminal Anchoring [62.81677226065374]
本稿では,短いトレーニングシーケンスのみを用いて,効果的なコンテキスト拡張を実現する手法であるEndPromptを提案する。
我々は、元の短いコンテキストを無傷の第1セグメントとして保存し、短い端末プロンプトを第2セグメントとして追加し、ターゲットコンテキスト長の近傍に位置指標を割り当てる。
エンドプロンプトの平均RULERスコアは76.03で、LongBenchでは最高であり、LCEG(72.24)、LongLoRA(72.95)、フル長のファインチューニングを上回っている。
論文 参考訳(メタデータ) (2026-05-14T09:00:03Z) - Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts [68.79341332280062]
長いコンテキストでの大規模言語モデル(LLM)のトレーニングは、トレーニング時間ではなく、GPUメモリの異常なオーバーヘッドによって厳しく制限される。
この障壁に直面するメモリ効率の高いトレーニングシステムOOMBを紹介します。
本手法では,オンザフライアクティベーション・リコンピュテーションを備えたチャンク・リカレント・トレーニング・フレームワークを用いて,一定のアクティベーションメモリフットプリントを維持する。
論文 参考訳(メタデータ) (2026-02-02T13:52:40Z) - Squeezed Attention: Accelerating Long Context Length LLM Inference [61.787865959140994]
本稿では,入力コンテキストの大部分を固定したアプリケーションを高速化するために,Squeezed Attentionを提案する。
推論中、ユーザ入力からのクエリトークンとセントロイドを比較し、固定されたコンテキストからどのキーが意味論的に関連しているかを予測する。
また,線形から対数的への注意の複雑さを,固定した文脈長に対して低減できる階層型アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-11-14T18:54:19Z) - A Little Goes a Long Way: Efficient Long Context Training and Inference with Partial Contexts [38.867323730365406]
LongGenは、事前訓練されたLLMを、長さ拡張中に効率的なアーキテクチャに微調整する。
LongGenはトレーニングのスピードアップを1.55倍にし、フルアテンションベースラインに比べてウォールタイム時間を36%短縮する。
推論中、LongGenはKVキャッシュメモリを62%削減し、1.67倍のプリフィルスピードアップと1.41倍のデコードスピードアップを達成した。
論文 参考訳(メタデータ) (2024-10-02T12:35:53Z) - ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities [53.97515452727115]
ChatQA 2は、128Kコンテキストウィンドウを備えたLlama 3.0ベースのモデルである。
Llama3-70Bベースのコンテキストウィンドウを8Kから128Kまで拡張するためのトレーニングレシピを提案する。
RAGを用いた長文LLMの性能は,多数のチャンクを検索した場合に向上することがわかった。
論文 参考訳(メタデータ) (2024-07-19T17:35:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。