論文の概要: LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
- arxiv url: http://arxiv.org/abs/2607.14952v1
- Date: Thu, 16 Jul 2026 13:00:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.116552
- Title: LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
- Title(参考訳): LongStraw: 固定GPU予算下で200万トークンを超える長期RL
- Abstract要約: LongStrawは、100万のRLポストトレーニングのためのアーキテクチャを意識した実行スタックで、GPU予算が固定されている。
オートグレードなしで共有プロンプトを評価し、後続のトークンで必要とされるモデル固有の状態のみを保持し、ショートレスポンスブランチを一度に再生する。
我々は、ハイブリッド・リカレント・フルアテンションQwen3.6-27Bと圧縮アテンション混合試験GLM-5.2に実装する。
- 参考スコア(独自算出の注目度): 23.770886960293286
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A growing gap separates inference context lengths from RL post-training: inference systems are approaching million-token contexts, while post-training workloads often remain at 256K tokens or below and rely on length generalization at deployment. The gap is especially important for AI agents, whose observations, tool outputs, documents, and prior decisions accumulate over long trajectories. LongStraw is an architecture-aware execution stack for million-token RL post-training under a fixed GPU budget, instantiated with Group Relative Policy Optimization (GRPO). It evaluates the shared prompt without autograd, retains only model-specific state needed by later tokens, and replays short response branches one at a time, reducing the live training graph at the cost of additional replay time. We implement it for the hybrid recurrent and full-attention Qwen3.6-27B and the compressed-attention mixture-of-experts GLM-5.2. On eight H20 GPUs, LongStraw completes grouped Qwen scoring and response backward at 2.1M positions for groups of 2 and 8; increasing the group size adds only 0.21 GB of peak allocated memory, while a separate stress test reaches 4.46M positions. On 32 H20 GPUs, we validate the end-to-end LongStraw execution path for a 2.1M-token prompt across all 78 layers of GLM-5.2. These experiments establish execution capacity rather than complete training correctness because the captured prompt state is detached and some distributed forward and gradient composition paths remain incomplete.
- Abstract(参考訳): 推論システムは100万単位のコンテキストに近づいているのに対して、ポストトレーニング後のワークロードは256Kトークン以下に留まり、デプロイ時に長さの一般化に依存していることが多い。
このギャップは、長い軌道上で観察、ツール出力、ドキュメント、事前決定が蓄積されるAIエージェントにとって特に重要である。
LongStrawは、グループ相対ポリシー最適化(GRPO)でインスタンス化された固定GPU予算の下で、100万のRLポストトレーニングのためのアーキテクチャを意識した実行スタックである。
オートグレードなしで共有プロンプトを評価し、後続のトークンで必要とされるモデル固有の状態のみを保持し、ショートレスポンスブランチを一度にリプレイすることで、追加のリプレイ時間によるライブトレーニンググラフの削減を実現している。
我々は、ハイブリッド・リカレント・フルアテンションQwen3.6-27Bと圧縮アテンション混合試験GLM-5.2に実装する。
8つのH20 GPU上で、LongStrawはグループ化されたQwenスコアと応答を2と8のグループで2.1M位置に戻す。
32のH20 GPU上で、GLM-5.2の全78層にわたる2.1Mトークンプロンプトに対して、エンドツーエンドのLongStraw実行パスを検証する。
これらの実験は、捕捉されたプロンプト状態が切り離され、いくつかの分散前方および勾配合成経路が不完全であるため、完全なトレーニングの正確性よりも実行能力を確立する。
関連論文リスト
- PARSER: Read in Parallel, Reason in Depth for Long-Context LLM Agents [85.82624962221026]
本稿では、読みを推論から切り離すPARSERを紹介する。
単一のチャンクにバインドされた軽量サブエージェントのバンクは、ドキュメント全体を並列に読み取る。
7Kから896Kまでのコンテキストを持つマルチホップQAでは、4Bバックボーンを持つPARSERが最強のシーケンシャルメモリベースラインを上回っている。
論文 参考訳(メタデータ) (2026-09-06T16:19:01Z) - Hindsight Memory-PRM: Supervising Memory Management with Auditable Hindsight Credit [48.811961095386]
Hindsight Memory-PRMはこの監査パスを2回利用します。
オフラインで操作条件付きメモリユーティリティの批判をトレーニングする。
オンラインでは、検索、引用、および1つの制御された削除と再回答が、介入校正されたエントリーレベルのプレゼンスクレジットを確定する。
論文 参考訳(メタデータ) (2026-08-30T06:53:13Z) - Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control [0.0]
固定シェアF, 正確なオフラインシェアP*, ローカルアッパーバウンドU, オンライン達成シェアAを用いて, 既定コホート境界を定式化する。
別のメカニズムの研究では、4バイトをホストに返さずに、GPUで計算されたバイナリ決定をデバイスに保持している。
論文 参考訳(メタデータ) (2026-08-12T14:42:15Z) - QSimAdv: A Late-Bound, Vendor-Agnostic Architecture for High-Performance Quantum-Circuit Simulation [1.435000056979246]
QSimAdvは共通カーネルではなく遅延バインディングである。
この設計はNVIDIA GH200とAMD MI250X/EPYCシステムで実現している。
論文 参考訳(メタデータ) (2026-08-11T23:17:29Z) - Qwen-CUA: Native Computer Use for (almost) Everything [104.78368489343713]
本稿では,Qwen-CUAについて紹介する。
DOMツリー、アクセシビリティメタデータ、タスク固有のAPIなしで、スクリーンショットのみを観察し、キーボードやマウスのイベントを通じて動作します。
足場は最大20個のアクティブなスクリーンショットを保持し、最近の証拠を保持するために固定サイズのブロックで古い視覚履歴を折り畳む。
論文 参考訳(メタデータ) (2026-08-03T15:04:20Z) - A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi [0.0]
このレポートはハードウェアを維持し、適合するモデルに何ができるかを尋ねる。
SigLIP2エンコーダとウィンドウアテンションマージを組み合わせた,現代的なマルチモーダルアシスタントであるMini-V-4.6をデプロイする。
システムは、画像質問のエンドツーエンドを1.7秒で答える。
論文 参考訳(メタデータ) (2026-07-16T04:48:44Z) - CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents [46.180980184707416]
本研究では,長期エージェントLLMをコンテキスト圧縮で学習するための強化学習戦略であるCompactionRLを提案する。
我々はオープンモデル上でCompactionRLを訓練し、エージェントコーディングタスクにおける一貫したパフォーマンス向上を観察する。
GLM-4.7-Flash (30B-A3B) をベースとして、CompactionRLはPass@1を5.5と6.8ポイント改善し、SWEベンチ認証では56.4%、ターミナルベンチ2.0では20.2%に達した。
論文 参考訳(メタデータ) (2026-07-06T17:55:12Z) - Hierarchical Global Attention (HGA) [0.0]
階層的グローバルアテンション(Hierarchical Global Attention, HGA)は、事前訓練された長文変換器における深い因果的注意の代替である。
HGAは64Kトークンのコンテキストに適用され、トークンレベルのK/Vストレージはこのハードウェアでは実現不可能である。
結果: 経路的注意は, 約0.01$--0.02$ナット内に留まり, 空間的注意は3%程度である。
論文 参考訳(メタデータ) (2026-06-29T16:20:35Z) - PersistentKV: Page-Aware Decode Scheduling for Long-Context LLM Serving on Commodity GPUs [0.8460698440162889]
本稿では,ブロックテーブル型デコードアテンションエンジンPersistentKVとページ認識スケジューリング研究について述べる。
Per Per PersistentKVマップはKVヘッドグループによって動作し、ネイティブページテーブル上で直接実行される。
5つのホールドアウト種子は、バイモーダル、均一、Zipfライクなワークロードにおいて、平均壁の復号化スループットを1.04xから1.08x改善することを示した。
論文 参考訳(メタデータ) (2026-06-25T06:56:43Z) - Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving [0.5076419064097734]
我々は、低レイテンシ、小バッチ、デバイス上の物理AIサービスという、反対の体制について研究する。
完全復元可能な状態に対するグラフバウンドチェックポイントと復元機構である実行状態カプセルを導入する。
これにより、トークンアドレス付きKVフラグメントからグラフバウンド実行状態境界への再利用が実現される。
論文 参考訳(メタデータ) (2026-06-18T17:49:36Z) - Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games [69.57330692969543]
RNG-Benchは、過去の観測を再構築するベースモデルの能力を分離するために設計されたベンチマークスイートである。
RNG-Benchには2つの補完ゲームがある: マッチングペア(英語版) - 特定の場所でカードのIDを短期間明らかにする) と、エゴセントリックなビューを空間地図に統合する3D Maze である。
最も難しい構成では、約128Kのトークンと350のイメージ入力のコンテキストが必要であり、フロンティアMLLMによる飽和には程遠いままである。
論文 参考訳(メタデータ) (2026-06-17T17:59:34Z) - ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation [69.45329019089041]
マルチショットビデオ外挿(マルチショットビデオ外挿、Multi-Shot Video Extrapolation、MSVE)は、観察されたフレームまたはクリップを撮影的に構造化された一連のショットに拡張するタスクである。
MSVEは、長ビデオの障害は単にコンテキスト長の制限ではなく、コンテキスト割り当ての障害であることを明らかにした。
本稿では,再帰的コンテキスト割当(Recursive Context Allocation, ReCA)を提案する。
論文 参考訳(メタデータ) (2026-05-26T04:16:56Z) - EndPrompt: Efficient Long-Context Extension via Terminal Anchoring [62.81677226065374]
本稿では,短いトレーニングシーケンスのみを用いて,効果的なコンテキスト拡張を実現する手法であるEndPromptを提案する。
我々は、元の短いコンテキストを無傷の第1セグメントとして保存し、短い端末プロンプトを第2セグメントとして追加し、ターゲットコンテキスト長の近傍に位置指標を割り当てる。
エンドプロンプトの平均RULERスコアは76.03で、LongBenchでは最高であり、LCEG(72.24)、LongLoRA(72.95)、フル長のファインチューニングを上回っている。
論文 参考訳(メタデータ) (2026-05-14T09:00:03Z) - Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts [68.79341332280062]
長いコンテキストでの大規模言語モデル(LLM)のトレーニングは、トレーニング時間ではなく、GPUメモリの異常なオーバーヘッドによって厳しく制限される。
この障壁に直面するメモリ効率の高いトレーニングシステムOOMBを紹介します。
本手法では,オンザフライアクティベーション・リコンピュテーションを備えたチャンク・リカレント・トレーニング・フレームワークを用いて,一定のアクティベーションメモリフットプリントを維持する。
論文 参考訳(メタデータ) (2026-02-02T13:52:40Z) - dParallel: Learnable Parallel Decoding for dLLMs [77.24184219948337]
拡散大言語モデル(dLLM)は並列トークン予測と低推論遅延を提供する。
既存のオープンソースモデルは、パフォーマンスを確保するためにトークン長のデコードステップをほとんど必要としています。
高速サンプリングのためにdLLMs固有の並列性を解き放つシンプルで効果的な方法であるdParallelを導入する。
論文 参考訳(メタデータ) (2025-09-30T16:32:52Z) - Squeezed Attention: Accelerating Long Context Length LLM Inference [61.787865959140994]
本稿では,入力コンテキストの大部分を固定したアプリケーションを高速化するために,Squeezed Attentionを提案する。
推論中、ユーザ入力からのクエリトークンとセントロイドを比較し、固定されたコンテキストからどのキーが意味論的に関連しているかを予測する。
また,線形から対数的への注意の複雑さを,固定した文脈長に対して低減できる階層型アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-11-14T18:54:19Z) - A Little Goes a Long Way: Efficient Long Context Training and Inference with Partial Contexts [38.867323730365406]
LongGenは、事前訓練されたLLMを、長さ拡張中に効率的なアーキテクチャに微調整する。
LongGenはトレーニングのスピードアップを1.55倍にし、フルアテンションベースラインに比べてウォールタイム時間を36%短縮する。
推論中、LongGenはKVキャッシュメモリを62%削減し、1.67倍のプリフィルスピードアップと1.41倍のデコードスピードアップを達成した。
論文 参考訳(メタデータ) (2024-10-02T12:35:53Z) - ChatQA 2: Bridging the Gap to Proprietary LLMs in Long Context and RAG Capabilities [53.97515452727115]
ChatQA 2は、128Kコンテキストウィンドウを備えたLlama 3.0ベースのモデルである。
Llama3-70Bベースのコンテキストウィンドウを8Kから128Kまで拡張するためのトレーニングレシピを提案する。
RAGを用いた長文LLMの性能は,多数のチャンクを検索した場合に向上することがわかった。
論文 参考訳(メタデータ) (2024-07-19T17:35:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。