論文の概要: Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- arxiv url: http://arxiv.org/abs/2607.07740v2
- Date: Fri, 10 Jul 2026 03:53:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.714148
- Title: Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- Title(参考訳): Jet-Long:動的二焦点RoPEによる効率的な長期拡張
- Abstract要約: Jet-Longは、ローカルなRoPE対応ウィンドウと長距離ウィンドウをペアリングする、チューニング不要なゼロショット方式である。
Qwen3-1.7B/4B/8Bから128Kまで、Jet-LongはRULERを$4.79$/$+2.18$/$+2.03$ ppでリードする。
- 参考スコア(独自算出の注目度): 26.27800618469414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern LLMs are increasingly deployed in long-context applications such as retrieval-augmented generation, repository-level coding, and agentic workflows whose accumulated reasoning and tool traces routinely push the input an order of magnitude past the pretraining window, making zero-shot context extension the dominant deployment path for open-weight checkpoints. The dominant zero-shot methods (YaRN, Self-Extend, DCA) fix a single rescaling factor up front, so an aggressive factor sacrifices short-context fidelity while a conservative one breaks down at long contexts; recent length-aware variants adapt the mapping, but with a fitted or distance-dependent schedule. We propose Jet-Long, a tuning-free zero-shot method that pairs a local RoPE-faithful window with a long-range window whose rescaling factor adapts dynamically to the current sequence length via a parameter-free analytic schedule, recovering the base model exactly at short inputs while extrapolating cleanly at long ones. An inclusion-exclusion attention merge and an on-the-fly RoPE correction rotation make the bifocal construction essentially free at inference; fused into a single CuTe kernel, long-context prefill reaches up to $1.39\times$ FA2 throughput on H100 (approaching the Hopper-only FA4), and single-batch generation incurs $\le 4\%$ overhead at every length. On Qwen3-1.7B/4B/8B up to 128K context, Jet-Long leads RULER by $+4.79$/$+2.18$/$+2.03$ pp over the strongest baseline at 1.7B/4B/8B, achieves the best overall accuracy on HELMET-RAG (a benchmark identified by HELMET as the most efficient predictor of downstream long-context performance) and attains the lowest PG-19 perplexity. Jet-Long also generalizes to hybrid attention architectures such as Jet-Nemotron for further long-context improvement without retraining, and remains hyperparameter-resilient for ease of deployment.
- Abstract(参考訳): 検索強化生成、リポジトリレベルのコーディング、そして蓄積された推論とツールトレースが、プレトレーニングウィンドウを通り、定期的に入力を桁違いにプッシュするエージェントワークフローといった、長いコンテキストのアプリケーションに、現代のLLMはますますデプロイされ、ゼロショットコンテキスト拡張がオープンウェイトチェックポイントのデプロイメントパスの主要なものになっている。
支配的なゼロショット法(YaRN、Self-Extend、DCA)は、1つの再スケーリング因子を前もって修正するので、攻撃的因子は短いコンテキストの忠実さを犠牲にし、保守的要素は長いコンテキストで分解する。
我々は,パラメータフリー解析スケジュールを用いて,局所的なRoPE忠実なウィンドウと長範囲のウィンドウをペアリングし,その再スケーリング係数を現在のシーケンス長に動的に適応させる,チューニング不要なゼロショット手法であるJet-Longを提案する。
1つのCuTeカーネルに融合し、長いコンテキストのプリフィルがH100上で最大1.39\times$ FA2スループットに達する(ホッパーのみのFA4を適用)。
Qwen3-1.7B/4B/8Bから128Kまでの文脈において、Jet-LongはRULERを$+4.79$/$+2.18$/$+2.03$ ppで1.7B/4B/8Bで最強のベースラインでリードし、HELMET-RAG(HELMETが下流の長文性能の最も効率的な予測器であると確認したベンチマーク)上で最高の総合精度を達成する。
Jet-Longはまた、Jet-Nemotronのようなハイブリットアテンションアーキテクチャに一般化して、リトレーニングなしでより長期のコンテキスト改善を実現し、デプロイが容易なハイパーパラメータ耐性を維持している。
関連論文リスト
- LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning [2.1218260966433955]
LongAttnCompは、軽量なクロスアテンションスコアリング層を微調整するAttnCompの長いコンテキスト適応である。
InfiniteBenchのコード-デバッグでは、LongAttnCompはフルコンテキストの正確さにマッチするか、超える。
LongBench v2では、2段階のレシピが多文書推論のステージ1のギャップを埋めている。
論文 参考訳(メタデータ) (2026-05-31T16:40:36Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling [0.0]
既存のスパースアテンション手法は、コンテキスト適応性、オーバーヘッドのサンプリング、微調整コストのトレードオフに直面している。
注意分布に垂直スラッシュ構造パターンを用いる軽量なトレーニング機構であるVSPrefillを提案する。
VSPrefillは注意点の98.35%を保存し、コンテキスト長128kで平均4.95倍のスピードアップを提供する。
論文 参考訳(メタデータ) (2026-03-03T09:24:58Z) - Fast Forward: Accelerating LLM Prefill with Predictive FFN Sparsity [5.223181756178433]
我々は,大規模言語モデル (LLM) のプレフィルをブロックワイドでコンテキスト対応のFFNスパシティによって高速化する,予測可能なスパシティフレームワークであるFastForwardを紹介した。
FastForwardは最大1.45$times$計算バウンド・スピードアップを50%FFN間隔で提供し、LongBenchの高密度ベースラインに比べて6%の精度で損失する。
論文 参考訳(メタデータ) (2026-01-30T23:23:40Z) - Q-ROAR: Outlier-Aware Rescaling for RoPE Position Interpolation in Quantized Long-Context LLMs [0.9510848451801044]
PIとPTQを組み合わせることで、長いコンテキストエイリアス化、ダイナミックレンジ拡張、軸格子異方性、位置依存ロジットノイズを誘導するシフトによる精度が低下することを示す。
本稿では,RoPE 次元を数個の周波数帯域にグループ化し,W_Q,W_K の帯域単位のスケールを最小に探索し,ロジットスケールを保存するための対称変種を任意に生成する,RoPE 対応の重み付き安定化 Q-ROAR を提案する。
論文 参考訳(メタデータ) (2025-09-17T19:50:16Z) - LongRoPE2: Near-Lossless LLM Context Window Scaling [46.936900701411965]
LongRoPE2は、トレーニング済みの大規模言語モデル(LLM)の効果的なコンテキストウィンドウをターゲット長に拡張する、新しいアプローチである。
提案手法は,(1) 従来の手法で観測された分布外問題に対して,RoPE次元のトレーニングが不十分であるという仮説,(2) 不十分なトレーニング問題に対処するために,"needle-driven" パープレクシリティによって導かれる進化的探索を採用する効果的なRoPE再スケーリングアルゴリズム,(3) 細管モデル重みを長文配列に適用するための混合コンテキストウィンドウトレーニングアプローチ,の3つによって達成される。
論文 参考訳(メタデータ) (2025-02-27T13:41:07Z) - LongEmbed: Extending Embedding Models for Long Context Retrieval [87.60404151086715]
本稿では、埋め込みモデルのコンテキストウィンドウ拡張について検討し、追加のトレーニングを必要とせず、制限を32kまで押し上げる。
まず、新たに構築したLongEmbedベンチマークにおいて、コンテキスト検索のための現在の埋め込みモデルの性能について検討する。
実験では、PlaceRoのようなトレーニング不要のコンテキストウィンドウ拡張戦略が、既存の埋め込みモデルのコンテキストウィンドウを複数の折り畳みで効果的に拡張できることが示されている。
論文 参考訳(メタデータ) (2024-04-18T11:29:23Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。