論文の概要: TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts
- arxiv url: http://arxiv.org/abs/2608.22788v2
- Date: Wed, 26 Aug 2026 14:14:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.001098
- Title: TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts
- Title(参考訳): TailSieve: LLMロールアウト用部分ロールアウトガイドタイルルーティング
- Abstract要約: 少数のロングテール世代がロールアウトステップ全体のエンド・ツー・エンドのメーパンを支配します。
本稿では、テールルーティングとレプリカアロケーションを共同で制御する部分ロールアウト誘導フレームワークであるTailSieveを紹介する。
我々はTailSieveが一様群ルーティングよりも最大1.67倍のルーティングのみの高速化を実現していることを示す。
- 参考スコア(独自算出の注目度): 35.68877516601675
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large-scale rollouts have become a core component of modern LLM systems, spanning reinforcement learning (RL) post-training, on-policy distillation (OPD), and sampling-heavy evaluation pipelines. Unlike online serving, which is typically optimized for request-level latency and throughput, a small number of long-tail generations can dominate the end-to-end makespan of an entire rollout step. In practice, rollout requests are often routed uniformly across replicas, which can place extremely long generations inside high-concurrency decoding batches. To address this, we present TailSieve, a partial-rollout-guided framework that jointly controls tail routing and replica allocation for LLM rollouts. In an idealized setting with known completion lengths, we show that makespan-optimal routing in the long-tail regime combines tail isolation with load balancing, and that a simple top-k policy closely approximates this offline optimum. Leveraging the observation that long-tail prompts tend to remain long-tailed across policy updates, TailSieve uses partial rollouts as a training-free signal for identifying candidate tail groups. A hierarchical controller then jointly adapts the number of isolated groups and the replica split between the tail and bulk pools using collected response-work history and a measured concurrency-throughput model. TailSieve achieves up to 1.67x routing-only speedup over uniform group routing. The resulting low-concurrency tail pool further enables route-specialized speculative decoding with MTP or DFlash, achieving up to 2.59x speedup over uniform routing. Selected prompts are regenerated under the current policy, preserving on-policy generation and avoiding additional routing-induced length bias in steady state.
- Abstract(参考訳): 大規模ロールアウトは、強化学習(RL)ポストトレーニング、オンライン蒸留(OPD)、サンプリング重度評価パイプラインなど、現代のLLMシステムの中核的なコンポーネントとなっている。
通常、要求レベルのレイテンシとスループットに最適化されているオンラインサービスとは異なり、少数のロングテール世代がロールアウトステップ全体のエンド・ツー・エンドのメーパンを支配します。
実際には、ロールアウト要求はレプリカ間で均一にルーティングされることが多く、高いコンカレンシー復号バッチ内に非常に長い世代を配置することができる。
そこで本研究では,LLMロールアウトにおけるテールルーティングとレプリカアロケーションを協調的に制御する部分ロールアウト誘導フレームワークであるTailSieveを紹介する。
既知完備長の理想的設定では、長テール構造におけるメイスパン最適ルーティングは、テールアイソレーションとロードバランシングを組み合わせたものであり、単純なトップkポリシーは、このオフライン最適化を近似していることを示す。
TailSieveは、長い尾のプロンプトがポリシー更新全体にわたって長い尾を保ち続ける傾向にあるという観察を生かして、部分的なロールアウトを、候補の尾のグループを特定するためのトレーニング不要の信号として使用している。
階層型コントローラは、収集された応答-作業履歴と測定された並行-処理モデルを用いて、分離されたグループの数とレプリカをテールとバルクプールに分割する。
TailSieveは、一様グループルーティングよりも最大1.67倍のルーティングのみのスピードアップを実現している。
結果として生じる低コンカレンシーなテールプールにより、MTPやDFlashによるルート特化投機デコードが可能となり、均一なルーティングよりも最大2.59倍のスピードアップが達成される。
選択されたプロンプトは、現在のポリシーの下で再生され、オン・ポリシーの生成を保ち、定常状態におけるルーティングによって引き起こされる長さバイアスを回避する。
関連論文リスト
- Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation [59.216721553953]
大規模言語モデルベースのレコメンデータシステム(LLM-RS)は、現実の多くのアプリケーションでは計算的に持続不可能である。
本稿では,スケーラブルなフルコーパスランキングを維持しつつ,コンパクトなLLMを向上する識別フレームワークを提案する。
Qwen 3 1.7BとLlama 3.2 3Bの3つの実世界のデータセットの実験は、FLEXRecが最先端の精度を達成していることを示している。
論文 参考訳(メタデータ) (2026-08-18T03:14:28Z) - EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts [20.460789503141466]
本稿では、RLロールアウトにおけるこのギャップに対処するために設計されたシステム対応セルフSDフレームワークであるEfficientRolloutを紹介する。
EfficientRolloutは、ARロールアウトベースラインを高速化することで、ロールアウトとエンドツーエンドのレイテンシをそれぞれ19.6%、12.7%削減する。
論文 参考訳(メタデータ) (2026-06-17T11:51:06Z) - Libra: Efficient Resource Management for Agentic RL Post-Training [11.701871372256205]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)を有能なエージェントに変換するための訓練後の標準パラダイムとして登場した。
エージェントRLでは、ロールアウトステージはツールを呼び出しながら軌道を生成し、長い尾と静止しないワークロードを生成する。
両課題に対処するリソース管理システムLibraについて,2つのコアメカニズムを用いて紹介する。
論文 参考訳(メタデータ) (2026-06-02T03:09:13Z) - Versioned Late Materialization for Ultra-Long Sequence Training in Recommendation Systems at Scale [12.736059967085025]
現代のディープラーニング勧告モデル(DLRM)は、シーケンス長のスケーリング法則に従う。
Fat Row"パラダイムは、これらのシーケンスをトレーニングのすべての例にプリマテリアル化し、ストレージとI/Oウォールを作成します。
本稿では、UIHを正規化不変層に一度保存することで、この冗長性を解消するエンバージョン遅延物質化パラダイムを提案する。
論文 参考訳(メタデータ) (2026-04-27T06:41:39Z) - Heddle: A Distributed Orchestration System for Agentic RL Rollout [26.439654927366163]
Heddleはエージェントロールアウトの実行を最適化するトラジェクトリ中心のシステムである。
Heddleは、長時間のボトルネックを効果的に中和し、最大2.5$times$高いエンドツーエンドのロールアウトスループットを実現します。
論文 参考訳(メタデータ) (2026-03-30T07:01:32Z) - SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling [54.276306194000405]
SortedRLを提案する。SortedRLは、強化学習をスケールするためのオンライン長対応スケジューリング戦略である。
SortedRLは、出力長に基づいてロールアウトサンプルをリオーダーし、短いサンプルが早期更新のためにグループを形成することを優先順位付けする。
LLaMA-3.1-8BとQwen-2.5-32Bを論理パズルを含む様々なタスクで実験した結果、SortedRLはRLトレーニングバブル比を50%以上削減することが示された。
論文 参考訳(メタデータ) (2026-03-24T16:48:31Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Beat the long tail: Distribution-Aware Speculative Decoding for RL Training [75.75462952580796]
モデル出力を変更することなくRLロールアウトを高速化する分散Aware Speculativeデコーディングフレームワークを提案する。
数学とコード推論タスクの実験は、DASが同一のトレーニング曲線を保ちながらロールアウト時間を最大50%短縮することを示している。
論文 参考訳(メタデータ) (2025-11-17T19:02:12Z) - RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training [19.00988498482758]
強化学習(Reinforcement Learning, RL)は、大規模言語モデル(LLM)の推論能力を高めるための重要なポストトレーニング手法である。
多くのRLシステムは同期を緩和することでこの問題を緩和しようとするが、これは精度のトレーニングを損なう可能性がある。
同期RLのための新しいロールアウトスケジューリング戦略であるtailを導入し,ロールアウトステップの小さなサブセット(ロングラウンド)に長いテール応答をもたらすプロンプトを体系的に統合する。
RollPackerは、veRLと比較して2.03x-2.56xのトレーニング時間を短縮し、Qwen2.5のRLHFuseよりも最大2.24倍のスピードアップを実現している。
論文 参考訳(メタデータ) (2025-09-25T11:13:22Z) - StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation [55.75008325187133]
強化学習(RL)は,大規模言語モデル(LLM)の学習後のコアとなる。
StreamRLは、最初の原則から分離して、2種類のパフォーマンスボトルネックに対処するように設計されている。
実験により、StreamRLは既存の最先端システムと比較してスループットを最大2.66倍改善することが示された。
論文 参考訳(メタデータ) (2025-04-22T14:19:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。