論文の概要: Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure
- arxiv url: http://arxiv.org/abs/2607.02544v1
- Date: Wed, 24 Jun 2026 05:57:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 07:26:11.069368
- Title: Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure
- Title(参考訳): すべての同期が安全ではない - 共有AIインフラストラクチャのためのキャリブレーションされたDiLoCoスケジューリング
- Abstract要約: DiLoCoスタイルのトレーニングは、時折外部同期の前に島々をローカルに列車に乗せることで通信を減らします。
このような船体に対する疑問は、外部マージがシステムコストに見合う価値があるのか、そして、事項を遅らせるためにエフェロウィンドウを選択するかどうかである。
このギャップを、スコアベースのコントローラであるWorkloadAware DiLoCoで埋めます。
- 参考スコア(独自算出の注目度): 6.71937346130764
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: DiLoCo-style training reduces communication by letting learner islands train locally before occasional outer synchronization, making it attractive for fragmented industrial AI fleets where training shares hardware with latency-sensitive serving. The question for such fleets is when an outer merge is worth its system cost, and whether choosing \emph{which} windows to defer matters at all. Existing scheduling studies evaluate workload-aware policies against fixed-period baselines, but most omit the control that isolates timing from budget: matched random deferral, which inherits the controller's synchronization budget but is not itself deployable. This omission is consequential: across controlled stress tests and real vLLM sidecar replays, matched random ties or beats every forecast-free policy we test, so gains reported against weaker baselines cannot be attributed to window choice. We fill this gap with Workload-Aware DiLoCo (WA-DiLoCo), a score-based controller that weighs learner progress against fleet pressure, and a calibration protocol that determines when matched random can be beaten, then demonstrate that it can. In the bursty regime where calibration exposes request-overlap structure, adding a one-step EWMA burst forecast to the online controller beats matched random in real vLLM sidecar replay, reducing SLO violations from 6.54\% to 5.09\% (8 of 10 seeds, $p=0.021$); offline Calibrated-WA, a non-deployable bound, shows the remaining headroom at 4.45\% versus 6.26\%. The deployable lesson remains the protocol: report real-sidecar effect-size transfer, a no-sync load match, and a matched-random envelope before claiming serving-SLO improvement.
- Abstract(参考訳): DiLoCoスタイルのトレーニングは、学習者の島々が時折外部同期する前にローカルで訓練することでコミュニケーションを減らす。
このようなフリートに対する疑問は、外部マージがそのシステムコストに価値があるのか、そして、問題を完全に延期するために \emph{which} ウィンドウを選択するかどうかである。
既存のスケジューリング研究は、一定期間の基準線に対するワークロード対応のポリシーを評価するが、ほとんどの場合、予算からタイミングを分離する制御を省略する:一致したランダムな遅延は、コントローラの同期予算を継承するが、それ自体はデプロイできない。
コントロールされたストレステストと実際のvLLMサイドカーのリプレイ、一致したランダムな結びつき、あるいはテストしたすべての予測自由ポリシーを破るため、ベースラインの弱さに対して報告された利得は、ウィンドウ選択によるものではない。
このギャップを、車両圧力に対する学習者の進捗を重み付けするスコアベースのコントローラであるWorkload-Aware DiLoCo(WA-DiLoCo)と、マッチしたランダムをいつ打ち負かすかを決定するキャリブレーションプロトコルで埋め、それを実証する。
キャリブレーションが要求オーバーラップ構造を露出するバーストモードでは、オンラインコントローラに1ステップのEWMAバースト予測を追加して、実際のvLLMサイドカーリプレイで一致したランダムビートにマッチし、SLO違反を6.54\%から5.09\%(10種中8つ、$p=0.021$);オフラインキャリブレーションWAは、非デプロイ可能なバウンドであり、残りのヘッドルームは4.45\%対6.26\%である。
実際のサイドカー効果サイズ転送、非同期ロードマッチ、および一致したランダムエンベロープを、サービスSLOの改善を主張する前に報告する。
関連論文リスト
- FedCritic-MIMO: Communication-Efficient Serverless Federated Critic Learning for Massive-MIMO Resource Control in Open and Disaggregated 6G RANs [4.726504262162973]
FedCritic-MIMOは、オープンかつ非アグリゲートな6G RANにおいて、独立してデプロイ可能なセルレベルコントローラをまたいだAIネイティブリソース制御のための、サーバレスのフェデレーション付きマルチエージェント強化学習フレームワークである。
コントローラはトレーナを共有しず、ローカルアクターとパーソナライズされた批評家コンポーネントを保持し、互換性のある批評家パラメータのみを交換する。
論文 参考訳(メタデータ) (2026-08-04T15:56:32Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Real-Time Rulebook-Aware Nonlinear MPC for Autonomous Driving with Priority-Biased Tiered Slacks [0.8363171780853939]
W-SQPは重み付きタイレッドスラック非線形モデル予測制御器(NMPC)である
We present W-SQP, a weighted tiered-slack non model predictive controller (NMPC)。
We present W-SQP, a weighted tiered-slack non model predictive controller (NMPC)。
論文 参考訳(メタデータ) (2026-07-13T00:40:27Z) - DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation [69.8840101036735]
投機的復号化はLarge Language Model (LLM)推論を加速させる。
最近の並列起草者は、1つの前方通過で長いトークン列を効率的に提案するが、トークン間の依存関係が欠如しているため、急速に受け入れが低下する。
我々はDSparkという投機的復号化フレームワークを導入し、高いスループットの並列生成を適応的かつロードアウェアな検証と統合する。
論文 参考訳(メタデータ) (2026-07-06T14:28:06Z) - AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes [0.0]
Managerはアクティブな実行から構造化されたテレメトリスナップショットを読み、制約されたアクション空間を監査し、トレーニングパラメータに検証された更新を返す。
TinyStoriesでは、マネージャがオーバーフィッティングを検出し修正し、ベースラインよりも60%低い検証損失を達成する。
ロボット操作強化学習タスクでは,評価やチェックポイント境界においてマネージャの更新を適用したエピソード閉ループ設定において,同じ境界決定インタフェースを使用する。
論文 参考訳(メタデータ) (2026-06-29T07:07:33Z) - ZAPS-DA: Zero-Phase Action Policy Smoothing with Decoupled Actor for Continuous Control in Reinforcement Learning [0.0]
ZAPS-DAは、無視可能なフェーズラグと後処理のないデプロイ時のアクションジッタを低減するフレームワークである。
MetaDriveでは、ZAPS-DAはステアリングジッタを14-21x、スロットルジッタを3-5x削減する。
論文 参考訳(メタデータ) (2026-05-28T22:05:08Z) - Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL [76.45061154544568]
セルフプレイ強化学習は、言語モデルを独自の生成タスクで訓練し、人間ラベルなしでプロジェクタとソルバを共進化させる。
最近のシステムでは強い推理効果が報告されているが、崩壊と不安定性は広く観察され、理解されていない。
代わりに、自己プレイの安定性は、提案者生成タスクがトレーニングプールに入るかを判断するデータレベルゲートと、すでに認められたタスクに関するポリシーを更新する報酬信号の2つの異なるレバーによって管理されていると論じる。
論文 参考訳(メタデータ) (2026-05-21T09:19:23Z) - Probing Routing-Conditional Calibration in Attention-Residual Transformers [17.576884726604902]
内部ルーティングトレースは、しばしば予測の信頼性を示すために使用される。
これらの痕跡は、信頼性を超えたポストホックキャリブレーションの安定したルーティング固有の証拠を提供していない。
信頼のみのキャパシティを制御に含めると、ルーティングプロファイルが同等のパフォーマンスを達成することを示す。
この設定は、一致した信頼、帯域幅、容量、置換制御が共通の欠点を除外するまで、内部状態のキャリブレーションとして読むべきではない。
論文 参考訳(メタデータ) (2026-05-11T01:06:25Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Robust Global-Local Behavior Arbitration via Continuous Command Fusion Under LiDAR Errors [0.0]
本稿では、2つのコントローラの出力を融合させるROS2ネイティブ仲裁モジュールを提案する。
各制御ステップにおいて、両コントローラはAckermannコマンドを提案し、PPO訓練されたポリシーはコンパクトな特徴観察から連続ゲートを予測する。
本研究は,計画レベルの相互作用推論の代替としてではなく,モジュール型ROS2環境でのコマンドレベルのロバスト性評価を意図している。
論文 参考訳(メタデータ) (2026-03-28T14:09:55Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Adaptive t Design Dummy-Gate Obfuscation for Cryogenic Scale Enforcement [0.0]
クラウド量子サービスは、スケジューラメタデータ、レイテンシパターン、共テナント干渉を通じて、回路構造とタイミングを明らかにすることができる。
我々は,ゲートモデルワークロードの運用上のプライバシを強制するスケジューリングおよび難読化スタックであるNADGOを紹介する。
低温CMOS制御による4キュービット超伝導タイルの試作を行い,深度可変ローカルランダム回路と小型QAOAインスタンスの両特性について検討した。
論文 参考訳(メタデータ) (2025-08-31T12:12:48Z) - Deep Reinforcement Learning for Wireless Scheduling in Distributed Networked Control [37.10638636086814]
完全分散無線制御システム(WNCS)の周波数チャネル数に制限のある結合アップリンクとダウンリンクのスケジューリング問題を考える。
深層強化学習(DRL)に基づくフレームワークを開発した。
DRLにおける大きなアクション空間の課題に対処するために,新しいアクション空間削減法とアクション埋め込み法を提案する。
論文 参考訳(メタデータ) (2021-09-26T11:27:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。