論文の概要: AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation
- arxiv url: http://arxiv.org/abs/2608.04502v1
- Date: Wed, 05 Aug 2026 06:39:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.75869
- Title: AFD-Ledger: Deployment Provisioning for Attention--FFN Disaggregation
- Title(参考訳): AFD-Ledger: 注意のためのデプロイメントプロビジョニング--FFNの分離
- Authors: Chengyu Qiu, Xiao Fu, Fengcun Li, Yulei Qian, Yuchen Xie, Xunliang Cai, Yingdi Shan, Yongwei Wu, Mingxing Zhang,
- Abstract要約: Attention-Feed-Forward Network (FFN) Disaggregation (AFD)は、Mixture-of-Experts (MoE)言語モデルを提供するための有望なアーキテクチャとして登場した。
同じモデルでは、ワークロード、TPOT(Time-per-output-token)サービスレベル目標(SLO)では、AFDは最適なデプロイメントよりも高いスループットを提供していますか?
AFD-Ledgerは、AFDと協調配置を独立にプロビジョニングするオフライン分析プロビジョニングシステムである。
- 参考スコア(独自算出の注目度): 19.123938703884978
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Attention--Feed-Forward Network (FFN) Disaggregation (AFD) is emerging as a promising architecture for serving Mixture-of-Experts (MoE) language models. While existing AFD systems improve the efficiency of disaggregated execution, they leave a deployment question unanswered: under the same model, workload, time-per-output-token (TPOT) service-level objective (SLO), hardware budget, hardware catalog, and runtime capabilities, does AFD provide higher throughput than the best collocated deployment? Answering this question requires jointly optimizing hardware assignment and deployment organization for both architectures, making exhaustive provisioning prohibitively expensive. We present AFD-Ledger, an offline analytical provisioning system that independently provisions AFD and collocated deployments using an analytical execution model and an evaluation-bounded hardware search. Across deployment spaces where exhaustive provisioning is feasible, AFD-Ledger reduces complete deployment evaluations by 68.8%--83.5% while still recovering the globally optimal deployment. On three physical LongCat 2.0 deployments, it preserves the correct architecture decision while predicting AFD-to-collocated throughput within 6.6%--9.6% of measurement. Using this validated framework, we show that homogeneous AFD improves fixed-budget throughput in only a minority of the studied settings, heterogeneous AFD requires deployment-level hardware complementarity rather than heuristic device selection, and role-specific hardware improvements matter primarily when they enable better deployment organizations by crossing deployment capability--price boundaries.
- Abstract(参考訳): Attention--Feed-Forward Network (FFN) Disaggregation (AFD)は、Mixture-of-Experts (MoE)言語モデルを提供するための有望なアーキテクチャとして登場した。
同じモデル、ワークロード、TPOT(Time-per-output-token)サービスレベル目標(SLO)、ハードウェア予算、ハードウェアカタログ、ランタイム機能の下で、AFDは最適なデプロイメントよりも高いスループットを提供していますか?
この疑問に答えるためには、両アーキテクチャのハードウェア割り当てとデプロイメントの組織を共同で最適化する必要がある。
AFD-Ledgerは,分析実行モデルと評価バウンドハードウェアサーチを用いて,AFDと協調配置を独立にプロビジョニングするオフライン分析プロビジョニングシステムである。
AFD-Ledgerは、完全な配置評価を68.8%--83.5%削減し、グローバルな最適な配置を回復している。
物理的に3つのLongCat 2.0デプロイメントでは、正しいアーキテクチャ決定を保ちながら、6.6%~9.6%の範囲でAFD対応のスループットを予測している。
この検証されたフレームワークを用いることで、同種AFDは研究対象のごく一部で固定予算スループットを向上し、異種AFDはヒューリスティックなデバイス選択よりも、デプロイメントレベルのハードウェア補完性を必要とし、主にデプロイメント能力-価格境界を越えることで、より良いデプロイメント組織を実現する上で、役割固有のハードウェア改善が重要となる。
関連論文リスト
- How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving [14.552785121277529]
本研究では,デバイス上でのカーネル計測と高忠実度ネットワークシミュレーションを融合したフレームワークを用いて,AFD(Attention-FFN Disaggregation)のメリットと限界について検討する。
厳格なTTFT/TPOT SLOの下では、AFDはチャット、コーディング、エージェントコーディングのワークロード間でDeepSeek-V3.2で約4kトークン/秒のシステムスループットを維持できる。
論文 参考訳(メタデータ) (2026-05-27T10:55:57Z) - Decentralized Orchestration Architecture for Fluid Computing: A Secure Distributed AI Use Case [2.359679792068363]
本稿では,流体計算環境における非依存型マルチドメインオーケストレーションアーキテクチャを提案する。
このアーキテクチャは、実行時にアプリケーションレベルの拡張をサポートするため、ドメインサイドコントロールサービスをファーストクラスの機能として高める。
我々は,SDN 対応マルチドメイン異常検出機構である FU-HST を導入して,ビザンチンのセキュリティを強化するために,ドメイン側の機能を活用している。
論文 参考訳(メタデータ) (2026-03-12T14:49:12Z) - Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition [53.50448142467294]
RAIMは、リポジトリレベルの機能追加のための、多設計およびアーキテクチャ対応のフレームワークである。
複数の多様な実装設計を生成することで、線形パッチから切り離される。
NoCode-bench Verifiedデータセットの実験では、RAIMが新しい最先端のパフォーマンスを確立することが示されている。
論文 参考訳(メタデータ) (2026-03-02T12:50:40Z) - Relatron: Automating Relational Machine Learning over Relational Databases [50.94254514286021]
本稿では, RDL と DFS を共有設計空間に統合し, 多様な RDB タスクを対象としたアーキテクチャ中心の検索を行う。
RDLはDFSを一貫して上回り、高いタスク依存性を持つ。(2)タスク全体において単一のアーキテクチャが支配的であり、タスク認識モデル選択の必要性を強調し、精度は選択アーキテクチャの信頼性の低いガイドである。
論文 参考訳(メタデータ) (2026-02-26T02:45:22Z) - Adaptive Dual-Weighting Framework for Federated Learning via Out-of-Distribution Detection [53.45696787935487]
Federated Learning (FL)は、大規模分散サービスノード間の協調的なモデルトレーニングを可能にする。
実世界のサービス指向デプロイメントでは、異種ユーザ、デバイス、アプリケーションシナリオによって生成されたデータは本質的にIIDではない。
FLoodは、オフ・オブ・ディストリビューション(OOD)検出にインスパイアされた新しいFLフレームワークである。
論文 参考訳(メタデータ) (2026-02-01T05:54:59Z) - A Hardware-oriented Approach for Efficient Active Inference Computation and Deployment [0.0]
本研究は, pymdp の柔軟性と効率性を, ハードウェア効率に最適化された, 疎結合な計算グラフに統合することにより, AIF の展開を促進する手法を提案する。
当社のアプローチでは,2倍以上のレイテンシとメモリを最大35%削減し,リアルタイムおよび組み込みアプリケーションに効率的なAIFエージェントをデプロイする。
論文 参考訳(メタデータ) (2025-08-12T09:39:46Z) - Unified modality separation: A vision-language framework for unsupervised domain adaptation [60.8391821117794]
教師なしドメイン適応(Unsupervised domain adapt, UDA)は、ラベル付きソースドメインでトレーニングされたモデルが新しいラベル付きドメインを扱うことを可能にする。
本稿では,モダリティ固有成分とモダリティ不変成分の両方に対応可能な統一モダリティ分離フレームワークを提案する。
提案手法は,9倍の計算効率で最大9%の性能向上を実現している。
論文 参考訳(メタデータ) (2025-08-07T02:51:10Z) - SVAFD: A Secure and Verifiable Co-Aggregation Protocol for Federated Distillation [10.234754822281774]
フェデレート蒸留(FD)用に設計された最初のプロトコルであるSVAFDを提案する。
クライアントとサーバの責務を再定義する。
SVAFDはストラグラーやクライアントの衝突に耐性があり、現実世界のアプリケーションにおける動的ネットワークに適している。
論文 参考訳(メタデータ) (2025-05-19T16:30:27Z) - Multi-objective Differentiable Neural Architecture Search [58.67218773054753]
我々は,ユーザの好みをトレードオフ性能やハードウェアメトリクスにエンコードするNASアルゴリズムを提案する。
提案手法は,既存のMOO NAS手法を,定性的に異なる検索空間やデータセットの広い範囲で性能良くする。
論文 参考訳(メタデータ) (2024-02-28T10:09:04Z) - DHA: End-to-End Joint Optimization of Data Augmentation Policy,
Hyper-parameter and Architecture [81.82173855071312]
本稿では,AutoMLコンポーネントを統合したエンドツーエンドソリューションを提案する。
Dhaは、様々なデータセット、特にセルベースの検索空間を持つImageNetの77.4%の精度で、最先端(SOTA)結果を達成する。
論文 参考訳(メタデータ) (2021-09-13T08:12:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。