論文の概要: Efficient Clustering with Provable Guardrails for LLM Inference at Scale
- arxiv url: http://arxiv.org/abs/2607.19704v1
- Date: Wed, 22 Jul 2026 03:06:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.958768
- Title: Efficient Clustering with Provable Guardrails for LLM Inference at Scale
- Title(参考訳): 大規模LLM推論のための予測可能なガードレールを用いた効率的なクラスタリング
- Abstract要約: 既存のクラスタリングメソッドでは、クラスタ内の類似性、カテゴリ属性の正確なマッチング、数千万のサンプルへのスケーラビリティが最小限に抑えられません。
ミニバッチK-Meansを用いて初期クラスタを生成する2段階のアルゴリズムを提案し,各初期クラスタ内の代表を選択する。
我々の手法はサンプルごとのガードレールを提供するだけでなく、10~1000倍高速に動作し、ほとんどの標準メソッドが難易度の高いデータサイズまでスケールする。
- 参考スコア(独自算出の注目度): 13.739399078718094
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Scaling LLM-based applications to millions of users is bottlenecked by the inference cost and latency of modern foundation models. A natural fix is to cluster the inputs and call the LLM only on cluster representatives, letting other members inherit the output -- but this is only safe if each member is measurably close to its representative. Existing clustering methods do not offer such per-sample quality control at scale: none jointly guarantee a minimal within-cluster similarity, exact matching of categorical attributes, and scalability to tens of millions of samples. We propose a two-stage algorithm that generates initial clusters with Mini-batch K-Means, then greedily selects representatives within each initial cluster -- a step equivalent to the Johnson-Chvatal heuristic for Set Cover over alpha-balls in embedding space. The algorithm enforces the similarity and attribute guardrails exactly by construction, and runs in $O(nd + n^2 d/K)$ time and $O(nd + n^2/K^2)$ memory for $n$ samples, feature dimension $d$, and $K$ initial clusters -- linear in $n$ when $K$ grows proportionally with $n$. We provide benchmarks against common clustering methods on internal and public datasets: our method not only delivers per-sample guardrails but also runs 10-1000x faster and scales to data sizes where most standard methods become intractable. Deployed on 38 million customers for a persona-based recommender, the clustering method cut downstream cost and latency by 50-fold while preserving personalization and unblocked the production launch.
- Abstract(参考訳): LLMベースのアプリケーションを数百万のユーザに拡大することは、現代の基礎モデルの推論コストと遅延によってボトルネックとなる。
自然な修正は、入力をクラスタ化し、クラスタの代表者のみに呼び出し、他のメンバが出力を継承できるようにすることです。
既存のクラスタリング手法では、クラスタ内での最小限の類似性、カテゴリ属性の正確なマッチング、数千万のサンプルに対するスケーラビリティを共同で保証することはできない。
我々は,ミニバッチK平均で初期クラスタを生成する2段階のアルゴリズムを提案し,各初期クラスタ内の代表を優雅に選択する。
このアルゴリズムは、構築によって正確に類似性と属性ガードレールを強制し、$O(nd + n^2 d/K)$ timeと$O(nd + n^2/K^2)$ memory for $n$ sample, feature dimension $d$, $K$ initial cluster -- $K$が$n$に比例して成長すると$n$となる。
当社の方法は,サンプル単位のガードレールを提供するだけでなく,10~1000倍高速に動作し,ほとんどの標準メソッドが抽出可能なデータサイズまでスケールする。
ペルソナベースのレコメンデータのために3800万の顧客にデプロイされたこのクラスタリングメソッドは、パーソナライゼーションを保ちながら、ダウンストリームコストとレイテンシを50倍に削減し、プロダクションローンチをブロックした。
関連論文リスト
- Federated Hierarchical Clustering with Automatic Selection of Optimal Cluster Numbers [13.396894845465468]
Federated Clustering(FC)は、分散およびプライバシ保護されたデータから、教師なしの方法でデータ分散パターンを探索する、新しくて有望なソリューションである。
我々はFed-$k*$-HCという新しいFCフレームワークを提案し、階層的クラスタリングによって探索されたデータ分布に基づいて最適なクラスタ数$k*$を自動的に決定できる。
論文 参考訳(メタデータ) (2026-03-13T05:58:35Z) - Bridged Clustering for Representation Learning: Semi-Supervised Sparse Bridging [7.631238459202664]
我々はBridged Clusteringを紹介した。Bridged Clusteringは、未実装の入力$X$と出力$Y$データセットから予測子を学習する半教師付きフレームワークである。
我々のメソッドはまず最初に$X$と$Y$を独立にクラスタし、その後、わずかにペア化された例を使ってクラスタ間のスパースで解釈可能なブリッジを学習する。
論文 参考訳(メタデータ) (2025-10-08T16:20:49Z) - Near-Optimal Clustering in Mixture of Markov Chains [74.3828414695655]
我々は、長さ$H$の軌跡を、大きさ$S$の有限状態空間上の未知のエルゴードマルコフ鎖の1つによって生成される、$T$ trajectories of length $H$の問題を研究する。
我々は、連鎖の遷移核間の重み付きKL分散によって支配されるクラスタリングエラー率に基づいて、インスタンス依存で高い確率の低い境界を導出する。
次に,新しい2段階クラスタリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-06-02T05:10:40Z) - Generalization Performance of Ensemble Clustering: From Theory to Algorithm [57.176040163699554]
本稿では,アンサンブルクラスタリングにおける一般化誤差,過剰リスク,一貫性に着目した。
有限クラスタリングに様々な重みを割り当てることで、経験的平均クラスタリングと期待値との誤差を最小化する。
我々は、新しいアンサンブルクラスタリングアルゴリズムを開発するために、我々の理論をインスタンス化する。
論文 参考訳(メタデータ) (2025-06-01T09:34:52Z) - Distributed Collapsed Gibbs Sampler for Dirichlet Process Mixture Models
in Federated Learning [0.22499166814992444]
本稿では,DPMM (DisCGS) のための分散マルコフ連鎖モンテカルロ (MCMC) 推論手法を提案する。
我々のアプローチでは、崩壊したGibbsサンプルラーを使用し、独立マシンと異種マシンの分散データを扱うように設計されています。
例えば、100Kのデータポイントのデータセットでは、中央集権的なアルゴリズムは100回のイテレーションを完了するのに約12時間かかります。
論文 参考訳(メタデータ) (2023-12-18T13:16:18Z) - Revisiting Instance-Optimal Cluster Recovery in the Labeled Stochastic Block Model [85.51611950757643]
IAC (Instance-Adaptive Clustering, インスタンス適応クラスタリング) を提案する。
IACは$ MathcalO(n, textpolylog(n) $の計算複雑性を維持しており、大規模問題に対してスケーラブルで実用的なものである。
論文 参考訳(メタデータ) (2023-06-18T08:46:06Z) - A One-shot Framework for Distributed Clustered Learning in Heterogeneous
Environments [54.172993875654015]
異種環境における分散学習のためのコミュニケーション効率化手法のファミリーを提案する。
ユーザによるローカル計算に基づくワンショットアプローチと、サーバにおけるクラスタリングベースのアグリゲーションステップは、強力な学習保証を提供する。
厳密な凸問題に対しては,ユーザ毎のデータ点数がしきい値を超える限り,提案手法はサンプルサイズの観点から順序最適平均二乗誤差率を達成する。
論文 参考訳(メタデータ) (2022-09-22T09:04:10Z) - Collaborative Learning and Personalization in Multi-Agent Stochastic
Linear Bandits [24.293155063082438]
エージェント(ユーザ)が似ているが、すべて同一ではないような、N$エージェントの不均一な線形帯域幅フレームワークにおける後悔を最小限に抑える問題を考える。
任意のエージェントに対して、後悔のスケールが$mathcalO(sqrtT/N)$、エージェントが十分に分離されたクラスタにある場合、あるいはクラスタが$mathcalO(Tfrac12 + varepsilon/(N)frac12 -varepsilon)$であることを示す。
論文 参考訳(メタデータ) (2021-06-15T00:45:55Z) - LSD-C: Linearly Separable Deep Clusters [145.89790963544314]
ラベルなしデータセットのクラスタを識別する新しい手法であるLSD-Cを提案する。
本手法は,最近の半教師付き学習の実践からインスピレーションを得て,クラスタリングアルゴリズムと自己教師付き事前学習と強力なデータ拡張を組み合わせることを提案する。
CIFAR 10/100, STL 10, MNIST, および文書分類データセットReuters 10Kなど, 一般的な公開画像ベンチマークにおいて, 当社のアプローチが競合より大幅に優れていたことを示す。
論文 参考訳(メタデータ) (2020-06-17T17:58:10Z) - Computationally efficient sparse clustering [67.95910835079825]
我々はPCAに基づく新しいクラスタリングアルゴリズムの有限サンプル解析を行う。
ここでは,ミニマックス最適誤クラスタ化率を,体制$|theta infty$で達成することを示す。
論文 参考訳(メタデータ) (2020-05-21T17:51:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。