論文の概要: A Scalable Pipeline for LLM-Teacher Distillation Labeling: Work-Stealing Job Scheduling and Memory-Aware GPU Concurrency
- arxiv url: http://arxiv.org/abs/2608.15975v1
- Date: Mon, 17 Aug 2026 00:02:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.492685
- Title: A Scalable Pipeline for LLM-Teacher Distillation Labeling: Work-Stealing Job Scheduling and Memory-Aware GPU Concurrency
- Title(参考訳): LLM-Teacher蒸留ラベリングのためのスケーラブルパイプライン:ワークステアリングジョブスケジューリングとメモリ対応GPUコンカレンシー
- Authors: Ravi Satya Durga Prasad Yenugula,
- Abstract要約: LLM教師による大規模テキストコーパスのラベル付けは,大規模データ学習の実践的方法となっている。
教師が1ドルあたり購入するラベルの品質と、不正で障害を起こしやすいワークロード下でGPUワーカーの群れを忙しくしておく方法だ。
両方に対処するシンプルな再現可能なパイプラインを提示する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Labeling large text corpora with LLM teachers has become a practical route to training data at scale. At millions of items, hand-labeling every batch is not feasible, and two questions dominate: what label quality a teacher buys per dollar, and how to keep a fleet of GPU workers busy under skewed, failure-prone workloads. We present a simple, reproducible pipeline that addresses both. First, a work-stealing ring pool: each worker owns a queue, drains it first, and then steals from ring successors, with exactly-once task claims via atomic conditional writes and crash tolerance via stale-claim sweeping. The claim protocol requires only a compare-and-set primitive from its storage layer; we implement it on a single SQLite file, which makes the reference implementation dependency-free and the experiments reproducible on one machine. Second, a memory-aware concurrency rule that sizes per-node parallelism by how many model copies fit on the GPU, so the same code runs safely across device sizes. Third, a relabeling benchmark methodology in which the teacher relabels a public dataset that already has gold labels, so quality reduces to an agreement measurement and cost follows from measured throughput. Under skewed load the pool sustains up to 3.4 times the throughput of static sharding while matching it at zero skew, loses 0 of 2,000 tasks when half the workers are killed mid-run (static sharding loses 953), and yields measured quality and cost points for an instruction-tuned teacher on irony and sentiment tasks. All experiments run on public data and commodity hardware; code, tests, and run logs are released.
- Abstract(参考訳): LLM教師による大規模テキストコーパスのラベル付けは,大規模データ学習の実践的方法となっている。
何百万もの項目において、バッチ毎に手作業でラベル付けすることは不可能であり、教師が1ドルで購入するラベルの品質と、不正で障害を起こしやすいワークロード下でGPUワーカーの群れを忙しくしておく方法についての2つの質問が支配的だ。
両方に対処するシンプルな再現可能なパイプラインを提示する。
まず、ワークステアリングプール: 各ワーカーがキューを所有し、最初にドレインし、次にリングの後継から盗む。
クレームプロトコルはストレージ層からの比較とセットのプリミティブしか必要とせず、単一のSQLiteファイル上に実装します。
第二に、メモリを意識した並行処理ルールでは、ノード毎の並列処理のサイズをGPUに適合するモデルコピー数で規定しているため、同じコードがデバイスサイズにわたって安全に実行される。
第3に、教師が既にゴールドラベルを持つ公開データセットをラベル付けする緩和ベンチマーク手法により、品質が合意された測定値に低下し、コストが測定されたスループットから続く。
スクイード負荷下では、プールは静的シャーディングのスループットを最大3.4倍に維持し、スキューを0倍にし、半分の労働者が死亡すると2,000のタスクを失う(スタティックシャーディングは973倍)。
すべての実験はパブリックデータとコモディティハードウェア上で実行され、コード、テスト、実行ログがリリースされる。
関連論文リスト
- Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation [0.42481744176244507]
本研究では,命令追従による制約の蓄積について検討する。
我々は,24個の検証済み命令を1回に1から20個積み重ねたベンチマークを導入し,実運用レベルのLCMを3つ評価する。
次にトレーニング不要のコンパイラを評価し、スタックされたプロンプトを1回の呼び出しで書き直し、クエリ間で再利用します。
論文 参考訳(メタデータ) (2026-07-31T10:58:29Z) - Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction [57.138342889101345]
Tencent WorkBuddy Benchは、コーディングエージェントのためのマルチドメイン評価スイートである。
本報告では, 設計手法, スコアリングプロトコル, クロスモデルリーダーボードについて述べる。
論文 参考訳(メタデータ) (2026-07-23T04:34:06Z) - DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks [1.7623000586936592]
DeepSWEは、コーディングエージェントを評価するための、113のオリジナルで長期のソフトウェアエンジニアリングタスクのベンチマークである。
タスクは91のアクティブなオープンソースリポジトリと5つの言語でスクラッチから書かれており、上流にコントリビュートされることはない。
SWE-Bench Proのプロンプトの約半分の長さにもかかわらず、DeepSWEのプロンプトは参照ソリューションが5.5倍のコードに触れるタスクを記述する。
論文 参考訳(メタデータ) (2026-07-08T21:45:34Z) - A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction [29.66946400529514]
textbfA$2$utoLPBenchは、平文で書かれた線形プログラミング問題に対してLLM駆動エージェントをテストするためのベンチマークである。
この答えは、解決者からの電話も人間の注釈もなしに、建設によって知られている。
ベンチマークは固定データセットではなくジェネレータであるため、固定データセットにマッチするプロパティがない。
論文 参考訳(メタデータ) (2026-07-02T13:18:57Z) - From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents [56.31499185764872]
教師の長い軌道上の監督された微調整(SFT)は、オープンソフトウェアエンジニアリング(SWE)エージェントに調査と推論を浸透させる主要な方法である。
本稿では,P2T (Patches-to-Trajectories) を提案する。P2T (Patches-to-Trajectories) は,P2T (Patches-to-Trajectories) において,P2T (Patches-to-Trajectories) とP2T (Patches-to-Trajectories) の2つの最適化法である。
論文 参考訳(メタデータ) (2026-05-21T04:54:55Z) - RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents [0.9821874476902969]
LLMエージェントは、単一のスカラーテストメトリクスで成功を判断するエンドツーエンドのMLエンジニアリングタスクをますます実行します。
エージェントは、モデルを改善するのではなく、評価パイプラインを妥協することで、報告されたスコアを増やすことができる。
ワークスペースベースのベンチマークであるRewardHackingAgentsを導入する。
論文 参考訳(メタデータ) (2026-03-11T22:06:44Z) - STAMP: Outlier-Aware Test-Time Adaptation with Stable Memory Replay [76.06127233986663]
テスト時間適応(TTA)は、トレーニングデータとテストデータの間の分散シフトに、未ラベルのデータのみを用いて対処することを目的としている。
本稿では,サンプル認識とオフリエ拒絶の両方を行う問題に注意を払っている。
本稿では,STAble Memory rePlay (STAMP) と呼ばれる新しい手法を提案する。
論文 参考訳(メタデータ) (2024-07-22T16:25:41Z) - Multi-Instance Partial-Label Learning: Towards Exploiting Dual Inexact
Supervision [53.530957567507365]
実世界のタスクでは、各トレーニングサンプルは、1つの基底真実ラベルといくつかの偽陽性ラベルを含む候補ラベルセットに関連付けられている。
本稿では,Multi-instance partial-label learning (MIPL) などの問題を定式化する。
既存のマルチインスタンス学習アルゴリズムと部分ラベル学習アルゴリズムはMIPL問題の解法に最適である。
論文 参考訳(メタデータ) (2022-12-18T03:28:51Z) - Label-Noise Learning with Intrinsically Long-Tailed Data [65.41318436799993]
本稿では,本質的な長期データを用いたラベルノイズ学習のための学習フレームワークを提案する。
具体的には, 2段階の2次元試料選択法(TABASCO)を提案する。
論文 参考訳(メタデータ) (2022-08-21T07:47:05Z) - Learning from Multiple Annotator Noisy Labels via Sample-wise Label
Fusion [17.427778867371153]
一部の現実世界のアプリケーションでは、正確なラベリングは実現できないかもしれない。
複数のノイズラベルは、データサンプル毎に複数のアノテータによって提供される。
論文 参考訳(メタデータ) (2022-07-22T20:38:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。