論文の概要: PromptPack: Scaling LLM Annotation Agents for Online Recommendation
- arxiv url: http://arxiv.org/abs/2607.20528v1
- Date: Fri, 10 Jul 2026 06:32:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.218943
- Title: PromptPack: Scaling LLM Annotation Agents for Online Recommendation
- Title(参考訳): PromptPack: オンラインレコメンデーションのためのLLMアノテーションエージェントのスケーリング
- Abstract要約: オンラインレコメンデーションプラットフォームは、広告クリエイティブから構造化された特徴を抽出するために、Large Language Models(LLM)をますます活用している。
創造的なプロンプトはスケールするのに費用がかかる。
PromptPackは、インコンテキストプロンプト、厳密なXML構造エンベロープ、出力補正層を通じて、このスケールを達成する。
本稿では,AUCを計測し,VWAL(Volume-Weighted Absolute Lift)を導入する。
- 参考スコア(独自算出の注目度): 2.349337242199567
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Online recommendation platforms increasingly use Large Language Models (LLMs) to extract structured features from ad creatives. While deploying a single-call LLM annotation agent yields significant Click-Through Rate (CTR) improvements in our live production environment, per-creative prompting is prohibitively expensive to scale. The redundant system instructions sent in every request account for 94% of billed input tokens. To break this cost bottleneck, we introduce PromptPack, a scalable, high-throughput LLM annotation agent. PromptPack achieves this scale via in-context batching, combining a shared system prompt, a strict XML structural envelope, and an output correction layer to ensure deterministic, pipeline-ready feature extraction across multiple creatives simultaneously. We evaluate PromptPack via an offline retrieval benchmark using a downstream logistic-regression ranker. To deeply profile the agent's behavior, we measure AUC and introduce Volume-Weighted Absolute Lift (VWAL), a novel metric capturing the signal quality of the generated features. Compared to our live, unbatched production baseline, PromptPack at batch size 20 cuts our LLM costs by 89% and accelerates throughput by 2.5x while fully preserving AUC.
- Abstract(参考訳): オンラインレコメンデーションプラットフォームは、広告クリエイティブから構造化された特徴を抽出するために、Large Language Models(LLM)をますます活用している。
単一呼び出しLDMアノテーションエージェントをデプロイすると、実運用環境においてCTR(Click-Through Rate)が大幅に向上する一方、創造的プロンプトのスケールは極めて高価である。
各要求で送られた冗長なシステム命令は、請求された入力トークンの94%を占める。
このコストボトルネックを解消するために、スケーラブルで高スループットのLLMアノテーションエージェントであるPromptPackを紹介します。
PromptPackは、共有システムプロンプト、厳密なXML構造エンベロープ、出力補正レイヤを組み合わせることで、複数のクリエーター間で決定論的かつパイプライン対応の機能抽出を同時に実現する。
ダウンストリームロジスティック・レグレッション・ローダを用いて,オフライン検索ベンチマークによるPromptPackの評価を行った。
エージェントの振舞いを深く表すため,AUCを計測し,生成した特徴の信号品質を計測する新しい指標であるVWALを導入する。
実運用ベースラインと比較すると,バッチサイズ20のPromptPackは,LLMのコストを89%削減し,AUCを完全に保存しながら,スループットを2.5倍向上します。
関連論文リスト
- APE: Agentic Prompt Enhancer for Image Generation and Editing [58.43341902967105]
Agentic Prompt Enhancer(APE)は、スモール言語モデル(SLM)をプロンプトエンハンスメントエージェントとしてポストトレーニングする軽量フレームワークである。
APEはシングルエージェント書き換えとロール特化マルチエージェント拡張の両方をサポートしている。
シングルエージェントインスタンス化のSAPEはワンパスでプロンプトを書き直し、マルチエージェントインスタンス化のMAPEはルータ-リライター-コンパイラプロセスに拡張を分解する。
論文 参考訳(メタデータ) (2026-05-29T17:59:31Z) - Indexing the Unreadable: LLM-Native Recursive Construction and Search of Service Taxonomies [5.010189948329798]
本稿では,A2X(Agent-to-Anything Service Discovery)を提案する。
A2Xは登録されたサービスを階層的な分類に自動的に整理し、クエリ時に層ごとに階層的に保存する。
フルコンテキストダンピングと比較すると、A2Xはプロンプトトーケンコストの9分の1で6.2ポイントのヒット率を達成している。
論文 参考訳(メタデータ) (2026-05-28T02:38:41Z) - PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting [5.314283762755523]
PromptEmbedderは、特定のバックボーン重みから埋め込み知識を分離する新しいデュアルLLMフレームワークである。
PromptEmbedderは、GPUメモリを40%削減し、トレーニングを3.7倍高速化しながら、LoRAの微調整で同等のパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2026-05-27T07:23:55Z) - One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States [5.647839536820347]
本稿では,隠れ状態を直接埋め込み空間にマッピングする軽量プロジェクションヘッドを提案する。
QReCCの会話型検索ベンチマークの実験では、標準生成コードパイプラインと比較して、Recall@10とMRR@10が競合している。
論文 参考訳(メタデータ) (2026-03-09T14:25:35Z) - Diffusion LLMs are Natural Adversaries for any LLM [50.88535293540971]
資源集約的(逆)な最適化問題を非効率な暗黙的推論タスクに変換する新しいフレームワークを提案する。
我々の中核となる洞察は、事前訓練された非自己回帰的生成LDMは、迅速な探索のための強力なサロゲートとして機能できるということである。
生成したプロンプトは、さまざまなブラックボックスターゲットモデルに対して強い転送可能性を示す、低複雑で多様なジェイルブレイクであることがわかった。
論文 参考訳(メタデータ) (2025-10-31T19:04:09Z) - PromptCOS: Towards System Prompt Copyright Auditing for LLMs via Content-level Output Similarity [61.793486262641345]
本稿では,コンテンツレベルの出力類似性に基づいたプロンプト著作権監査手法であるPromptCOSを提案する。
プロンプトを最適化し、特別な検証クエリとコンテントレベルの信号マークを同時に最適化することで、透かしを埋め込む。
PromptCOSは、著作権検証のために、疑わしい出力と信号マークの類似性を比較することによって、不正使用を識別する。
論文 参考訳(メタデータ) (2025-09-03T08:19:40Z) - Efficiency Unleashed: Inference Acceleration for LLM-based Recommender Systems with Speculative Decoding [61.45448947483328]
LLMベースのレコメンダシステム(LASER)の投機的復号化によるロスレス高速化について紹介する。
LASERは、検索効率を高めるためのカスタマイズされた検索プールと、ドラフトトークンの受け入れ率を改善するための緩和検証を備えている。
LASERは公開データセットの3~5倍のスピードアップを実現し、オンラインA/Bテスト中に約67%の計算リソースを節約する。
論文 参考訳(メタデータ) (2024-08-11T02:31:13Z) - Refiner: Restructure Retrieval Content Efficiently to Advance Question-Answering Capabilities [30.1331670544648]
大規模言語モデル(LLM)はパラメトリックな知識によって制限され、知識集約的なタスクに幻覚をもたらす。
我々は、RAGの検索後のプロセスで機能するエンドツーエンドの抽出・再構成パラダイムである$textitRefiner$を提案する。
論文 参考訳(メタデータ) (2024-06-17T09:25:10Z) - Prompt Highlighter: Interactive Control for Multi-Modal LLMs [50.830448437285355]
本研究では,マルチモーダル LLM (LLMs&VLMs) 推論における重要な側面として,明示的な制御可能なテキスト生成を目標とする。
本稿では,新しい推論手法であるPrompt Highlighterを導入し,ユーザが特定のプロンプトスパンをハイライトし,生成中のフォーカスをインタラクティブに制御できるようにする。
推論中、注意重みを通して強調されたトークンでモデルを導くことで、より望ましい出力が得られます。
論文 参考訳(メタデータ) (2023-12-07T13:53:29Z) - Guiding Large Language Models via Directional Stimulus Prompting [114.84930073977672]
我々は,特定の所望の出力に対して,ブラックボックス大言語モデル(LLM)を導くための新しいフレームワークであるDirectional Stimulus Promptingを紹介する。
LLMを直接調整するのではなく、小さな調整可能なポリシーモデルを用いて各入力インスタンスに対して補助的な指向性刺激プロンプトを生成する。
論文 参考訳(メタデータ) (2023-02-22T17:44:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。