論文の概要: Prompt Generation Technical Report
- arxiv url: http://arxiv.org/abs/2607.11326v1
- Date: Mon, 13 Jul 2026 09:46:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.419419
- Title: Prompt Generation Technical Report
- Title(参考訳): プロンプトジェネレーション技術報告
- Authors: Dan Ou, Gui Ling, Hao Wan, Hongbin Zhou, Jialiang Cheng, Jiangnan Pang, Silu Zhou, Wei Shi, Weichen Ye, Wenming Zhang, Yang Wang, Yu Li, Yuliang Yan, Zhan Fa, Zhihong Chen, Zongyuan Wu, Bo Zheng, Changfa Wu, Dunxian Huang, Haihong Tang, Jinlong Guo, Kaixuan Zhang, Kun Ma, Lin Qu, Longbo Zhong, Tao Lan, Tong Xiong, Zhibo Wu,
- Abstract要約: 生成的検索は、産業検索、レコメンデーション、広告システムのパラダイムとしてますます採用され、オンライン上で大きな利益をもたらしている。
実際には、機能エンジニアリングは効果をモデル化する上で重要だが、その複雑さによりオフラインのイテレーションが遅くなり、オンラインデプロイメントが重く再利用が困難になる。
本稿では、モデルアーキテクチャから2つの構成ファイルを通して特徴処理ロジックを分離するフレームワークであるPrompt Generationを紹介する。
- 参考スコア(独自算出の注目度): 31.708685939233806
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative retrieval has become an increasingly adopted paradigm for industrial search, recommendation, and advertising systems, delivering significant online gains. Most existing work combines user behavior sequences with large language models (LLMs) to model user preferences. In practice, feature engineering remains critical to model effectiveness, yet its complexity slows offline iteration and makes online deployment heavy and hard to reuse, all under tight online latency budgets. The root cause is a tight coupling between feature-processing logic and model architecture, where every feature change touches the training and serving code and resists reuse across scenarios. To break this coupling, we present Prompt Generation (PG), a high-level tokenizer and configuration-driven framework that decouples feature-processing logic from model architecture through two declarative JSON files, which serve as the single source of truth for both offline training and online serving, ensuring feature consistency across the two stages. Organizing features under four types with three composable processing components to assemble and compress heterogeneous features, PG delivers acceleration at three levels: (1)fast training iteration: feature experiments require only configuration changes, with built-in token compression for ultra-long sequences; (2)fast deployment: a new scenario only needs to conform to the PG schema and plug into a universal pipeline, with no scenario-specific engineering; (3)fast online inference: engine applies unified optimizations over the standardized configuration, reducing PG's overhead to a negligible level. PG has been deployed on Taobao Search with statistically significant online A/B uplifts of +0.47% in transaction count and +0.51% in GMV, and has been applied across multiple Taobao search and recommendation teams as the iteration framework for generative retrieval.
- Abstract(参考訳): 生成的検索は、産業検索、レコメンデーション、広告システムのパラダイムとしてますます採用され、オンライン上で大きな利益をもたらしている。
既存の作業の多くは、ユーザの振る舞いシーケンスと大きな言語モデル(LLM)を組み合わせて、ユーザの好みをモデル化している。
実際には、機能エンジニアリングは効果をモデル化する上で重要だが、その複雑さによりオフラインのイテレーションが遅くなり、オンラインデプロイメントが重く再利用が困難になる。
根本原因は、機能処理ロジックとモデルアーキテクチャの密結合であり、すべての機能変更がトレーニングに触れ、コードを提供し、シナリオをまたいだ再利用に抵抗する。
この結合を断ち切るために、私たちはPrompt Generation(PG)という高レベルなトークンライザと構成駆動フレームワークを紹介します。このフレームワークは、2つの宣言型JSONファイルを通じてモデルアーキテクチャから機能処理ロジックを分離します。
PGは、構成可能な3つのコンポーネントを組み立てて圧縮するために、以下の3つのレベルを加速する。 (1) 高速なトレーニングイテレーション: 機能実験は、超長いシーケンスにトークン圧縮を組み込んだ構成変更のみを必要とする (2) 高速なデプロイ: PGスキーマに準拠し、シナリオ固有のエンジニアリングなしで、普遍的なパイプラインにプラグインする新しいシナリオのみを必要とする。
PGは、統計学的に有意なオンラインA/B上昇率+0.47%、GMV+0.51%でTaobao Searchにデプロイされ、生成検索のイテレーションフレームワークとして複数のTaobao Searchとレコメンデーションチームに適用されている。
関連論文リスト
- HMACE: Heterogeneous Multi-Agent Collaborative Evolution for Combinatorial Optimization [19.90781293176099]
HMACEは異種多言語協調進化フレームワークである。
それぞれの進化生成を4つの調整されたエージェントで自律的で役割特異的なループに分解する。
冗長な評価を避けながら、多様で有望な行動への探索を導く。
論文 参考訳(メタデータ) (2026-05-08T04:02:28Z) - Relatron: Automating Relational Machine Learning over Relational Databases [50.94254514286021]
本稿では, RDL と DFS を共有設計空間に統合し, 多様な RDB タスクを対象としたアーキテクチャ中心の検索を行う。
RDLはDFSを一貫して上回り、高いタスク依存性を持つ。(2)タスク全体において単一のアーキテクチャが支配的であり、タスク認識モデル選択の必要性を強調し、精度は選択アーキテクチャの信頼性の低いガイドである。
論文 参考訳(メタデータ) (2026-02-26T02:45:22Z) - Query as Anchor: Scenario-Adaptive User Representation via Large Language Model [28.30329175937291]
静的エンコーディングから動的クエリ認識合成へユーザモデリングをシフトするフレームワークであるQuery-as-Anchorを提案する。
まず,産業規模の事前学習データセットであるUserUを構築し,行動系列とユーザ理解のセマンティクスを整合させる。
クラスタベースのSoft Prompt Tuningを導入し、識別潜在構造を強制する。
デプロイメントでは、シーケンスターミニでのクエリのアンカーにより、無視可能なインクリメンタルレイテンシでKVキャッシュを加速する推論が可能になる。
論文 参考訳(メタデータ) (2026-02-16T06:09:31Z) - AIConfigurator: Lightning-Fast Configuration Optimization for Multi-Framework LLM Serving [16.664502126572856]
AIConfiguratorは、Large Language Model(LLM)推論のための統一されたパフォーマンスモデリングシステムである。
GPUベースのプロファイリングを必要とせずに、迅速なフレームワークベースの構成検索を可能にする。
これは、高密度モデルのパフォーマンスを最大40%向上させる優れたサービス構成を特定する。
論文 参考訳(メタデータ) (2026-01-09T20:03:57Z) - Pangu Embedded: An Efficient Dual-system LLM Reasoner with Metacognition [95.54406667705999]
Pangu Embeddedは、Ascend Neural Processing Units (NPU) 上で開発された効率的なLarge Language Model (LLM) 推論器である。
既存の推論最適化 LLM でよく見られる計算コストと推論遅延の問題に対処する。
単一の統一モデルアーキテクチャ内で、迅速な応答と最先端の推論品質を提供する。
論文 参考訳(メタデータ) (2025-05-28T14:03:02Z) - Trinity-RFT: A General-Purpose and Unified Framework for Reinforcement Fine-Tuning of Large Language Models [92.19059398963647]
Trinity-RFTは、大規模言語モデルの強化微調整(RFT)のために設計された汎用的で統一的で使いやすいフレームワークである。
RFT-coreは、同期/非同期、オンライン/オフライン、RTTのオンライン/オフラインモードを統一・一般化する。
論文 参考訳(メタデータ) (2025-05-23T12:41:09Z) - OTOv3: Automatic Architecture-Agnostic Neural Network Training and
Compression from Structured Pruning to Erasing Operators [57.145175475579315]
このトピックは、構造化プルーニングからニューラルアーキテクチャサーチまで、さまざまなテクニックにまたがっている。
第3世代のOTOv3(Noth-Train-Once)を導入する。
我々は,構造化プルーニングとニューラルアーキテクチャ探索におけるOTOv3の有効性を実証した。
論文 参考訳(メタデータ) (2023-12-15T00:22:55Z) - You Only Compress Once: Towards Effective and Elastic BERT Compression
via Exploit-Explore Stochastic Nature Gradient [88.58536093633167]
既存のモデル圧縮アプローチでは、さまざまなハードウェアデプロイメントに対応するために、さまざまな制約にまたがる再圧縮や微調整が必要となる。
圧縮を一度行い、至るところに展開するための新しいアプローチであるYOCO-BERTを提案する。
最先端のアルゴリズムと比較すると、YOCO-BERTはよりコンパクトなモデルを提供するが、GLUEベンチマークの平均精度は2.1%-4.5%向上している。
論文 参考訳(メタデータ) (2021-06-04T12:17:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。