論文の概要: GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval
- arxiv url: http://arxiv.org/abs/2608.00938v2
- Date: Tue, 04 Aug 2026 15:35:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.865295
- Title: GRACE: Generative Recommender Acceleration Engine for Real-Time Ads Retrieval
- Title(参考訳): GRACE: リアルタイム広告検索のためのジェネレーションレコメンデーションアクセラレーションエンジン
- Abstract要約: 本稿では,広告生成検索のためのサービスシステムGRACEについて述べる。
GRACEはGTM(Generative Target Matching)を導入した。
計算コストとレイテンシに関して、GRACEはLLMよりも軽量なエンコーダ・デコーダ変換をターゲットとしている。
- 参考スコア(独自算出の注目度): 15.73766250149643
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Productionizing generative recommenders for high-volume, real-time ads retrieval creates two serving challenges: eligibility, ensuring that each generated ad is eligible for the request under the advertiser's audience targeting rules, and compute, which requires meeting strict latency and GPU cost requirements while remaining capable of generating thousands of ads per request with wide-beam decoding. This paper presents GRACE, a serving system for ads generative retrieval that addresses both challenges. For eligibility, GRACE introduces Generative Target Matching (GTM), which extends catalog-valid constrained decoding with personalized filtering over Semantic ID (SID) prefixes using bitmask and Bloom filter matchers derived from targeting rules. SID-level GTM improves final ad-level target matching pass rate from 23.55% to 40.42% over constrained decoding alone. For compute-cost and latency, GRACE targets encoder-decoder Transformers, which are more lightweight than LLMs. It redesigns the decoder around the wide-beam, short-sequence regime, covering attention kernels, KV cache, and beam search optimizations. On NVIDIA GH200, compared with the faster of FlashAttention-2 and FlashAttention-3 baselines, GRACE improves cross-attention latency by 68.0 times and self-attention latency by 23.4-25.8 times across decode steps. Together, these changes reduce decoder latency by 11.1 times, keeping ads generative retrieval within latency and compute requirements.
- Abstract(参考訳): 高ボリュームでリアルタイムな広告検索のための生成レコメンデータを生産することは、2つの重要な課題を生み出す: 適格性、各生成された広告が広告主のオーディエンスターゲティングルールの下で要求に適合することを保証すること、計算は厳格なレイテンシとGPUコスト要件を満たしながら、広義のデコーディングでリクエスト毎に数千の広告を生成できること、である。
本稿では,両課題に対処する広告生成検索システムGRACEを提案する。
これは、ターゲティングルールから派生したBitmaskとBloomフィルタマッチングを使用して、セマンティックID(SID)プレフィックスによるパーソナライズされたフィルタリングにより、カタログ価制約付きデコーディングを拡張するものだ。
SIDレベルのGTMは、制約付き復号化だけで、最終的な広告レベルのターゲットマッチングパスレートを23.55%から40.42%に改善する。
計算コストとレイテンシに関して、GRACEはLLMよりも軽量なエンコーダ・デコーダ変換をターゲットとしている。
デコーダを再設計し、注目カーネル、KVキャッシュ、ビームサーチ最適化をカバーした。
NVIDIA GH200では、FlashAttention-2とFlashAttention-3のベースラインの高速化と比較して、GRACEはクロスアテンションレイテンシを68.0倍、自己アテンションレイテンシを23.4-25.8倍改善している。
これらの変更により、デコーダのレイテンシが11.1倍減少し、広告生成検索をレイテンシと計算要求内に保持する。
関連論文リスト
- Long-History User Transformers for Real-Time Ad Ranking [0.027185251060695432]
本稿では、リアルタイム推論から履歴エンコーディングを分離することで、プロダクション広告システムがこの対立を解決する方法について述べる。
高容量オフライン変圧器は、ユーザの全対面インタラクション履歴を、機能ストアにキャッシュされたコンパクトな表現に非同期に符号化する。
製品A/B実験では、検索広告で+2.77%、Yandex Advertising Networkで+2.1%、収益で+2.26%、+0.43%のランキングで+2.43%向上した。
論文 参考訳(メタデータ) (2026-07-15T19:51:16Z) - WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference [56.297697169678095]
WISV(Wireless-Informed Semantic Verification)は、分散投機的復号化フレームワークである。
WISVは最大60.8%の許容長の増加、37.3%の対話ラウンドの削減、31.4%のエンドツーエンドレイテンシの改善を実現している。
NVIDIA Jetson AGX OrinとA40搭載サーバからなるハードウェアテストベッド上でWISVを検証する。
論文 参考訳(メタデータ) (2026-04-20T01:29:56Z) - Tiny Inference-Time Scaling with Latent Verifiers [56.696619768584675]
Verifier on Hidden States (VHS) は、Diffusion Transformer (DiT) の中間的な隠れ表現で動作する。
VHSは、画素空間に復号することなくジェネレータ機能を解析することにより、候補毎の検証コストを削減できる。
VHSは同じ推論時予算でGenEvalを+2.7%改善する。
論文 参考訳(メタデータ) (2026-03-23T19:00:02Z) - Wide-In, Narrow-Out: Revokable Decoding for Efficient and Effective DLLMs [57.69190972274813]
Diffusion Large Language Models (DLLM) は、自動回帰モデルの魅力的な代替品として登場した。
既存のDLLMは、高速な並列復号化によって性能が著しく低下する、厳しい品質と速度のトレードオフに悩まされている。
本稿では,DLLMの復号化を可能にするトレーニング不要復号アルゴリズムであるWide-In, Narrow-Out (WINO)を紹介する。
論文 参考訳(メタデータ) (2025-07-24T16:51:33Z) - FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge [60.000984252907195]
自動回帰(AR)モデルは、サンプリング効率が優れているため、近年、視覚生成タスクにおいて有望であることが示されている。
ビデオ生成は、コヒーレントな時間フレームを生成するために、かなり多くのトークンを必要とする。
我々は,時間的冗長性を探究して,ARビデオ生成のデコードフェーズを高速化する textbfFastCar フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-17T05:00:39Z) - Efficient Inference for Large Language Model-based Generative Recommendation [78.38878421030522]
LLM(Large Language Model)ベースの生成レコメンデーションは目覚ましい成功を収めた。
ジェネレーティブレコメンデーションにSD(Speculative Decoding)を適用すると、トップKアイテムを生成する必要があるため、ユニークな課題が提示される。
我々は,厳密なトップK検証の下でトップKアライメントを最適化する AtSpeed-S というアライメントフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-07T16:23:36Z) - Real-Time GPU-Accelerated Machine Learning Based Multiuser Detection for
5G and Beyond [70.81551587109833]
非線形ビームフォーミングフィルタは、大規模な接続を伴う定常シナリオにおいて、線形アプローチを著しく上回る。
主な課題の1つは、これらのアルゴリズムのリアルタイム実装である。
本稿では,大規模並列化によるAPSMに基づくアルゴリズムの高速化について検討する。
論文 参考訳(メタデータ) (2022-01-13T15:20:45Z) - Minimum Latency Training Strategies for Streaming Sequence-to-Sequence
ASR [44.229256049718316]
線形時間復号複雑性を伴うオンライン音声認識を実現するために,ストリームアテンションに基づくシーケンス・ツー・シーケンス(S2S)モデルが提案されている。
これらのモデルでは、一方向エンコーダには将来的な情報がないため、実際の音響境界よりもトークンを生成する決定が遅れる。
本稿では,ハイブリッドモデルから抽出した外部ハードアライメントを活用することで,トレーニング中のいくつかの戦略を提案する。
Cortana音声検索タスクの実験により,提案手法は遅延を著しく低減し,デコーダ側の特定の場合の認識精度も向上することを示した。
論文 参考訳(メタデータ) (2020-04-10T12:24:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。