論文の概要: SPD: Single Pass Decoding for Generative Reranking
- arxiv url: http://arxiv.org/abs/2609.01807v2
- Date: Fri, 04 Sep 2026 17:18:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 16:04:20.335348
- Title: SPD: Single Pass Decoding for Generative Reranking
- Title(参考訳): SPD: ジェネレーティブリグレードのためのシングルパスデコード
- Abstract要約: 大規模言語モデル(LLM)は、最先端の生成的ランキング品質を達成するが、それらが生成するランキングはデコードされなければならない。
SPD(Single Forward Pass)は、$O(1)$フォワードパスですべての$N$オーディナルをデコードするフォーマット特化デコード戦略である。
自動回帰式LLM蒸留と組み合わせたLoRAファインチューニングは, 教師と同等のランキング品質を維持しつつ, エンドツーエンドの推算で28ms, 64倍の高速化を実現した。
- 参考スコア(独自算出の注目度): 20.780080437181223
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) achieve state-of-the-art generative ranking quality, but the ranking they produce must be decoded, and autoregressive decoding spends one sequential forward pass per emitted token. We observe that the only tokens a ranker must emit are the $N$ ordinal values naming the items in ranked order, and that this narrow, permutation-structured output format admits decoding strategies which are much more efficient than left-to-right generation. We introduce SPD (Single Forward Pass), a format-specialized decoding strategy that decodes all $N$ ordinals in $O(1)$ forward passes. SPD reads an $N \times K$ item-position score matrix off the LLM's prefill hidden states with a lightweight self-attention head, then decodes the ordinals as the optimal bipartite assignment of that matrix via the Hungarian algorithm, yielding a valid permutation by construction rather than by repair. Through a systematic study of training signals and backbone adaptation, we show that LoRA-based fine-tuning combined with auto-regressive LLM ranking distillation reaches 28 ms end-to-end inference, a speed-up of 64x while maintaining ranking quality on par with the teacher. We provide a complete ablation decomposing the contributions of architecture, training signal, and backbone adaptation. Our framework connects generative ranking to combinatorial optimization, opening a path toward other $O(1)$-decode mechanisms for real-time ranking.
- Abstract(参考訳): 大規模言語モデル(LLM)は、最先端の生成的ランク付けの品質を達成するが、それらが生成するランク付けはデコードされなければならない。
我々は、ランク付け者が発行しなければならない唯一のトークンは、ランク付け順序の項目を命名する$N$ordinal値であり、この狭義の置換構造型出力形式は、左から右への生成よりもはるかに効率的な復号戦略を許容していることを観察する。
SPD(Single Forward Pass)は、$O(1)$フォワードパスですべての$N$オーディナルをデコードするフォーマット特化デコード戦略である。
SPD は LLM の隠された状態から軽量な自己アテンションヘッドで$N \times K$アイテムポジションスコア行列を読み、ハンガリーのアルゴリズムを介してその行列の最適な二部割当として順序を復号し、修復によってではなく、建設によって有効な置換をもたらす。
トレーニング信号とバックボーン適応の体系的な研究を通して,LoRAをベースとした微調整と自己回帰型LCMランキング蒸留が28msのエンド・ツー・エンド推論を実現し,64倍の高速化を実現し,教師と同等のランキング品質を維持した。
アーキテクチャ、トレーニング信号、バックボーン適応のコントリビューションを分解する完全なアブレーションを提供する。
我々のフレームワークは、生成的ランキングと組合せ最適化を結びつけ、リアルタイムランキングのための他の$O(1)$-decodeメカニズムへの道を開く。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - SSTQ:Privacy-Preserving Vector Quantization via Subsampled Stochastic TurboQuant [79.24089819400126]
Subsampled TurboQuant (SSTQ) は、オーバーコンプリートな等幅のタイトフレーム、座標サブサンプリング、プライバシ対応量子化を組み合わせたフレームワークである。
SSTQは平均2乗誤差スケーリングを実現し、クライアントあたり$lceil log N il + b$ bitsを使用する。
また、コードブックに依存したMSEスケーリングを$O(4b)$から$O(2b)$に削減する、プライバシを意識したコードブックの目的も導出します。
論文 参考訳(メタデータ) (2026-08-05T17:51:25Z) - Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection [1.9371675344367494]
SemEval-2026 Task 13 Subtask コードスニペット上のバイナリ分類として検出を運用する。
本研究では,各クラスを専用出力トークンにマッピングし,構造化された応答で単一トークンラベルを出力するようにモデルを訓練するSALSAスタイルの定式化を提案する。
論文 参考訳(メタデータ) (2026-06-23T19:17:11Z) - $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - BLITZRANK: Principled Zero-shot Ranking Agents with Tournament Graphs [14.085089126904101]
我々は、$k$-wiseランキングの原則となる基盤を提供するトーナメントグラフフレームワークを導入する。
それぞれ$k$-item比較すると、$binomk2$の完全なトーナメントがペアワイズで表示される。
我々は、アイテムのランクが確実に決定されたときを形式化し、情報ゲインを最大化する欲求クエリスケジュールを設計する。
論文 参考訳(メタデータ) (2026-02-05T08:41:00Z) - Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders [37.16464474575651]
マルチトークンドクIDを用いたポイントワイズ生成ランキングはデュアルエンコーダよりも優れていることを示す。
SToICaLは、アイテムとトークンのレベルの両方において、ランク対応の監視を組み込むことができるシンプルなトークンの校正損失である。
論文 参考訳(メタデータ) (2026-01-09T07:16:28Z) - Route Experts by Sequence, not by Token [58.92918003265283]
Mixture-of-Experts (MoE)アーキテクチャは、トークンごとに専門家のサブセットだけを活性化することによって、大きな言語モデル(LLM)をスケールする。
標準的なTopKルーティングは、すべてのトークンに同じ固定数の専門家を割り当てる。
トークンレベルからシークエンスレベルにシフトする最小限の修正であるシークエンスレベルTopK(SeqTopK)を提案する。
論文 参考訳(メタデータ) (2025-11-09T18:36:07Z) - Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning [70.6126069527741]
ConvRec-R1は会話レコメンデーションシステムのエンドツーエンドトレーニングのための2段階のフレームワークである。
ステージ1では,Remap-Reflect-Adjustパイプラインを用いた行動閉鎖データセットを構築した。
ステージ2では,グループ相対政策最適化の原則的拡張である Rank-GRPO を提案する。
論文 参考訳(メタデータ) (2025-10-23T02:56:00Z) - Reinforcement Speculative Decoding for Fast Ranking [9.584558586988953]
大規模言語モデル (LLM) は情報検索 (IR) システムやレコメンダシステム (RS) などのランキングシステムで広く採用されている。
LLMの高速ランキング推定のための強化復号法を提案する。
論文 参考訳(メタデータ) (2025-05-23T02:25:26Z) - KnowCoder: Coding Structured Knowledge into LLMs for Universal Information Extraction [59.039355258637315]
コード生成によるユニバーサル情報抽出(UIE)を行うためのLarge Language Model(LLM)であるKnowCoderを提案する。
KnowCoderは、異なるスキーマをPythonクラスに一様に変換するコードスタイルのスキーマ表現メソッドを導入した。
KnowCoderには、2フェーズの学習フレームワークがあり、コード事前トレーニングによるスキーマ理解能力と、命令チューニングによるスキーマ追従能力を向上させる。
論文 参考訳(メタデータ) (2024-03-12T14:56:34Z) - Learning-to-Rank Meets Language: Boosting Language-Driven Ordering
Alignment for Ordinal Classification [60.28913031192201]
順序分類のための新しい言語駆動順序付け手法を提案する。
事前学習された視覚言語モデルの最近の発展は、人間の言語におけるリッチな順序性を活用するきっかけとなった。
顔の年齢推定,ヒストリカルカラーイメージ(HCI)分類,美的評価を含む3つの日常的分類課題の実験は,その有望な性能を示す。
論文 参考訳(メタデータ) (2023-06-24T04:11:31Z) - Order-sensitive Neural Constituency Parsing [9.858565876426411]
本稿では, 従来のニューラルスパンベースCKYデコーダの改良手法を提案する。
従来のスパンベースの復号法とは対照的に、スパンの組み合わせスコアが順序に敏感なベースからより慎重に導出される、順序に敏感な戦略を導入する。
我々のデコーダは,低レベルスパンを高レベルスパンに組み合わせるための細粒度スコアリング方式を決定する際に,既存のスパンベースデコーダの一般化と見なすことができる。
論文 参考訳(メタデータ) (2022-11-01T12:31:30Z) - Matching Pursuit Based Scheduling for Over-the-Air Federated Learning [67.59503935237676]
本稿では,フェデレートラーニング手法を用いて,オーバー・ザ・エアラーニングのための低複雑さデバイススケジューリングアルゴリズムのクラスを開発する。
最先端の提案方式と比較すると,提案方式は極めて低効率なシステムである。
提案手法の有効性は,CIFARデータセットを用いた実験により確認した。
論文 参考訳(メタデータ) (2022-06-14T08:14:14Z) - Learning Autoencoders with Relational Regularization [89.53065887608088]
データ分散のオートエンコーダを学習するための新しいフレームワークを提案する。
エンフレレーショナル正規化によるモデルと対象分布の差を最小限にする
我々はこのフレームワークを2つのスケーラブルアルゴリズムで実装し、確率的および決定論的オートエンコーダの両方に適用する。
論文 参考訳(メタデータ) (2020-02-07T17:27:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。