論文の概要: hLLM: Single Pass Decoding for Generative Reranking
- arxiv url: http://arxiv.org/abs/2609.01807v1
- Date: Tue, 01 Sep 2026 19:30:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.962945
- Title: hLLM: Single Pass Decoding for Generative Reranking
- Title(参考訳): hLLM: ジェネレーティブリグレードのためのシングルパスデコーディング
- Authors: Emil Laftchiev, Prachi Agrawal, Moe Kayali, Bixing Yan, Qi Xu, Zijie Lei, Chen Qiu, Zhi Hua, Ke Li, Luke Simon,
- Abstract要約: hLLM(ハンガリー語)はフォーマット特化復号化戦略であり、$O(1)$フォワードパスですべての$N$オーディナルをデコードする。
また,LoRAをベースとした微調整と教師のランク付けを併用した微調整は,教師と同等の格付けを維持しつつ,エンドツーエンドの推論で28msの高速化を実現した。
- 参考スコア(独自算出の注目度): 20.780080437181223
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) achieve state-of-the-art generative ranking quality, but the ranking they produce must be decoded, and autoregressive decoding spends one sequential forward pass per emitted token. We observe that the only tokens a ranker must emit are the $N$ ordinal values naming the items in ranked order, and that this narrow, permutation-structured output format admits decoding strategies which are much more efficient than left-to-right generation. We introduce hLLM (Hungarian LLM), a format-specialized decoding strategy that decodes all $N$ ordinals in $O(1)$ forward passes. hLLM reads an $N \times K$ item-position score matrix off the LLM's prefill hidden states with a lightweight self-attention head, then decodes the ordinals as the optimal bipartite assignment of that matrix via the Hungarian algorithm, yielding a valid permutation by construction rather than by repair. Through a systematic study of training signals and backbone adaptation, we show that LoRA-based fine-tuning combined with teacher ranking distillation reaches 28 ms end-to-end inference, a speed-up of $64\times$ while maintaining ranking quality on par with the teacher. We provide a complete ablation decomposing the contributions of architecture, training signal, and backbone adaptation. Our framework connects generative ranking to combinatorial optimization, opening a path toward other $O(1)$-decode mechanisms for real-time ranking.
- Abstract(参考訳): 大規模言語モデル(LLM)は、最先端の生成的ランク付けの品質を達成するが、それらが生成するランク付けはデコードされなければならない。
我々は、ランク付け者が発行しなければならない唯一のトークンは、ランク付け順序の項目を命名する$N$ordinal値であり、この狭義の置換構造型出力形式は、左から右への生成よりもはるかに効率的な復号戦略を許容していることを観察する。
我々は、フォーマット特化復号化戦略であるhLLM(ハンガリー語: LLM)を導入し、すべての$N$順序を$O(1)$フォワードパスで復号する。
hLLM は LLM の隠された状態から軽量な自己アテンションヘッドで$N \times K$アイテムポジションスコア行列を読み出し、ハンガリーのアルゴリズムを介してその行列の最適な二部割当として順序を復号し、修復によってではなく、建設によって有効な置換を与える。
学習信号とバックボーン適応の体系的な研究を通して,LoRAをベースとした微調整と教師の格付け蒸留を組み合わせた微調整が,教師と同等の格付けを維持しつつ,エンドツーエンドの推論で28msに達することを示す。
アーキテクチャ、トレーニング信号、バックボーン適応のコントリビューションを分解する完全なアブレーションを提供する。
我々のフレームワークは、生成的ランキングと組合せ最適化を結びつけ、リアルタイムランキングのための他の$O(1)$-decodeメカニズムへの道を開く。
関連論文リスト
- $\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space [71.23672814629448]
$nabla$-Reasonerは、トークンログに対する差別化可能な最適化をデコードループに統合する反復生成フレームワークである。
$nabla$-Reasonerは、挑戦的な数学的推論ベンチマークで20%以上の精度の向上を実現している。
論文 参考訳(メタデータ) (2026-03-05T08:42:54Z) - BLITZRANK: Principled Zero-shot Ranking Agents with Tournament Graphs [14.085089126904101]
我々は、$k$-wiseランキングの原則となる基盤を提供するトーナメントグラフフレームワークを導入する。
それぞれ$k$-item比較すると、$binomk2$の完全なトーナメントがペアワイズで表示される。
我々は、アイテムのランクが確実に決定されたときを形式化し、情報ゲインを最大化する欲求クエリスケジュールを設計する。
論文 参考訳(メタデータ) (2026-02-05T08:41:00Z) - Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders [37.16464474575651]
マルチトークンドクIDを用いたポイントワイズ生成ランキングはデュアルエンコーダよりも優れていることを示す。
SToICaLは、アイテムとトークンのレベルの両方において、ランク対応の監視を組み込むことができるシンプルなトークンの校正損失である。
論文 参考訳(メタデータ) (2026-01-09T07:16:28Z) - Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning [70.6126069527741]
ConvRec-R1は会話レコメンデーションシステムのエンドツーエンドトレーニングのための2段階のフレームワークである。
ステージ1では,Remap-Reflect-Adjustパイプラインを用いた行動閉鎖データセットを構築した。
ステージ2では,グループ相対政策最適化の原則的拡張である Rank-GRPO を提案する。
論文 参考訳(メタデータ) (2025-10-23T02:56:00Z) - KnowCoder: Coding Structured Knowledge into LLMs for Universal Information Extraction [59.039355258637315]
コード生成によるユニバーサル情報抽出(UIE)を行うためのLarge Language Model(LLM)であるKnowCoderを提案する。
KnowCoderは、異なるスキーマをPythonクラスに一様に変換するコードスタイルのスキーマ表現メソッドを導入した。
KnowCoderには、2フェーズの学習フレームワークがあり、コード事前トレーニングによるスキーマ理解能力と、命令チューニングによるスキーマ追従能力を向上させる。
論文 参考訳(メタデータ) (2024-03-12T14:56:34Z) - Learning-to-Rank Meets Language: Boosting Language-Driven Ordering
Alignment for Ordinal Classification [60.28913031192201]
順序分類のための新しい言語駆動順序付け手法を提案する。
事前学習された視覚言語モデルの最近の発展は、人間の言語におけるリッチな順序性を活用するきっかけとなった。
顔の年齢推定,ヒストリカルカラーイメージ(HCI)分類,美的評価を含む3つの日常的分類課題の実験は,その有望な性能を示す。
論文 参考訳(メタデータ) (2023-06-24T04:11:31Z) - Learning Autoencoders with Relational Regularization [89.53065887608088]
データ分散のオートエンコーダを学習するための新しいフレームワークを提案する。
エンフレレーショナル正規化によるモデルと対象分布の差を最小限にする
我々はこのフレームワークを2つのスケーラブルアルゴリズムで実装し、確率的および決定論的オートエンコーダの両方に適用する。
論文 参考訳(メタデータ) (2020-02-07T17:27:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。