論文の概要: Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking
- arxiv url: http://arxiv.org/abs/2608.03091v1
- Date: Tue, 04 Aug 2026 04:04:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 07:04:20.693653
- Title: Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking
- Title(参考訳): 位置バイアスは、リストワイズLLMに基づくリグレードにおける選好整合を弱める
- Abstract要約: 位置バイアスがLLMによるリランカーのランク付けプロセスにどのように影響するかを検討する。
本稿では、ペアワイズな選好不安定性、グローバルな選好不整合性、リストワイズな出力整合性を測定する評価フレームワークを提案する。
- 参考スコア(独自算出の注目度): 2.5827686695037335
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have emerged as promising listwise rerankers for recommender systems, but their reliability under equivalent candidate permutations remains unclear. Since recommendation candidates form an unordered set, a reranker should not depend on the arbitrary order used to serialize them. However, decoder-only LLM rerankers can allow input order to affect model scores, pairwise preferences, and rankings. We study how position bias affects the ranking process induced by LLM-based rerankers. Instead of measuring only changes in final ranked lists, we treat rankings produced under equivalent candidate permutations as observations of an induced preference system. We introduce an evaluation framework measuring pairwise preference instability, global preference inconsistency, and listwise output consistency. This framework characterizes candidate-order sensitivity at the pairwise, global, and output levels. Experiments across multiple LLMs, datasets, and list lengths show that these consistency measures are closely aligned, but can diverge from recommendation effectiveness and marginal position-exposure bias. Improving relevance or flattening exposure across positions does not necessarily restore stable pairwise preferences, globally coherent preference structures, or consistent ranked outputs. These results show that reducing marginal exposure skew is insufficient to establish ranking-function validity in LLM-based reranking. Code is available at https://github.com/ejbito/InvariRank .
- Abstract(参考訳): 大規模言語モデル (LLM) は、レコメンダシステムのための有望なリストワイズリランカとして登場したが、等価な候補置換の下での信頼性はまだ不明である。
レコメンデーション候補は未順序集合を形成するため、リランカはそれらをシリアライズするために使用される任意の順序に依存してはならない。
しかし、デコーダのみのLLMリランカは、入力順序がモデルスコア、ペアの選好、ランキングに影響を与えることを許容する。
位置バイアスがLLMによるリランカーのランク付けプロセスにどのように影響するかを検討する。
最終ランクリストの変更のみを測定する代わりに、等価な候補置換の下で生成されたランクを、誘導された選好システムの観測として扱う。
本稿では、ペアワイズな選好不安定性、グローバルな選好不整合性、リストワイズな出力整合性を測定する評価フレームワークを提案する。
このフレームワークは、ペア、グローバル、および出力レベルの候補順序感度を特徴付ける。
複数のLCM、データセット、リスト長にわたる実験では、これらの一貫性は密に一致しているが、推奨の有効性と限界位置露光バイアスから逸脱する可能性がある。
位置間の関連性の向上や平坦化は、安定なペアワイズ選好、グローバルなコヒーレントな選好構造、一貫性のあるランク付けされた出力を復元するとは限らない。
これらの結果から, LLMによる再ランク付けにおいて, 限界露出スキューの低減は, ランク機能の有効性を確立するには不十分であることが示唆された。
コードはhttps://github.com/ejbito/InvariRank で入手できる。
関連論文リスト
- Structure-aware Relative Policy Optimization for Ranking [35.05747484313467]
リストワイドランキングのためのtextbfStructure-aware textbfRelative textbfPolicy textbfOptimizationフレームワークであるSRPOを提案する。
これは、トップウェイトなケンダルタウ距離を用いてサンプル置換間の差を測定し、対応する距離によってそのペアの報酬差を正規化する。
2つのランキングシナリオにまたがる実験結果から、順列レベルの差を明示的にモデル化することで、リストワイドランキングの有効性と安定性が向上することが示された。
論文 参考訳(メタデータ) (2026-07-28T04:13:47Z) - Active Learners as Efficient PRP Rerankers [1.4892446073126189]
Pairwise Ranking Prompting (PRP)は、LLMからペアワイズ選好判断を導き出し、通常は古典的なソートアルゴリズムによってランキングに集約する。
PRPをノイズの多いペアワイズ比較からアクティブラーニングとして再評価し,コール制限体制下での1コールあたりのNDCG@10を改善するために,アクティブローダがドロップイン代替品であることを示す。
論文 参考訳(メタデータ) (2026-05-14T01:03:53Z) - F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - One Pass, Any Order: Position-Invariant Listwise Reranking for LLM-Based Recommendation [2.5827686695037335]
大規模言語モデル(LLM)は、再ランク付けにますます使用されるが、それらのリストワイズ予測は、候補が提示される順序に依存する可能性がある。
これにより、セットベースのレコメンデーションとデコーダのみのLLMのシーケンスベースの計算のミスマッチが生成される。
InvariRankは、アーキテクチャレベルでこの依存に対処する置換不変なリストワイド・リグレード・フレームワークである。
論文 参考訳(メタデータ) (2026-04-30T08:49:44Z) - RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking [50.709454968853954]
ポイントワイドスコアは効率的だが、しばしばリストレベルの相互作用を考慮に入れない。
リストワイズアプローチはグローバルなコンテキストを活用することができるが、計算コストが高く、候補リストが大きくなるにつれて不安定になる。
本稿では,リストワイズ表現レベルの残差補正としてランク付けするResidual Listwise Preference Optimization (RLPO)を提案する。
論文 参考訳(メタデータ) (2026-01-12T11:45:19Z) - In-context Ranking Preference Optimization [65.5489745857577]
In-context Ranking Preference Optimization (IRPO) フレームワークを提案する。
IRPOは標準のDPO手法よりも高い性能を示し、LLMと直接文脈内ランキング設定の整合性を強調した。
論文 参考訳(メタデータ) (2025-04-21T23:06:12Z) - CoRanking: Collaborative Ranking with Small and Large Ranking Agents [94.09834629572403]
大規模言語モデル(LLM)は、優れたリストワイドランキング性能を示している。
CoRankingは、小規模と大規模なランキングモデルを組み合わせて、効率的かつ効果的なランク付けを行う。
論文 参考訳(メタデータ) (2025-03-30T13:00:52Z) - LLM-RankFusion: Mitigating Intrinsic Inconsistency in LLM-based Ranking [17.96316956366718]
大規模言語モデル(LLM)によるランク付けは、現代の情報検索(IR)システムにおいて有望な性能を達成することができる。
ソートに基づく手法では、パスを正しくソートするには一貫した比較が必要であり、LCMがしばしば違反することを示す。
LLMベースのランキングフレームワークであるLLM-RankFusionを提案する。
論文 参考訳(メタデータ) (2024-05-31T23:29:42Z) - Found in the Middle: Permutation Self-Consistency Improves Listwise Ranking in Large Language Models [63.714662435555674]
大規模言語モデル(LLM)は、文脈の使い方に位置バイアスを示す。
我々は,ブラックボックスLLMのランキングリスト出力に対して,自己整合性(permutation self-consistency)を提案する。
LLaMA v2 (70B) では GPT-3.5 では 7-18% , LLaMA v2 (70B) では 8-16% である。
論文 参考訳(メタデータ) (2023-10-11T17:59:02Z) - SetRank: A Setwise Bayesian Approach for Collaborative Ranking from
Implicit Feedback [50.13745601531148]
提案手法は,提案システムにおける暗黙的フィードバックの特性に対応するために,協調的ランキング(SeetRank)のためのセッティングワイドベイズ的手法を提案する。
具体的には、SetRankは、新しい設定された選好比較の後方確率を最大化することを目的としている。
また、SetRankの理論解析により、余剰リスクの境界が$sqrtM/N$に比例できることを示す。
論文 参考訳(メタデータ) (2020-02-23T06:40:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。