論文の概要: Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers
- arxiv url: http://arxiv.org/abs/2608.26762v1
- Date: Thu, 27 Aug 2026 07:55:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.297287
- Title: Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers
- Title(参考訳): 等級・等級・等級・等級・等級・等級・等級・等級・等級等級
- Authors: Markus Frohmann, Mahdiyar Alavi, Elizabeth Lingg, Navid Rekabsaz,
- Abstract要約: 均等なランク付けの質は、決定が等しくないことを示します。
通算では0.010点中5点が0.66-0.84点と重なっていた。
OC-SFTはランキング品質を保持し、訓練されたスコアのすべての決定安定度をリードする。
- 参考スコア(独自算出の注目度): 6.786248692886496
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Rerankers, reward models and multi-document QA scorers score candidate documents or responses in one LLM prompt, so each score depends on their order. Such scorers are selected on ranking quality, but their scores determine a decision: what a score threshold retains, a reader answers, or a preference model selects. However, equal ranking quality does not imply equal decisions: on passage reranking, five trained scorers within 0.010 nDCG@10 retain sets that overlap by only 0.66-0.84 when reordered. A published reranker takes the highest retained-set F1 in our comparison and still overlaps by only 0.667. No prompt-time change we test removes that order dependence: the only one that gains ranking quality leaves all three decisions unchanged. Order-consistency SFT (OC-SFT) attenuates it in the weights, training a candidate's score not to depend on the order. It holds ranking quality and leads every decision-stability measure among trained scorers on all three tasks: it flips the reader's answer on 0.125 of permutation pairs against 0.149-0.164 for three other objectives that target order. It is more stable than order-averaged distillation on 12 base models, and one OC-SFT permutation retains sets that overlap more than ten averaged off-the-shelf permutations. A comparison should therefore report what a threshold retains and a reader answers, not ranking quality alone. Code is available at https://github.com/thomsonreuters/presentation-dependence.
- Abstract(参考訳): リランカー、報酬モデル、マルチドキュメントQAスコアラーは候補文書または1つのLCMプロンプトで応答をスコアするので、それぞれのスコアは順番に依存する。
このようなスコアはランキング品質に基づいて選択されるが、スコアが決定する:スコアしきい値、読者回答、または選好モデルが選択される。
しかし、均等なランク付けの品質は、パスリランクでは、0.010 nDCG@10内の5つのトレーニングされたスコアラーは、リオーダー時にわずか0.66-0.84でオーバーラップするセットを保持する。
公表されたリランカは、我々の比較において最も高い保持集合F1を受け取り、それでもわずか0.667で重なる。
私たちがテストした即時的な変更は、その順序依存を排除します。
順序整合性SFT(OC-SFT)は重みを減らし、順序に依存しないよう候補者のスコアを訓練する。
ランキング品質を保持し、全ての3つのタスクにおいて、トレーニングされたスコアのすべての決定安定度をリードする: 順序を目標とする他の3つの目的に対して、順列対0.149-0.164に対して、読み手の解答を0.15に反転させる。
12塩基モデルの注文平均蒸留よりも安定であり、1つのOC-SFT置換は10以上の平均オフザシェルフ置換の重なり合う集合を保持する。
したがって、比較は、ランキング品質のみではなく、しきい値と読者の回答を報告すべきである。
コードはhttps://github.com/thomsonreuters/presentation-dependence.comで入手できる。
関連論文リスト
- Rank-Deviation Quality: A Distance-Aware Metric for Multi-Answer Retrieval and Ranking Evaluation [51.55909067323666]
Rank-Deviation Quality (RDQ) は、検索およびランキングシステムの評価指標である。
検索された基準項目はそれぞれ、ランクずれペナルティによって乗算された出力位置重みに寄与する。
RDQは順序付きランキングで動作し、アノテータはペアワイドまたはリストワイドの判断によって生成することができる。
論文 参考訳(メタデータ) (2026-08-26T03:00:18Z) - When Does Machine Learning Beat Value Sorting? A Three-Dataset Diagnostic of Exposure-Weighted Shipment Prioritization [0.0]
機械学習が要求のないモデルベースラインをクリアするかどうかを評価する。
実際の3つのサプライチェーンのコンテキストにおいて,リーク制御された圧延オリジン評価と1000サンプルペアブートストラップ信頼区間を用いる。
論文 参考訳(メタデータ) (2026-07-20T23:11:18Z) - Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs [11.997694190254974]
しばしば、帰属のための自動メトリクスを交換可能なものとして扱う。
3つの評価項目にまたがって8つの自動スコアを監査する。
評価器を選択するための単純な"best-on-average"ルールは、そのままのデータセットアウトに失敗する。
論文 参考訳(メタデータ) (2026-06-22T20:25:36Z) - Boosting Self-Consistency with Ranking [56.38798757709555]
自己整合性は、複数の推論パスをサンプリングし、最も頻繁な回答を選択することで、大きな言語モデルを改善する。
この制限は、自己整合性における解答選択をランク付け問題として再構成する、ランク付け改善自己整合性(RISC)に対処する。
論文 参考訳(メタデータ) (2026-06-03T16:12:30Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - One Pass, Any Order: Position-Invariant Listwise Reranking for LLM-Based Recommendation [2.5827686695037335]
大規模言語モデル(LLM)は、再ランク付けにますます使用されるが、それらのリストワイズ予測は、候補が提示される順序に依存する可能性がある。
これにより、セットベースのレコメンデーションとデコーダのみのLLMのシーケンスベースの計算のミスマッチが生成される。
InvariRankは、アーキテクチャレベルでこの依存に対処する置換不変なリストワイド・リグレード・フレームワークである。
論文 参考訳(メタデータ) (2026-04-30T08:49:44Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Found in the Middle: Permutation Self-Consistency Improves Listwise Ranking in Large Language Models [63.714662435555674]
大規模言語モデル(LLM)は、文脈の使い方に位置バイアスを示す。
我々は,ブラックボックスLLMのランキングリスト出力に対して,自己整合性(permutation self-consistency)を提案する。
LLaMA v2 (70B) では GPT-3.5 では 7-18% , LLaMA v2 (70B) では 8-16% である。
論文 参考訳(メタデータ) (2023-10-11T17:59:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。