論文の概要: Tie Handling Is Part of the Evaluation Protocol: An Order-Invariance Audit for Tie-Heavy Recommender Scores
- arxiv url: http://arxiv.org/abs/2609.26977v1
- Date: Tue, 22 Sep 2026 19:13:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.737512
- Title: Tie Handling Is Part of the Evaluation Protocol: An Order-Invariance Audit for Tie-Heavy Recommender Scores
- Title(参考訳): Tie Handlingは評価プロトコルの一部である: Tie-Heavy Recommender スコアの順序不変監査
- Abstract要約: いくつかの候補者が全く同じスコアを受け取った場合、タイブリングルールはランキングの一部となる。
共通実装は、まず関連項目を格納し、次に安定なソートを適用し、同じスコア間の入力順序を保存する。
対象項目が同じスコアの候補間でランダムに順序付けられた場合, カットオフ k で予測ヒット率と NDCG を導出する。
- 参考スコア(独自算出の注目度): 8.99950006550205
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline top-k evaluation often ranks one held-out relevant item together with sampled negatives. When several candidates receive exactly the same score, the tie-breaking rule becomes part of the ranking. A common implementation stores the relevant item first and then applies a stable sort, which preserves input order among equal scores; the relevant item therefore wins every tie. We call an evaluator row-order invariant when permuting the input candidates without changing their identities, labels, or scores leaves the final ranking unchanged. We audit this property by holding candidates and scores fixed and changing only the tie-breaking rule. On 30,000 Amazon Beauty & Personal Care rows, NDCG@10 for a rating-weighted attribute-overlap score is 0.85 under input-order tie-breaking. A deterministic hash tie-break based on user and item IDs lowers it to 0.17. The exact expectation under uniform random tie-breaking closely matches the mean over 100 independent hash seeds, while a residualized attribute score with few exact ties is nearly unchanged. MovieLens Tag Genome shows the same pattern for an attribute-overlap score, whereas item popularity is nearly unchanged. We derive expected Hit Rate and NDCG at cutoff k when the relevant item is randomly ordered among candidates with the same score, and we provide a practical reporting checklist. The same issue can occur in sampled or full-catalog evaluation whenever exact ties affect top-k membership or rank.
- Abstract(参考訳): オフライントップk評価は、しばしばサンプル陰性とともに1つの保持された関連項目をランク付けする。
いくつかの候補者が全く同じスコアを受け取った場合、タイブリングルールはランキングの一部となる。
共通の実装は、関連項目をまず格納し、続いて安定なソートを適用し、同じスコア間の入力順序を保存する。
入力候補のID、ラベル、スコアを変更することなく、入力候補を置換する際に、評価器の行順不変性(evaluator row-order invariant)と呼ぶ。
我々は、この特性を候補者を保持して評価し、タイブレーキングルールのみを定め、変更する。
アマゾン・ビューティー&パーソナライズ・ケアの3万行で、評価重み付けされた属性オーバーラップスコアのNDCG@10は、入力順序のタイブレークで0.85である。
ユーザIDとアイテムIDに基づく決定論的ハッシュタイブレークは0.17に低下する。
均一な無作為な結び目の下での正確な予測は、100以上の独立したハッシュシードの平均と密接に一致し、正確な結び目がほとんどない残差属性スコアは、ほとんど変化しない。
MovieLens Tag Genomeは属性オーバーラップスコアと同じパターンを示しているが、アイテムの人気はほぼ変わらない。
対象項目が同じスコアの候補間でランダムに順序付けられた場合, カットオフ k で予測ヒット率と NDCG を導出し, 実際の報告チェックリストを提供する。
正確な関係がトップKメンバーシップやランクに影響を与える場合、サンプルまたはフルカタロジ評価でも同様の問題が生じる可能性がある。
関連論文リスト
- Calibration Count Reuse: Validity Does Not Determine Efficiency [0.0]
あるカウントを他のクラスから得点したクラスに渡すことは、その適合性を改善するべきではない。
共通分離変換では、普遍交換可能な妥当性はカウントの非減少と等価である。
2つのiid構造は、常にカバー範囲を変更せずに、同じ有効なルールを改善または悪化させる。
論文 参考訳(メタデータ) (2026-09-21T04:58:08Z) - Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers [6.786248692886496]
均等なランク付けの質は、決定が等しくないことを示します。
通算では0.010点中5点が0.66-0.84点と重なっていた。
OC-SFTはランキング品質を保持し、訓練されたスコアのすべての決定安定度をリードする。
論文 参考訳(メタデータ) (2026-08-27T07:55:42Z) - What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals [1.7006003864727406]
我々はこの欠落したクレーム・リプレイ層を凍結基板Dを介して形式化する。
次に、機械的に許容できる124の検査Evalsユニットを、ピン留めされたコミットで調査します。
論文 参考訳(メタデータ) (2026-08-18T14:32:50Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Gate AI: LLM Security Benchmark Evaluation Methodology and Results [0.0]
本稿では,データセットごとのしきい値調整と未開示動作点に対処する評価ハーネスについて述べる。
評価中の検出器は5倍のクロスバリデーションを用いて16の公開ベンチマークで評価される。
外部比較において、検出器の閾値は、競合が公表した偽陽性率に再調整される。
論文 参考訳(メタデータ) (2026-06-01T23:29:58Z) - Ranking Items from Discrete Ratings: The Cost of Unknown User Thresholds [5.361620932483819]
粗い離散スケールのレーティングから、きめ細かい項目のランキングを復元できるかどうかを問う。
ほぼ完璧なランキングを達成するには、$Theta(n2)$ユーザと$Omega(n2)$クエリが必要です。
しきい値の多様性は、多くのユーザの粗いレーティングをきめ細かなランキングにマージするために必要ですが、しきい値が未知であれば、この多様性はコストがかかります。
論文 参考訳(メタデータ) (2025-10-02T10:23:52Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Found in the Middle: Permutation Self-Consistency Improves Listwise Ranking in Large Language Models [63.714662435555674]
大規模言語モデル(LLM)は、文脈の使い方に位置バイアスを示す。
我々は,ブラックボックスLLMのランキングリスト出力に対して,自己整合性(permutation self-consistency)を提案する。
LLaMA v2 (70B) では GPT-3.5 では 7-18% , LLaMA v2 (70B) では 8-16% である。
論文 参考訳(メタデータ) (2023-10-11T17:59:02Z) - Bipartite Ranking Fairness through a Model Agnostic Ordering Adjustment [54.179859639868646]
本稿では,二部類ランキングにおける公平性を実現するためのモデルに依存しない後処理フレームワークxOrderを提案する。
xOrderは、教師なしおよび教師なしの公正度メトリックを含む、さまざまな分類モデルとランキングフェアネスメトリクスと互換性がある。
提案アルゴリズムを,4つのベンチマークデータセットと2つの実世界の患者電子健康記録リポジトリ上で評価した。
論文 参考訳(メタデータ) (2023-07-27T07:42:44Z) - Integrating Rankings into Quantized Scores in Peer Review [61.27794774537103]
ピアレビューでは、レビュアーは通常、論文のスコアを提供するように求められます。
この問題を軽減するため、カンファレンスはレビュアーにレビューした論文のランキングを付加するように求め始めている。
このランキング情報を使用するための標準的な手順はなく、エリアチェアは異なる方法でそれを使用することができる。
我々は、ランキング情報をスコアに組み込むために、原則化されたアプローチを取る。
論文 参考訳(メタデータ) (2022-04-05T19:39:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。