論文の概要: Rank-Deviation Quality: A Distance-Aware Metric for Multi-Answer Retrieval and Ranking Evaluation
- arxiv url: http://arxiv.org/abs/2608.25318v1
- Date: Wed, 26 Aug 2026 03:00:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.536818
- Title: Rank-Deviation Quality: A Distance-Aware Metric for Multi-Answer Retrieval and Ranking Evaluation
- Title(参考訳): ランク判定品質:複数回答検索とランキング評価のための距離対応尺度
- Abstract要約: Rank-Deviation Quality (RDQ) は、検索およびランキングシステムの評価指標である。
検索された基準項目はそれぞれ、ランクずれペナルティによって乗算された出力位置重みに寄与する。
RDQは順序付きランキングで動作し、アノテータはペアワイドまたはリストワイドの判断によって生成することができる。
- 参考スコア(独自算出の注目度): 51.55909067323666
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Rank-Deviation Quality (RDQ), an evaluation metric for retrieval and ranking systems that adapts to queries with varying numbers of reference items, from a single correct answer to many valid results. RDQ scores a candidate ranking against an ordered reference list (ORL): each retrieved reference item contributes its output-position weight multiplied by a rank-deviation penalty, and items outside the ORL receive zero credit. Application-specific parameters control tolerance to misordering. Larger values emphasize retrieving valid reference items, whereas smaller values place more weight on matching their reference order. The output-position weights can reflect visibility in the application's interface, such as a vertical list or a carousel. Unlike metrics that require absolute relevance grades, RDQ operates on ordinal rankings, which annotators can produce through pairwise or listwise judgments. Unlike rank-correlation measures such as Kendall's tau, RDQ accounts for both which items are returned and how they are ordered. On a 5,000-query point-of-interest (POI) dataset with 12 systems, RDQ has the highest median empirical power@100 among the 13 evaluated metric configurations. It reaches mean tau >= 0.8 agreement with its own full-query ordering at 200 queries; RBP(0.9), the strongest tested non-RDQ configuration, reaches the same threshold at 250. On TREC Deep Learning benchmarks, where NDCG uses native graded labels and RDQ uses ordinal tiers derived from them, RDQ reaches comparable median power at n=25, while NDCG is higher at n=100.
- Abstract(参考訳): 本稿では,参照項目数が異なるクエリに適応する検索・ランキングシステムの評価指標であるRange-Deviation Quality(RDQ)を,単一の正解から多数の有効な結果へ導入する。
RDQは、順序付けられた基準リスト(ORL)に対してランク付けされた候補をスコアし、各検索された基準項目は、ランク決定ペナルティに乗じて出力位置重みを寄与し、ORL以外の項目はゼロクレジットを受ける。
アプリケーション固有のパラメータは、ミスオーダーに対する耐性を制御する。
より大きな値は有効な参照項目を取得することを強調する一方、より小さな値は参照順序の一致をより重み付けする。
出力位置重みは、垂直リストやカルーセルのようなアプリケーションのインターフェイスの可視性を反映することができる。
絶対的関連格付けを必要とするメトリクスとは異なり、RDQは順序付けで操作し、アノテータはペアワイドまたはリストワイドの判断によって生成することができる。
ケンドールのタウのようなランク相関法とは異なり、RDQはどのアイテムが返却されたか、どのように注文されたかの両方を説明できる。
12のシステムを持つ5000クエリポイント・オブ・関心(POI)データセットでは、RDQは評価された13のメトリクス構成の中で、最も中央値の実証パワー@100を持つ。
平均タウ>=0.8の一致で200のクエリを順序付けし、RDQ以外の最強のテストであるRDP(0.9)は250で同じ閾値に達した。
TREC Deep Learningベンチマークでは、NDCGはネイティブグレードラベルを使用し、RDQはそれらから派生した順序レベルを使用するが、RDQはn=25で同等の中央値まで達し、NDCGはn=100で高い。
関連論文リスト
- Balance of Benchmarks: Semantic Density Reweighting for Benchmark Multiplicity and Task-Conditioned Evaluation [0.0]
ベンチマークのバランスはベンチマーク記述を埋め、各ベンチマークに逆密度のセマンティックウェイトを割り当てる。
残留フィールドは同じ幾何学を用いてタスククエリのランク付けを条件付けする。
BoBは最も高い平均プロファイルを獲得し、最寄り、調整されたトップ(k)、半径、クラスタベースのアグリゲーションを著しく上回っている。
論文 参考訳(メタデータ) (2026-08-30T21:06:29Z) - Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score [14.579552536669217]
一般データ保護規制法に準拠するためには、ビジョンランゲージモデル(VLM)のアンラーニングが必要である。
マルチモーダル・アンラーニングにおける信頼性の最初の研究について述べる。
統一品質スコア(Unified Quality Score, UQS)は, 各計量のスピアマン相関と距離の関係から得られる重みを持つ計量である。
論文 参考訳(メタデータ) (2026-05-04T04:13:00Z) - One Pass, Any Order: Position-Invariant Listwise Reranking for LLM-Based Recommendation [2.5827686695037335]
大規模言語モデル(LLM)は、再ランク付けにますます使用されるが、それらのリストワイズ予測は、候補が提示される順序に依存する可能性がある。
これにより、セットベースのレコメンデーションとデコーダのみのLLMのシーケンスベースの計算のミスマッチが生成される。
InvariRankは、アーキテクチャレベルでこの依存に対処する置換不変なリストワイド・リグレード・フレームワークである。
論文 参考訳(メタデータ) (2026-04-30T08:49:44Z) - Metric-agnostic Learning-to-Rank via Boosting and Rank Approximation [33.0347118359824]
そこで本研究では,各クエリの平均平方損失に対してスムーズな近似を組み合わした,新たな微分可能なランキング損失を提案する。
本手法は,情報検索における現状と同等の効率で性能を向上する。
論文 参考訳(メタデータ) (2026-04-16T14:59:00Z) - RLPO: Residual Listwise Preference Optimization for Long-Context Review Ranking [50.709454968853954]
ポイントワイドスコアは効率的だが、しばしばリストレベルの相互作用を考慮に入れない。
リストワイズアプローチはグローバルなコンテキストを活用することができるが、計算コストが高く、候補リストが大きくなるにつれて不安定になる。
本稿では,リストワイズ表現レベルの残差補正としてランク付けするResidual Listwise Preference Optimization (RLPO)を提案する。
論文 参考訳(メタデータ) (2026-01-12T11:45:19Z) - LINKAGE: Listwise Ranking among Varied-Quality References for Non-Factoid QA Evaluation via LLMs [61.57691505683534]
非F (Non-Factoid) Question Answering (QA) は多種多様な潜在的回答と客観的基準により評価が困難である。
大規模言語モデル (LLM) は、様々なNLPタスクにおいて魅力的な性能を持つため、NFQAの評価に利用されてきた。
提案手法は,LLMを用いて基準回答のランク付けを行う新しい評価手法であるNFQAの評価手法を提案する。
論文 参考訳(メタデータ) (2024-09-23T06:42:21Z) - SQUARE: Automatic Question Answering Evaluation using Multiple Positive
and Negative References [73.67707138779245]
SQuArE (Sentence-level QUestion AnsweRing Evaluation) という新しい評価指標を提案する。
文レベルの抽出(回答選択)と生成(GenQA)の両方のQAシステムでSQuArEを評価する。
論文 参考訳(メタデータ) (2023-09-21T16:51:30Z) - Replace Scoring with Arrangement: A Contextual Set-to-Arrangement
Framework for Learning-to-Rank [40.81502990315285]
ラーニング・トゥ・ランク(Learning-to-rank)は、トップNレコメンデーションタスクの中核的なテクニックであり、理想的なランク付けはアイテムからアレンジへのマッピングである。
既存のソリューションのほとんどは確率的ランキング原理(PRP)のパラダイムに該当する。すなわち、まず候補セットで各項目をスコアし、次にソート操作を行い、トップランキングリストを生成する。
本稿では,個別のスコアリングやソートを必要とせずに,候補項目の順列を直接生成する新しいフレームワークであるSet-To-Arrangement Ranking (STARank)を提案する。
論文 参考訳(メタデータ) (2023-08-05T12:22:26Z) - Recommendation Systems with Distribution-Free Reliability Guarantees [83.80644194980042]
我々は、主に良いアイテムを含むことを厳格に保証されたアイテムのセットを返す方法を示す。
本手法は, 擬似発見率の厳密な有限サンプル制御によるランキングモデルを提供する。
我々はYahoo!のランキングとMSMarcoデータセットの学習方法を評価する。
論文 参考訳(メタデータ) (2022-07-04T17:49:25Z) - Surprise: Result List Truncation via Extreme Value Theory [92.5817701697342]
そこで本研究では,問合せ時における可逆的・校正的関連度スコアを,ランク付けされたスコアに留まらず,統計的に生成する手法を提案する。
本稿では、画像、テキスト、IRデータセット間での結果リストのトランケーションタスクにおいて、その効果を実証する。
論文 参考訳(メタデータ) (2020-10-19T19:15:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。