論文の概要: When Do Anchor-Based Pointwise LLM Rerankers Help? Retriever Quality, Statistical Scope, and Anchor Design
- arxiv url: http://arxiv.org/abs/2608.10528v2
- Date: Wed, 12 Aug 2026 17:43:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.583992
- Title: When Do Anchor-Based Pointwise LLM Rerankers Help? Retriever Quality, Statistical Scope, and Anchor Design
- Title(参考訳): アンカーベースポイントワイドLCMリランカーはいつ役に立つか? : 検索品質, 統計的スコープ, アンカー設計
- Abstract要約: 我々は、アンカーベースポイントワイドの制御されたコンポーネントレベルストレステストの出発点として再生を利用する。
厳密な統計的補正の下では、コアコントラストスコアリングのアイデアが堅牢であることがわかった。
紙のアンカーを構築するためのより複雑な方法は不要である。
- 参考スコア(独自算出の注目度): 4.468952886990851
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Anchor-based pointwise LLM reranking scores each candidate against a shared reference passage to recover cross-document context at pointwise cost. We study when this actually helps, using GCCP/PAGC as a representative method. Our study is reproduction-first. We use reproduction as a starting point for a controlled component-level stress test of anchor-based pointwise reranking. Our initial reimplementation, based only on the paper text, achieves 0.24 nDCG@10 instead of the reported 0.66, revealing that several undocumented implementation details are necessary to reproduce the method. After identifying and recovering eight such details, we reproduce the reported results within 1.6% and use the validated implementation for controlled analysis. We find that the core contrastive scoring idea is robust under rigorous statistical correction. However, two design choices held fixed in the original paper are less reliable. First, we find that combining the contrastive score with the standard pointwise relevance score helps when the first-stage retriever is BM25, but gives little or no benefit when the first-stage retriever is a stronger dense model such as E5. Second, the paper's more complex method for constructing the anchor is unnecessary. A much simpler anchor, built by interleaving the top-ranked sentences, matches or outperforms it across datasets. These findings are consistent across different LLM backbones, including a 4-bit quantized 72B model. Overall, anchor-based pointwise reranking is effective, but its gains come mainly from contrastive scoring rather than from the more complex aggregation and anchor-construction choices, and they appear under narrower conditions than the original evaluation suggests.
- Abstract(参考訳): アンカーベースのポイントワイドLLMは、各候補が共有参照パスに対してスコアを更新し、ポイントワイズコストでクロスドキュメントコンテキストを回復する。
我々はGCCP/PAGCを代表的手法として用いて,これが実際にどのように役立つかを研究する。
私たちの研究は再生優先です。
我々は、アンカーベースポイントワイドの制御されたコンポーネントレベルストレステストの出発点として再生を利用する。
論文テキストのみに基づく初期再実装では,0.66ではなく0.24nDCG@10が達成され,メソッドの再現にはいくつかの未文書実装の詳細が必要であることが判明した。
8つの詳細を同定・復元した後、報告された結果を1.6%以内で再現し、検証済みの実装を制御分析に使用した。
厳密な統計的補正の下では、コアコントラストスコアリングのアイデアが堅牢であることがわかった。
しかし、元の論文で固定された2つの設計選択は信頼性が低い。
まず,第1段レトリバーがBM25である場合,第1段レトリバーがE5のような強い高密度モデルである場合,コントラッシブスコアと標準点関連スコアとを組み合わせることで,利益がほとんどあるいは全く得られないことがわかった。
第2に、アンカーを構築するためのより複雑な手法は不要である。
トップランクの文をインターリーブして構築された、はるかにシンプルなアンカー。
これらの知見は、4ビット量子化72Bモデルを含む異なるLLMバックボーン間で一致している。
全体として、アンカーベースのポイントワイドリランクは有効であるが、その利得は主に、より複雑なアグリゲーションとアンカーコンストラクションの選択からではなく、対照的なスコアから得られるものであり、元の評価より狭い条件下で現れる。
関連論文リスト
- Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training [11.136092421166097]
Agentic RAGは、外部知識を取り入れることで、大きな言語モデルを強化する。
現在のRLベースのトレーニング手法は、中間信号を捨てるスパース結果報酬に悩まされている。
本稿では,エージェントRAGトレーニングにパス中心の報酬形成を導入するフレームワークであるSearch-P1を提案する。
論文 参考訳(メタデータ) (2026-02-26T03:31:00Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Automated Skill Decomposition Meets Expert Ontologies: Bridging the Granularity Gap with LLMs [1.2891210250935148]
本稿では,Large Language Models (LLM) を用いた自動スキル分解について検討する。
我々のフレームワークは、パイプラインをプロンプトと生成から正規化とオントロジーノードとのアライメントまで標準化する。
出力を評価するために、コンテンツ精度を評価するために最適な埋め込みベースのマッチングを使用するF1スコアと、粒度を評価するために構造的に正しい配置を信用する階層型F1スコアの2つの指標を導入する。
論文 参考訳(メタデータ) (2025-10-13T12:03:06Z) - Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data? [82.09573568241724]
EssenceBenchは反復遺伝的アルゴリズム(GA)を利用した粗粒度フレームワーク
提案手法は, 再構成誤差が低く, 効率が著しく向上した, 優れた圧縮結果が得られる。
HellaSwagベンチマーク(10Kサンプル)では,25倍少ないサンプルを用いて,全モデルが5%以内の順位を保ち,わずか200倍少ないサンプルを用いて,95%未満のランキング保持シフトを達成している。
論文 参考訳(メタデータ) (2025-10-12T05:38:10Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning [54.85131761693927]
意思決定前にLLM審査員に思考を教えるための強化学習フレームワークであるJ1を紹介する。
私たちのコアコントリビューションは、検証不可能で検証可能なプロンプトのすべての判断タスクを、検証可能な報酬を持った統一フォーマットに変換することです。
次に、RLを用いて8B、32B、70Bのスケールで思考判断を訓練し、彼らが最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2025-05-15T14:05:15Z) - CASPR: Automated Evaluation Metric for Contrastive Summarization [4.310460539747285]
本稿では,一対の要約のコントラストをよりよく測定するための自動評価指標CASPRを提案する。
従来のデータセットであるCoCoTRIPによる結果から,CASPRは,ベースラインと比較して,要約ペアのコントラスト性をより確実に捉えることができることが示された。
論文 参考訳(メタデータ) (2024-04-23T23:27:29Z) - Detection Transformer with Stable Matching [48.963171068785435]
もっとも重要な設計は, 肯定的な事例の分類スコアを監督するために, 位置測定値のみを使用することである。
本原理では,DTRの分類損失とマッチングコストに位置測定値を統合することで,簡易かつ効果的な2つの修正を提案する。
12エポックおよび24エポックのトレーニング設定の下でResNet-50バックボーンを用いてCOCO検出ベンチマークで50.4および51.5APを達成する。
論文 参考訳(メタデータ) (2023-04-10T17:55:37Z) - [Re] Don't Judge an Object by Its Context: Learning to Overcome
Contextual Bias [15.701707809084715]
PyTorch 1.7.0でスクラッチからパイプライン全体を実装する。
その結果,提案手法はいずれも文脈バイアスの軽減に役立つことがわかった。
論文 参考訳(メタデータ) (2021-04-28T06:21:28Z) - Probabilistic Anchor Assignment with IoU Prediction for Object Detection [9.703212439661097]
オブジェクト検出では、どのアンカーを正または負のサンプルとして割り当てるか、すなわちアンカー代入(アンカー代入)がモデルの性能に大きく影響を与えるコアプロシージャとして明らかにされている。
本稿では,モデルの学習状況に応じて,アンカーを正と負のサンプルに適応的に分離する新しいアンカー代入戦略を提案する。
論文 参考訳(メタデータ) (2020-07-16T04:26:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。