論文の概要: Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson
- arxiv url: http://arxiv.org/abs/2608.18531v1
- Date: Wed, 19 Aug 2026 04:29:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 20:13:55.27867
- Title: Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson
- Title(参考訳): Pairwise Ranking Outforms Single-Action RL for Offline Explanation Selection: a Practical Lesson
- Abstract要約: LLM上に構築された産業説明・勧告システムはかなりの費用がかかる。
我々は選択から世代を分離する: 説明は凍結候補プールとして事前に生成される。
主要なベンチマークは2,958対のXRec Google Localサブセットです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Industrial explainable-recommendation systems built on LLMs incur a substantial serving cost: each request triggers an LLM generation, with latency in the hundreds of milliseconds and cost that scales linearly with traffic. We separate generation from selection: explanations are produced ahead of time as a frozen candidate pool (six prompt styles, two commodity LLMs), and a small CPU-resident selector picks one at request time. The stack needs no GPU and returns in under 100 ms. Our primary benchmark is a 2,958-pair XRec Google Local subset, evaluating six offline-pool selectors (LambdaRank, PPO, GRPO, DPO, teacher-student distillation) and three KG-path selectors (random walks, edge-disjoint enumeration, MMR-reranked paths). A 300-pair MovieLens-1M split with Claude-Sonnet-4.5 references serves as an internal cross-dataset check, since no public benchmark exists for this setting. All variants use the same BERTScore-F1 protocol as XRec and G-Refer, averaged across five seeds. LambdaRank reaches F1 = 0.500 on Google Local, exceeding both G-Refer and XRec, and F1 = 0.329 on the MovieLens-1M check. With seed variance below 0.003 F1, the ordering is reliable: pairwise learning-to-rank outperforms single-action RL (PPO, GRPO, DPO), which use only one labelled candidate per rollout, leaving K-1 labels unused. The KG-path family targets a different objective: all three variants reach USR = 1.000 on Google Local and 0.997-1.000 on MovieLens-1M, since per-request path grounding yields a unique output per query, avoiding template-collapse failures affecting cached-LLM outputs. A generator-pool study comparing Claude 3 Haiku and Claude Haiku 4.5 shows small F1 shifts (0.001-0.006) while preserving selector ranking: selector and generator can be evaluated independently, though absolute F1 depends on the generator. End-to-end build cost is near $15 on commodity hardware.
- Abstract(参考訳): 各要求は、数百ミリ秒のレイテンシとトラフィックと線形にスケールするコストで、LLM生成をトリガーする。
我々は選択から生成を分離する:説明は凍結した候補プール(6つのプロンプトスタイル、2つのコモディティLCM)として事前に生成され、リクエスト時に小さなCPU常駐セレクタが1つを選択する。
一番のベンチマークは、オフラインプールセレクタ6つ(LambdaRank、PPO、GRPO、DPO、教師学生の蒸留)と3つのKGパスセレクタ(ランダムウォーク、エッジ不整合列挙、MMR参照パス)を評価した、2,958ペアのXRec Google Localサブセットです。
300対のMovieLens-1MとClaude-Sonnet-4.5の参照は内部のクロスデータセットチェックとして機能する。
全ての変種は、XRecやG-Referと同じBERTScore-F1プロトコルを使用しており、5つの種で平均化されている。
LambdaRankはGoogle LocalでF1 = 0.500に達し、G-ReferとXRecを上回り、MovieLens-1MチェックでF1 = 0.329となる。
PPO、GRPO、DPOはロールアウト毎に1つのラベル付き候補しか使用せず、K-1ラベルは未使用である。
KGパスファミリーは異なる目的を目標としている: 3つの変種がGoogle Localで1.000、MovieLens-1Mで0.997-1.000に達する。
Claude 3 Haiku 4.5 と Claude Haiku 4.5 を比較したジェネレータプールによる研究では、セレクタランキングを維持しながら、小さな F1 シフト (0.001-0.006) を示し、セレクタとジェネレータは独立に評価できるが、絶対 F1 はジェネレータに依存している。
エンドツーエンドのビルドコストは、コモディティハードウェアで約15ドルだ。
関連論文リスト
- Your Retriever Already Knows: Distribution-Shape QPP for RAG Retrieval Sufficiency [0.0]
チェコの核レギュレータの展開を動機として,RAGにおける検索効率向上のためのクエリ性能予測(QPP)パラダイムを3つ比較した。
我々の24の非語彙機能は、古典的なQPP文学プールの前に、クエリあたり2msで0.856の重み付き平均AUROCに達する。
LLM判定を1つの特徴(ハイブリッド)として加えると、ViDoRe(0.863)ではS1と一致するが、SJBでは統計的に有意なエッジが得られる。
論文 参考訳(メタデータ) (2026-09-10T14:52:16Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - RAG-Based Auto-Configuration for Industrial Fieldbus Devices [2.623633900557428]
工業機器のコミッショニングでは、技術者がPDFマニュアルから数百のプロトコル固有のパラメータを手作業で抽出する必要がある。
本稿では,OPC-UA,Profibus DP,CANopenのデバイス構成をエンドツーエンドで自動化する生産指向パイプラインを提案する。
論文 参考訳(メタデータ) (2026-08-09T10:07:13Z) - Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs [11.997694190254974]
しばしば、帰属のための自動メトリクスを交換可能なものとして扱う。
3つの評価項目にまたがって8つの自動スコアを監査する。
評価器を選択するための単純な"best-on-average"ルールは、そのままのデータセットアウトに失敗する。
論文 参考訳(メタデータ) (2026-06-22T20:25:36Z) - Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing [51.56484100374058]
プロダクションLLMアプリケーションは、いくつかの防衛ファミリを積み重ねる -- 拒絶フレーズフィルタ、トークンバッジコントロール、モデル許容度リスト、レート制限、ツール登録認証 -- が、BASベンチマークでは、単一の集計カバレッジ番号を報告している。
21エージェントベースラインスキャナに4つのLLM-Top-10対応エージェントを追加し、4つの合成LDMエンドポイントの格子をターゲットとした。
論文 参考訳(メタデータ) (2026-06-01T19:39:25Z) - LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis [7.571129923187892]
CIの障害ログは大きい(中央5k行、このコーパスで最大200k)し、ノイズがあります。
デバッグしようとするコーディングエージェントは、上流ツールに依存して、ログを管理可能なコンテキストに還元する。
11のコンテキスト推論ツールを比較するベンチマークであるLogDx-CIを紹介します。
論文 参考訳(メタデータ) (2026-05-26T06:34:47Z) - Fidelity Probes for Specification--Code Alignment [7.754687669049819]
我々は,コード由来の接地真実解を持つ参照アーティファクトから生成した自然依存問題である忠実度プローブを紹介する。
忠実度プローブは矛盾とカバレッジギャップ率に分解され、ターゲット仕様の編集を収束させる。
15のプログラムで約12kラインのベンチマークを行い、8回のイテレーションで0.63から0.94に凍結テスト仕様の忠実度を上げました。
論文 参考訳(メタデータ) (2026-05-17T04:05:54Z) - OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation [53.88666485159289]
OpenDeepThinkは、集団ベースのテスト時間計算フレームワークで、ペアワイズBradley-Terryの比較によって選択する。
OpenDeepThinkはGemini 3.1 ProのCodeforces Eloを8回のLCMコールラウンドで+405ポイント引き上げる。
CF-73は、国際グランドマスターアノテーションによる73の専門家評価コードフォース問題と、公式判決に対する99%の地域評価合意のキュレートされたセットである。
論文 参考訳(メタデータ) (2026-05-14T17:57:40Z) - Metal-Sci: A Scientific Compute Benchmark for Evolutionary LLM Kernel Search on Apple Silicon [6.599344783327054]
Metal-SciはApple Silicon Metal計算カーネルの10タスクベンチマークである。
各タスクはCPU参照、ルーフラインアンコールされたフィットネス機能、および保持可能な一般化サイズを出荷する。
We reported matched single-model sweeps of Claude Opus 4.7, Gemini 3.1 Pro, GPT 5.5 on M1 Pro。
論文 参考訳(メタデータ) (2026-05-10T19:11:26Z) - HiRE: High Recall Approximate Top-$k$ Estimation for Efficient LLM
Inference [68.59839755875252]
HiREは2つの新しいコンポーネントから構成される: (i) (i) (i) (i) (i) (i) (i) (i) (i) (i) (ii) DA-TOP-$k$: 効率的なマルチデバイス近似トップ-k$演算子) (i) (i) (i) (i) (i) (i) (i) DA-TOP-$k$演算子) 。
我々は、10億のパラメータモデルにおいて、HiREがソフトマックスとフィードフォワード層の両方に適用され、ほぼ一致した事前学習と下流の精度を実現し、1台のTPUv5eデバイスで1.47Times$の推論遅延を高速化することを示した。
論文 参考訳(メタデータ) (2024-02-14T18:04:36Z) - Large Language Models are Effective Text Rankers with Pairwise Ranking Prompting [65.00288634420812]
Pairwise Ranking Prompting (PRP)は、大規模言語モデル(LLM)の負担を大幅に軽減する手法である。
本研究は,中等級のオープンソースLCMを用いた標準ベンチマークにおいて,最先端のランク付け性能を達成した文献としては初めてである。
論文 参考訳(メタデータ) (2023-06-30T11:32:25Z) - Generating EDU Extracts for Plan-Guided Summary Re-Ranking [77.7752504102925]
要約候補を生成して1つの要約を返す2段階のアプローチでは、標準的な単一ステップアプローチよりもROUGEスコアを改善することができる。
これらの問題に対処する再ランク付け候補を生成するための新しい手法を設計する。
広く使われている単一文書ニュース記事コーパスにおいて,以前に公表された手法よりも大きな関連性を示した。
論文 参考訳(メタデータ) (2023-05-28T17:22:04Z) - IRLI: Iterative Re-partitioning for Learning to Index [104.72641345738425]
分散環境でのロードバランスとスケーラビリティを維持しながら、高い精度を得る方法とのトレードオフが必要だ。
クエリ項目関連データから直接バケットを学習することで、アイテムを反復的に分割するIRLIと呼ばれる新しいアプローチを提案する。
我々は,irliが極めて自然な仮定の下で高い確率で正しい項目を検索し,優れた負荷分散を実現することを数学的に示す。
論文 参考訳(メタデータ) (2021-03-17T23:13:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。