論文の概要: RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation
- arxiv url: http://arxiv.org/abs/2609.00918v1
- Date: Tue, 01 Sep 2026 08:44:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.484651
- Title: RPCBench: A Benchmark for Proactive Premise Critique in LLM-based Recommendation
- Title(参考訳): RPCBench: LLMベースのレコメンデーションにおけるProactive Premise Critiqueのベンチマーク
- Authors: Zhongru Chen, Yuan Wu, Yi Chang,
- Abstract要約: RPCBenchはRecommender-Premise Critiqueを評価するためのベンチマークです。
RPCBenchには、5つのレコメンデーションドメインからエビデンスベースのテストインスタンスが含まれている。
本研究では,前向きな検出,エラーの局所化,検出後処理戦略を計測する言語評価フレームワークを設計する。
- 参考スコア(独自算出の注目度): 16.995082216096787
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used as interactive recommender assistants. Their evaluation should therefore go beyond plausible item recommendation and test whether they can recognize flawed recommendation requests. Existing recommender benchmarks mainly assess ranking, generation, or preference satisfaction, while existing error-detection benchmarks are usually not grounded in recommendation-specific user and candidate evidence. To address this gap, we introduce RPCBench, a benchmark for evaluating Recommender-Premise Critique: the ability to detect, diagnose, and properly handle faulty premises in natural-language recommendation requests. RPCBench contains evidence-grounded test instances from five recommendation domains and covers ten types of premise failures. Each instance provides a visible recommendation context and a corrupted user query. We further design a fine-grained evaluation framework that measures proactive detection, error localization, post-detection handling strategy, and evidence faithfulness. Through a systematic evaluation of 11 LLMs, we find that proactive detection is the main bottleneck in Recommender-Premise Critique, and models perform worst on underspecified-premise errors. We also observe that target-critical information density matters more than redundant evidence, and that longer reasoning does not monotonically improve critique quality: performance peaks at intermediate reasoning length, while overly long reasoning is accompanied by an overthinking penalty. The code is available at https://github.com/ZhongruChen/RPCBench.
- Abstract(参考訳): 大規模言語モデルは、インタラクティブなレコメンデーターアシスタントとしてますます使われている。
したがって、彼らの評価は、妥当な項目のレコメンデーションを超えて、欠陥のあるレコメンデーション要求を認識できるかどうかをテストするべきである。
既存の推奨ベンチマークは、主にランキング、生成、選好の満足度を評価するが、既存のエラー検出ベンチマークは、レコメンデーション固有のユーザーおよび候補のエビデンスを根拠にしない。
このギャップに対処するために、RPCBenchを紹介します。これはRecommender-Premise Critiqueを評価するためのベンチマークで、自然言語レコメンデーションリクエストで障害のある前提を検出し、診断し、適切に処理する機能です。
RPCBenchには5つのレコメンデーションドメインからのエビデンスベースのテストインスタンスが含まれ、10種類の前提障害をカバーしている。
各インスタンスは、可視的なレコメンデーションコンテキストと、破損したユーザクエリを提供する。
さらに、前向きな検出、エラーの局所化、検出後処理戦略、証拠忠実度を測定するためのきめ細かい評価フレームワークを設計する。
11個のLDMを体系的に評価した結果,プロアクティブ検出がRecommender-Premise Critiqueの主要なボトルネックとなり,不特定前提誤差に対してモデルが最悪となることが判明した。
また、目標臨界情報密度は冗長な証拠以上の重要であり、長い推論は単調に批判的品質を向上しない、すなわち、中間的推論におけるパフォーマンスピークはピークであり、過度に長い推論には過度に過度な罰が伴う、ということも観察した。
コードはhttps://github.com/ZhongruChen/RPCBench.comで入手できる。
関連論文リスト
- MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs [16.970480774847857]
我々は、Proactive Critiqueを、追加のプロンプトなしで欠陥のあるユーザ入力を特定し、分析し、修正するモデルの自律的な能力として定義する。
MLLMの積極的批判能力を評価するための総合的なフレームワークMMPCBenchを提案する。
12のサブカテゴリにまたがる4つの主要なエラータイプのきめ細かい分類が特徴で、クロスモーダルな矛盾から視覚的前提の欠如まで様々である。
論文 参考訳(メタデータ) (2026-08-29T14:19:10Z) - User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation [5.10348690267577]
オフラインレコメンデータ評価における妥当性判断の枠組みを提案する。
我々のアプローチは2つの補完的な役割で大きな言語モデルを使用する。
実験により,この手法はオフライントップN評価の堅牢性を向上させるための有望な戦略であることが示された。
論文 参考訳(メタデータ) (2026-07-13T10:16:24Z) - LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation [16.60711435187638]
オフライン評価は、観測されたユーザのフィードバックを、真の好みのプロキシとして扱う。
トップKメトリクスは、それらをサポートする意味のある洞察を提供することなく、数値スコアを確立するだけです。
オフラインのレコメンデーション評価のための信頼性と説明可能なLCM-as-a-Judgeフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-22T07:42:01Z) - SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones? [51.154921661608675]
我々は、ICLRの投稿から再構成された1,099の機械学習研究提案のキュレートされたベンチマークであるSoundnessBenchを紹介する。
SoundnessBenchは、完全なレビュー結果の正確な予測よりも、復元可能な提案段階の音質のベンチマークとして解釈されるべきである。
論文 参考訳(メタデータ) (2026-05-28T17:57:37Z) - Verifiable Reasoning for LLM-based Generative Recommendation [106.7765000777685]
大規模言語モデル(LLM)における推論は、最近、生成的レコメンデーションの強化に強い可能性を示している。
本稿では,信頼性の高いフィードバックを提供するために,検証と推論をインターリーブする新しいTextbftextitreason-verify-recommendパラダイムを提案する。
4つの実世界のデータセットの実験は、VRecが効率を損なうことなく、推奨の有効性とスケーラビリティを大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-03-08T16:55:45Z) - PredictaBoard: Benchmarking LLM Score Predictability [50.47497036981544]
大きな言語モデル(LLM)は予測不能に失敗することが多い。
これは、安全なデプロイメントを保証する上で、大きな課題となる。
PredictaBoardは,新しいベンチマークフレームワークである。
論文 参考訳(メタデータ) (2025-02-20T10:52:38Z) - Is ChatGPT Fair for Recommendation? Evaluating Fairness in Large
Language Model Recommendation [52.62492168507781]
LLM(FaiRLLM)を用いたFairness of Recommendationと呼ばれる新しいベンチマークを提案する。
このベンチマークは、慎重に作成されたメトリクスと、8つの機密属性を考慮に入れたデータセットで構成されている。
FaiRLLMベンチマークを用いて、ChatGPTの評価を行い、レコメンデーションを生成する際には、いくつかの機密属性に対して不公平であることがわかった。
論文 参考訳(メタデータ) (2023-05-12T16:54:36Z) - CausPref: Causal Preference Learning for Out-of-Distribution
Recommendation [36.22965012642248]
現在のレコメンデータシステムは、現実的なシナリオにおけるユーザやアイテムの配布シフトに対して、依然として脆弱である。
本稿では,推奨特化DAG学習者を因果選好に基づく推薦フレームワークCausPrefに組み込むことを提案する。
当社のアプローチは、アウト・オブ・ディストリビューション・セッティングのタイプにおいて、ベンチマークモデルを大幅に上回っている。
論文 参考訳(メタデータ) (2022-02-08T16:42:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。