論文の概要: GenCAR: Generative Counterfactual Alignment with Risk-Controlled Selection for Out-of-Distribution Recommendation
- arxiv url: http://arxiv.org/abs/2609.02162v1
- Date: Wed, 02 Sep 2026 06:24:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.10499
- Title: GenCAR: Generative Counterfactual Alignment with Risk-Controlled Selection for Out-of-Distribution Recommendation
- Title(参考訳): GenCAR: アウト・オブ・ディストリビューション・レコメンデーションのためのリスク制御された選択によるジェネレーティブ・デファクト・アライメント
- Abstract要約: 我々は、OODを$$-Valid Counterfactual Recommendation($-VCR)問題として機能させる。
我々は、優先順位付き対実管理と校正セット選択を結合したGenCARを提案する。
特に、GenCARは環境要因に介入しながら、安定した参照表現を修正します。
- 参考スコア(独自算出の注目度): 7.538235053815412
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Serving useful recommendations under distribution shift is crucial for balancing utility and risk in out-of-distribution (OOD) recommendation. However, most existing OOD methods improve ranking or construct counterfactual candidates without controlling the proxy-label false discovery rate (FDR) of the served set. In this work, we formulate OOD serving as the $α$-Valid Counterfactual Recommendation ($α$-VCR) problem to retain candidate support learned from counterfactual supervision while controlling proxy-label FDR, and propose GenCAR, which couples preference-grounded counterfactual supervision with calibrated set selection. In particular, GenCAR fixes the stable-preference representation while intervening on the environmental factor, grounds offline large language model proposals through preference anchors and trust-radius filtering, and uses conformal $p$-values for Benjamini--Hochberg selection. We theoretically bound conditional counterfactual approximation error and prove finite-sample, distribution-free control of proxy-label FDR under exchangeability and positive regression dependence, with a Benjamini--Yekutieli guarantee under arbitrary dependence. Extensive experiments audit realized proxy false discovery proportions and demonstrate that GenCAR consistently enhances OOD candidate recovery across diverse benchmarks.
- Abstract(参考訳): 流通シフトの下で有用なレコメンデーションを実現することは、アウト・オブ・ディストリビューション(OOD)レコメンデーションにおけるユーティリティとリスクのバランスをとるために不可欠である。
しかし、既存のOOD手法の多くは、サービスセットのプロキシラベル偽発見率(FDR)を制御せずに、ランク付けや偽造候補の構築を改善している。
本稿では,OODを$α$-Valid Counterfactual Recommendation(α$-VCR)問題として定式化し,プロキシラベルFDRを制御しながら,対実管理から学んだ候補支援を維持するとともに,優先的な対実管理と校正された集合選択を結合したGenCARを提案する。
特に、GenCARは環境要因に介入しながら安定な参照表現を修正し、好みアンカーと信頼ラディウスフィルタリングを通じてオフラインの大規模言語モデルの提案を根拠にし、Benjamini-Hochberg選択に共形$p$-valueを使用する。
理論的には条件付き反事実近似誤差と有限サンプル, 交換性および正回帰依存性の下でのプロキシラベルFDRの分布自由制御を, 任意の依存下でのBenjamini-Yekutieli保証で証明する。
大規模な実験はプロキシの偽発見比率を検証し、GenCARが様々なベンチマークでOOD候補の回復を継続的に強化することを示した。
関連論文リスト
- Robust Conformalized Selection with Noisy Responses [23.306273801765297]
コンフォーマル化された選択は、大規模なデータセットから高品質な候補を選択するために広く適用されてきた。
我々は、上記のタスクを、真の予測ラベルを持つ候補を選択するか、特定の値を超える応答を持つものとして定式化する。
本稿では,汎用ラベル汚染下での有効なFDR制御による選択分類のための統合フレームワークであるRobust Conformalized Selection (RCS)を提案する。
論文 参考訳(メタデータ) (2026-07-25T01:51:46Z) - Denoised Conformal Alignment for Reliable Selection of Conditional Average Treatment Effect Predictions [10.945117945979566]
ブラックボックスCATE予測器の信頼性の選択について検討する。
疑似アウトカムから2つの堅牢なプロキシエラーを構築する。
定式化コンフォーマルアライメントを提案する。
論文 参考訳(メタデータ) (2026-07-03T10:00:28Z) - Selective Ensemble Based on Preference-Directed Multi-Objective Bandits [90.75513823660775]
我々は、部分的に指定された線形選好の下で逐次決定問題を定式化する。
次に、嗜好指向の高信頼度境界(PrefUCB)アルゴリズムを提案する。
大規模な事前学習型モデル選択アンサンブルタスクと,機関委任下でのオンラインアセットアロケーションの実験により,本手法が検証された。
論文 参考訳(メタデータ) (2026-06-20T07:52:46Z) - Beyond Fixed False Discovery Rates: Post-Hoc Conformal Selection with E-Variables [31.204606769083068]
コンフォーマルセレクション(CS)は、キャリブレーションデータを使用して、未観測結果が所定の最小品質要件を満たす可能性のあるテスト入力を識別し、偽発見率(FDR)を制御している。
既存の方法は、データを見る前にターゲットFDRレベルを固定し、ユーザが選択したテスト入力数とFDR間のバランスを、利用可能なデータに基づいてダウンストリームのニーズと制約に適合させないようにする。
本稿では,データ駆動型偽発見率(FDP)の推定値と組み合わせて,候補選択集合の経路を生成するポストホックCS(PH-CS)を提案する。
論文 参考訳(メタデータ) (2026-04-13T11:02:44Z) - DARC: Disagreement-Aware Alignment via Risk-Constrained Decoding [59.16244104797919]
本稿では,リスク制約付き復号法(DARC)*による分散アライメント(Disagreement-Aware Alignment)を提案する。
DARCは応答選択を、分布的に堅牢で、リスクに敏感な意思決定として捉えている。
アライメントベンチマークの実験では、DARCは競合平均品質を維持しながら、不一致と尾のリスクを低減する。
論文 参考訳(メタデータ) (2026-03-09T09:21:29Z) - VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction [55.04308051033549]
RLVR(Reinforcement Learning with Verifiable Rewards)は、LLM(Large Language Models)推論を向上するための主要なパラダイムとして登場した。
モデル固有の信頼性を活用して外部検証から独立したカリキュラムを構築するフレームワークであるVerifier-Independent Curriculum Reinforcement Learning (VI-CuRL)を紹介する。
論文 参考訳(メタデータ) (2026-02-13T03:40:52Z) - R-Align: Enhancing Generative Reward Models through Rationale-Centric Meta-Judging [69.96389360650072]
解析精度は, 標準ラベルの精度を超えて, 下流RLHFの結果を高い精度で予測できることが示される。
我々は,金の判断でトレーニングを増強し,合理的アライメントを明示的に監督するR-Alignを提案する。
論文 参考訳(メタデータ) (2026-02-06T15:17:11Z) - LEC: Linear Expectation Constraints for False-Discovery Control in Selective Prediction and Routing Systems [95.35293543918762]
大規模言語モデル(LLM)はしばしば信頼できない答えを生成するが、不確実性のある手法は誤った予測と完全に区別することができない。
我々は、この問題を、偽発見率(FDR)制御のレンズを通して解決し、全ての許容された予測のうち、エラーの割合が目標のリスクレベルを超えないことを保証する。
本稿では,線形期待制約を強制することで,選択予測を制約付き決定問題として再解釈するLECを提案する。
論文 参考訳(メタデータ) (2025-12-01T11:27:09Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - COIN: Uncertainty-Guarding Selective Question Answering for Foundation Models with Provable Risk Guarantees [51.5976496056012]
COINは、統計的に有効な閾値を校正し、質問毎に1つの生成された回答をフィルタリングする不確実性保護選択フレームワークである。
COINはキャリブレーションセット上で経験的誤差率を推定し、信頼区間法を適用して真誤差率に高い確率上界を確立する。
リスク管理におけるCOINの堅牢性,許容回答を維持するための強いテストタイムパワー,キャリブレーションデータによる予測効率を実証する。
論文 参考訳(メタデータ) (2025-06-25T07:04:49Z) - A Novel Generative Model with Causality Constraint for Mitigating Biases in Recommender Systems [20.672668625179526]
遅延共起バイアスは、ユーザのフィードバックとアイテムの露出の間の真の因果関係を曖昧にする可能性がある。
本稿では,Recommender Systemsにおける表現学習のための遅延因果制約(Latent Causality Constraints)と呼ばれる新しい生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-22T14:09:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。