論文の概要: CARRE: Counterfactual Action Retrieval and Reason Evaluation for Explainable Churn Prescription
- arxiv url: http://arxiv.org/abs/2609.09766v2
- Date: Thu, 10 Sep 2026 01:31:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.301577
- Title: CARRE: Counterfactual Action Retrieval and Reason Evaluation for Explainable Churn Prescription
- Title(参考訳): CARRE:説明可能なチャーン処方文の偽行動検索と推論評価
- Abstract要約: CARREは,検索強化候補生成,費用対効果評価,大規模言語モデル(LLM)推論を組み合わせた3段階のフレームワークである。
IBM Telco Customer Churnデータセットでは、CARREは通常のSHAPベースラインよりも79.8%高い平均モデル予測リスク削減を実現している。
- 参考スコア(独自算出の注目度): 5.823033362443801
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Churn models typically identify high-risk customers but do not specify which feasible retention action should be considered or why that action is appropriate. We present CARRE (Counterfactual Action Retrieval and Reason Evaluation), a three-stage framework that combines retrieval-augmented candidate generation, cost-aware counterfactual scoring, and large language model (LLM) reasoning. CARRE retrieves a predefined catalog of retention actions, estimates model-predicted churn-risk changes under explicit feature transformations, and generates a structured churn reason and a profile-grounded explanation for the selected action. On the IBM Telco Customer Churn dataset, CARRE achieves 79.8% greater mean model-predicted risk reduction than the plain SHAP baseline and 80.4% greater reduction than the cost-controlled SHAP+Cost baseline across 313 high-risk test cases; its cost-normalized efficiency is 10.5% higher than that of plain SHAP. On a 136-case reason-stratified evaluation sample, diagnosis-driven prompt refinement increases weak-label agreement from 79.4% to 90.4%, with no auxiliary-plan constraint violations; because the same sample was used for error diagnosis and re-evaluation, the post-refinement result is not an independent estimate of generalization. For 135 explanations generated using the pre-refinement v2 reason outputs, two cross-vendor LLM judges assign mean scores ranging from 4.02 to 5.00 out of 5, although one judge saturates on actionability, and a deterministic audit finds no contradictions among 66 verifiable profile claims. Retrieval ablations show that k=5 provides the best evaluated compromise between high candidate coverage and downstream reasoning agreement in this dataset. These results illustrate how retrieval, model-based counterfactual scoring, and language generation can be separated and jointly evaluated in a prototype churn-prescription pipeline.
- Abstract(参考訳): チャーンモデルは通常、リスクの高い顧客を特定するが、どの実行可能な保持アクションを考慮すべきか、そのアクションが適切であるかは特定しない。
CARRE(Counterfactual Action Retrieval and Reason Evaluation)は,検索強化候補生成,費用対効果評価,大規模言語モデル(LLM)推論を組み合わせた3段階のフレームワークである。
CARREは、保持動作の予め定義されたカタログを取得し、明示的な特徴変換の下でモデル予測されたチャーンリスク変化を推定し、選択されたアクションに対する構造化チャーン理由とプロファイル基底説明を生成する。
IBM Telco Customer Churnデータセットでは、CARREは通常のSHAPベースラインよりも79.8%、コスト管理されたSHAP+Costベースラインよりも80.4%、コスト正規化効率は通常のSHAPよりも10.5%高い。
136ケースの理由階層化評価サンプルでは、診断駆動の即時改善により、弱いラベルの一致が79.4%から90.4%に増加し、補助的な計画的制約違反は発生しない。
プレリファインメント v2 の理由出力を用いて生成された 135 の説明に対し、2 人のクロスベンダー LLM 判事は 5 のうち平均スコアを 4.02 から 5.00 まで割り当てるが、1 人の裁判官は動作性に飽和し、決定論的監査は66 の検証可能なプロファイルクレームの間に矛盾は見つからない。
検索アブリゲーションは、k=5が、高い候補カバレッジと、このデータセットにおける下流の推論合意の間の最良の評価された妥協を提供することを示している。
これらの結果は,プロトタイプのチャーン処方パイプラインにおいて,検索,モデルに基づく対実的スコアリング,言語生成を分離し,共同で評価する方法を示している。
関連論文リスト
- State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - Recursive Agentic Reasoning [4.7490116928645065]
反復精製、分解、繰り返しサンプリングといったテスト時間推論手法は、しばしば分離して評価される。
エージェントの推論トレース上の再帰演算子として,これらの手法の統一ビューを導入する。
同一のプロンプト、トークン予算、グレーディングコードを持つ共有ハーネスの下で、3つの演算子全てをシングルパスチェーン・オブ・ソートベースラインに対して評価する。
論文 参考訳(メタデータ) (2026-08-25T01:34:08Z) - Claim-Level Reliability Assessment for Efficient Test-Time Reasoning [9.168249719115845]
テストタイムスケーリングの原則としてクレームレベルのファルシフィケーションを提案し、Claim-Level Reliability Assessment (CLR) を通じてそれをインスタンス化する。
CLRは、追加のソリューションサンプリングからターゲット検証まで、テスト時間計算を再配置する。
論文 参考訳(メタデータ) (2026-08-12T12:33:05Z) - Beyond Aggregate Calibration: Decomposing Income-Conditional Recall Disparities in Automated Credit Default Prediction [0.0]
高所得既定者は低所得既定者に対してラベルノイズとして不均等に分類される。
16.86パーセントのポイントギャップは、最終的にデフォルトとなった高所得者と低所得者の間で真の正のレート(リコール)である。
論文 参考訳(メタデータ) (2026-08-08T15:57:15Z) - Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery [95.44432473367836]
大規模言語モデル(LLM)は、事前に特定された質問に答える能力に優れるが、未解決の未解決段階をナビゲートする能力はほとんど測定されていない。
仮説探索(PHD)を導入し,不確定な証拠から,仮説空間を自律的に構築することをモデルに求める。
本稿では,6つの科学的・分析的領域にわたる988ケースのベンチマークであるHypoArenaと,オープンエンド仮説セットの評価フレームワークであるHypoEvalを紹介する。
論文 参考訳(メタデータ) (2026-07-17T08:56:43Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - When the Ruler is Broken: Parsing-Induced Suppression in LLM-Based Security Log Evaluation [0.0]
完全に機能的なモデルが完全に非機能なカテゴリに現れる可能性のある,無音で体系的な評価誤差のクラスを実証する。
SOC-Bench v0は、標準化された13のカテゴリの脅威分類、最小統計パワー要件、ファジィフィールド抽出仕様、および将来のSOC研究における特定の精度の歪みを防ぐための公開スコアリングスクリプトからなるベンチマークフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T06:03:11Z) - ReasoningBomb: A Stealthy Denial-of-Service Attack by Inducing Pathologically Long Reasoning in Large Reasoning Models [67.15960154375131]
大規模推論モデル(LRM)は、多段階推論トレースを明示した大規模言語モデルを拡張する。
この能力は、推論の高い計算コストを生かした、新しいタイプのプロンプト誘発推論時間拒否攻撃(PI-DoS)を導入している。
本稿では,強化学習に基づくPI-DoSフレームワークであるReasoningBombについて紹介する。
論文 参考訳(メタデータ) (2026-01-29T18:53:01Z) - Reasoning-Enhanced Rare-Event Prediction with Balanced Outcome Correction [45.88028371034407]
本稿では,予測のためのLPCORP(Low-Prevalence CORrector for Prediction)*を提案する。
医療・消費者サービス分野における実世界のデータセット上でLPCORPを評価する。
論文 参考訳(メタデータ) (2026-01-23T02:34:29Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment [0.0]
フルテキストのスクリーニングは、体系的なレビューの大きなボトルネックです。
私たちは、ファジィな決定問題として包摂/排除を再設計する、スケーラブルで監査可能なパイプラインを提示します。
論文 参考訳(メタデータ) (2025-08-17T17:41:50Z) - Benchmarking Reasoning Robustness in Large Language Models [76.79744000300363]
新規データや不完全データでは,性能が著しく低下することがわかった。
これらの結果は、厳密な論理的推論に対するリコールへの依存を浮き彫りにした。
本稿では,情報不足によって引き起こされる幻覚を利用して推論ギャップを明らかにする,Math-RoBと呼ばれる新しいベンチマークを提案する。
論文 参考訳(メタデータ) (2025-03-06T15:36:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。