論文の概要: Trustworthy synthetic data for campaign decision support: strategy simulation fidelity and the PolicySynth framework
- arxiv url: http://arxiv.org/abs/2607.11269v1
- Date: Mon, 13 Jul 2026 08:51:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.402342
- Title: Trustworthy synthetic data for campaign decision support: strategy simulation fidelity and the PolicySynth framework
- Title(参考訳): キャンペーン決定支援のための信頼できる総合データ:戦略シミュレーションの忠実度とポリシシンスフレームワーク
- Abstract要約: プライバシの制約により、実際のデータの使用が制限されないため、意思決定支援システムは、合成顧客人口に対して、いつまでも分析を継続する傾向にある。
実人口と同一のGo/no-goキャンペーン決定を合成集団がどれだけ頻繁に獲得するかを評価する基準である戦略シミュレーション忠実度(SSF)を提示する。
政策シンスの平均SSFは0.923と0.960で、種子と種子のばらつきは電気通信のCTGANの約10倍、銀行の2.5倍である。
- 参考スコア(独自算出の注目度): 0.8757175705879833
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Decision support systems (DSS) increasingly run retention what-if analysis on synthetic customer populations, because privacy constraints preclude unrestricted use of real data. Such a system is trustworthy only if the synthetic data lead managers to the same decisions as the real data would; yet prevailing criteria certify distributional similarity, not decision alignment, so a synthetic population can match every marginal distribution while still steering a marketing team toward the wrong campaigns. We close this decision-alignment gap with three contributions: strategy simulation fidelity (SSF), a criterion measuring how often the synthetic population yields the same go/no-go campaign decision as the real population; PolicySynth, a DSS framework whose generator is conditioned on the production churn scorer to align decision-relevant structure; and a three-axis reporting standard of decision alignment, membership-inference resistance, and novel-record rate as the minimum deployment quality gate. On a telecommunications churn corpus and a banking acquisition corpus, PolicySynth attains a mean SSF of 0.923 and 0.960, with seed-to-seed variance roughly ten times tighter than CTGAN on telecommunications and 2.5 times on banking. This stability is the deployable property: go/no-go recommendations shift by at most 1.2 percentage points between monthly retraining cycles, against 11.5 for CTGAN, a reversed recommendation on one campaign in nine. A bootstrap baseline matches PolicySynth on SSF yet copies real records verbatim and fails membership inference, evidence that no single axis suffices. PolicySynth reliably supports directional go/no-go screening; its ROI estimates diverge from real outcomes by 70 to 78% and require the volume correction we document.
- Abstract(参考訳): 決定支援システム(DSS)は、プライバシの制約により、実際のデータの使用が制限されないため、合成顧客人口の保持状況の分析を行う傾向にある。
このようなシステムは、合成データ管理者が実際のデータと同じ決定を下す場合にのみ、信頼できる。しかし、一般的な基準では、決定のアライメントではなく、分布の類似性を証明している。
我々は、この意思決定調整のギャップを、戦略シミュレーションフィデリティ(SSF)、合成人口が実際の人口と同じgo/no-goキャンペーン決定をどれだけ頻繁に得るかを測定する基準、意思決定関連構造を整合させるために生産チューンスコアに条件付けされたDSSフレームワーク、および最小配置品質ゲートとしての3軸報告基準、メンバーシップ推論抵抗、新規記録率の3つの基準で埋める。
電気通信のチャーンコーパスと銀行買収コーパスでは、シード・ツー・シードのばらつきがCTGANの約10倍、銀行の2.5倍となる0.923および0.960の平均SSFが達成される。
go/no-goレコメンデーションは、毎月のリトレーニングサイクルの間、少なくとも1.2ポイントずつシフトし、CTGANの11.5は、9回のキャンペーンで逆のレコメンデーションとなる。
ブートストラップベースラインは、SSF上のポリシーと一致するが、実際のレコードは冗長にコピーし、メンバーシップ推論に失敗する。
PolicySynthは、方向性のgo/no-goスクリーニングを確実にサポートしています。
関連論文リスト
- Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay [0.6768558752130311]
単一エージェント環境において,実行されたリプレイからポリシー条件の真偽を検査する。
段階的な信用シグナルは、限界整合シャッフル制御以上の信頼度の高いインクリメンタル忠実度を示すものではない。
信頼のみのルータは、チャンスレベルにおいて重要なステップを回復するが、1ターンあたりの審査コストを13.1%削減する。
論文 参考訳(メタデータ) (2026-08-20T08:04:00Z) - SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement [2.8129261352670003]
我々は、調達をコストに配慮したルーティング問題として扱う統計第一のゲーティングアーキテクチャであるsysを提案する。
ゲートは間隔が狭く、サンプルサイズが適切で、軸が一致する場合にのみ決定を受理する。
コンサイドの勝利率は0.80、ポジションフリップ率は52%である。
論文 参考訳(メタデータ) (2026-07-21T10:52:04Z) - Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization [31.547614109943158]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルにおける長鎖推論の強力なパラダイムとして登場した。
提案手法は,最終回答に対する思考軌跡の情報量を測定するシーケンスレベル信号と,重要な決定トークンにおける確実な予測を円滑化させるトークンレベル指向報酬とを組み合わせ,ISPO(Intrinsic Signal Policy Optimization)を提案する。
ISPOは競争ベースラインを一貫して上回り、ゼロアドバンテージ崩壊が最も頻繁なベンチマークで最大の利益を上げ、トレーニング力学診断では両方の障害モードが減少していることを確認した。
論文 参考訳(メタデータ) (2026-06-07T20:08:36Z) - Certified Policy Optimisation for Nested Causal Bandits via PAC-Bayes Risk [0.0]
問題クラスをNested Contextual Causal Bandits (NCCBs) として定式化する。
我々の主要な理論的結果は、任意のデプロイメントポリシーを認定する因果的PAC-Bayesian過剰リスク境界である。
論文 参考訳(メタデータ) (2026-05-28T11:39:51Z) - Decoupled Conformal Optimisation: Efficient Prediction Sets via Independent Tuning and Calibration [20.21455697379946]
そこで我々は,列車チューンキャリブレート設計の原則としてデカップリング・コンフォーマル最適化(DCO)を提案する。
DCOは、効率指向構造選択のために独立したチューニングスプリットと、最終共形量子化のための新鮮なキャリブレーションスプリットを使用する。
DCOは,PACスタイルのキャリブレーションに対して,平均予測セットサイズや間隔幅を小さくしながら,名目カバレッジレベルを密に追跡する。
論文 参考訳(メタデータ) (2026-05-18T13:10:21Z) - Meituan Merchant Business Diagnosis via Policy-Guided Dual-Process User Simulation [15.639936579155922]
グループレベルのユーザ行動のシミュレーションは、コストのかかるオンライン実験を伴わずに、商業戦略のスケーラブルな偽物評価を可能にする。
動作軌跡から伝達可能な決定ポリシーをマイニングする2プロセスフレームワークであるPGHS(Policy-Guided Hybrid Simulation)を提案する。
PGHSはグループシミュレーションの誤差の8.80%を達成し、それぞれ45.8%、40.9%改善した。
論文 参考訳(メタデータ) (2026-04-16T16:23:13Z) - Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions [89.52532304099522]
フェデレートラーニング(FL)は、クライアントが生データを集中せずに共有モデルを共同でトレーニングすることを可能にし、固有のプライバシーレベルを提供する。
グラデーションとモデル更新は機密情報を漏洩する可能性があるが、悪意のあるサーバはビザンティン操作のような敵攻撃をマウントする可能性がある。
これらの脆弱性は、統合されたフレームワーク内の差分プライバシー(DP)とビザンチンの堅牢性に対処する必要性を強調している。
Byz-Clip21-SGD2Mを提案する。
論文 参考訳(メタデータ) (2026-03-24T17:39:09Z) - DeFRiS: Silo-Cooperative IoT Applications Scheduling via Decentralized Federated Reinforcement Learning [62.347535250646196]
本稿では、ロバストでスケーラブルなシロコラボ型IoTアプリケーションスケジューリングのための分散フェデレーション強化学習フレームワークであるDeFRiSを提案する。
DeFRiSは、(i)異種サイロ間のシームレスな知識伝達を可能にするための候補資源スコアを利用したアクション空間非依存ポリシー、(ii)汎用アドバンテージ推定とクリッピングされたポリシー更新を組み合わせたサイロ最適化ローカル学習メカニズム、(iii)類似性認識の知識伝達と異常検出に勾配指紋を利用するDual-Track Non-IIDロバストな分散集約プロトコル、の3つのイノベーションを統合する。
論文 参考訳(メタデータ) (2026-03-16T02:02:38Z) - Ratio-Variance Regularized Policy Optimization for Efficient LLM Fine-tuning [48.34492357368989]
本稿では,安定なオン・ポリティクス学習をサポートし,オフ・ポリティクスデータの再利用を原則とするプリミティブ・デュアル・フレームワークを提案する。
R2VPO$は、強いクリッピングベースのベースラインよりも17%の平均的な相対的なゲインで優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-01-06T14:01:42Z) - Navigating the Synchrony-Stability Frontier in Adaptive Chatbots [0.0]
コア設計の緊張を明示する計算評価フレームワークを提案する。
人間のログデータセットに対する明示的な適応ポリシーをシミュレートし比較する。
限定されたポリシーは、同期に控えめなコストで、安定性の大幅な向上を実現している。
我々は、フロンティアポリシーが命令のチャーンを減らし、ジャリングレジスタのフリップを減らしたことを示す「素早い正当性」を定量化する。
論文 参考訳(メタデータ) (2025-09-30T22:50:30Z) - MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources [113.33902847941941]
VAS (Variance-Aware Sampling) は、Variance Promotion Score (VPS) によって導かれるデータ選択戦略である。
我々は、1.6MのCoT冷間開始データと15kのRLQAペアを含む大規模かつ慎重にキュレートされたリソースをリリースする。
数学的推論ベンチマークによる実験では、キュレートされたデータと提案されたVASの有効性が示されている。
論文 参考訳(メタデータ) (2025-09-25T14:58:29Z) - Label Distributionally Robust Losses for Multi-class Classification:
Consistency, Robustness and Adaptivity [55.29408396918968]
多クラス分類のためのラベル分布ロバスト(LDR)損失という損失関数群について検討した。
我々の貢献は、多クラス分類のためのLDR損失のトップ$kの一貫性を確立することによって、一貫性と堅牢性の両方を含んでいる。
本稿では,各インスタンスのクラスラベルの雑音度に個別化温度パラメータを自動的に適応させる適応型LDR損失を提案する。
論文 参考訳(メタデータ) (2021-12-30T00:27:30Z) - Post-Contextual-Bandit Inference [57.88785630755165]
コンテキストバンディットアルゴリズムは、電子商取引、医療、政策立案における非適応的なA/Bテストを置き換える傾向にある。
研究参加者の成果を改善することもでき、良い方針や最良の政策を特定できる可能性を高めることもできる。
研究の終盤における新規介入の信頼性推論を支援するため, 平均治療効果, サブグループ効果, あるいは新政策の価値について, 有効な信頼区間を構築したい。
論文 参考訳(メタデータ) (2021-06-01T12:01:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。