論文の概要: Collaborative Synthetic Data for Privacy-Preserving Financial Fraud Detection Across Organizational Silos
- arxiv url: http://arxiv.org/abs/2609.33754v2
- Date: Sat, 03 Oct 2026 08:50:23 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:34:10.834479
- Title: Collaborative Synthetic Data for Privacy-Preserving Financial Fraud Detection Across Organizational Silos
- Title(参考訳): プライバシ保護のための組織サイロ間の協調的合成データ
- Abstract要約: CollaFuse を不正検出のための協調拡散に基づく代替手段として検討する。
古典的なオーバーサンプリング、局所的な生成ベースライン、集中的な拡散ベンチマークと比較すると、CollaFuseは最も高い局所的忠実さを達成していない。
これらの結果から, 合成データは伝達可能な組織間構造よりも局所的リアリズムにより分析的価値が低いことが示唆された。
- 参考スコア(独自算出の注目度): 4.532998801488736
- License:
- Abstract: Organizations seek analytical value from AI, yet relevant data are often fragmented across organizations and constrained by privacy. This is acute in financial fraud detection, where rare fraud cases and imbalanced local datasets limit decision-relevant analytics. Federated learning enables collaboration without direct data sharing but does not resolve minority-class scarcity. Synthetic data generation can help, yet lightweight methods are interpolation-bound, while generative models require substantial data and computation. Existing collaborative generative approaches often rely on federated learning, imposing considerable organization-side training burdens. In this paper, we examine CollaFuse as a collaborative diffusion-based alternative for fraud detection and evaluate it across five fraud datasets. Compared with classical oversampling, local generative baselines, and centralized diffusion benchmarks, CollaFuse does not achieve the highest local fidelity but improves downstream fraud detection more consistently across most datasets. These findings suggest that synthetic data create analytical value less through local realism than through transferable cross-organizational structure.
- Abstract(参考訳): 組織はAIから分析的価値を求めるが、関連するデータは組織間で断片化され、プライバシによって制約されることが多い。
これは、希少な不正事件や不均衡なローカルデータセットが意思決定関連分析を制限する、金融詐欺検出において、緊急である。
フェデレートラーニングは、直接的なデータ共有なしにコラボレーションを可能にするが、マイノリティクラスの不足を解決しない。
合成データ生成は役に立つが、軽量なメソッドは補間バウンドであり、生成モデルはかなりのデータと計算を必要とする。
既存の共同生成アプローチは、しばしば連合学習に依存しており、組織側でのトレーニングのかなりの負担を課している。
本論文では,コラフューズを不正検出のための協調拡散に基づく代替手段として検討し,5つの不正データセットで評価する。
古典的なオーバーサンプリング、局所的な生成ベースライン、集中的な拡散ベンチマークと比較すると、CollaFuseは最も高い局所的な忠実さを達成せず、ほとんどのデータセットでより一貫して下流での不正検出を改善する。
これらの結果から, 合成データは伝達可能な組織間構造よりも局所的リアリズムにより分析的価値が低いことが示唆された。
関連論文リスト
- Phantoms and Disclosures: a Causal Framework for Auditing Synthetic Data [56.86147283213652]
データ開示の検出と説明を目的とした,カスタマイズ可能な実証監査フレームワークを提案する。
本フレームワークでは,ユーザの情報を直接再現する「真の開示」と,ユーザのデータを偶発的に生成する「幻の開示」とを区別する機構を導入する。
論文 参考訳(メタデータ) (2026-06-15T16:54:02Z) - When Privacy Isn't Synthetic: Hidden Data Leakage in Generative AI Models [2.084639874934284]
生成モデルは、プライバシを保存する合成データを作成するために、ますます使われています。
このような合成リリースは、データ多様体の構造的重複を通じて、基礎となるトレーニングサンプルに関する情報を引き続き漏洩させることができることを実証する。
モデル内部や実データへのアクセスを必要とせずに、この脆弱性を悪用するブラックボックスメンバーシップ推論攻撃を提案する。
論文 参考訳(メタデータ) (2025-12-05T18:52:35Z) - Repurposing Synthetic Data for Fine-grained Search Agent Supervision [81.95597592711688]
LLMベースの検索エージェントは、エンティティ中心の合成データに基づいてますます訓練されている。
一般的なトレーニングメソッドは、このリッチなエンティティ情報を破棄し、代わりにスパースで結果に基づく報酬に依存します。
E-GRPO(Entity-Aware Group Relative Policy Optimization)は、高密度なエンティティ認識報酬関数を定式化する新しいフレームワークである。
論文 参考訳(メタデータ) (2025-10-28T17:50:40Z) - Fairness for the People, by the People: Minority Collective Action [50.29077265863936]
機械学習モデルは、トレーニングデータに存在するバイアスを保存し、一部の少数民族を不公平に扱う。
我々は,企業のトレーニングプロセスを変更することなく,公正性を高めるために,自らのデータを戦略的に再ラベルする調整されたマイノリティグループを提案する。
以上の結果から,少数民族のサブグループは,全体の予測誤差に少なからぬ影響で,不公平さを著しく低減できることが明らかとなった。
論文 参考訳(メタデータ) (2025-08-21T09:09:39Z) - Robust Molecular Property Prediction via Densifying Scarce Labeled Data [53.24886143129006]
薬物発見において、研究を進める上で最も重要な化合物は、しばしば訓練セットを越えている。
本稿では, ラベル付きデータを利用して, 分布内データ(ID)と分布外データ(OOD)を補間する2段階最適化手法を提案する。
論文 参考訳(メタデータ) (2025-06-13T15:27:40Z) - Anomaly Detection in Double-entry Bookkeeping Data by Federated Learning System with Non-model Sharing Approach [3.827294988616478]
ジャーナルのエントリーデータは極めて敏感であり、監査会社間で直接共有することは不可能である。
データコラボレーション(DC)分析に基づく新しい異常検出フレームワークを提案する。
提案手法は,8つの医療機関から収集した総合的および実世界のジャーナルエントリデータを用いて評価した。
論文 参考訳(メタデータ) (2025-01-22T08:53:12Z) - Fin-Fed-OD: Federated Outlier Detection on Financial Tabular Data [11.027356898413139]
実世界のシナリオにおける異常検出は、動的でしばしば未知の異常分布による課題を引き起こす。
本稿では、データの機密性を損なうことなく、個々の組織における異常検出を強化するという課題に対処する。
本稿では,表現学習とフェデレーション学習技術を利用して未知の異常の検出を改善する手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:22:04Z) - Federated Anomaly Detection over Distributed Data Streams [0.0]
本稿では,異常検出,フェデレート学習,データストリーム間のブリッジ構築手法を提案する。
作業の包括的な目標は、分散データストリーム上でのフェデレーション環境での異常を検出することだ。
論文 参考訳(メタデータ) (2022-05-16T17:38:58Z) - DRFLM: Distributionally Robust Federated Learning with Inter-client
Noise via Local Mixup [58.894901088797376]
連合学習は、生データをリークすることなく、複数の組織のデータを使用してグローバルモデルをトレーニングするための有望なアプローチとして登場した。
上記の2つの課題を同時に解決するための一般的な枠組みを提案する。
我々は、ロバストネス解析、収束解析、一般化能力を含む包括的理論的解析を提供する。
論文 参考訳(メタデータ) (2022-04-16T08:08:29Z) - Local Learning Matters: Rethinking Data Heterogeneity in Federated
Learning [61.488646649045215]
フェデレートラーニング(FL)は、クライアントのネットワーク(エッジデバイス)でプライバシ保護、分散ラーニングを行うための有望な戦略である。
論文 参考訳(メタデータ) (2021-11-28T19:03:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。