論文の概要: Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models
- arxiv url: http://arxiv.org/abs/2607.21636v2
- Date: Wed, 29 Jul 2026 01:37:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 16:47:49.721151
- Title: Measuring the Dependency Gap: Diagnosing Inter-Column Fidelity in Tabular Generative Models
- Title(参考訳): 依存ギャップの測定:タブラリ生成モデルにおけるカラム間忠実度診断
- Abstract要約: 本稿では,強い勾配型分類器2サンプルテスト (XGB-C2ST) を限界, 依存性, 数値カテゴリーのクロスコンポーネントに分解する依存性を考慮した忠実度診断法を提案する。
標準メトリクスが見逃し、マイノリティクラスのユーティリティを追跡する、真の依存性のギャップを公開します。
- 参考スコア(独自算出の注目度): 5.216183083750454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Synthetic tabular data is prized for preserving not just each column's marginal distribution but the dependencies between columns - structure that carries much of the discriminative signal for minority classes in imbalanced domains such as fraud detection and clinical risk. Yet the metrics most commonly used to certify such data are largely blind to this structure: a fully-factorized baseline that destroys all inter-column dependency is judged nearly indistinguishable from real data by the logistic-regression C2ST, while the pairwise Trend score is only partially sensitive. We introduce a dependency-aware fidelity diagnostic that decomposes a strong gradient-boosted classifier two-sample test (XGB-C2ST) into marginal, dependency, and numerical-categorical cross components, anchored between a fully-factorized lower bound and a real-data oracle upper bound. Applying it to state-of-the-art flow-matching (TabbyFlow/EF-VFM) and diffusion (TabDiff) generators, we expose a real dependency gap that standard metrics miss and that tracks minority-class utility. The gap is not a structural limitation of mean-field objectives - consistent with recent recovery results, these are asymptotically exact - yet it is stubborn: neither a 16x capacity increase nor post-hoc copula correction closes it, pointing to the absence of direct dependency supervision rather than a capacity or structural limit.
- Abstract(参考訳): 合成表データは, 各カラムの限界分布だけでなく, 不正検出や臨床リスクなどの不均衡領域におけるマイノリティクラスに対する識別シグナルの多くを伝達する, カラム間の依存関係の保存に有用である。
カラム間の依存を全て破壊する完全なリファクタリングされたベースラインは、ロジスティック回帰C2STによって実際のデータとほとんど区別できないと判断され、対向傾向スコアは部分的にしか感度がない。
そこで本研究では,高勾配型2サンプル試験(XGB-C2ST)を,完全整合下界と実データオラクル上界との間に固定した境界,依存性,数値カテゴリーのクロス成分に分解する依存性認識型忠実度診断法を提案する。
最先端のフローマッチング(TabbyFlow/EF-VFM)と拡散(TabDiff)ジェネレータに適用すると、標準メトリクスが見逃し、少数クラスのユーティリティを追跡する真の依存性ギャップが明らかになります。
ギャップは平均フィールドの目的の構造的な制限ではなく、最近の回復結果と一致するが、これらは漸近的に正確である。
関連論文リスト
- Impute-EM: Native Mixed-State Diffusion Models for Heterogeneous Data Imputation [71.74203645336385]
Impute-EMは、現在のモデルとインプットされていないエントリを交換し、完了したデータに拡散バックボーンをリフィットする。
我々は、この更新を特徴付け、観測されたマスクインデクシングされた辺縁線が、その限界で目標と一致していることを示す。
論文 参考訳(メタデータ) (2026-09-14T09:39:13Z) - Constraint-Aware Synthetic Tabular Data Generation via Inter-Column Constraint Discovery with LLM Agents [3.7680093320209553]
本研究では,3つのカラム間制約家族の発見と実施について検討する。
私たちの統合ツール・グラウンドド・ワークフローは、3つ全てをマシン実行可能な仮説として表現しています。
論文 参考訳(メタデータ) (2026-08-15T08:19:54Z) - TimeLAVA: Learning-Agnostic Data Valuation for Time Series [48.76711740818533]
TimeLAVAは、評価データと参照データの間の分布差を最小限に抑えるために、時間セグメントを限界貢献によって評価する学習非依存のフレームワークである。
モデルに依存しない一般化にバリュエーションをリンクする理論的保証を提供し、汚染に対する有界感度を証明する。
論文 参考訳(メタデータ) (2026-06-17T06:16:16Z) - Towards Anomaly Detection on Relational Data [51.473064583839296]
属性とリレーショナルエッジの両方から異常を捕捉する再構成に基づくフレームワークを提案する。
RelADは競争効率を保ちながら、他のベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-06-17T02:36:32Z) - Learning Higher-Order Structure from Incomplete Spatiotemporal Data: Multi-Scale Hypergraph Laplacians with Neural Refinement [26.873671102536438]
センサネットワークは現代のインフラを統治するが、標準計算ベンチマークによって仮定される一様ランダムパターンには、それらが失うデータが欠落することは滅多にない。
不完全な観測から高次構造を学習するフレームワークであるMulti-Scale Hypergraph Laplaciansを紹介する。
我々はMSHLがグループ保存パターンをペアワイズグラフに到達不能に表現し、対数係数まで最高の固定スケールに適応し、一方的な改善を保証することを証明した。
論文 参考訳(メタデータ) (2026-05-17T08:15:16Z) - MuteBench: Modality Unavailability Tolerance Evaluation for Incomplete Multimodal Fusion [37.86089523035199]
7つの臨床領域から9つのデータセットをカバーするベンチマークであるMuteBenchを提示する。
アーキテクチャファミリは、パラメータ数を上回る、ロバスト性の最も強い予測要因であることがわかった。
チャネルに依存しないモデルは、モダリティの欠如を許容するが、モダリティの欠如に敏感である。
論文 参考訳(メタデータ) (2026-05-13T19:32:11Z) - Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning [8.35064965629059]
MMFL(Multimodal Federated Learning)は、プライバシー保護のための協調トレーニングを提供する。
実世界の臨床応用は、しばしば、センサーの断続性や不規則なサンプリングによって生じるモダリティの欠如に悩まされる。
本研究では,条件付き拡散モデルを用いて,この欠陥に明示的に対処するフレームワークであるCondIを提案する。
論文 参考訳(メタデータ) (2026-04-25T02:35:08Z) - Domain-Aware Hierarchical Contrastive Learning for Semi-Supervised Generalization Fault Diagnosis [49.89578655034085]
本稿では,障害診断のためのドメイン認識型階層的コントラスト学習(DAHCL)という統合フレームワークを提案する。
DAHCLは、ソースドメインの幾何学的特徴を捉え、異種ソースドメイン間の擬似ラベル予測を校正する。
また,動的信頼層化とファジィコントラスト監視を組み合わせた階層型コントラスト学習モジュールを開発した。
論文 参考訳(メタデータ) (2026-04-22T08:41:27Z) - The Digital Twin Counterfactual Framework: A Validation Architecture for Simulated Potential Outcomes [0.0]
Digital Twin Counterfactual Framework (DTCF)
五段階検証アーキテクチャは、シミュレーターが正しい反事実を生成できるという不当な主張を、観測可能なデータに対する偽証可能なテストに変換する。
分解は因果量から極端に検証されるものへと分離する。
共同因果関係の主張は明示的な前提付きとなる。
論文 参考訳(メタデータ) (2026-04-01T19:04:15Z) - Dependence Fidelity and Downstream Inference Stability in Generative Models [0.0]
共分散レベル依存フィデリティは、生成モデルを評価するのに有用な基準である。
依存性のばらつきは、下流の推論において定量的不安定を引き起こす。
これらの結果から, 依存性の忠実度が生成モデル評価に有用であることが示唆された。
論文 参考訳(メタデータ) (2026-03-17T18:24:31Z) - A Unified View of Attention and Residual Sinks: Outlier-Driven Rescaling is Essential for Transformer Training [86.64715217940274]
外接線は正規化と共に機能する。
アウトリーチは、コントリビュータではなく、再スケール要因として役立ちます。
外乱は学習可能なパラメータに吸収されるか、明示的なゲート再スケーリングによって緩和される。
論文 参考訳(メタデータ) (2026-01-30T13:29:45Z) - Detecting Unobserved Confounders: A Kernelized Regression Approach [46.52607207396279]
Kernel Regression Confounder Detection (KRCD) は、単一環境下での非線形観測データにおける観測不能なコンバウンディングを検出する新しい方法である。
ゼロからの有意な偏差が観測不能な共起を示すテスト統計学。
合成ベンチマークとツインズデータセットの実験は、KRCDが既存のベースラインを上回るだけでなく、計算効率も優れていることを示した。
論文 参考訳(メタデータ) (2026-01-01T04:26:02Z) - Cellwise and Casewise Robust Covariance in High Dimensions [0.0]
cellRCovメソッドは、ケースワイド・アウトレイア、セルワイド・アウトレイア、および欠落したデータを同時に処理する。
シミュレーション研究は、汚染されたデータシナリオと欠落したデータシナリオにおいて、CellRCovの優れた性能を示す。
また、ロバストかつ規則化された正準相関解析のためのセルRCCA法の構築と説明を行う。
論文 参考訳(メタデータ) (2025-05-26T12:46:44Z) - Towards Self-Supervised Covariance Estimation in Deep Heteroscedastic Regression [102.24287051757469]
深部異方性回帰における自己教師付き共分散推定について検討する。
正規分布の間の2-ワッサーシュタイン距離の上界を導出する。
幅広い合成データセットと実データセットに対する実験により、提案された2-ワッサーシュタインと擬似ラベルアノテーションが結合した結果、計算的に安価で正確な深部ヘテロ代用回帰が導かれることが示された。
論文 参考訳(メタデータ) (2025-02-14T22:37:11Z) - DAGnosis: Localized Identification of Data Inconsistencies using
Structures [73.39285449012255]
機械学習モデルを確実に使用するためには、デプロイメント時のデータの不整合の特定と適切な処理が不可欠である。
我々は,有向非巡回グラフ(DAG)を用いて,トレーニングセットの特徴分布と非依存性を構造として符号化する。
我々の手法はDAGnosisと呼ばれ、これらの構造的相互作用を利用して、価値があり洞察に富んだデータ中心の結論をもたらす。
論文 参考訳(メタデータ) (2024-02-26T11:29:16Z) - Bilateral Dependency Optimization: Defending Against Model-inversion
Attacks [61.78426165008083]
本稿では,モデル反転攻撃に対する二元的依存性最適化(BiDO)戦略を提案する。
BiDOは、さまざまなデータセット、分類器、MI攻撃に対する最先端の防御性能を達成する。
論文 参考訳(メタデータ) (2022-06-11T10:07:03Z) - Disentanglement and Generalization Under Correlation Shifts [22.499106910581958]
実世界のデータでは、変動要因間の相関が一般的である。
機械学習アルゴリズムは、ノイズの多いデータに対する予測性能を高めることができるため、そのような相関を利用する利点がある。
潜在部分空間の様々な要因を捉える表現を学習することを目的としている。
論文 参考訳(メタデータ) (2021-12-29T18:55:17Z) - Examining and Combating Spurious Features under Distribution Shift [94.31956965507085]
我々は、最小限の統計量という情報理論の概念を用いて、ロバストで刺激的な表現を定義し、分析する。
入力分布のバイアスしか持たない場合でも、モデルはトレーニングデータから急激な特徴を拾い上げることができることを証明しています。
分析から着想を得た結果,グループDROは,グループ同士の相関関係を直接考慮しない場合に失敗する可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-14T05:39:09Z) - Federated Deep AUC Maximization for Heterogeneous Data with a Constant
Communication Complexity [77.78624443410216]
異種胸部データ検出のための改良型FDAMアルゴリズムを提案する。
本研究は,提案アルゴリズムの通信が機械数に強く依存し,精度レベルにも強く依存していることを示す。
FDAMアルゴリズムのベンチマークデータセットと、異なる組織の医療用胸部X線画像に対する効果を実験により実証した。
論文 参考訳(メタデータ) (2021-02-09T04:05:19Z) - Weakly-Supervised Cross-Domain Adaptation for Endoscopic Lesions
Segmentation [79.58311369297635]
異なるデータセットにまたがるトランスファー可能なドメイン不変知識を探索できる,新しい弱い教師付き病巣移動フレームワークを提案する。
wasserstein quantified transferability frameworkは、広い範囲の転送可能なコンテキスト依存性を強調するために開発されている。
新規な自己監督型擬似ラベル生成器は、送信困難かつ転送容易なターゲットサンプルの両方に対して、確実な擬似ピクセルラベルを等しく提供するように設計されている。
論文 参考訳(メタデータ) (2020-12-08T02:26:03Z) - Generalizing Variational Autoencoders with Hierarchical Empirical Bayes [6.273154057349038]
確率的生成モデルのための計算的に安定なフレームワークである階層的経験的ベイズオートエンコーダ(HEBAE)を提案する。
鍵となる貢献は2つであり、まず、符号化分布を階層的に優先することで、再構成損失関数の最小化と過正規化の回避とのトレードオフを適応的にバランスさせることで、利益を得る。
論文 参考訳(メタデータ) (2020-07-20T18:18:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。