論文の概要: Pattern-Aware Graph Neural Networks for Handling Missing Data
- arxiv url: http://arxiv.org/abs/2607.08915v1
- Date: Thu, 09 Jul 2026 20:14:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.735821
- Title: Pattern-Aware Graph Neural Networks for Handling Missing Data
- Title(参考訳): 欠測データ処理のためのパターン認識型グラフニューラルネットワーク
- Abstract要約: 観測値とともに,どの特徴が欠落しているかを明示的に符号化するパターン認識型グラフニューラルネットワークを提案する。
自然に欠落している7つのUCIデータセットに対して、学習された埋め込み、凍結したランダムな埋め込み、統計的特徴、階層的な表現の4つのエンコーディング戦略を使用します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Missing data is ubiquitous in real-world datasets. Traditional methods either discard incomplete samples or apply imputation techniques that ignore potentially informative missingness patterns, implicitly assuming that missingness occurs randomly. However, missingness patterns might provide additional information. We propose pattern-aware graph neural networks that explicitly encode which features are missing alongside observed values. We used four encoding strategies -- learned embeddings, frozen random embeddings, statistical features, and hierarchical representations -- across seven UCI datasets with naturally occurring missingness. Our Pattern-aware methods achieve substantial improvements over baselines, with an average improvement of 17\% in balanced accuracy and 22\% in F1-macro across all datasets. The benefits vary significantly by dataset: annealing shows dramatic improvement (+80\% balanced accuracy), while hepatitis and soybean show minimal gains (+4--5\%). Notably, even simple random pattern embeddings perform comparably to learned embeddings (0.650 vs 0.663 balanced accuracy), suggesting that distinguishing between patterns may be more important than task-specific optimization. Our ablation study reveals that attention mechanisms, while helpful, are not critical when pattern information is available -- simple mean aggregation with pattern awareness achieves 0.640 balanced accuracy compared to 0.645 for attention-based variants.
- Abstract(参考訳): データの欠落は、現実世界のデータセットにどこにでもある。
従来の方法では、不完全なサンプルを捨てたり、潜在的に有意な欠陥パターンを無視する計算技法を適用したりし、無作為性はランダムに起こると暗黙的に仮定する。
しかし、欠落パターンは追加情報を提供するかもしれない。
観測値とともに,どの特徴が欠落しているかを明示的に符号化するパターン認識型グラフニューラルネットワークを提案する。
自然に欠落している7つのUCIデータセットに対して、学習された埋め込み、凍結したランダムな埋め込み、統計的特徴、階層的な表現の4つのエンコーディング戦略を使用しました。
パターン認識手法はベースラインよりも大幅に改善され,平均17倍の精度向上とF1マクロの22倍の精度向上を実現した。
アニーリングは劇的な改善(+80\%のバランスの取れた精度)を示すが、肝炎と大豆は最低利得(+4--5\%)を示す。
特に、単純なランダムなパターン埋め込みでさえ、学習された埋め込み(0.650対0.663のバランスの取れた正確さ)と同等に機能し、パターンの区別がタスク固有の最適化よりも重要であることを示唆している。
我々のアブレーション研究は、注意機構が有用であるにもかかわらず、パターン情報が利用可能である場合、重要ではないことを明らかにしている。
関連論文リスト
- Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - How Ensemble Learning Balances Accuracy and Overfitting: A Bias-Variance Perspective on Tabular Data [0.0]
本研究では,4つの分類課題におけるアンサンブルの精度と過度適合性について検討した。
その結果, アンサンブルは, 平均昇降や制御によるばらつきを低減し, 大きなギャップを伴わずに高い精度を達成できることが示唆された。
論文 参考訳(メタデータ) (2025-12-05T06:51:06Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - CACTI: Leveraging Copy Masking and Contextual Information to Improve Tabular Data Imputation [1.6008229267455227]
CACTIは,欠落パターンやコンテキスト情報の構造を生かした,暗黙の自動符号化手法である。
この結果から,データセット固有のコンテキスト情報と欠落パターンを活用して計算性能を向上させることの価値を強調した。
論文 参考訳(メタデータ) (2025-06-02T22:50:22Z) - Advancing Tabular Stroke Modelling Through a Novel Hybrid Architecture and Feature-Selection Synergy [0.9999629695552196]
本研究は、ストロークを予測するように設計されたデータ駆動型、解釈可能な機械学習フレームワークを開発し、検証する。
定期的に収集された人口統計、生活習慣、臨床変数は4,981件の公的なコホートから得られた。
提案したモデルでは精度97.2%、F1スコア97.15%が達成され、先行する個人モデルと比較して大幅に向上した。
論文 参考訳(メタデータ) (2025-05-18T21:46:45Z) - Telling Left from Right: Identifying Geometry-Aware Semantic Correspondence [80.6840060272386]
本稿では,意味的対応のための幾何学的認識の重要性を明らかにする。
この情報を活用することで,意味的対応性能が著しく向上することを示す。
提案手法は,SPair-71kデータセット上で,65.4(ゼロショット)と85.6(教師)のPCK@0.10スコアを達成する。
論文 参考訳(メタデータ) (2023-11-28T18:45:13Z) - Boosting Differentiable Causal Discovery via Adaptive Sample Reweighting [62.23057729112182]
異なるスコアに基づく因果探索法は観測データから有向非巡回グラフを学習する。
本稿では,Reweighted Score関数ReScoreの適応重みを動的に学習することにより因果発見性能を向上させるためのモデルに依存しないフレームワークを提案する。
論文 参考訳(メタデータ) (2023-03-06T14:49:59Z) - With a Little Help from My Friends: Nearest-Neighbor Contrastive
Learning of Visual Representations [87.72779294717267]
対比損失で最も近い隣り合わせを正として使用すると、ImageNet分類でパフォーマンスが大幅に向上します。
提案手法が複雑なデータ拡張に依存しないことを実証的に証明する。
論文 参考訳(メタデータ) (2021-04-29T17:56:08Z) - Don't Wait, Just Weight: Improving Unsupervised Representations by
Learning Goal-Driven Instance Weights [92.16372657233394]
自己教師付き学習技術は、役に立たないデータから有用な表現を学習することで、パフォーマンスを向上させることができる。
ベイジアンのインスタンスの重み付けを学習することで、下流の分類精度を向上させることができることを示す。
本研究では,STL-10 と Visual Decathlon の自己教師型回転予測タスクを用いて,BetaDataWeighter の評価を行った。
論文 参考訳(メタデータ) (2020-06-22T15:59:32Z) - On the consistency of supervised learning with missing values [15.666860186278782]
多くのアプリケーション設定において、データは分析を難しくするエントリを欠いている。
ここでは、教師あり学習の設定について考察する。トレーニングデータとテストデータの両方に、欠落した値が現れるときにターゲットを予測する。
本研究では,学習前の平均値など,一定値が得られない場合に一定であることを示す。
論文 参考訳(メタデータ) (2019-02-19T07:27:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。