論文の概要: Instance Hardness-Based Relevance for Imbalanced Regression
- arxiv url: http://arxiv.org/abs/2607.20173v2
- Date: Thu, 23 Jul 2026 12:05:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 14:12:06.755445
- Title: Instance Hardness-Based Relevance for Imbalanced Regression
- Title(参考訳): 不均衡回帰に対するインスタンスの硬度に基づく関連性
- Authors: Vitor M. Leitao, Juscimara G. Avelino, George D. C. Cavalcanti, Rafael M. O. Cruz,
- Abstract要約: 本研究では,レグレッション問題における稀なインスタンスを識別するインスタンスハーネスに基づく関連関数(InHaR)を提案する。
従来の関連関数とは異なり、提案手法は学習困難を伴い、ターゲット分布から希少性を推定する。
実験の結果,InHaRは2モーダル分布下での希少領域を正しく同定することがわかった。
- 参考スコア(独自算出の注目度): 7.352103534432416
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Imbalanced regression problems arise when the target variable has an asymmetric distribution, resulting in underrepresented value ranges in the dataset. Traditional approaches for identifying rare instances rely on a relevance function that assigns higher importance to specific regions of the target distribution. However, the effectiveness of imbalance-aware learning methods depends strongly on how relevance is defined. In more complex scenarios, such as bimodal distributions, traditional relevance functions struggle to capture rarity, as they assign fixed relevance values based solely on target values, thereby compromising the distinction between truly rare and normal instances. To address these limitations, this study proposes an Instance Hardness-based relevance function (InHaR) for identifying rare instances in regression problems. Unlike traditional relevance functions, the proposed approach incorporates learning difficulty, allowing rarity to be inferred not only from the target distribution but also from the difficulty of instances for the learning algorithm. This property is particularly important in bimodal scenarios, where rarity cannot be accurately inferred from target values alone. Experimental results demonstrate that the InHaR correctly identifies rare regions under bimodal distributions and, when used to guide resampling strategies such as Random Oversampling (RO) and Gaussian Noise (GN), leads to significant improvements in predictive performance compared to traditional relevance-based approaches. The code, dataset, and further details about the proposed method are publicly available at https://github.com/VitorLeitao/instance-hardness-Imbalanced-regression.
- Abstract(参考訳): 不均衡回帰問題は、ターゲット変数が非対称な分布を持つと発生し、その結果、データセットの未表現値の範囲が大きくなる。
稀なインスタンスを識別するための従来のアプローチは、ターゲットディストリビューションの特定の領域により高い重要性を割り当てる関連関数に依存している。
しかし,不均衡を考慮した学習手法の有効性は,関連性の定義に強く依存する。
バイモーダル分布のようなより複雑なシナリオでは、伝統的な関連関数は、ターゲット値のみに基づいて固定された関連値を割り当て、真に稀なインスタンスと通常のインスタンスの区別を妥協するので、希少性を捉えるのに苦労する。
これらの制約に対処するために、回帰問題における稀なインスタンスを識別するためのインスタンスハーネスに基づく関連関数(InHaR)を提案する。
従来の関連関数とは異なり、提案手法は学習難易度を組み込んでおり、対象分布だけでなく学習アルゴリズムのインスタンスの難易度からも希少性を推定することができる。
この性質は、ターゲット値のみから正確さを推測できないバイモーダルシナリオにおいて特に重要である。
実験により,InHaRはバイモーダル分布下での希少領域を正しく同定し,Random Oversampling (RO) やGaussian Noise (GN) などの再サンプリング戦略を導出する場合,従来の妥当性に基づくアプローチと比較して予測性能が大幅に向上することが示された。
提案されたメソッドに関するコードやデータセット、さらに詳しい情報は、https://github.com/VitorLeitao/instance-hardness-Im Balanced-regressionで公開されている。
関連論文リスト
- How Useful is Causal Invariance for Domain Adaptation in Finite-Sample Settings? [58.740078141879984]
機械学習モデルは、トレーニングされたソースディストリビューションとは異なるターゲットディストリビューションにデプロイされると、しばしば劣化する。
因果関係に基づく領域一般化における最近の研究は、共用因果構造が不変な予測因子を誘導する方法を示している。
本稿では,完全あるいは部分的な因果知識が,教師付きドメイン適応を確実に改善できるかどうかについて検討する。
論文 参考訳(メタデータ) (2026-06-10T21:07:49Z) - Amortized Variational Inference for Logistic Regression with Missing Covariates [4.027766797152636]
Amortized Variational Inference for Logistic Regression (AV-LR) は、バイナリロジスティック回帰のための統一されたエンドツーエンドフレームワークである。
AV-LRは、確率的生成モデルと単純な償却推論ネットワークを統合する。
計算コストを大幅に削減し、最先端のEMライクなアルゴリズムと同等かそれ以上の精度で推定できる。
論文 参考訳(メタデータ) (2026-03-22T14:00:59Z) - Variable Selection Using Relative Importance Rankings [0.0]
本稿では,モデル作成前における可変ランク付けとフィルタに基づく選択の可能性について検討する。
具体的には、予測器の直接効果と組み合わせ効果の両方が組み込まれているため、RI測度から強い性能を期待する。
これらのランキングに基づいて構築された予測モデルは競争力が高く、しばしばラッソや緩やかなラッソのような最先端の手法よりも優れていることを示す。
論文 参考訳(メタデータ) (2025-09-13T15:21:39Z) - Regression Augmentation With Data-Driven Segmentation [0.0]
不均衡回帰は、ターゲット分布が歪んだときに発生し、モデルが密度の高い領域に集中し、表現不足の(マイノリティ)サンプルと競合する原因となる。
本稿では,Mahalanobis-Gaussian Mixture Modeling (GMM) を用いて,マイノリティサンプルの自動同定を行う,完全なデータ駆動型GANベースの拡張フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-02T18:12:11Z) - Enforcing Fundamental Relations via Adversarial Attacks on Input Parameter Correlations [76.2226569692207]
入力パラメータ間の相関は、多くの科学的分類タスクにおいて重要な役割を果たす。
我々はRandom Distribution Shuffle Attack (RDSA)と呼ばれる新たな敵攻撃アルゴリズムを提案する。
6つの分類課題においてRDSAの有効性を示す。
論文 参考訳(メタデータ) (2025-01-09T21:45:09Z) - Conditional expectation with regularization for missing data imputation [19.254291863337347]
欠落したデータは、医学、スポーツ、ファイナンスなど、さまざまな領域のデータセットで頻繁に発生する。
正規化による損失値の条件分布に基づくインプット(DIMV)という新しいアルゴリズムを提案する。
DIMVは、完全に観察された特徴からの情報をベースとして、エントリが不足している特徴の条件分布を決定することで機能する。
論文 参考訳(メタデータ) (2023-02-02T06:59:15Z) - KL Guided Domain Adaptation [88.19298405363452]
ドメイン適応は重要な問題であり、現実世界のアプリケーションにしばしば必要である。
ドメイン適応文学における一般的なアプローチは、ソースとターゲットドメインに同じ分布を持つ入力の表現を学ぶことである。
確率的表現ネットワークにより、KL項はミニバッチサンプルにより効率的に推定できることを示す。
論文 参考訳(メタデータ) (2021-06-14T22:24:23Z) - Fundamental Limits and Tradeoffs in Invariant Representation Learning [99.2368462915979]
多くの機械学習アプリケーションは、2つの競合する目標を達成する表現を学習する。
ミニマックスゲーム理論の定式化は、精度と不変性の基本的なトレードオフを表す。
分類と回帰の双方において,この一般的かつ重要な問題を情報論的に解析する。
論文 参考訳(メタデータ) (2020-12-19T15:24:04Z) - Learning Invariant Representations and Risks for Semi-supervised Domain
Adaptation [109.73983088432364]
半教師付きドメイン適応(Semi-DA)の設定の下で不変表現とリスクを同時に学習することを目的とした最初の手法を提案する。
共同で textbfLearning textbfInvariant textbfRepresentations と textbfRisks の LIRR アルゴリズムを導入する。
論文 参考訳(メタデータ) (2020-10-09T15:42:35Z) - GenDICE: Generalized Offline Estimation of Stationary Values [108.17309783125398]
重要なアプリケーションでは,効果的な推定が依然として可能であることを示す。
我々のアプローチは、定常分布と経験分布の差を補正する比率を推定することに基づいている。
結果として得られるアルゴリズム、GenDICEは単純で効果的である。
論文 参考訳(メタデータ) (2020-02-21T00:27:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。