論文の概要: An Empirical Study of Feature Selection Granularity
- arxiv url: http://arxiv.org/abs/2607.24145v1
- Date: Mon, 27 Jul 2026 08:24:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.362176
- Title: An Empirical Study of Feature Selection Granularity
- Title(参考訳): 特徴選択粒度に関する実証的研究
- Abstract要約: 従来の特徴選択アルゴリズムは、機能セット全体の機能重要度スコアをグローバルに計算し、単一のステップで上位機能を選択する。
情報の少ない(あるいは騒がしい)機能の存在は、他のより関連性の高い機能の重要性を隠蔽するだろうか?
- 参考スコア(独自算出の注目度): 3.3545793786322347
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Feature selection aims to identify the most informative and relevant features for a given dataset, either in terms of capturing the underlying data structure and distribution better, or with respect to the performance on a downstream task. Existing research in this area has largely focused on developing novel algorithms (in both supervised and unsupervised settings), proposing new evaluation metrics and frameworks, or benchmarking the performance of existing methods. In this work, we examine feature selection through an algorithmic design perspective. Conventional feature selection algorithms typically compute feature importance scores globally across the entire feature set and then select the top-ranked features in a single step. However, this approach raises a critical question: Can the presence of less informative (or noisy) features mask or obscure the true importance of other, more relevant features? In other words, would a recursive strategy, where features are removed one by one while re-evaluating importance at each step, yield different and potentially better results than the standard global ranking approach? To answer this question, we conduct an extensive empirical study using five diverse feature selection algorithms. We implement each algorithm under both the conventional global selection design and the greedy recursive elimination design. We then analyze the impact of this algorithmic choice, both individually for each method and collectively across all methods, on a range of standard feature selection evaluation metrics. The empirical evaluation results show that the greedy approach improves the overall feature selection quality almost consistently, albeit on the expense of higher computational cost, supporting our initial expectation that the curse of dimensionality also obscures the ways of mitigating it.
- Abstract(参考訳): 機能選択は、基盤となるデータ構造と分散性を改善すること、あるいは下流タスクのパフォーマンスに関して、与えられたデータセットの最も有意義で関連性の高い機能を特定することを目的としている。
この分野における既存の研究は、(教師なしと教師なしの両方で)新しいアルゴリズムの開発、新しい評価指標とフレームワークの提案、または既存のメソッドのパフォーマンスのベンチマークに重点を置いている。
本研究では,アルゴリズム設計の観点から特徴選択について検討する。
従来の特徴選択アルゴリズムは、通常、機能セット全体の機能重要度スコアをグローバルに計算し、単一のステップで上位機能を選択する。
しかし、このアプローチは批判的な疑問を提起する: より情報に富んだ(あるいは騒がしい)機能の存在は、他のより関連性の高い機能の重要性を隠蔽するだろうか?
言い換えれば、各ステップにおける重要度を再評価しながら、機能をひとつずつ取り除き、標準的なグローバルランキングアプローチとは異なる、より優れた結果をもたらす、再帰的な戦略なのだろうか?
そこで本研究では,5種類の特徴選択アルゴリズムを用いて実験を行った。
我々は,従来のグローバルな選択設計と欲求再帰的除去設計の両方の下で,それぞれのアルゴリズムを実装した。
次に、このアルゴリズムの選択が、各メソッドごとに、およびすべてのメソッド全体で、様々な標準特徴選択評価指標に与える影響を分析する。
実験的な評価結果から,この手法は,計算コストを犠牲にしつつも,全体の特徴選択品質をほぼ一定に改善し,次元性の呪いも緩和する方法を曖昧にするという当初の期待を裏付けるものである。
関連論文リスト
- Nearly Optimal Active Preference Learning and Its Application to LLM Alignment [68.56793807995417]
大規模言語モデルの調整は、人間の好みラベルの高品質なデータセットに依存する。
既存の多くのアプローチでは、G-やD-最適化のような古典的な実験的な設計基準が採用されている。
本研究では,これら設計目標の適合性に疑問を呈する,選好学習に特有な単純な直観を同定する。
論文 参考訳(メタデータ) (2026-02-02T03:21:29Z) - Cascaded two-stage feature clustering and selection via separability and consistency in fuzzy decision systems [8.048511956662336]
特徴選択は、計算複雑性を減らし、モデルパフォーマンスを改善し、オーバーフィッティングのリスクを軽減することができるため、機械学習において重要なテクニックである。
本稿では,ファジィ決定システムのための2段階特徴クラスタリングと選択アルゴリズムを提案する。
提案アルゴリズムの有効性を18の公開データセットと現実世界の統合失調症データセットを用いて評価した。
論文 参考訳(メタデータ) (2024-07-22T02:44:32Z) - Feature Selection as Deep Sequential Generative Learning [50.00973409680637]
本研究では, 逐次再構成, 変分, 性能評価器の損失を伴って, 深部変分変圧器モデルを構築した。
提案モデルでは,特徴選択の知識を抽出し,連続的な埋め込み空間を学習し,特徴選択決定シーケンスをユーティリティスコアに関連付けられた埋め込みベクトルにマッピングする。
論文 参考訳(メタデータ) (2024-03-06T16:31:56Z) - Sequential Attention for Feature Selection [12.89764845700709]
本稿では,ニューラルネットワークの最先端な実験結果を実現するSequential Attentionと呼ばれる特徴選択アルゴリズムを提案する。
この設定への適応が古典的直交整合探索(OMP)アルゴリズムと等価であることを示すことによって、線形回帰のためのアルゴリズムの理論的な洞察を与える。
論文 参考訳(メタデータ) (2022-09-29T15:49:06Z) - Compactness Score: A Fast Filter Method for Unsupervised Feature
Selection [66.84571085643928]
本稿では,CSUFS (Compactness Score) と呼ばれる高速な教師なし特徴選択手法を提案する。
提案アルゴリズムは既存のアルゴリズムよりも正確で効率的である。
論文 参考訳(メタデータ) (2022-01-31T13:01:37Z) - Estimating leverage scores via rank revealing methods and randomization [50.591267188664666]
任意のランクの正方形密度あるいはスパース行列の統計レバレッジスコアを推定するアルゴリズムについて検討した。
提案手法は,高密度およびスパースなランダム化次元性還元変換の合成と階調明細化法を組み合わせることに基づく。
論文 参考訳(メタデータ) (2021-05-23T19:21:55Z) - Algorithmic Stability and Generalization of an Unsupervised Feature
Selection Algorithm [20.564573628659918]
アルゴリズム安定性は、入力サンプルの摂動に対する感度に関するアルゴリズムの重要な特徴である。
本稿では,この安定性を保証可能な保証で実現した,革新的な教師なし特徴選択アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-10-19T12:25:39Z) - A Novel Community Detection Based Genetic Algorithm for Feature
Selection [3.8848561367220276]
著者らは3つのステップで機能するコミュニティ検出に基づく遺伝的アルゴリズムを提案する。
提案手法の性能から,9つのベンチマーク分類問題を解析した。
論文 参考訳(メタデータ) (2020-08-08T15:39:30Z) - Run2Survive: A Decision-theoretic Approach to Algorithm Selection based
on Survival Analysis [75.64261155172856]
生存分析(SA)は、自然に検閲されたデータをサポートし、アルゴリズムランタイムの分散モデルを学習するためにそのようなデータを使用する適切な方法を提供する。
我々は、アルゴリズム選択に対する洗練された決定論的アプローチの基礎として、そのようなモデルを活用し、Run2Surviveを疑う。
標準ベンチマークASlibによる広範な実験では、我々のアプローチは競争力が高く、多くの場合、最先端のASアプローチよりも優れていることが示されている。
論文 参考訳(メタデータ) (2020-07-06T15:20:17Z) - On-the-Fly Joint Feature Selection and Classification [16.84451472788859]
本稿では,共同で特徴選択と分類を行うためのフレームワークを提案する。
我々は、関連する最適化問題の最適解を導出し、その構造を解析する。
提案アルゴリズムの性能を複数の公開データセット上で評価する。
論文 参考訳(メタデータ) (2020-04-21T19:19:39Z) - Extreme Algorithm Selection With Dyadic Feature Representation [78.13985819417974]
我々は,数千の候補アルゴリズムの固定セットを考慮に入れた,極端なアルゴリズム選択(XAS)の設定を提案する。
我々は、XAS設定に対する最先端のAS技術の適用性を評価し、Dyadic特徴表現を利用したアプローチを提案する。
論文 参考訳(メタデータ) (2020-01-29T09:40:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。