論文の概要: Binary Classification: Is Boosting stronger than Bagging?
- arxiv url: http://arxiv.org/abs/2410.19200v1
- Date: Thu, 24 Oct 2024 23:22:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-10-28 13:37:49.870239
- Title: Binary Classification: Is Boosting stronger than Bagging?
- Title(参考訳): バイナリ分類: ブースティングはバッグよりも強いか?
- Authors: Dimitris Bertsimas, Vasiliki Stoumpou,
- Abstract要約: 本稿では,バニラ・ランダム・フォレストの拡張である拡張ランダム・フォレストを紹介し,付加機能と適応サンプルおよびモデル重み付けについて述べる。
トレーニングサンプルの重み付けを適応するための反復アルゴリズムを開発し、最も難しい例を選好し、新しいサンプルごとに個別の木の重み付け手法を見つけるためのアプローチを開発した。
本手法は15の異なる二分分類データセットにまたがる通常のランダムフォレストを著しく改善し,XGBoostを含む他の木法よりも優れていた。
- 参考スコア(独自算出の注目度): 5.877778007271621
- License:
- Abstract: Random Forests have been one of the most popular bagging methods in the past few decades, especially due to their success at handling tabular datasets. They have been extensively studied and compared to boosting models, like XGBoost, which are generally considered more performant. Random Forests adopt several simplistic assumptions, such that all samples and all trees that form the forest are equally important for building the final model. We introduce Enhanced Random Forests, an extension of vanilla Random Forests with extra functionalities and adaptive sample and model weighting. We develop an iterative algorithm for adapting the training sample weights, by favoring the hardest examples, and an approach for finding personalized tree weighting schemes for each new sample. Our method significantly improves upon regular Random Forests across 15 different binary classification datasets and considerably outperforms other tree methods, including XGBoost, when run with default hyperparameters, which indicates the robustness of our approach across datasets, without the need for extensive hyperparameter tuning. Our tree-weighting methodology results in enhanced or comparable performance to the uniformly weighted ensemble, and is, more importantly, leveraged to define importance scores for trees based on their contributions to classifying each new sample. This enables us to only focus on a small number of trees as the main models that define the outcome of a new sample and, thus, to partially recover interpretability, which is critically missing from both bagging and boosting methods. In binary classification problems, the proposed extensions and the corresponding results suggest the equivalence of bagging and boosting methods in performance, and the edge of bagging in interpretability by leveraging a few learners of the ensemble, which is not an option in the less explainable boosting methods.
- Abstract(参考訳): ランダムフォレストは、特に表のデータセットを扱うことに成功しているため、過去数十年で最も人気のあるバッグング手法の1つです。
これらは広く研究され、XGBoostのようなより優れたモデルと比較されている。
ランダムフォレスト(Random Forests)は、最終モデルを構築する上で、すべてのサンプルと森林を形成するすべての木が同様に重要であるといういくつかの単純な仮定を採用する。
本稿では,バニラ・ランダム・フォレストの拡張である拡張ランダム・フォレストを紹介し,付加機能と適応サンプルおよびモデル重み付けについて述べる。
トレーニングサンプルの重み付けを適応するための反復アルゴリズムを開発し、最も難しい例を選好し、新しいサンプルごとに個別の木の重み付け手法を見つけるためのアプローチを開発した。
我々の手法は15の異なる二分分類データセットにまたがる正規のランダムフォレストを著しく改善し、XGBoostを含む他のツリーメソッドよりも優れている。
木重み付け手法は、均一に重み付けされたアンサンブルに匹敵する性能を向上し、さらに重要なことは、新しいサンプルの分類への貢献に基づいて、木の重要度を定義するために活用されている。
これにより、新しいサンプルの結果を定義する主要なモデルとして、少数の木にのみ焦点をあてることができる。
二項分類問題では,提案した拡張とそれに対応する結果から,バッジ法とブーイング法の等価性が示唆され,アンサンブルの学習者数名を活用することにより,バッジのエッジが解釈可能であることが示唆された。
関連論文リスト
- Can a Single Tree Outperform an Entire Forest? [5.448070998907116]
一般的な考え方は、単一の決定木は、テスト精度において古典的なランダムな森林を過小評価する。
本研究では,斜め回帰木の試験精度を大幅に向上させることで,このような考え方に挑戦する。
本手法は,木習熟を非制約最適化タスクとして再編成する。
論文 参考訳(メタデータ) (2024-11-26T00:18:18Z) - Learning Deep Tree-based Retriever for Efficient Recommendation: Theory and Method [76.31185707649227]
効率的なレコメンデーションのために,Deep Tree-based Retriever (DTR)を提案する。
DTRは、トレーニングタスクを、同じレベルでツリーノード上のソフトマックスベースのマルチクラス分類としてフレーム化している。
非リーフノードのラベル付けによって引き起こされる準最適性を緩和するため、損失関数の補正法を提案する。
論文 参考訳(メタデータ) (2024-08-21T05:09:53Z) - Why do Random Forests Work? Understanding Tree Ensembles as
Self-Regularizing Adaptive Smoothers [68.76846801719095]
統計学で広く普及している偏りと分散還元に対する現在の高次二分法は、木のアンサンブルを理解するには不十分である、と我々は主張する。
森林は、通常暗黙的に絡み合っている3つの異なるメカニズムによって、樹木を改良できることを示す。
論文 参考訳(メタデータ) (2024-02-02T15:36:43Z) - A Mathematical Programming Approach to Optimal Classification Forests [1.0705399532413618]
本稿では,与えられた木を同時に構築する数学的最適化手法を提案する。
分類規則は、森林の樹木の中で最も頻繁に予測される分類をそれぞれの観察に割り当てることによって導かれる。
提案手法は,最先端木分類法と同等あるいは優れた性能を示す。
論文 参考訳(メタデータ) (2022-11-18T20:33:08Z) - ProBoost: a Boosting Method for Probabilistic Classifiers [55.970609838687864]
ProBoostは確率的分類器のための新しいブースティングアルゴリズムである。
各トレーニングサンプルの不確実性を使用して、最も困難で不確実なものを決定する。
これは、最も不確実性が高いと判明したサンプルに徐々に焦点をあてる配列を生成する。
論文 参考訳(メタデータ) (2022-09-04T12:49:20Z) - Explaining random forest prediction through diverse rulesets [0.0]
Local Tree eXtractor (LTreeX)は、与えられたテストインスタンスのフォレスト予測を、いくつかの異なるルールで説明することができる。
提案手法は予測性能の点で他の説明可能な手法よりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2022-03-29T12:54:57Z) - To Boost or not to Boost: On the Limits of Boosted Neural Networks [67.67776094785363]
ブースティングは分類器のアンサンブルを学ぶ方法である。
ブースティングは決定木に非常に有効であることが示されているが、ニューラルネットワークへの影響は広く研究されていない。
単一のニューラルネットワークは通常、同じ数のパラメータを持つ小さなニューラルネットワークの強化されたアンサンブルよりもよく一般化される。
論文 参考訳(メタデータ) (2021-07-28T19:10:03Z) - Growing Deep Forests Efficiently with Soft Routing and Learned
Connectivity [79.83903179393164]
この論文は、いくつかの重要な側面で深い森林のアイデアをさらに拡張します。
我々は、ノードがハードバイナリ決定ではなく、確率的ルーティング決定、すなわちソフトルーティングを行う確率的ツリーを採用する。
MNISTデータセットの実験は、私たちの力のある深部森林が[1]、[3]よりも優れたまたは匹敵するパフォーマンスを達成できることを示しています。
論文 参考訳(メタデータ) (2020-12-29T18:05:05Z) - Residual Likelihood Forests [19.97069303172077]
本稿では,Residual Likelihood Forests(RLF)と呼ばれる新たなアンサンブル学習手法を提案する。
我々の弱い学習者は、過去の学習者の文脈でグローバルな損失を用いて逐次最適化された条件付き確率を生成する。
Random Forests や Gradient Boosted Trees など,いくつかのアンサンブルアプローチと比較すると,RDF のパフォーマンスは大幅に向上している。
論文 参考訳(メタデータ) (2020-11-04T00:59:41Z) - Random boosting and random^2 forests -- A random tree depth injection
approach [0.1749935196721634]
本稿では, 連続的および並列的木系アプローチに適した新しいランダムな樹木深度注入手法を提案し, 提案手法について検討する。
結果として得られたメソッドは、emphRandom Boost と emphRandom$2$ Forest と呼ばれる。
論文 参考訳(メタデータ) (2020-09-13T20:14:50Z) - MurTree: Optimal Classification Trees via Dynamic Programming and Search [61.817059565926336]
動的プログラミングと探索に基づいて最適な分類木を学習するための新しいアルゴリズムを提案する。
当社のアプローチでは,最先端技術が必要とする時間のごく一部しか使用せず,数万のインスタンスでデータセットを処理することが可能です。
論文 参考訳(メタデータ) (2020-07-24T17:06:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。