論文の概要: Optimised Support Vector Regression for California Housing Price Prediction: The Critical Role of Feature Engineering and Hyperparameter Tuning
- arxiv url: http://arxiv.org/abs/2605.08660v1
- Date: Sat, 09 May 2026 03:58:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.797718
- Title: Optimised Support Vector Regression for California Housing Price Prediction: The Critical Role of Feature Engineering and Hyperparameter Tuning
- Title(参考訳): カリフォルニア住宅価格予測のための最適支援ベクトル回帰 : 特徴工学とハイパーパラメータ調整の重要性
- Authors: Emmanuel Adutwum,
- Abstract要約: Support Vector Regressionは、California Housingベンチマークデータセットで最も弱いパフォーマーの1つとして引用されている。
本稿では,従来報告されていた性能が,アルゴリズムに固有の制限ではなく,実験的な構成選択を反映しているかどうかを検討する。
チューニングされたSVRは、以前報告されたSVR結果よりも0.123ポイントの絶対的な改善である0.723の試験R2を達成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In the recent literature, Support Vector Regression (SVR) has been cited as one of the weakest performers on the California Housing benchmark dataset, with Preethi et al. (2025)specifically ranking it last among the algorithms they tested, reporting an R2 of only 0.60. This paper examines whether the previously reported performance reflects experimental configuration choices rather than an inherent algorithmic limitation. A structured experimental workflow is applied: ten domain-motivated derived features are constructed from the eight raw inputs, an exploratory ensemble feature importance analysis identifies the most predictive candidates, and a randomised search over hyperparameter combinations with three-fold cross-validation selects the optimal SVR configuration within a leakage-safe scikit-learn Pipeline. A formal four-stage ablation study isolates the contribution of each component: scaling alone accounts for +0.744 in R2 (from -0.054 to 0.690), feature engineering adds +0.026 (to 0.716), and hyperparameter tuning contributes +0.008 (to 0.723). The resulting tuned SVR achieves a test R2 of 0.723, a 0.123-point absolute improvement over the previously reported SVR result (from 0.60 to 0.723, approximately 20% relative gain). In the ten-model comparison, the tuned SVR ranks fourth with R2 = 0.723, below XGBoost (0.832), Random Forest (0.814) and Gradient Boosting (0.783), while substantially outperforming simpler baselines. Ten-fold cross-validation yields a mean R2 of 0.703 (95% CI: [0.630, 0.775]), confirming robust generalisation. The observed improvement from R2 = 0.60 to R2 = 0.723 is associated primarily with proper feature scaling within a unified preprocessing pipeline, with domain-motivated feature engineering and systematic hyperparameter tuning, providing further incremental gains.
- Abstract(参考訳): 最近の文献では、Support Vector Regression (SVR) がカリフォルニアハウジングベンチマークデータセットで最も弱いパフォーマーの1つとして挙げられており、Preethi et al (2025) はテスト対象のアルゴリズムの中で最後にランク付けし、R2はわずか0.60である。
本稿では,従来報告されていた性能が,アルゴリズムに固有の制限ではなく,実験的な構成選択を反映しているかどうかを検討する。
8つの生の入力から10個のドメインを動機とする特徴を抽出し、探索的アンサンブル特徴重要度分析により最も予測可能な候補を同定し、3倍のクロスバリデーションによる超パラメータの組み合わせをランダムに探索し、リーク安全シキトラーンパイプライン内の最適SVR構成を選択する。
公式な4段階のアブレーション研究では、R2における+0.744(-0.054から0.690)のスケーリングのみ、+0.026(-0.716)のフィーチャエンジニアリングの追加、+0.008(-0.723)のハイパーパラメータチューニングが寄与している。
その結果、調整されたSVRは、前報したSVR結果よりも0.123ポイント絶対的な改善である0.723の試験R2を達成する(0.60から0.723、約20%の相対利得)。
XGBoost (0.832)、Random Forest (0.814)、Gradient Boosting (0.783)の4位にランクされ、より単純なベースラインをはるかに上回っている。
10倍のクロスバリデーションにより平均R2は0.703(95% CI: [0.630, 0.775])となり、堅牢な一般化が確認される。
R2 = 0.60 から R2 = 0.723 までの観察された改善は、主に統合前処理パイプライン内の適切な機能スケーリングと関連付けられている。
関連論文リスト
- Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment [53.72927532626824]
わずか50個のサンプル(0.3%のデータ)のサブセットは、完全なベンチマークスコアと0.93以上のピアソン相関を達成可能であることを示す。
選好をより良く予測するために、選択したサブセットの回帰モデルを訓練し、0.98の相関を達成した。
これは回帰モデリングにおいて、よく計算されたサブセットが完全なベンチマークを予測し、量を超える品質を示すことを示している。
論文 参考訳(メタデータ) (2026-04-20T00:57:31Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification [0.0]
マルチモーダル胸部X線分析は、しばしば計算コストのかかる大きな視覚言語モデルを微調整する。
我々は,インディアナ大学チェストX線データセットのマルチラベル分類のための冷凍エンコーダ,BitFit,LoRA,アダプタなど,パラメータ効率のよいトレーニング戦略について検討した。
論文 参考訳(メタデータ) (2025-12-25T05:02:19Z) - Generalizable Diabetes Risk Stratification via Hybrid Machine Learning Models [0.0]
糖尿病は世界中で5億3700万人を超え、2045年までに7億8300万人に達すると予測されている。
2つのハイブリッド分類器を比較し、外部コホート上での一般化性を評価する。
論文 参考訳(メタデータ) (2025-09-24T21:18:52Z) - Enhanced Predictive Modeling for Hazardous Near-Earth Object Detection: A Comparative Analysis of Advanced Resampling Strategies and Machine Learning Algorithms in Planetary Risk Assessment [0.0]
本研究では,二元分類フレームワークによる有害地球近傍天体(NEO)の予測のための機械学習モデルの性能評価を行った。
RFC と GBC はともに 0.987 と 0.896 の印象的な F2 スコアで最高の性能を発揮した。
論文 参考訳(メタデータ) (2025-08-20T22:50:00Z) - Reinforcement Learning for Reasoning in Large Language Models with One Training Example [117.86853102104256]
1つのトレーニング例(1ショットRLVR)を用いた強化学習は,大規模言語モデル(LLM)の算数推論能力の向上に有効であることを示す。
1ショットRLVRにおける興味深い現象として、クロスカテゴリの一般化、自己回帰の頻度の増加、テスト性能の向上の持続などを挙げる。
論文 参考訳(メタデータ) (2025-04-29T09:24:30Z) - Intelligent Gradient Boosting Algorithms for Estimating Strength of Modified Subgrade Soil [0.14843690728081999]
本研究は,水和ライム活性米灰 (HARSH) で改質した土壌の分類的増進 (CatBoost) と極勾配増進 (XGBoost) と支持ベクトル回帰 (SVR) を用いて特性を推定する。
その結果、XGBoostはCBR, UCS, Rをそれぞれ0.9994, 0.9995, 0.9999と、これらの特性を推定する際のCatBoostおよびSVRよりも優れていた。
論文 参考訳(メタデータ) (2025-01-08T20:26:13Z) - Impact of Comprehensive Data Preprocessing on Predictive Modelling of COVID-19 Mortality [0.0]
本研究では、新型コロナウイルスの死亡率を予測する10の機械学習モデルに対する、カスタムデータ前処理パイプラインの影響を評価する。
私たちのパイプラインは、標準的な前処理パイプラインと4つの重要なステップで異なります。
論文 参考訳(メタデータ) (2024-08-15T13:23:59Z) - ADAHESSIAN: An Adaptive Second Order Optimizer for Machine Learning [91.13797346047984]
本稿では,2次最適化アルゴリズムであるADAHESSIANを紹介する。
ADAHESSIANは、他の適応最適化手法と比較して、新しい最先端の成果を大きなマージンで達成することを示す。
論文 参考訳(メタデータ) (2020-06-01T05:00:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。