論文の概要: Evolutional Math: Cross-Validated Island-Model Genetic Programming for Interpretable Symbolic Regression on Small, Wide Datasets
- arxiv url: http://arxiv.org/abs/2606.28381v1
- Date: Sat, 20 Jun 2026 10:31:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.537204
- Title: Evolutional Math: Cross-Validated Island-Model Genetic Programming for Interpretable Symbolic Regression on Small, Wide Datasets
- Title(参考訳): 進化的数学:小型・広域データセット上での解釈可能な記号回帰のためのクロスバリデードアイランドモデル遺伝的プログラミング
- Abstract要約: 遺伝的プログラミングによるシンボリック回帰は、小さくて広いデータセットで日常的に失敗する。
提案するEvolutional Mathは,4つの設計選択を組み合わせて,コンパクトで解釈可能な式を生成する,オープンソースの遺伝的プログラミングシステムである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Symbolic regression via genetic programming routinely fails on small, wide datasets - a regime common in clinical-trial monitoring, biostatistics, and engineering pilot studies - by converging on bloated, overfit expressions that exploit correlation rather than prediction. We present Evolutional Math, an open-source genetic programming system that combines four design choices to yield compact, interpretable formulas in this regime. First, fitness is measured by R-squared on held-out cross-validation folds rather than Pearson correlation on the training set, eliminating single-variable shortcuts that correlate but mis-scale. Second, a multi-island architecture runs independent populations seeded with distinct operator subsets (algebraic, logarithmic, trigonometric, and full) with ring-topology migration every M generations, preventing the search from collapsing into one region of formula space. Third, a structural deduplication scheme treats formulas differing only in constants as equivalent, so the elite archive contains structurally distinct candidates rather than near-duplicate variants. Fourth, top-k individuals undergo numerical constant refinement via scipy L-BFGS-B after each migration phase, decoupling structure search from parameter fitting. We evaluate the system on synthetic benchmarks of the form log(x_i) * x_j / (x_k * c), trigonometric mixtures, and an anonymized clinical site-monitoring dataset with 24 rows and approximately 290 candidate numeric features. The system consistently recovers compact ground-truth structures with R-squared at or above 0.99 within tens of thousands of unique formula evaluations. A reference implementation is released under a noncommercial source-available license.
- Abstract(参考訳): 遺伝的プログラミングによる象徴的回帰は、予測よりも相関性を利用した肥大した過剰適合表現を収束させることによって、小さな、広いデータセット(臨床・臨床的モニタリング、バイオ統計学、工学パイロット研究に共通する体制)で定期的に失敗する。
提案するEvolutional Mathは,4つの設計選択を組み合わせ,コンパクトで解釈可能な論理式を生成する,オープンソースの遺伝的プログラミングシステムである。
第一に、トレーニングセット上のピアソン相関ではなく、ホールドアウトされたクロスバリデーションフォールド上のR-二乗法により、適合度を測定し、相関するが誤スケールの単変量ショートカットを除去する。
第二に、マルチランドアーキテクチャは、M世代ごとに環トポロジー移動を伴う異なる作用素部分集合(代数的、対数的、三角的、および完全)でシードされた独立した集団を実行し、探索が公式空間の1つの領域に崩壊することを防ぐ。
第三に、構造的重複スキームは定数のみが異なる式を等価として扱うため、エリートアーカイブは、ほぼ重複した変種ではなく、構造的に異なる候補を含んでいる。
第4に,Scipy L-BFGS-Bによる数値定値化を行い,パラメータフィッティングから構造探索を分離した。
本システムは,log(x_i) * x_j / (x_k * c) と三角法混合物,24行,約290の数値特徴を持つ匿名化臨床現場監視データセットの合成ベンチマークで評価した。
このシステムは、数万のユニークな公式評価において、R-二乗あるいは0.99以上のコンパクトな接地構造を一貫して復元する。
参照実装は、非商用のソース可利用ライセンスの下でリリースされている。
関連論文リスト
- Impute-EM: Native Mixed-State Diffusion Models for Heterogeneous Data Imputation [71.74203645336385]
Impute-EMは、現在のモデルとインプットされていないエントリを交換し、完了したデータに拡散バックボーンをリフィットする。
我々は、この更新を特徴付け、観測されたマスクインデクシングされた辺縁線が、その限界で目標と一致していることを示す。
論文 参考訳(メタデータ) (2026-09-14T09:39:13Z) - Sparse Orthogonal Regression Technique: A Spectral Framework for Equation Discovery, Approximation, and Integration [4.389213808289583]
ノイズや不規則なサンプルデータから正規直交基底展開を学習するためのスパースフレームワークを開発した。
SORTは、L1正規化回帰を用いて拡張係数を推定し、明示的な二次的あるいは分析的内積評価を避けた。
中心的な応用は、データ駆動による通常の微分方程式の発見である。
論文 参考訳(メタデータ) (2026-08-13T17:31:27Z) - Tropical Algebraic Geometry for Neuronal Representations: An Arakelov-Green Measure Based Descriptor for Graph Learning [14.563432689352084]
本稿では,熱帯代数幾何学に基づくトレーニング不要な幾何学的事前手法を提案する。
空間木を熱帯ヤコビアンへの埋め込みに適した巡回計量グラフに変換する。
離散的なアラケロフ・グリーン測度は、グラフラプラシアンの一般化された逆数を通して閉じた形で計算され、この被覆上の不定分極距離を除いた固有経路計量に正確に分解されることを示す。
論文 参考訳(メタデータ) (2026-08-05T05:34:50Z) - Missing Data Imputation under Manifold Hypothesis [0.0]
多様体仮説は、高次元データが低次元の埋め込み多様体の近くに集中していることを仮定する。
混合変分オートエンコーダ(VAE)の最近の進歩は、そのような基盤構造を忠実に抽出する強力なツールを提供する。
本稿では, (p(bmx_mathrmmismid bmx_mathrmobs) からのサンプリングをサンプリング・イパタンス・リサンプリング(SIR)法により行うことができるモデルベース計算法を提案する。
論文 参考訳(メタデータ) (2026-07-03T23:42:33Z) - Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback [56.69850045068714]
逐次的2段階プロセスとして方程式発見をフレーム化する方法である textitInfluence-Guided Regression (IGSR) を導入する。
LLM-SRBench, 薬理学的PKPDモデル, 疫学シミュレーション, 実世界のゲノムデータなど, IGSRの有効性を示す。
論文 参考訳(メタデータ) (2026-05-27T23:48:01Z) - Riemannian geometry meets fMRI: the advantages of modeling correlation manifolds and eigenvector subspaces [0.0]
相関行列は機能的脳ネットワークの基本要約である。
既存の幾何学的手法は、しばしば閉形式演算を欠いているか、あるいは任意の領域順序に依存する。
オフログ計量とグラスマン部分空間判別という2つの要素を持つスケーラブルな幾何学的枠組みを導入する。
論文 参考訳(メタデータ) (2026-05-21T11:22:31Z) - Finite-Sample Inference for Sparsely Permuted Linear Regression [6.2000582635449994]
我々は、置換係数と回帰係数に関する一般的な統計的推論フレームワークを開発する。
計算目的のために、時間で計算可能な線形代入問題を開発し、高い確率で計算コストの高い従来の最小二乗の解と等価であることを示す。
論文 参考訳(メタデータ) (2026-01-21T11:00:47Z) - Riemannian Flow Matching for Brain Connectivity Matrices via Pullback Geometry [31.81804424897497]
DiffeoCFMは,行列のプルバック量に対して条件付きフローマッチング(CFM)を実現する手法である。
DiffeoCFM は 4600 以上のデータセットを持つような測定値と等価であることを示す。
論文 参考訳(メタデータ) (2025-05-20T07:52:55Z) - Bi-invariant Geodesic Regression with Data from the Osteoarthritis Initiative [1.024113475677323]
我々はアフィン接続設定を用いた非計量推定器を開発した。
その計算のために,簡単な微分式を必要とする効率的な固定点アルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-02-17T14:20:54Z) - Computational-Statistical Gaps in Gaussian Single-Index Models [77.1473134227844]
単次元モデル(Single-Index Models)は、植木構造における高次元回帰問題である。
我々は,統計的クエリ (SQ) と低遅延多項式 (LDP) フレームワークの両方において,計算効率のよいアルゴリズムが必ずしも$Omega(dkstar/2)$サンプルを必要とすることを示した。
論文 参考訳(メタデータ) (2024-03-08T18:50:19Z) - MIRACLE: Causally-Aware Imputation via Learning Missing Data Mechanisms [82.90843777097606]
欠落データに対する因果認識型計算アルゴリズム(MIRACLE)を提案する。
MIRACLEは、欠落発生機構を同時にモデル化することにより、ベースラインの計算を反復的に洗練する。
我々は、MIRACLEが一貫してイミューテーションを改善することができることを示すために、合成および様々な公開データセットに関する広範な実験を行う。
論文 参考訳(メタデータ) (2021-11-04T22:38:18Z) - Robust Finite Mixture Regression for Heterogeneous Targets [70.19798470463378]
本稿では,サンプルクラスタの探索と,複数の不完全な混合型ターゲットを同時にモデル化するFMRモデルを提案する。
我々は、高次元の学習フレームワークの下で、無症状のオラクルのパフォーマンス境界をモデルに提供します。
その結果,我々のモデルは最先端の性能を達成できることがわかった。
論文 参考訳(メタデータ) (2020-10-12T03:27:07Z) - Identification of Probability weighted ARX models with arbitrary domains [75.91002178647165]
PieceWise Affineモデルは、ハイブリッドシステムの他のクラスに対する普遍近似、局所線型性、同値性を保証する。
本研究では,任意の領域を持つ固有入力モデル(NPWARX)を用いたPieceWise Auto Regressiveの同定に着目する。
このアーキテクチャは、機械学習の分野で開発されたMixture of Expertの概念に従って考案された。
論文 参考訳(メタデータ) (2020-09-29T12:50:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。