論文の概要: Evolutionary Feature Engineering for Structured Data
- arxiv url: http://arxiv.org/abs/2607.01548v1
- Date: Thu, 02 Jul 2026 00:11:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.618616
- Title: Evolutionary Feature Engineering for Structured Data
- Title(参考訳): 構造化データの進化的特徴工学
- Abstract要約: EFEは、標準化されたFit/transformインターフェイスでPythonプログラムとして変換を表現する。
時系列予測では、EFE-Timeはデータセット固有の正規化を学び、既成の時系列基礎モデルを改善する。
EFE-Tabは、便利な解釈可能な機能を追加し、冗長な機能を除去する、コンパクトな機能プログラムを進化させる。
- 参考スコア(独自算出の注目度): 26.2268110175559
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Large language models are increasingly used as open-ended search operators in evolutionary optimization. We introduce Evolutionary Feature Engineering (EFE), a framework for using LLM-based evolution to discover preprocessing transformations for structured data. EFE represents transformations as Python programs with a standardized fit/transform interface, allowing them to be inserted directly into existing machine learning pipelines. During evolution, candidate programs are refined using dataset context, summary statistics, and downstream performance feedback on validation set. We instantiate EFE in two settings. For time-series forecasting, EFE-Time learns invertible, dataset-specific normalizations that improve off-the-shelf time-series foundation models. It reduces forecasting errors (MASE, WQL, MAE) 3% or more when averaged across datasets and improvements are as much as 19% on the COVID-Deaths dataset. Notably, these improvements occur with recent TSFMs such as Chronos-2. For tabular prediction, EFE-Tab evolves compact feature programs that add useful interpretable features and remove redundant ones, improving or matching existing LLM-based feature-engineering methods. We found EFE-Tab to be particularly effective on classical decision trees, where small sets of evolved features yield competitive accuracy while preserving interpretability. Overall, EFE demonstrates that LLM-based evolution can improve both accuracy and interpretability when automatically tackling structured data.
- Abstract(参考訳): 大規模言語モデルは、進化的最適化においてオープンエンド検索演算子としてますます使われている。
我々は、構造化データに対する前処理変換を発見するためにLLMベースの進化を利用するフレームワークであるEvolutionary Feature Engineering (EFE)を紹介する。
EFEはPythonプログラムとして標準化された適合/変換インターフェースで表現され、既存の機械学習パイプラインに直接挿入できる。
進化の過程で、候補プログラムはデータセットコンテキスト、要約統計、検証セットに対する下流のパフォーマンスフィードバックを使用して洗練される。
EFEを2つの設定でインスタンス化する。
時系列予測では、EFE-Timeは非可逆なデータセット固有の正規化を学び、既成の時系列基礎モデルを改善する。
データセットの平均化時に予測エラー(MASE、WQL、MAE)を3%以上削減し、COVID-Deathsデータセットで最大19%改善する。
特に、これらの改善はChronos-2のような最近のTSFMで起こる。
表形式での予測のために、EFE-Tabは、便利な解釈可能な機能を追加し、冗長な機能を削除し、既存のLLMベースの機能エンジニアリング手法を改善したり、適合させたりするための、コンパクトな機能プログラムを進化させた。
EFE-Tabは古典的決定木において特に有効であり, 解釈性を維持しつつ, 競争精度が向上することがわかった。
全体として、EFEは構造化データの自動処理において、LLMベースの進化が精度と解釈可能性の両方を改善することを実証している。
関連論文リスト
- TopoFE: topology-aware LLM-guided Automated Feature Engineering [22.323342919724492]
TOPOFEは、LLM誘導機能エンジニアリングのためのトポロジーを意識した進化的フレームワークである。
分類タスクと回帰タスクにまたがって、最先端のAutoFEメソッドに対して一貫した改善を示す。
論文 参考訳(メタデータ) (2026-07-25T16:45:00Z) - DataEvolver: Automatic Data Preparation for Large Language Models through Multi-Level Self-Evolving [55.85201665674226]
大規模言語モデル(LLM)には高品質なトレーニングデータが不可欠である
既存の自動データ準備手法は、事前に定義されたパイプラインやカスタマイズされた人間の指示に依存している。
我々は、パイプラインを自動的に構築して、生データを高品質なデータに変換する、最初の自己進化型データ準備システムであるDataEvolverを紹介する。
論文 参考訳(メタデータ) (2026-06-05T07:44:34Z) - EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation [79.71802168256542]
大きな言語モデル(LLM)を目的のタスクに効率的に、効果的に適応させることは、根本的な課題である。
1つの簡単なアプローチは、外部ジェネレータを通じて候補データを合成する反復的な生成訓練ループである。
モデル更新に先立って選択ステップを組み込んだ改良パラダイム,すなわち反復生成選択学習ループを導入する。
論文 参考訳(メタデータ) (2026-04-28T23:26:16Z) - From Insight to Action: A Novel Framework for Interpretability-Guided Data Selection in Large Language Models [73.72877445629383]
Interpretability-Guided Data Selection (IGDS) は、まず周波数リコールと干渉フィルタリングによって因果タスクの特徴を識別するフレームワークである。
我々は,数学的推論,要約,翻訳タスクに関するIGDSをGemma-2,LLaMA-3.1,Qwen3モデルで検証する。
論文 参考訳(メタデータ) (2026-04-28T03:16:24Z) - Learning from the Undesirable: Robust Adaptation of Language Models without Forgetting [18.680059467974825]
言語モデル(LM)は、ダウンストリームタスクに特化するために、教師付き微調整(SFT)によって適応されることが多い。
微調整データに制限がある典型的なシナリオでは、SFTはLMを過度に適合させ、急激なパターンに依存する。
本研究では,SFT がデータ制限のある LM を微調整する際の問題を緩和するための,単純かつ効果的な正規化手法であるLfU を提案する。
論文 参考訳(メタデータ) (2025-11-17T06:57:44Z) - Estimating Time Series Foundation Model Transferability via In-Context Learning [74.65355820906355]
時系列基礎モデル(TSFM)は、大規模な事前訓練を通じて強力なゼロショット予測を提供する。
微調整は、公開データに制限のあるドメインのパフォーマンス向上に依然として不可欠である。
モデル選択をコンテキスト内学習問題として再キャストする転送可能性推定フレームワークであるTimeTicを紹介する。
論文 参考訳(メタデータ) (2025-09-28T07:07:13Z) - LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers [10.282327560070202]
大規模言語モデル(LLM)は、機能エンジニアリングプロセスにドメイン知識を統合することを可能にする。
進化的探索とドメイン知識とLLMの推論能力を組み合わせた新しいフレームワーク LLM-FE を提案する。
以上の結果から,LLM-FEは最先端のベースラインを一貫して上回っていることが明らかとなった。
論文 参考訳(メタデータ) (2025-03-18T17:11:24Z) - Meta-Statistical Learning: Supervised Learning of Statistical Inference [59.463430294611626]
この研究は、大きな言語モデル(LLM)の成功を駆動するツールと原則が、分散レベルのタスクに取り組むために再利用可能であることを実証している。
本稿では,統計的推論タスクを教師付き学習問題として再構成するマルチインスタンス学習に触発されたメタ統計学習を提案する。
論文 参考訳(メタデータ) (2025-02-17T18:04:39Z) - APAR: Modeling Irregular Target Functions in Tabular Regression via Arithmetic-Aware Pre-Training and Adaptive-Regularized Fine-Tuning [12.35924469567586]
APAR(Arithmetic-Aware Pre-training and Adaptive-Regularized Fine-tuning framework)を提案する。
事前学習フェーズでは、APARは、連続ラベルの観点から複雑なサンプル-ワイド関係をキャプチャするための算術的な事前文の目的を導入している。
微調整フェーズでは、自己学習に適したデータ拡張のために、一貫性に基づく適応正規化手法が提案されている。
論文 参考訳(メタデータ) (2024-12-14T19:33:21Z) - Structural Entropy Guided Probabilistic Coding [52.01765333755793]
構造エントロピー誘導型確率的符号化モデルSEPCを提案する。
我々は、構造エントロピー正規化損失を提案することにより、潜在変数間の関係を最適化に組み込む。
分類タスクと回帰タスクの両方を含む12の自然言語理解タスクに対する実験結果は、SEPCの優れた性能を示す。
論文 参考訳(メタデータ) (2024-12-12T00:37:53Z) - A Transformer-based Framework For Multi-variate Time Series: A Remaining
Useful Life Prediction Use Case [4.0466311968093365]
本研究は,時系列予測のためのエンコーダ変換アーキテクチャに基づくフレームワークを提案する。
C-MAPPSベンチマークデータセットの4セットすべてに対して,提案手法の有効性を検証した。
機械寿命の初期段階と劣化経路のモデル認識を可能にするため, 新たな拡張窓手法が提案された。
論文 参考訳(メタデータ) (2023-08-19T02:30:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。