論文の概要: Task-Conditioned Synthetic Data Generation for Improving Machine Learning Performance in Agricultural Prediction Tasks
- arxiv url: http://arxiv.org/abs/2607.09751v1
- Date: Sat, 04 Jul 2026 11:40:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.176063
- Title: Task-Conditioned Synthetic Data Generation for Improving Machine Learning Performance in Agricultural Prediction Tasks
- Title(参考訳): 農業予測タスクにおける機械学習性能向上のためのタスク記述型合成データ生成
- Authors: Hamid Ebrahimy, Moritz Lucas, Martin Atzmueller,
- Abstract要約: 合成データ生成(Synthetic Data Generation)は、オリジナルのデータの重要な特性を保持する人工的だが現実的なサンプルを作成するための実践的なアプローチを提供する。
提案アルゴリズムは,作物収量予測と作物型分類の2つの農業予測課題について評価した。
- 参考スコア(独自算出の注目度): 0.6967006044904097
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Machine Learning (ML) algorithms have been widely used to estimate agricultural variables across diverse contexts. However, because the quantity and quality of training data strongly influence performance of ML algorithms, their use can be constrained by limited or incomplete reference data. Synthetic Data Generation (SDG) offers a practical approach to address this issue by producing artificial but realistic samples that preserve key characteristics of the original data. Building on teacher-student knowledge transfer and in-context learning for tabular data, this study proposes a Task-Conditioned SDG (TCSDG) algorithm that pairs a Bayesian Network generator with a transformer-based tabular foundation model (TabICL). The proposed algorithm was evaluated on two agricultural prediction tasks: crop yield prediction and crop type classification. Six benchmark SDG algorithms were also utilized to compare their performance with that of TCSDG. Across twelve study sites, two training-data fractions, four multiplication ratios, and three predictive ML algorithms, augmenting the original data with TCSDG-generated synthetic data improved ML performance in 89% of the crop type classification experiments and 74% of the crop yield prediction experiments. TCSDG also substantially outperformed benchmark SDG algorithms and was the only method to consistently improve ML performance across both tasks at the aggregate level. The study demonstrates that carefully designed and processed synthetic data can improve ML performance in precision-agriculture applications. TCSDG offers a practical and extensible framework for generating synthetic data that supports downstream ML agricultural prediction. The full implementation of TCSDG is publicly available as open source at https://github.com/HamidEbrahimy/TCSDG.
- Abstract(参考訳): 機械学習(ML)アルゴリズムは、さまざまな文脈で農業変数を推定するために広く使われている。
しかし、トレーニングデータの量と品質がMLアルゴリズムの性能に強く影響するため、それらの使用は限定的あるいは不完全な参照データによって制限される。
合成データ生成(SDG)は、原データの鍵となる特性を保持する人工的だが現実的なサンプルを作成することによって、この問題に対処する実践的なアプローチを提供する。
本研究は,教師による知識伝達と表型データに対するコンテキスト学習に基づいて,ベイジアンネットワーク生成器と変換器に基づく表型基礎モデル(TabICL)を組み合わせたタスク記述型SDG(TCSDG)アルゴリズムを提案する。
提案アルゴリズムは,作物収量予測と作物型分類の2つの農業予測課題について評価した。
また,6つのベンチマークSDGアルゴリズムを用いて,その性能をTCSDGと比較した。
12か所の試験場、2つのトレーニングデータ分画、4つの乗算比、3つの予測的MLアルゴリズムにより、元のデータをTCSDG生成合成データで拡張し、作物型分類実験の89%、収量予測実験の74%でML性能を改善した。
TCSDGはまた、ベンチマークSDGアルゴリズムを大幅に上回っており、集計レベルで両方のタスク間でMLパフォーマンスを一貫して改善する唯一の方法であった。
この研究は、精密・農業的応用において、慎重に設計され、処理された合成データがML性能を向上させることを実証している。
TCSDGは、下流ML農業予測をサポートする合成データを生成するための実用的で拡張可能なフレームワークを提供する。
TCSDGの完全な実装はhttps://github.com/HamidEbrahimy/TCSDGで公開されている。
関連論文リスト
- Soil Compaction Parameters Prediction Based on Automated Machine Learning Approach [0.0]
本研究では,最適水分量(OMC)と最大乾燥密度(MDD)を予測する自動機械学習(AutoML)手法を提案する。
この研究により、XGBoost(Extreme Gradient Boosting)アルゴリズムは最高の性能を示し、MDDは80.4%、OCCは89.1%のR2乗値を得た。
論文 参考訳(メタデータ) (2025-12-09T08:13:04Z) - Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods [5.278929538141005]
我々は、特徴ベースの手法、生成AI(GenAI)、古典的なレンダリングアプローチを含む、ドメインランダム化(DR)およびドメイン適応(DA)テクニックをベンチマークする。
本評価では,低レベルの特徴アライメントと高レベルの特徴アライメントの有効性,および実世界の文脈から生成されたプロンプトによって誘導される拡散に基づくDA法について検討する。
その結果、十分な可変性を持つレンダリングベースデータが、輝度ベースや知覚的ハッシュフィルタリングといったよりシンプルな特徴ベースのメソッドとして利用可能である場合、精度と資源効率の両方においてより複雑なGenAIベースのアプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2025-11-28T14:51:08Z) - Leveraging Large Language Models to Address Data Scarcity in Machine Learning: Applications in Graphene Synthesis [0.0]
材料科学における機械学習は、限られた実験データのために困難に直面している。
大規模言語モデル(LLM)を用いて機械学習の性能を向上させる戦略を提案する。
論文 参考訳(メタデータ) (2025-03-06T16:04:01Z) - Mitigating Forgetting in LLM Fine-Tuning via Low-Perplexity Token Learning [65.23593936798662]
LLM生成データによる微調整により,目標タスクの性能が向上し,非目標タスクの劣化が低減されることを示す。
微調整後のLSMにおける破滅的忘れを緩和するために、トークンの難易度低減に基づく経験的説明を提供する最初の研究である。
論文 参考訳(メタデータ) (2025-01-24T08:18:56Z) - Leveraging Semi-Supervised Learning to Enhance Data Mining for Image Classification under Limited Labeled Data [35.431340001608476]
従来のデータマイニング手法は、大規模で高次元で複雑なデータに直面すると不十分である。
本研究では,ラベルのないデータを利用するアルゴリズムの能力向上を目的とした,半教師付き学習手法を提案する。
具体的には、自己学習法を採用し、画像の特徴抽出と分類のための畳み込みニューラルネットワーク(CNN)と組み合わせる。
論文 参考訳(メタデータ) (2024-11-27T18:59:50Z) - Generating Realistic Tabular Data with Large Language Models [49.03536886067729]
大規模言語モデル(LLM)は多様なタスクに使われてきたが、特徴と対象変数の正確な相関は捉えていない。
そこで本研究では,LLMに基づく3つの重要な改良を加えて,実データの特徴クラス相関を正しく把握する手法を提案する。
実験の結果,本手法は下流タスクにおいて,20個のデータセット上で10個のSOTAベースラインを著しく上回っていることがわかった。
論文 参考訳(メタデータ) (2024-10-29T04:14:32Z) - AI enhanced data assimilation and uncertainty quantification applied to
Geological Carbon Storage [0.0]
本稿では,Surrogate-based hybrid ESMDA (SH-ESMDA)を導入し,Surrogate-based hybrid ESMDA (SH-ESMDA)について述べる。
また,SurrogateをベースとしたHybrid RML(SH-RML)も導入する。
以上の結果より,SH-RMLは従来のESMDAと比較して不確実性が高いことが示唆された。
論文 参考訳(メタデータ) (2024-02-09T00:24:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。