論文の概要: LLMs as Master Forgers: Generating Synthetic Time Series Data for Manufacturing
- arxiv url: http://arxiv.org/abs/2609.16155v1
- Date: Mon, 14 Sep 2026 18:01:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.165695
- Title: LLMs as Master Forgers: Generating Synthetic Time Series Data for Manufacturing
- Title(参考訳): マスターフォージェとしてのLLM:製造のための合成時系列データの生成
- Abstract要約: 本稿では,Large Language Models (LLMs) を利用した合成時系列データ生成手法を提案する。
実世界の製造環境におけるラベル付き時系列データの不足に触発されて,複雑な時間的依存関係を学習するためのLLMの可能性を探る。
- 参考スコア(独自算出の注目度): 0.0021808911997182007
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: This paper presents a novel framework leveraging Large Language Models (LLMs) to generate synthetic time series data for manufacturing processes. Motivated by the scarcity of labeled time-series data in real-world manufacturing settings, which hinders the development of robust machine learning models, we explore the potential of LLMs to learn complex temporal dependencies and generate realistic synthetic data. Our approach involves fine-tuning pre-trained LLMs on manufacturing process instructions and employing a Retrieval Augmented Generation (RAG) technique to enhance data diversity and realism. We evaluate our method against traditional time series modeling techniques like ARIMA and LSTMs, using quantitative metrics, PCA analysis, and downstream task performance (anomaly detection). Results demonstrate that our LLM-driven framework outperforms these baselines, generating high-quality synthetic time series data that effectively captures temporal dependencies and statistical properties of real manufacturing data, leading to improvements in downstream task performance.
- Abstract(参考訳): 本稿では,Large Language Models (LLMs) を利用した合成時系列データ生成手法を提案する。
実世界の製造環境におけるラベル付き時系列データの不足により、堅牢な機械学習モデルの開発を妨げ、複雑な時間的依存関係を学習し、現実的な合成データを生成するLLMの可能性を探る。
提案手法は, 製造プロセスの指示に対する事前学習型LLMの微調整と, データの多様性とリアリズムを高めるために, RAG(Retrieval Augmented Generation)技術を用いる。
我々は,ARIMA や LSTM などの従来の時系列モデリング手法に対して,定量的指標,PCA 分析,下流タスク性能(異常検出)を用いて評価を行った。
その結果、LLM駆動のフレームワークはこれらのベースラインよりも優れており、高品質な合成時系列データを生成し、実際の製造データの時間的依存性や統計的特性を効果的に把握し、下流タスク性能の向上につながった。
関連論文リスト
- OATS: Online Data Augmentation for Time Series Foundation Models [49.1394215208561]
時系列基礎モデル(TSFM)は時間分析の強力なパラダイムであり、しばしばデータ品質を向上させるために合成データ拡張によって強化される。
OATS (Online Data Augmentation for Time Series Foundation Models) は、異なるトレーニング手順に合わせて合成データを生成する基本戦略である。
論文 参考訳(メタデータ) (2026-01-26T23:51:03Z) - From Parameters to Performance: A Data-Driven Study on LLM Structure and Development [73.67759647072519]
大規模言語モデル(LLM)は、様々な領域で大きな成功を収めている。
モデルスケールと能力の急激な成長にもかかわらず、構造構成がパフォーマンスに与える影響に関する体系的なデータ駆動の研究は依然として少ない。
多様なオープンソースLLM構造を含む大規模データセットと,その性能を複数のベンチマークで比較した。
論文 参考訳(メタデータ) (2025-09-14T12:20:39Z) - FASTGEN: Fast and Cost-Effective Synthetic Tabular Data Generation with LLMs [3.703188184729035]
合成データ生成は、現実のデータ収集と使用がコストと不足によって制限されるシナリオにおいて、重要なソリューションである。
個々のレコードを生成するために大きな言語モデルを直接使用する既存のアプローチは、禁止時間とコスト負担を個別に課している。
LLMを利用して各フィールドの分布を再利用可能なサンプリングスクリプトに推論してエンコードする,現実的な表形式データ合成のための高速で費用対効果の高い手法を提案する。
論文 参考訳(メタデータ) (2025-07-21T17:51:46Z) - LLMSynthor: Macro-Aligned Micro-Records Synthesis with Large Language Models [20.767947974005168]
LLM Synthorは、ターゲットのマクロ統計と一致した現実的なマイクロレコードを生成するマクロ認識シミュレータである。
合成データセットを反復的に構築し、合成アグリゲーションとターゲットアグリゲーションの差を最小限に抑える。
強力な現実主義、統計的忠実さ、実用性を実現し、経済学、社会科学、都市研究に広く応用されている。
論文 参考訳(メタデータ) (2025-05-20T13:35:38Z) - Efficient Model Selection for Time Series Forecasting via LLMs [52.31535714387368]
本稿では,Large Language Models (LLM) をモデル選択の軽量な代替手段として活用することを提案する。
提案手法は, LLMの固有知識と推論能力を活用することで, 明示的な性能行列の必要性を解消する。
論文 参考訳(メタデータ) (2025-04-02T20:33:27Z) - The Performance of the LSTM-based Code Generated by Large Language Models (LLMs) in Forecasting Time Series Data [0.3749861135832072]
本稿では,ChatGPT, PaLM, LLama, FalconなどのLLMの時系列データ解析のためのディープラーニングモデルの生成における性能について検討し, 比較する。
その結果は、生成的AIを活用して、許容できる良さで優れた予測モデルを作成したいデータアナリストや実践者にとって有益である。
論文 参考訳(メタデータ) (2024-11-27T20:18:36Z) - Curated LLM: Synergy of LLMs and Data Curation for tabular augmentation in low-data regimes [57.62036621319563]
本稿では,Large Language Models (LLMs) の知識を低データ構造におけるデータ拡張に活用したCLLMを紹介する。
従来のジェネレータと比較して,低データ方式におけるCLLMの優れた性能を示す。
論文 参考訳(メタデータ) (2023-12-19T12:34:46Z) - Synthetic Data Generation with Large Language Models for Text
Classification: Potential and Limitations [21.583825474908334]
本研究では,合成データに基づいて学習したモデルの性能が,分類の主観性によってどう変化するかを検討する。
その結果,主観性は,タスクレベルとインスタンスレベルの両方において,合成データに基づいて訓練されたモデルの性能と負の相関関係があることが示唆された。
論文 参考訳(メタデータ) (2023-10-11T19:51:13Z) - Time-LLM: Time Series Forecasting by Reprogramming Large Language Models [110.20279343734548]
時系列予測は多くの実世界の力学系において重要な意味を持つ。
時系列予測のための大規模言語モデルを再利用するための再プログラミングフレームワークであるTime-LLMを提案する。
Time-LLMは、最先端の特殊な予測モデルよりも優れた、強力な時系列学習者である。
論文 参考訳(メタデータ) (2023-10-03T01:31:25Z) - From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning [52.257422715393574]
本稿では,Large Language Models (LLMs) の自己誘導手法を導入し,オープンソースデータセットからサクラサンプルを自動識別し,選択する。
我々の重要な革新である命令追従困難度(IFD)メトリックは、モデルが期待する応答と本質的な生成能力の相違を識別するための重要な指標として現れます。
論文 参考訳(メタデータ) (2023-08-23T09:45:29Z) - TSGM: A Flexible Framework for Generative Modeling of Synthetic Time Series [61.436361263605114]
時系列データは、研究者と産業組織間のデータの共有を妨げるため、しばしば不足または非常に敏感である。
本稿では,合成時系列の生成モデリングのためのオープンソースフレームワークである時系列生成モデリング(TSGM)を紹介する。
論文 参考訳(メタデータ) (2023-05-19T10:11:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。