論文の概要: CurateEvo: Data-Curation Evolving for Agentic Post-Training
- arxiv url: http://arxiv.org/abs/2607.06140v1
- Date: Tue, 07 Jul 2026 11:07:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.499259
- Title: CurateEvo: Data-Curation Evolving for Agentic Post-Training
- Title(参考訳): CurateEvo: エージェント・ポスト・トライニングのためのデータ・キュレーション
- Abstract要約: エージェント学習後データキュレーションのための障害駆動動的進化フレームワークであるCurateEvoを提案する。
CurateEvoは、キュレーション戦略を実行可能なコードとして表現し、保持された開発セットから失敗したトラジェクトリを使って反復的に書き直します。
各エポックにおいて、進化した戦略は、固定された生コーパスを教師付き微調整データ、強化学習データ、推論時メモリバンクに変換する。
- 参考スコア(独自算出の注目度): 53.68149869349268
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Large language model (LLM) agents require post-training methods that can improve long-horizon decision making from environment feedback. However, existing agentic post-training pipelines often treat data curation as a fixed preprocessing step, focusing mainly on data augmentation while neglecting filtering, refinement, and adaptation to downstream failures. We propose CurateEvo, a failure-driven dynamic evolution framework for agentic post-training data curation. CurateEvo represents the curation strategy as executable code and iteratively rewrites it using failed trajectories from a held-out development set. At each epoch, the evolved strategy transforms a fixed raw corpus into supervised fine-tuning data, reinforcement learning data, and an inference-time memory bank. The evolution process first improves effectiveness by diagnosing recurring failure modes and augmenting, filtering, or refining data accordingly, and then improves efficiency by pruning redundant or low-utility training turns under a cost-aware objective. Experiments on ACEBench-Agent, BFCL-V4, and τ^2-Bench under both labeled and wild-data settings show that CurateEvo consistently outperforms prior curation methods, improving average scores by 3.2 and 2.7 points, respectively. Further analyses demonstrate that CurateEvo is compatible with different post-training recipes and substantially reduces curation overhead.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、環境フィードバックによる長期意思決定を改善するためのポストトレーニング手法を必要とする。
しかし、既存のエージェントのポストトレーニングパイプラインは、データキュレーションを固定された前処理ステップとして扱うことが多く、主にデータ拡張に焦点を当て、フィルタリング、精細化、下流の障害への適応を無視する。
エージェント学習後データキュレーションのための障害駆動動的進化フレームワークであるCurateEvoを提案する。
CurateEvoは、キュレーション戦略を実行可能なコードとして表現し、保持された開発セットから失敗したトラジェクトリを使って反復的に書き直します。
各エポックにおいて、進化した戦略は、固定された生コーパスを教師付き微調整データ、強化学習データ、推論時メモリバンクに変換する。
進化過程は、まず、繰り返し発生する障害モードの診断、データの拡張、フィルタリング、あるいは精錬により効率を向上し、その後、コストを意識した目的の下で冗長または低ユーティリティなトレーニングターンを刈り取ることにより効率を向上する。
ACEBench-Agent、BFCL-V4、τ^2-Benchのラベル付きおよびワイルドデータ設定による実験では、CurateEvoは、それぞれ平均スコアを3.2および2.7ポイント改善した。
さらに分析したところ、CurateEvoは異なるトレーニング後のレシピと互換性があり、キュレーションオーバーヘッドを大幅に減らすことが示されている。
関連論文リスト
- ADE: Agentic Data Evolution Framework for Human-Centered Objectives [27.381414874688318]
Agentic Data Evolution (ADE)は、データスナップショットの進化として、合成監視を組織する。
ADEは、クローズドループのObservatory-Variation-Selection(OVS)手順を通じて、データスナップショットを改善する。
ブラインドの専門家による評価はさらにこれを確認し、66.11%が進化した回答を好んでいる。
論文 参考訳(メタデータ) (2026-08-24T18:07:40Z) - Self-Improving Large Language Models via Progressive Experience Evolution [52.03479747358687]
textbfSPEE(textbfSelf-textbfProgressive textbfExperience textbfEvolution)を提案する。
5つの数学的推論ベンチマークの実験は、SPEEが3つのモデルスケールでテスト時間とトレーニング時間の両方の自己進化ベースラインを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-08-03T12:27:32Z) - Self-evolving LLM agents with in-distribution Optimization [60.05867547965365]
大規模言語モデル(LLM)は最近、複雑な環境で対話的なエージェントのための強力なコントローラとして登場した。
本稿では,自動プロセス・リワードラベリングとポリシー学習を統一するLDMエージェントの自己進化フレームワークであるQ-Evolveを提案する。
我々は,AlfWorld,WebShop,ScienceWorldの手法を評価し,Q-Evolveがサンプル効率,堅牢性,全体的なタスク性能において高いベースラインを達成していることを示す。
論文 参考訳(メタデータ) (2026-06-05T15:09:52Z) - Rethinking Data Curation in LLM Training: Online Reweighting Offers Better Generalization than Offline Methods [30.96121293915128]
ADAPTは動的オンラインフレームワークで、類似性に基づく品質信号によって導かれる適応的なサンプル単位の学習率でトレーニングサンプルを再重み付けする。
ADAPTはオフラインの選択/ミキシングと先行のオンライン手法を一貫して上回り、同じFLOPの下でより強力なクロスベンチマークの一般化を実現している。
論文 参考訳(メタデータ) (2026-04-19T14:23:23Z) - Adaptive Data Dropout: Towards Self-Regulated Learning in Deep Neural Networks [10.269961654607108]
ディープニューラルネットワークは通常、エポック全体にわたって大きなデータセットを均一にサンプリングすることによって訓練される。
最近の研究は、トレーニングデータの量を徐々に減らすことで、効率と一般化が向上することを示している。
本稿では,パフォーマンスフィードバックに基づいてトレーニングデータのサブセットを動的に調整するフレームワークであるAdaptive Data Dropoutを提案する。
論文 参考訳(メタデータ) (2026-04-14T16:41:33Z) - DIET: Learning to Distill Dataset Continually for Recommender Systems [69.68271683922536]
ディープラーニングモデルは、大規模で継続的な成長するストリーミング行動ログに依存する、継続的な学習パラダイムの下でトレーニングされる。
大規模なプラットフォームでは、アーキテクチャ比較やイテレーションのために、完全な履歴データ上でモデルを再トレーニングするのは、極めて高価であり、モデル開発を著しく遅くする。
我々は,この問題を,レコメンデータシステムのためのEmphstreaming dataset distillationとして定式化し,トレーニングクリティカルな信号を保持しながら,ストリーミングデータとともに進化するコンパクトな蒸留データセットを維持する統一フレームワークである textbfDIET を提案する。
論文 参考訳(メタデータ) (2026-03-26T02:50:13Z) - Beyond Efficiency: Molecular Data Pruning for Enhanced Generalization [30.738229850748137]
MolPegは、一般化を強化するための分子データプルーニングフレームワークである。
これは、事前訓練されたモデルでデータプルーニングを適用する、ソースフリーなデータプルーニングシナリオに焦点を当てている。
4つのダウンストリームタスクで既存のDPメソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2024-09-02T09:06:04Z) - PREM: A Simple Yet Effective Approach for Node-Level Graph Anomaly
Detection [65.24854366973794]
ノードレベルのグラフ異常検出(GAD)は、医学、ソーシャルネットワーク、eコマースなどの分野におけるグラフ構造化データから異常ノードを特定する上で重要な役割を果たす。
本稿では,GADの効率を向上させるために,PREM (preprocessing and Matching) という簡単な手法を提案する。
我々のアプローチは、強力な異常検出機能を維持しながら、GADを合理化し、時間とメモリ消費を削減します。
論文 参考訳(メタデータ) (2023-10-18T02:59:57Z) - Distributionally Robust Cross Subject EEG Decoding [15.211091130230589]
本稿では,デコードロバスト性を改善するために,データ上で動的に進化する原理的手法を提案する。
We derived a general data evolution framework based on Wasserstein gradient flow (WGF) and provide two different form of evolution within the framework。
提案手法は、さらなる改善のために、他のデータ拡張手法と容易に統合できる。
論文 参考訳(メタデータ) (2023-08-19T11:31:33Z) - Optimizing a Transformer-based network for a deep learning seismic
processing workflow [0.0]
StorSeismicは、様々な地震処理タスクに対応するためにTransformerをベースとした最近導入されたモデルである。
微調整作業における事前学習と競争の速さを観察し,バニラモデルと比較してトレーニングすべきパラメータを少なくする。
論文 参考訳(メタデータ) (2023-08-09T07:11:42Z) - Confidence Attention and Generalization Enhanced Distillation for
Continuous Video Domain Adaptation [62.458968086881555]
連続ビデオドメイン適応(CVDA、Continuous Video Domain Adaptation)は、ソースモデルが個々の変更対象ドメインに適応する必要があるシナリオである。
CVDAの課題に対処するため,遺伝子組み換え型自己知識解離(CART)を用いた信頼性保証ネットワークを提案する。
論文 参考訳(メタデータ) (2023-03-18T16:40:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。