論文の概要: Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale
- arxiv url: http://arxiv.org/abs/2607.06233v2
- Date: Tue, 14 Jul 2026 02:46:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.363896
- Title: Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale
- Title(参考訳): ToFFEEを実証する: 大規模データエージェントの軌道を合成する学習システム
- Authors: Ziting Wang, Yin Li, Zuhao Yang, Xiuchang Li, Jiale Bai, Gao Cong,
- Abstract要約: 既存のデータエージェントは、特に異質なエンタープライズ環境で、目に見えないデータ環境と分析に一般化するのに苦労している。
ToFFEEは,モンテカルロ木探索によって与えられたデータ環境から高品質なデータエージェントトラジェクトリを合成するシステムである。
ToFFEEは異種環境における複雑な解析タスクに対して,スケーラブルなトラジェクトリデータを効果的に生成できることを示す。
- 参考スコア(独自算出の注目度): 15.09465040407523
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM-powered data agents are playing an increasingly important role in data-driven decision making. However, existing data agents struggle to generalize to unseen data environments and analytical workflows, especially in heterogeneous enterprise settings. This creates a growing need for synthesizing high-quality data agent trajectories that capture complex analytical workflows for given data environments. Such trajectories support two key downstream uses: they can serve as supervised finetuning (SFT) data that adapts data agent models to the target domain, and as in-context learning (ICL) demonstrations to guide general-purpose LLMs in unfamiliar data environments. Thus, we introduce TOFFEE, a system for synthesizing high-quality data agent trajectories from given data environments via Monte Carlo Tree Search (MCTS) with adaptive model selection and cross-task prefix reuse. We show that TOFFEE can effectively generate scalable trajectory data for complex analytical tasks across heterogeneous environments. In this demonstration, we present the system framework of TOFFEE, including its task pool construction, trajectory explorer, and learned cost model. We also introduce the web interface of TOFFEE and its workflow, and demonstrate two end-to-end scenarios: trajectory synthesis for data agent finetuning, and demonstration-augmented data agent reasoning.
- Abstract(参考訳): LLMによるデータエージェントは、データ駆動意思決定において、ますます重要な役割を担っている。
しかし、既存のデータエージェントは、特に異質なエンタープライズ環境で、目に見えないデータ環境や分析ワークフローに一般化するのに苦労している。
これにより、与えられたデータ環境の複雑な分析ワークフローをキャプチャする高品質なデータエージェントトラジェクトリを合成する必要性が高まっます。
これらのトラジェクトリは、データエージェントモデルをターゲットドメインに適応させる教師付き微調整(SFT)データや、不慣れなデータ環境における汎用LSMをガイドするインコンテキストラーニング(ICL)デモとして機能する。
そこで、TOFFEEは、モンテカルロ木探索(MCTS)を用いて、与えられたデータ環境から高品質なデータエージェントトラジェクトリを合成し、適応モデル選択とクロスタスクプレフィックスの再利用を行うシステムである。
ToFFEEは異種環境における複雑な解析タスクに対して,スケーラブルなトラジェクトリデータを効果的に生成できることを示す。
本稿では,タスクプールの構築,軌道探索,学習コストモデルなど,TOFFEEのシステムフレームワークについて述べる。
また、TOFFEEのWebインターフェースとそのワークフローを紹介し、データエージェントの微調整のためのトラジェクトリ合成と、デモ強化データエージェント推論の2つのエンドツーエンドシナリオを紹介した。
関連論文リスト
- Exploring Autonomous Agentic Data Engineering for Model Specialization [37.35310287793494]
大規模言語モデル (LLM) は一般的なタスクにおいて高いパフォーマンスを示し、特殊なドメインへの適応に苦慮することが多い。
我々は、LSMを自律データエンジニアとして評価するための新しいタスクである textbf Autonomous Agentic Data Engineering を定式化した。
GPT-5.2 は textbf57.29% で学生モデルを改善する訓練カリキュラムを構築している。
論文 参考訳(メタデータ) (2026-05-28T17:50:10Z) - Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs [66.63911043019294]
データ準備は、生のデータセットを識別し、データセット間の関係を解明し、それらから貴重な洞察を抽出することを目的としている。
本稿では,様々な下流タスクのためのデータ準備にLLM技術を用いることに焦点を当てる。
データクリーニング、標準化、エラー処理、計算、データ統合、データ豊か化という3つの主要なタスクにフィールドを編成するタスク中心の分類を導入します。
論文 参考訳(メタデータ) (2026-01-22T12:02:45Z) - SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data [0.0]
大規模言語モデル(LLM)のための総合的な合成データ生成フレームワークを提案する。
本手法では,手作業による介入を最小限に抑えた複雑な対話フローをモデル化可能なモジュール型および構成型パイプラインを用いる。
得られたデータセットは、SFTとDPOの両方のユースケースをサポートするフレキシブルなスキーマの下で構成され、多様なトレーニングへのシームレスな統合を可能にする。
論文 参考訳(メタデータ) (2025-08-21T10:35:41Z) - Data Agent: A Holistic Architecture for Orchestrating Data+AI Ecosystems [8.816332263275305]
従来のData+AIシステムは、システムパイプラインのオーケストレーションに人間の専門家に大きく依存しています。
既存のData+AIシステムは、セマンティック理解、推論、計画の能力に制限がある。
データエージェント(Data Agent) - データ+AIエコシステムのオーケストレーションを目的とした包括的なアーキテクチャ。
論文 参考訳(メタデータ) (2025-07-02T11:04:49Z) - AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning [98.26836657967162]
textbfAgentOhanaは、さまざまなシナリオにまたがって、異なる環境からエージェントのトラジェクトリを集約する。
AIエージェント用に調整された大規模なアクションモデルである textbfxLAM-v0.1 は、さまざまなベンチマークで例外的なパフォーマンスを示している。
論文 参考訳(メタデータ) (2024-02-23T18:56:26Z) - TRoVE: Transforming Road Scene Datasets into Photorealistic Virtual
Environments [84.6017003787244]
本研究では、シミュレーションデータセットに存在する困難とドメインギャップに対処する合成データ生成パイプラインを提案する。
既存のデータセットからアノテーションや視覚的手がかりを利用すれば、自動マルチモーダルデータ生成が容易になることを示す。
論文 参考訳(メタデータ) (2022-08-16T20:46:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。