論文の概要: DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- arxiv url: http://arxiv.org/abs/2607.16617v1
- Date: Sat, 18 Jul 2026 03:30:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.197521
- Title: DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- Title(参考訳): DataFlow-Harness: 編集可能なLLMデータパイプラインを構築するための接地型コードベースプラットフォーム
- Authors: Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang,
- Abstract要約: 我々は,LLMエージェントを案内して,プラットフォームネイティブな非巡回グラフを構築するプラットフォームであるtextscDataFlow-Harnessを紹介した。
12タスクのデータエンジニアリングベンチマークでは、textscDataFlow-Harnessが93.3%のエンドツーエンドパスレートを達成した。
- 参考スコア(独自算出の注目度): 9.38656029481013
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) are increasingly used to automate data-processing workflows, yet coding agents typically produce scripts that are not automatically materialized as persistent, editable platform artifacts. We call this disconnect the \textit{NL2Pipeline gap}. To bridge it, we introduce \textsc{DataFlow-Harness}, a platform that guides an LLM agent to construct platform-native directed acyclic graphs (DAGs) through typed, incremental mutations rather than free-form scripts. The platform combines \textsc{DataFlow-Skills} for procedural guidance, a Model Context Protocol (MCP) layer that exposes the live operator registry and current pipeline state, and \textsc{DataFlow-WebUI}, which synchronizes conversational authoring with a visual DAG editor. On a 12-task data-engineering benchmark, \textsc{DataFlow-Harness} achieves a 93.3\% observed end-to-end pass rate. Relative to Vanilla Claude Code, it reduces measured monetary cost by 72.5\% and generation latency by 49.9\%; its observed pass rate is within 0.9 percentage points of the Context-Aware Claude Code baseline while its cost is 42.8\% lower. Per-task analysis indicates that Skills are most useful when construction depends on implicit procedural knowledge. These results show that live platform grounding can produce persistent, editable workflow artifacts with an observed reliability close to script-generation baselines and with lower measured construction cost and latency.
- Abstract(参考訳): 大規模言語モデル(LLM)は、データ処理ワークフローの自動化にますます使用されているが、コーディングエージェントは通常、永続的で編集可能なプラットフォームアーティファクトとして自動的に実現されないスクリプトを生成する。
これを Disconnect the \textit{NL2Pipeline gap} と呼ぶ。
そこで本研究では,LLMエージェントを誘導して,自由形式のスクリプトではなく,タイプ付きインクリメンタルな変異を通じて,プラットフォームネイティブな非巡回グラフ(DAG)を構築するプラットフォームである,‘textsc{DataFlow-Harness} を紹介する。
このプラットフォームは、手続き的ガイダンスのために \textsc{DataFlow-Skills} と、生きたオペレータレジストリと現在のパイプライン状態を公開する Model Context Protocol (MCP) 層と、ビジュアルDAGエディタと会話のオーサリングを同期する \textsc{DataFlow-WebUI} を組み合わせる。
12タスクのデータエンジニアリングベンチマークで、 \textsc{DataFlow-Harness} は 93.3\% のエンド・ツー・エンドのパスレートを達成する。
バニラ・クロード・コードとは対照的に、測定された通貨のコストを72.5\%削減し、発生遅延を49.9\%削減し、観測されたパスレートは、コンテキスト対応クロード・コードのベースラインの0.9ポイント以内であり、そのコストは42.8\%以下である。
タスクごとの分析は、建設が暗黙の手続き的知識に依存している場合、スキルが最も有用であることを示している。
これらの結果から,スクリプト生成ベースラインに近い信頼性を持ち,建設コストやレイテンシを低減した,永続的で編集可能なワークフローアーティファクトをライブプラットフォームで生成できることが示唆された。
関連論文リスト
- FlowPipe: LLM-Enhanced Conditional Generative Flow Networks for Data Preparation Pipeline Construction [43.791981476558384]
データ準備パイプラインは、生のテーブルを学習可能なデータに変換することによって、機械学習におけるデータ品質を改善する。
既存の最先端(SOTA)マルチDQNメソッドは3つの重要な制限に直面している。
有向非巡回グラフ上での条件付き確率フロー生成としてパイプライン合成を定式化する統合フレームワークであるFlowPipeを提案する。
論文 参考訳(メタデータ) (2026-06-23T15:10:00Z) - DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams [48.434767119224375]
本稿ではエージェントデータ処理へのパラダイムシフトを提案する。
このような高次の能力をトレーニングする際のデータ不足のボトルネックを克服するために、2段階のパイプラインを設計する。
$textDataClaw_0$-9B モデルは、グループ相対ポリシー最適化によるスーパービジョンファインチューニングをシナジする。
論文 参考訳(メタデータ) (2026-06-19T11:31:43Z) - ChipMATE: Multi-Agent Training via Reinforcement Learning for Enhanced RTL Generation [55.947962672433675]
ChipMATEは、RTL生成のための最初の自己学習型マルチエージェントフレームワークである。
ChipMATEは産業的な実践に触発され、VerilogエージェントとPythonのリファレンスモデルエージェントをペアにし、相互に出力を検証する。
ChipMATEは、VerilogEval V2で75.0%と80.1%パス@1を4Bと9Bベースモデルで達成している。
論文 参考訳(メタデータ) (2026-05-13T01:04:21Z) - ARISE: A Repository-level Graph Representation and Toolset for Agentic Fault Localization and Program Repair [0.0]
ARISE (Agentic Repository-level Issue Solving Engine) は,マルチグラニュラリティプログラムグラフを用いたLLMエージェントを拡張したものである。
ARISEはこのグラフを3層ツールAPIを通じて公開し、データフロースライシングをファーストクラスのクエリ可能なエージェントプリミティブとして提供する。
我々は、Qwen2.5-Coder-32B-Instructをバックボーンとして、SWE-bench Lite(300の実際のGitHubイシュー、11のPythonレポジトリ)を評価した。
論文 参考訳(メタデータ) (2026-05-04T19:59:23Z) - LeJOT-AutoML: LLM-Driven Feature Engineering for Job Execution Time Prediction in Databricks Cost Optimization [27.72622904072875]
Databricksのジョブオーケストレーションシステム(例:LeJOT)は、レイテンシと依存性の制約を満たしながら、低価格の計算を選択することで、クラウドコストを削減する。
既存のパイプラインは、静的で手動で構築されたランタイム効果に依存している。
エージェント駆動型AutoMLフレームワークであるLeJOT-AutoMLについて,MLライフサイクルを通じて大規模言語モデルエージェントを組み込む。
論文 参考訳(メタデータ) (2026-03-09T02:31:50Z) - Causify DataFlow: A Framework For High-performance Machine Learning Stream Computing [0.0]
我々は、無制限の時系列データ上に機械学習システムを構築し、テストし、デプロイするための計算フレームワークであるDataFlowを紹介する。
従来のデータサイエンスは有限データセットを前提としており、バッチプロトタイプからストリーミングプロダクションシステムに移行する際には、かなりの再実装が必要である。
DataFlowは、ポイント・イン・タイムの理想性を持つ非循環グラフに基づいて、これらの問題を統一された実行モデルで解決する。
論文 参考訳(メタデータ) (2025-12-30T04:24:04Z) - SWE-Flow: Synthesizing Software Engineering Data in a Test-Driven Manner [53.54568352375669]
テスト駆動開発(TDD)に基づく新しいデータ合成フレームワーク**SWE-Flow*を紹介します。
人為的な問題に依存する既存のソフトウェアエンジニアリングデータとは異なり、**SWE-Flow*は、単体テストから直接インクリメンタルな開発ステップを推論する。
私たちは現実のGitHubプロジェクトから16,061のトレーニングインスタンスと2,020のテストインスタンスを生成し、**SWE-Flow-Eval**ベンチマークを作成しました。
論文 参考訳(メタデータ) (2025-06-10T17:23:33Z) - ToolACE: Winning the Points of LLM Function Calling [139.07157814653638]
ToolACEは、正確で複雑で多様なツール学習データを生成するように設計された自動エージェントパイプラインである。
我々は、合成データに基づいてトレーニングされたモデルが、8Bパラメータだけで、バークレー・ファンクション・カリング・リーダーボード上で最先端のパフォーマンスを達成することを実証した。
論文 参考訳(メタデータ) (2024-09-02T03:19:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。