論文の概要: Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks
- arxiv url: http://arxiv.org/abs/2607.21482v1
- Date: Thu, 23 Jul 2026 16:23:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.48317
- Title: Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks
- Title(参考訳): クラウドのないエージェントコーディング--時系列データ作成タスクにおけるオープンウェイト大言語モデルの評価
- Authors: Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann,
- Abstract要約: 大規模言語モデル(LLM)とエージェントは現在、コード開発で広く使われている。
個人データを用いた研究における彼らの採用は、一般的に外部サービスへのデータ転送を禁止しているガバナンス要件によって制限されている。
我々は,オープンウェイトLSMを用いたAIエージェントの有効性を評価するためのオープンソースフレームワークを,長手集団研究における最も永続的なボトルネックの1つとして紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) and agents are now widely used tools in code development, with data typically sent to third-party cloud-based models. Their adoption in research using personal data is constrained by governance requirements that typically prohibit data transmission to external services. Locally deployable open-weight models offer an alternative since sensitive data never leave the local environment. We introduce an open-source framework for evaluating the efficacy of AI agents powered by open-weight LLMs on one of the most persistent bottlenecks in research on longitudinal population studies: data preparation. The framework comprises: a curated ground-truth dataset (cleaning scripts preparing six sweeps of data from a British cohort study), task definitions encompassing tasks such as category harmonization and multi-wave merging, and automated routines for evaluating the LLM-produced R code and outputted data. We benchmark LLMs across the (consumer grade) deployment spectrum to assess their efficacy in 20 data preparation tasks (creation of 102 variables). Current state-of-the-art, 31-35B parameter models almost saturated our benchmark ("average task completion" up to 87.9%). The performance of open-weight LLMs running on consumer-grade hardware shows promise of a viable path toward AI-assisted data preparation in governance-restricted research settings. Our framework is publicly available at: https://github.com/UCL-ARC/RRBench.
- Abstract(参考訳): 大規模言語モデル(LLM)とエージェントは現在、コード開発で広く使われているツールであり、データは一般的にサードパーティのクラウドベースモデルに送信される。
個人データを用いた研究における彼らの採用は、一般的に外部サービスへのデータ転送を禁止しているガバナンス要件によって制限されている。
ローカルにデプロイ可能なオープンウェイトモデルは、機密データがローカル環境を離れることはないため、代替手段を提供する。
我々は,LLMを用いたAIエージェントの有効性を評価するためのオープンソースフレームワークを,長手集団研究における最も永続的なボトルネックの1つとして,データ準備について紹介する。
このフレームワークは、キュレートされたグランドトゥルースデータセット(イギリスのコホート研究から6つのデータスイープを準備するクリーン化スクリプト)、カテゴリ調和やマルチウェーブマージといったタスクを含むタスク定義、LLM生成したRコードと出力データを評価するための自動ルーチンを含む。
我々は、20データ作成タスク(102変数の作成)において、LCMを(消費者の)展開スペクトルにわたってベンチマークし、その有効性を評価する。
現在の最先端の31-35Bパラメータモデルはベンチマークをほぼ飽和させた("平均タスク完了"は87.9%まで)。
コンシューマグレードのハードウェア上で動作するオープンウェイトLLMのパフォーマンスは、ガバナンスに制限のある研究環境において、AI支援データ準備に向けた実行可能な道筋を示す。
私たちのフレームワークは、https://github.com/UCL-ARC/RRBench.comで公開されています。
関連論文リスト
- LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning [12.792070502265616]
大規模言語モデル(LLM)は、専門分野の性能を高めるために、ドメイン固有のデータに基づいて微調整することができる。
このようなデータには、多くの低品質なサンプルが含まれており、効果的なデータ処理(DP)を必要としている。
論文 参考訳(メタデータ) (2026-01-28T08:37:34Z) - What Language Models Know But Don't Say: Non-Generative Prior Extraction for Generalization [5.663538370244175]
ベイジアンロジスティック回帰のための情報的事前分布を抽出する決定論的手法であるLoIDを提案する。
生成したテキストに頼るのではなく、注意深く構築された文を通して、モデルが対立する意味的方向に対する自信を探索する。
合成アウトオブディストリビューション(OOD)設定下で10個の実世界のデータセット上でLoIDを評価する。
論文 参考訳(メタデータ) (2026-01-24T22:05:01Z) - Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs [66.63911043019294]
データ準備は、生のデータセットを識別し、データセット間の関係を解明し、それらから貴重な洞察を抽出することを目的としている。
本稿では,様々な下流タスクのためのデータ準備にLLM技術を用いることに焦点を当てる。
データクリーニング、標準化、エラー処理、計算、データ統合、データ豊か化という3つの主要なタスクにフィールドを編成するタスク中心の分類を導入します。
論文 参考訳(メタデータ) (2026-01-22T12:02:45Z) - DataSciBench: An LLM Agent Benchmark for Data Science [33.3811507234528]
DataSciBenchは、データサイエンスにおけるLarge Language Model(LLM)の機能を評価するためのベンチマークである。
我々は、グラウンド・真実(GT)を生成し、評価指標を検証するための半自動パイプラインを開発した。
我々は、各コード実行結果を評価する革新的なTask-Function-Codeフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-19T17:31:51Z) - SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic Finetuning [70.21358720599821]
大規模言語モデル(LLM)は、適切な自然言語プロンプトを提供する際に、多様なタスクを解決するという約束を持っている。
学生LLMからタスク固有の入出力ペアを合成する多段階メカニズムであるSELF-GUIDEを提案する。
ベンチマークの指標から,分類タスクに約15%,生成タスクに18%の絶対的な改善を報告した。
論文 参考訳(メタデータ) (2024-07-16T04:41:58Z) - DiscoveryBench: Towards Data-Driven Discovery with Large Language Models [50.36636396660163]
我々は、データ駆動探索の多段階プロセスを形式化する最初の包括的なベンチマークであるDiscoveryBenchを紹介する。
我々のベンチマークには、社会学や工学などの6つの分野にまたがる264のタスクが含まれている。
私たちのベンチマークでは、自律的なデータ駆動型発見の課題を説明し、コミュニティが前進するための貴重なリソースとして役立ちます。
論文 参考訳(メタデータ) (2024-07-01T18:58:22Z) - AvaTaR: Optimizing LLM Agents for Tool Usage via Contrastive Reasoning [93.96463520716759]
大規模言語モデル(LLM)エージェントは、精度と幻覚を高めるために外部ツールと知識を活用する際、印象的な能力を示した。
本稿では、LLMエージェントを最適化して提供されたツールを効果的に活用し、与えられたタスクのパフォーマンスを向上させる新しい自動化フレームワークであるAvaTaRを紹介する。
論文 参考訳(メタデータ) (2024-06-17T04:20:02Z) - DCA-Bench: A Benchmark for Dataset Curation Agents [9.60250892491588]
不完全なドキュメンテーション、不正確なラベル、倫理的懸念、時代遅れの情報といったデータ品質問題は、広く使われているデータセットで共通している。
大きな言語モデル(LLM)の急増する能力により、LLMエージェントによる隠れデータセット問題の発見の合理化が約束されている。
本研究では,この課題に対処するLLMエージェントの能力を評価するためのベンチマークを確立する。
論文 参考訳(メタデータ) (2024-06-11T14:02:23Z) - How to Train Data-Efficient LLMs [56.41105687693619]
事前学習言語モデル(LLM)に対するデータ効率のアプローチについて検討する。
Ask-LLMと密度サンプリングがそれぞれのカテゴリで最適であることがわかった。
何百もの評価タスクと事前学習作業を含む19個のサンプルを比較したところ,Ask-LLMと密度がそれぞれのカテゴリで最適な方法であることが判明した。
論文 参考訳(メタデータ) (2024-02-15T02:27:57Z) - Accelerated Cloud for Artificial Intelligence (ACAI) [24.40451195277244]
我々は、エンドツーエンドのクラウドベースの機械学習プラットフォームであるAccelerated Cloud for AI (ACAI)を提案する。
ACAIは、インデックス付き、ラベル付き、検索可能なデータのクラウドストレージと、自動リソースプロビジョニング、ジョブスケジューリング、実験追跡を可能にする。
自動プロビジョン装置は1.7倍のスピードアップと39%のコスト削減を実現し,典型的なMLのユースケースにおいて,ML科学者の実験時間を20%短縮することを示した。
論文 参考訳(メタデータ) (2024-01-30T07:09:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。