論文の概要: Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows
- arxiv url: http://arxiv.org/abs/2607.07504v1
- Date: Wed, 08 Jul 2026 15:00:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.430448
- Title: Do LLM-Generated Skills Make Better AI Data Scientists? A Component Ablation Across Data-Science Workflows
- Title(参考訳): LLM生成スキルはAIデータサイエンティストを改善するか?
- Abstract要約: 再利用可能なスキルファイルは、タスクファミリのパッケージングガイダンスによって、スクラッチからのプロンプトを回避することを意図している。
専門家が書いたスキルは高品質なガイダンスをエンコードするが、多くのデータサイエンスタスクファミリにまたがってそれらを書き、維持することは、手作業によるボトルネックを生み出す。
LLM生成スキルは、タスクプロンプトだけでパフォーマンスを向上させることができるのか?
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Product data scientists often ask LLM-based agents to help with recurring execution tasks such as cleaning data, writing SQL, choosing statistical tests, and formatting results. Reusable skill files are meant to avoid prompting from scratch by packaging guidance for a task family. Expert-written skills can encode high-quality guidance, but writing and maintaining them across many data-science task families creates a manual bottleneck. We ask whether LLM-generated skills offer a useful low-curation alternative: do they improve performance over the task prompt alone? We test this question across four lifecycle stages: data preparation, data extraction, statistical analysis, and reporting, using one generated skill per stage. We find no reliable improvement from full generated skills over No-Skill prompting. We then ask whether any part of the skill is useful by ablating different skill components. The main ablation covers 56 tasks, nine model configurations, and three providers, yielding 7,560 runs. Compared with prompting using the task alone, neither the full generated skill nor any ablated skill variant significantly improves performance; all p-values are at least 0.396, and the total spread across variants is only 1.2 pp. A supplemental token-matched control adds 1,512 runs and finds that Full skills perform similarly to task-irrelevant skill-formatted content. The results caution against using one LLM-generated skill per data-science workflow as a default single-shot prompting strategy.
- Abstract(参考訳): 製品データサイエンティストは、LLMベースのエージェントに、データのクリーニング、SQLの記述、統計的テストの選択、結果のフォーマットなど、繰り返し実行されるタスクを支援するように依頼することが多い。
再利用可能なスキルファイルは、タスクファミリのパッケージングガイダンスによって、スクラッチからのプロンプトを回避することを意図している。
専門家が書いたスキルは高品質なガイダンスをエンコードするが、多くのデータサイエンスタスクファミリにまたがってそれらを書き、維持することは、手作業によるボトルネックを生み出す。
LLM生成スキルは、タスクプロンプトだけでパフォーマンスを向上させることができるのか?
データ準備、データ抽出、統計分析、レポートの4つのライフサイクルステージで、各ステージに1つの生成スキルを用いてこの質問を検証した。
No-Skillのプロンプトよりも、完全な生成スキルによる信頼性の向上は見つからない。
次に、スキルのどの部分でも、異なるスキルコンポーネントを非難することで有用かどうかを尋ねます。
メインのアブレーションには56のタスク、9つのモデル構成、3つのプロバイダが含まれ、7,560回の実行がある。
タスク単独でのプロンプトと比較すると、完全な生成スキルも改善されたスキル変種もパフォーマンスは向上せず、すべてのp値が0.396であり、変種にまたがる全拡散は1.2ppである。
追加のトークンマッチング制御では、1,512回の実行が追加され、タスク非関連のスキルフォーマットコンテンツと同様のフルスキルが実行される。
結果は、デフォルトの単発プロンプト戦略として、データサイエンスワークフロー毎に1つのLLM生成スキルを使用することに注意する。
関連論文リスト
- Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents [17.291924088593408]
大規模言語モデル(LLM)エージェントは、完了したタスクからスキルを誘導し、後で再利用することで、より経験を積むことができる。
実際には、誘導されたスキルは信頼できない移動をし、それらを回収するエージェントを傷つけることもある。
我々は、タスク間でのスキルの伝達の仕方について、包括的で制御された研究を行う。
論文 参考訳(メタデータ) (2026-08-20T17:12:08Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance [10.175883215226776]
SkillSentryは、スキル実行のためのランタイムガイダンスを表現するための、スキル指向のランタイム保証フレームワークである。
SkillSentryは2つのLLMエージェントにまたがって15のスキルで評価され、それぞれに2つのバックボーンモデルが組み合わされた。
その結果、SkillSentryはLLMエージェントのタスク成功率を平均24.1%向上させ、繰り返し実行時の変動度を低下させることを示した。
論文 参考訳(メタデータ) (2026-08-10T08:13:52Z) - Not All Skills Help: Measuring and Repairing Agent Knowledge [47.498075849595374]
ASSAYは、生成をキュレーションから分離するフレームワークである。
スキルごとの因果属性を小さな開発セットで計算する。
ライブラリをオフラインで再構築し、各テストタスクに対して負の効果でスキルを抑圧する。
論文 参考訳(メタデータ) (2026-06-13T16:37:38Z) - SKILL0: In-Context Agentic Reinforcement Learning for Skill Internalization [61.37478254738943]
推論時のスキル向上は基本的に制限されている。
SKILL0は,スキル内部化のためのコンテキスト内強化学習フレームワークである。
SKILL0は標準のRLベースラインよりも大幅に改善されている。
論文 参考訳(メタデータ) (2026-04-02T17:03:05Z) - SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic Finetuning [70.21358720599821]
大規模言語モデル(LLM)は、適切な自然言語プロンプトを提供する際に、多様なタスクを解決するという約束を持っている。
学生LLMからタスク固有の入出力ペアを合成する多段階メカニズムであるSELF-GUIDEを提案する。
ベンチマークの指標から,分類タスクに約15%,生成タスクに18%の絶対的な改善を報告した。
論文 参考訳(メタデータ) (2024-07-16T04:41:58Z) - AvaTaR: Optimizing LLM Agents for Tool Usage via Contrastive Reasoning [93.96463520716759]
大規模言語モデル(LLM)エージェントは、精度と幻覚を高めるために外部ツールと知識を活用する際、印象的な能力を示した。
本稿では、LLMエージェントを最適化して提供されたツールを効果的に活用し、与えられたタスクのパフォーマンスを向上させる新しい自動化フレームワークであるAvaTaRを紹介する。
論文 参考訳(メタデータ) (2024-06-17T04:20:02Z) - Instances Need More Care: Rewriting Prompts for Instances with LLMs in the Loop Yields Better Zero-Shot Performance [11.595274304409937]
大規模言語モデル(LLM)はゼロショットタスクのパフォーマンスに革命をもたらした。
レッツ・シンク・バイ・ステップ(Let's Think by Step)」のようなトリガーフレーズを使った現在の手法は依然として限られている。
本研究では,タスクインスタンスのゼロショットプロンプトを最適化するPRomPTedを導入する。
論文 参考訳(メタデータ) (2023-10-03T14:51:34Z) - Large Language Models as Batteries-Included Zero-Shot ESCO Skills
Matchers [0.0]
大規模言語モデル(LLM)に基づくジョブ記述からスキル抽出のためのエンドツーエンドゼロショットシステムを提案する。
ESCOのスキル全体に関する総合的なトレーニングデータを生成し,求職者からのスキル言及を抽出するために分類器を訓練する。
また、類似性検索を用いてスキル候補を生成し、第2のLCMを用いて再ランク付けする。
論文 参考訳(メタデータ) (2023-07-07T12:04:12Z) - Design of Negative Sampling Strategies for Distantly Supervised Skill
Extraction [19.43668931500507]
本稿では,リテラルマッチングによる遠隔監視に基づく,スキル抽出のためのエンドツーエンドシステムを提案する。
ESCO分類を用いて、関連するスキルからネガティブな例を選択することで、最大の改善が得られます。
我々は,タスクのさらなる研究を促進するために,研究目的のベンチマークデータセットをリリースする。
論文 参考訳(メタデータ) (2022-09-13T13:37:06Z) - KnowDA: All-in-One Knowledge Mixture Model for Data Augmentation in
Few-Shot NLP [68.43279384561352]
既存のデータ拡張アルゴリズムはタスク非依存のルールや微調整の汎用事前訓練言語モデルを利用する。
これらの手法は、簡単なタスク固有の知識を持ち、単純なタスクにおいて弱いベースラインのための低品質な合成データを得るに限られる。
我々は,様々なNLPタスクを予め学習したエンコーダ/デコーダLMの知識混合データ拡張モデル(KnowDA)を提案する。
論文 参考訳(メタデータ) (2022-06-21T11:34:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。