論文の概要: From Brittle to Robust: Improving LLM Annotations for SE Optimization
- arxiv url: http://arxiv.org/abs/2603.22474v1
- Date: Mon, 23 Mar 2026 18:42:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-25 19:53:37.151218
- Title: From Brittle to Robust: Improving LLM Annotations for SE Optimization
- Title(参考訳): Brittle から Robust へ:SE最適化のための LLM アノテーションの改善
- Authors: Lohith Senthilkumar, Tim Menzies,
- Abstract要約: 人間の専門知識が乏しい場合、SE研究者は大きな言語モデル(LLM)に欠けているラベルを尋ねることがある。
この課題に対処するために,SynthCore と呼ばれる新しい LLM プロンプト戦略を提案する。
一つの意見が失敗すると、SynthCoreはLLMによって生成された複数の分離された意見と、数発の学習者のアンサンブルを結合する。
- 参考スコア(独自算出の注目度): 4.082216579462797
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Software analytics often builds from labeled data. Labeling can be slow, error prone, and expensive. When human expertise is scarce, SE researchers sometimes ask large language models (LLMs) for the missing labels. While this has been successful in some domains, recent results show that LLM-based labeling has blind spots. Specifically, their labeling is not effective for higher dimensional multi-objective problems. To address this task, we propose a novel LLM prompting strategy called SynthCore. When one opinion fails, SynthCore's combines multiple separated opinions generated by LLMs (with no knowledge of each others' answers) into an ensemble of few-shot learners. Simpler than other strategies (e.g. chain-of-thought, multi-agent-debate, etc) SynthCore aggregates results from multiple single prompt sessions (with no crossover between them). SynthCore has been tested on 49 SE multi-objective optimization tasks, handling tasks as diverse as software project management, Makefile configuration, and hyperparameter optimization. SynthCore's ensemble found optimizations that are better than state-of-the-art alternative approaches (Gaussian Process Models, Tree of Parzen Estimators, active learners in both exploration and exploitation mode). Importantly, these optimizations were made using data labeled by LLMs, without any human opinions. From these experiments, we conclude that ensembles of few shot learners can successfully annotate high dimensional multi-objective tasks. Further, we speculate that other successful few-shot prompting results could be quickly and easily enhanced using SynthCore's ensemble approach. To support open science, all our data and scripts are available at https://github.com/lohithsowmiyan/lazy-llm/tree/clusters.
- Abstract(参考訳): ソフトウェア分析はラベル付きデータから作られることが多い。
ラベル付けは遅く、エラーが多く、高価です。
人間の専門知識が乏しい場合、SE研究者は大きな言語モデル(LLM)に欠けているラベルを尋ねることがある。
これはいくつかの領域で成功したが、最近の研究ではLSMベースのラベリングには盲点があることが示されている。
特に、それらのラベル付けは高次元多目的問題には有効ではない。
この課題に対処するために,SynthCore と呼ばれる新しい LLM プロンプト戦略を提案する。
一つの意見が失敗すると、SynthCore は LLM によって生成される複数の分離された意見(お互いの回答を知らない)を、数発の学習者の集まりにまとめる。
他の戦略(例えば、チェーン・オブ・シンク、マルチエージェント・ディベートなど)よりもシンプルに、SynthCoreは複数のプロンプトセッションから結果を集約します。
SynthCoreは49のSEマルチオブジェクト最適化タスク、ソフトウェアプロジェクト管理、Makefile設定、ハイパーパラメータ最適化といったタスクでテストされている。
SynthCoreのアンサンブルは、最先端の代替手法よりも優れた最適化(ガウスのプロセスモデル、パーズン推定子のツリー、探索モードとエクスプロイトモードの両方でアクティブな学習者)を発見した。
重要な点として、これらの最適化はLLMによってラベル付けされたデータを使用して行われた。
これらの実験から,少数のショット学習者のアンサンブルが高次元多目的タスクのアノテートに成功できることがわかった。
さらに,SynthCoreのアンサンブルアプローチを用いて,他の数発のプロンプト結果を迅速かつ容易に拡張できるのではないかと考えている。
オープンサイエンスをサポートするために、我々のデータとスクリプトはhttps://github.com/lohithsowmiyan/lazy-llm/tree/clusters.comで入手できる。
関連論文リスト
- How Low Can You Go? The Data-Light SE Challenge [4.282746516699565]
ソフトウェアエンジニアリング(SE)の研究の多くは、進歩は大量のデータセットとCPU集約に依存すると仮定している。
本稿では、ソフトウェア構成とパフォーマンスチューニング、クラウドとシステム最適化、プロジェクトとプロセスレベルの意思決定モデリング、行動分析、金融リスクモデリング、プロジェクトヘルス予測、強化学習タスク、セールス予測、ソフトウェアテストなど、他の方法も提案する。
我々の結果によると、いくつかのSEタスクは、ラベルが少なく、計算量がはるかに少ない軽量なアプローチによってよりうまく機能する可能性がある。
論文 参考訳(メタデータ) (2025-12-15T16:49:50Z) - Teamwork makes the dream work: LLMs-Based Agents for GitHub README.MD Summarization [7.330697128881243]
様々な大規模言語モデル(LLM)のシナジーを増幅するための新しいアプローチとしてメタジェンテを提案する。
メタジェンテ(Metagente)は、特殊エージェント間の評価、フィードバック、協調を通じてシステムを自己最適化する一連のLLMに基づくマルチエージェントフレームワークである。
最も関連するベンチマークであるGitSumと比較して、パフォーマンスの向上は27.63%から60.43%である。
論文 参考訳(メタデータ) (2025-03-13T20:42:39Z) - SELF-GUIDE: Better Task-Specific Instruction Following via Self-Synthetic Finetuning [70.21358720599821]
大規模言語モデル(LLM)は、適切な自然言語プロンプトを提供する際に、多様なタスクを解決するという約束を持っている。
学生LLMからタスク固有の入出力ペアを合成する多段階メカニズムであるSELF-GUIDEを提案する。
ベンチマークの指標から,分類タスクに約15%,生成タスクに18%の絶対的な改善を報告した。
論文 参考訳(メタデータ) (2024-07-16T04:41:58Z) - Aligning Language Models with Demonstrated Feedback [58.834937450242975]
Demonstration ITerated Task Optimization (DITTO)は、言語モデルの出力とユーザの実証された振る舞いを直接調整する。
我々は,DITTOがニュース記事やメール,ブログ記事などのドメイン間できめ細かいスタイルやタスクアライメントを学習する能力を評価する。
論文 参考訳(メタデータ) (2024-06-02T23:13:56Z) - SynthesizRR: Generating Diverse Datasets with Retrieval Augmentation [55.2480439325792]
トピック分類,感情分析,トーン検出,ユーモアの6つのデータセットの合成について検討した。
その結果,SynthesizRRは語彙や意味の多様性,人文との類似性,蒸留性能を大幅に向上させることがわかった。
論文 参考訳(メタデータ) (2024-05-16T12:22:41Z) - MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation [96.71370747681078]
我々は,CIFAR-10におけるモデル性能の改善から,BabyLMのような最近の研究課題まで,13のタスクからなるMLAgentBenchを紹介した。
各タスクに対して、エージェントはファイルの読み書き、コードの実行、出力の検査などのアクションを実行することができる。
我々は、Claude v1.0、Claude v2.1、Claude v3 Opus、GPT-4、GPT-4-turbo、Gemini-Pro、Mixtralに基づいてベンチマークエージェントをベンチマークし、Claude v3 Opusエージェントが成功率の点で最高であることを示す。
論文 参考訳(メタデータ) (2023-10-05T04:06:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。