論文の概要: PromptResponse: Optimizing Prompts for LLM Coding Tasks
- arxiv url: http://arxiv.org/abs/2608.21074v1
- Date: Fri, 21 Aug 2026 13:16:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.55116
- Title: PromptResponse: Optimizing Prompts for LLM Coding Tasks
- Title(参考訳): PromptResponse: LLM符号化タスクのプロンプト最適化
- Authors: Erik Thureck, Robert Kühnen, Tim Jacobowitz,
- Abstract要約: 本稿ではその方法を検討する。
フォーマットと編集のプロンプトが影響します
コーディングの効率と安定性です
データセットは5つです。
変種は どのようにあるかを示します
GPAML-4の個別調整版が解決した。
コーディングの問題です
これらの結果から,低便益化は測定可能な改善に有効であることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Large language models (LLMs) are increasingly used in research workflows and software development pipelines, yet their output remains sensitive to input prompt variations. This paper presents $\unicode{x00AB}$PromptResponse$\unicode{x00BB}$, a controlled study examining how formatting and LLM-based tuning of coding task prompts affect the resulting code's performance, efficiency, and stability. Using five semantically identical yet syntactically distinct variants of the HumanEval dataset$\unicode{x2014}$baseline, JSON, Markdown, YAML, and an LLM-tuned version$\unicode{x2014}$we had GPT-4o solve its coding problems over 8200$\unicode{x00A0}$executions. Our results show that consistent formatting$\unicode{x2014}$especially JSON$\unicode{x2014}$improves generation efficiency and syntactic stability, with minor gains in task performance. Conversely, the LLM-tuned prompts resulted in significantly degraded task performance without significant improvements in any other dimension. These findings suggest that low-effort reformatting alone can yield measurable improvements, while tuning must account for model alignment. We conclude our work with providing a set of practical recommendations informed by our results as well as releasing our dataset variants and evaluation pipeline for future work.
- Abstract(参考訳): 大規模言語モデル(LLM)は研究ワークフローやソフトウェア開発パイプラインでますます使われているが、その出力はインプットプロンプトのバリエーションに敏感である。
本稿では,書式化とLLMに基づくコーディングタスクのチューニングがコードの性能,効率,安定性にどのように影響するかを制御した研究である。
HumanEvalのデータセットである$\unicode{x2014}$baseline, JSON, Markdown, YAML と LLM でチューニングされたバージョン$\unicode{x2014}$ We have GPT-4o は 8200$\unicode{x00A0}$executions のコーディング問題を解く。
我々の結果は、一貫性のあるフォーマット$\unicode{x2014}$ especially JSON$\unicode{x2014}$improving generation efficiency and syntactic stability, with minor gains in task performance.
逆に、LLMで調整されたプロンプトは、他のどの次元でも大幅に改善されることなく、タスク性能が著しく低下した。
これらの結果から,低便益化だけで測定可能な改善が得られ,チューニングはモデルアライメントを考慮しなければならないことが示唆された。
結果から得られた実践的なレコメンデーションのセットを提供し、将来の作業のためにデータセットの変種と評価パイプラインをリリースすることで、作業を終えました。
関連論文リスト
- Sparse Autoencoder-guided Supervised Finetuning to Mitigate Unexpected Code-Switching in LLMs [59.371789255015244]
大規模言語モデルは予期せぬコードスイッチング(言語ミキシングとしても知られる)に悩まされる。
この問題は可読性を低下させ、モデル応答のユーザビリティを低下させる。
我々は、$textbfS$parse $textbfA$utoencoder-guided $textbfS$upervised $textbfF$ine$textbft$uningを提案する。
論文 参考訳(メタデータ) (2025-07-20T10:20:01Z) - Zero-Shot Statistical Tests for LLM-Generated Text Detection using Finite Sample Concentration Inequalities [13.657259851747126]
コンテンツの証明は、教育機関、ソーシャルメディアプラットフォーム、企業など、多くの組織の機能に不可欠である。
LLM(Large Language Models)が生成するテキストが、人間が生成したコンテンツとほとんど区別できないようになるにつれて、この問題はますます難しくなってきている。
本稿では,あるテキストが与えられた場合,特定の LLM が生成したかどうかを特定できるのか,という問いに答える。
LLM生成したテキストは、歴史に完全に依存したシーケンシャルなプロセスとしてモデル化し、ゼロショット統計テストを設計し、2つの異なるLCM集合によって生成されたテキストを区別する。
論文 参考訳(メタデータ) (2025-01-04T23:51:43Z) - Reasoning Robustness of LLMs to Adversarial Typographical Errors [49.99118660264703]
大規模言語モデル(LLM)は、Chain-of-Thought(CoT)プロンプトを使用した推論において、印象的な機能を示している。
本研究では,LLMのタイポグラフィ的誤りに対するロバスト性について検討する。
我々は,クエリに重要な単語の型を反復的にサンプリングし,攻撃に成功しそうな編集を選択する,Adversarial Typo Attack(texttATA$)アルゴリズムを設計する。
論文 参考訳(メタデータ) (2024-11-08T05:54:05Z) - Large Language Models Are Overparameterized Text Encoders [17.608805125623803]
大規模言語モデル(LLM)は、教師付きコントラスト訓練で微調整されたテキスト埋め込みモデルとして高い性能を示す。
我々は,LLMの最後の$p%のレイヤーを1000ステップの指導訓練前に刈り取ることで,メモリと推論時間の比例的に削減できることを示す。
論文 参考訳(メタデータ) (2024-10-18T16:26:45Z) - Great Memory, Shallow Reasoning: Limits of $k$NN-LMs [71.73611113995143]
検索とnext-word予測を統合した$k$NN-LMsは、言語モデリングにおいて強力な性能を示している。
この改良された情報リコール能力が、本当に下流の能力に変換されるかどうかを問う。
論文 参考訳(メタデータ) (2024-08-21T17:59:05Z) - Reducing Sequence Length by Predicting Edit Operations with Large
Language Models [50.66922361766939]
本稿では,ローカルなシーケンス変換タスクに対して,ソーステキストの編集スパンを予測することを提案する。
編集スパンの監督データに大規模言語モデルに対する命令チューニングを適用する。
実験の結果,提案手法は4つのタスクにおいて,ベースラインに匹敵する性能を発揮することがわかった。
論文 参考訳(メタデータ) (2023-05-19T17:51:05Z) - LeTI: Learning to Generate from Textual Interactions [60.425769582343506]
本稿では,テキストインタラクション(LETI)から学習するLMの可能性を,バイナリラベルによる正当性をチェックするだけでなく,テキストフィードバックを通じて出力中のエラーをピンポイントし,説明する。
私たちの焦点はコード生成タスクであり、そこではモデルが自然言語命令に基づいてコードを生成する。
LETIは、目的のLMを用いて、自然言語命令、LM生成プログラム、テキストフィードバックの結合に基づいて、モデルを反復的に微調整する。
論文 参考訳(メタデータ) (2023-05-17T15:53:31Z) - Progressive-Hint Prompting Improves Reasoning in Large Language Models [63.98629132836499]
本稿では,プログレッシブ・ヒント・プロンプト(PHP)と呼ばれる新しいプロンプト手法を提案する。
事前に生成された回答をヒントとして使用することで、ユーザとLLM(Large Language Models)間の自動多元的対話を可能にする。
我々は7つのベンチマークで広範囲かつ包括的な実験を行った。その結果、PHPは高い効率を保ちながら精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2023-04-19T16:29:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。