論文の概要: To Write or to Automate Linguistic Prompts, That Is the Question
- arxiv url: http://arxiv.org/abs/2603.25169v1
- Date: Thu, 26 Mar 2026 08:42:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-27 20:52:48.186798
- Title: To Write or to Automate Linguistic Prompts, That Is the Question
- Title(参考訳): 言語プロンプトを書くか、自動化するか - それが質問だ
- Authors: Marina Sánchez-Torrón, Daria Akselrod, Jason Rauchwerk,
- Abstract要約: 自動プロンプト最適化が言語タスクにおける専門家のプロンプト工学に取って代わるかどうかを評価する。
本報告では,手作りゼロショットプロンプト,ベースDSPシグネチャ,GEPA最適化DSPシグネチャの翻訳,用語挿入,言語品質評価を初めて体系的に比較した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM performance is highly sensitive to prompt design, yet whether automatic prompt optimization can replace expert prompt engineering in linguistic tasks remains unexplored. We present the first systematic comparison of hand-crafted zero-shot expert prompts, base DSPy signatures, and GEPA-optimized DSPy signatures across translation, terminology insertion, and language quality assessment, evaluating five model configurations. Results are task-dependent. In terminology insertion, optimized and manual prompts produce mostly statistically indistinguishable quality. In translation, each approach wins on different models. In LQA, expert prompts achieve stronger error detection while optimization improves characterization. Across all tasks, GEPA elevates minimal DSPy signatures, and the majority of expert-optimized comparisons show no statistically significant difference. We note that the comparison is asymmetric: GEPA optimization searches programmatically over gold-standard splits, whereas expert prompts require in principle no labeled data, relying instead on domain expertise and iterative refinement.
- Abstract(参考訳): LLMの性能は、プロンプト設計に非常に敏感であるが、自動プロンプト最適化が言語タスクにおける専門家のプロンプト工学を置き換えることができるかどうかはまだ不明である。
本報告では,手作りゼロショットエキスパートプロンプト,ベースDSPyシグネチャ,GEPA最適化DSPyシグネチャの翻訳,用語挿入,言語品質評価を初めて体系的に比較し,モデル構成を5つ評価する。
結果はタスク依存です。
用語の挿入、最適化、手動のプロンプトは、ほとんど統計的に区別できない品質を生み出す。
翻訳では、それぞれのアプローチが異なるモデルで勝利する。
LQAでは、最適化がキャラクタリゼーションを改善しながら、専門家がより強力なエラー検出を実現する。
すべてのタスクにおいて、GEPAは最小のDSPyシグネチャを増大させ、専門家最適化比較の大多数は統計的に有意な差は示さない。
GEPA最適化は金標準分割をプログラムで探索するのに対し、専門家のプロンプトは原則としてラベル付きデータを必要としず、代わりにドメインの専門知識と反復的な洗練に依存している。
関連論文リスト
- Error Taxonomy-Guided Prompt Optimization [14.654343320792941]
本稿では,トップダウンアプローチを採用した即時最適化アルゴリズムETGPOを提案する。
ETGPOは、モデルエラーを収集し、それらを分類に分類し、最も頻繁な障害モードをターゲットにしたガイダンスでプロンプトを強化することで、グローバルな障害状況に焦点を当てている。
ETGPOは、最適化フェーズトークンの使用と評価予算のおよそ3分の1を必要としながら、最先端の手法と同等かそれ以上の精度を達成する。
論文 参考訳(メタデータ) (2026-02-01T03:27:44Z) - Improving Alignment Between Human and Machine Codes: An Empirical Assessment of Prompt Engineering for Construct Identification in Psychology [0.0]
本稿では,テキスト中のコンストラクタをインシデントエンジニアリングで識別するために,インシデント性能を最適化するための実証的フレームワークを提案する。
提案手法は,コードブックによる経験的プロンプト選択,自動プロンプトエンジニアリング,ペルソナプロンプト,チェーンオブ思考推論,説明的プロンプトという5つのプロンプト戦略を実験的に評価した。
3つの構成と2つのモデルで、分類は専門家の判断に最も適しており、コードブックに誘導された経験的プロンプト選択と自動プロンプトエンジニアリングを組み合わせた数発のプロンプトから生まれた。
論文 参考訳(メタデータ) (2025-12-03T14:07:42Z) - Structured Prompting Enables More Robust Evaluation of Language Models [38.53918044830268]
DSPy+HELMフレームワークを提案する。
構造化されたプロンプトがなければ、HELMはLM性能(平均4%)を過小評価し、性能評価はベンチマークによって異なることがわかった。
これは、構造化されたプロンプトを確立された評価フレームワークに体系的に統合する最初のベンチマーク研究である。
論文 参考訳(メタデータ) (2025-11-25T20:37:59Z) - Grammar-Guided Evolutionary Search for Discrete Prompt Optimisation [63.97051732013936]
本稿では,2段階からなる離散的な自動最適化に対する進化的探索手法を提案する。
第1段階では、文法誘導型遺伝的プログラミングが実行され、プロンプト生成プログラムを合成する。
第2段階では、局所探索を用いて、最高のパフォーマンスプログラムの周辺を探索する。
論文 参考訳(メタデータ) (2025-07-14T14:34:15Z) - Self-Supervised Prompt Optimization [19.159322848728646]
十分に設計されたプロンプトは、Large Language Model(LLM)推論能力の強化に不可欠である。
既存のプロンプト最適化手法は、地上の真実や人間による外部参照に大きく依存している。
本稿では,閉じたタスクとオープンなタスクの両方に効果的なプロンプトを発見する費用効率のよいフレームワークであるセルフ・スーパービジョン・プロンプト・最適化(SPO)を提案する。
論文 参考訳(メタデータ) (2025-02-07T17:45:16Z) - On the Worst Prompt Performance of Large Language Models [93.13542053835542]
大規模言語モデル(LLM)の性能は,プロンプトの表現に非常に敏感である。
セマンティックに等価なケースレベルのクエリで構成される新しいベンチマークであるRobustAlpacaEvalを紹介する。
RobustAlpacaEvalとChatGPT、およびLlama、Mistral、Gemmaファミリーの6つのオープンソースLLMによる実験により、モデル性能のかなりのばらつきが明らかになった。
論文 参考訳(メタデータ) (2024-06-08T13:40:38Z) - PromptAgent: Strategic Planning with Language Models Enables
Expert-level Prompt Optimization [60.00631098364391]
PromptAgentは、エキスパートレベルのプロンプトを、専門家による手工芸品と同等の品質で作成する最適化手法である。
PromptAgentは人間のような試行錯誤の探索にインスパイアされ、専門家レベルの正確な洞察と詳細な指示を誘導する。
PromptAgentを3つの実践領域にまたがる12のタスクに適用する。
論文 参考訳(メタデータ) (2023-10-25T07:47:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。