論文の概要: STEVE: Stabilizing Textual Gradient-Based Prompt Optimization via Error-Driven Refinement and Regularized Verification
- arxiv url: http://arxiv.org/abs/2609.23716v1
- Date: Sun, 20 Sep 2026 15:48:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.945801
- Title: STEVE: Stabilizing Textual Gradient-Based Prompt Optimization via Error-Driven Refinement and Regularized Verification
- Title(参考訳): STEVE: エラー駆動リファインメントと正規化検証によるテキストグラディエントベースプロンプト最適化の安定化
- Abstract要約: テキスト段階のプロンプト最適化のための安定化フレームワークであるSTEVEを紹介する。
STEVEは劣化を低減し、10個の推論ベンチマークでより堅牢なプロンプトを生成する。
- 参考スコア(独自算出の注目度): 36.16462854301401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Textual-gradient methods automate prompt optimization through natural-language feedback, but their iterative updates can be unstable. We identify two sources of this instability: noisy gradients produced from already-correct examples and over-specialization to hard cases that degrades performance on simpler inputs. We introduce STEVE, a stabilization framework with two coupled mechanisms. Error-Driven Refinement generates gradients only from incorrectly handled examples, concentrating updates on informative failures. Regularized Verification treats every update as provisional and accepts it only when improvement on hard cases does not cause unacceptable regression on a preservation set. Across ten reasoning benchmarks, three evaluator/optimizer models, and established prompt-optimization baselines, STEVE reduces degradation and produces more robust prompts. Additional evaluations with gpt-5.4-mini/gpt-5.4 on symbolic reasoning, GSM8K-Platinum, and DS-1000 show that these gains persist with newer models and larger test sets. STEVE therefore provides a practical way to improve the stability and effectiveness of textual-gradient prompt optimization.
- Abstract(参考訳): テキストグラディエントな手法は、自然言語フィードバックによる迅速な最適化を自動化するが、反復的な更新は不安定である。
この不安定性の2つの源は、既に正しい例から生じるノイズ勾配と、単純な入力で性能を低下させるハードケースへの過剰特殊化である。
本稿では,2つの結合機構を持つ安定化フレームワークであるSTEVEを紹介する。
エラー駆動リファインメント(Error-Driven Refinement)は、誤った処理例からのみグラデーションを生成し、情報的障害の更新に集中する。
正規化検証は、すべての更新を一時的なものとして扱い、ハードケースの改善が保存セットに許容できない回帰を起こさない場合にのみ受け入れる。
10の推論ベンチマークと3つの評価器/最適化モデル、およびプロンプト最適化ベースラインを確立することで、STEVEは劣化を低減し、より堅牢なプロンプトを生成する。
gpt-5.4-mini/gpt-5.4による記号的推論、GSM8K-Platinum、DS-1000によるさらなる評価は、これらの利得がより新しいモデルとより大きなテストセットで持続することを示している。
したがって、STEVEはテキスト段階的なプロンプト最適化の安定性と有効性を改善するための実用的な方法を提供する。
関連論文リスト
- GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning [61.67411833252235]
本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
論文 参考訳(メタデータ) (2026-08-03T17:55:24Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Auto-Prompt Generation is Not Robust: Prompt Optimization Driven by Pseudo Gradient [50.15090865963094]
PertBenchは、幅広い入力摂動を含む包括的なベンチマークデータセットである。
我々の分析は、既存の即時生成戦略における重大な脆弱性を明らかにしている。
PGOは、摂動型を擬似次数次信号として活用する、勾配のないプロンプト生成フレームワークである。
論文 参考訳(メタデータ) (2024-12-24T06:05:08Z) - COME: Test-time adaption by Conservatively Minimizing Entropy [45.689829178140634]
保守的に最小化されるエントロピー (COME) は従来のエントロピー (EM) の代替品である
COMEはモデル予測よりもディリクレ事前分布を特徴付けることによって、不確実性を明示的にモデル化する。
我々はCOMEが一般的なベンチマークで最先端のパフォーマンスを達成することを示す。
論文 参考訳(メタデータ) (2024-10-12T09:20:06Z) - Large Continual Instruction Assistant [59.585544987096974]
CIT(Continuous Instruction Tuning)は、大規模モデルにデータによる人間の意図データに従うよう指示するために用いられる。
既存の更新勾配は、CITプロセス中に前のデータセットのパフォーマンスを著しく損なうことになる。
本稿では,この課題に対処する汎用的な連続的命令チューニングフレームワークを提案する。
論文 参考訳(メタデータ) (2024-10-08T11:24:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。