論文の概要: MAGE: Understanding Stability-Performance Trade-offs in Multi-component Prompt Optimization
- arxiv url: http://arxiv.org/abs/2607.11944v1
- Date: Sat, 11 Jul 2026 10:05:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:29.889955
- Title: MAGE: Understanding Stability-Performance Trade-offs in Multi-component Prompt Optimization
- Title(参考訳): MAGE:多成分プロンプト最適化における安定性-性能トレードオフの理解
- Abstract要約: MAGE(Memory-Augmented Goal Prompt Evolution)は、コンポーネント間の相互作用を即時最適化する制御分析フレームワークである。
我々の実験は、複数の最適化信号が閉じた反射ループ内で動作しているときに、以前に報告されていない現象である、Prompt Optimization Coupling Effect (POCE)を発見した。
- 参考スコア(独自算出の注目度): 3.7323766833175718
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: How do different components of iterative prompt optimization interact, and what happens when they are combined? We investigate this through MAGE (Memory-Augmented Goal-directed Prompt Evolution), a controlled analysis framework for studying component interaction in prompt optimization. MAGE is not proposed as a superior optimizer in absolute terms; it integrates episodic memory, multi-objective Pareto selection, and adaptive evaluation as a platform for controlled ablation. Our experiments uncover a previously unreported phenomenon, the Prompt Optimization Coupling Effect (POCE): when multiple stochastic optimization signals operate within a closed reflective loop, they interact in ways that simultaneously improve performance and amplify variance, behavior that cannot be predicted by analyzing components in isolation. Three main findings emerge. First, failure-grounded reflection is essential: methods relying only on scores (OPRO) or abstract critique (Self-Refine) fail to improve prompts. Second, MAGE achieves 46.4% versus GEPA's 34.0% on GSM8K-Hard (+12.4%, P(MAGE>GEPA)=0.998, 5 seeds on gpt-4o-mini), with comparable variance (7.3% vs. 7.0%). Third, increasing candidate diversity reveals the clearest POCE signal: expanding the candidate pool from n=3 to n=5 improves mean accuracy by +21.6% while increasing variance by 3.7x. We further validate on Llama 3.1 8B and show POCE is headroom-dependent: when the base model already achieves high accuracy, variance amplification disappears. Finally, in low-data regimes (Ntrain=30), well-designed fixed prompts outperform all reflective optimizers, indicating that scaffold choice dominates optimizer choice. Our results suggest prompt optimization systems behave as coupled stochastic processes and should be evaluated in terms of both performance and stability, not just peak accuracy.
- Abstract(参考訳): 反復的プロンプト最適化の異なるコンポーネントはどのように相互作用し、組み合わせるとどうなるのか?
MAGE(Memory-Augmented Goal-directed Prompt Evolution)は,コンポーネント間の相互作用を即時最適化するための制御分析フレームワークである。
MAGEは絶対的な意味で優れたオプティマイザとして提案されておらず、エピソードメモリ、多目的パレート選択、および制御アブレーションのためのプラットフォームとしての適応評価を統合している。
複数の確率的最適化信号が閉じた反射ループ内で動作した場合、それらは同時に性能を改善し、分散を増幅する方法で相互作用する。
主な発見は3つある。
スコア(OPRO)や抽象的批判(Self-Refine)のみに依存するメソッドはプロンプトを改善することができない。
第2に、GEPAのGSM8K-Hardの34.0%(+12.4%、P(MAGE>GEPA)=0.998、gpt-4o-miniの5種)に対して、MAGEは46.4%、差は7.0%である。
候補プールをn=3からn=5に拡大すると、平均精度は+21.6%向上し、ばらつきは3.7倍になる。
さらにLlama 3.1 8Bを検証し,POCEがヘッドルーム依存であることを示す。
最後に、低データレシエーション(Ntrain=30)では、よく設計された固定プロンプトがすべての反射オプティマイザより優れており、足場選択がオプティマイザ選択を支配していることを示している。
この結果から,最適化システムは確率過程の結合として振る舞うことが示唆され,ピーク精度だけでなく,性能と安定性の両面から評価されるべきである。
関連論文リスト
- ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize [21.715943293929296]
ESPOは、迅速な最適化を3つのフェーズに分解する: クラスターを1ラウンドで全てのトレーニングエラーを診断する; Proposeは、独立バイアスを持つ4つの補完戦略を介して候補を生成する; Selectはブートストラップの安定性を適用する。
7つのパブリックNLPベンチマークでは、ESPOは最先端技術(GEPAでは74.67%対70.91%)よりも平均精度を$3.76 ppで改善している。
論文 参考訳(メタデータ) (2026-09-03T17:59:37Z) - On-Policy Self-Distillation in Diffusion Models [89.32656931795293]
強化学習は、拡散モデルと人間の好みやタスク固有の目的とを一致させることができるが、エンドポイント報酬は、中間的偏見予測をどのように変更すべきかを規定していない。
そこで我々は、DiffusionOPSDを、画像レベルの報酬誘導を明示的なターゲットに変換して、サンプルクエリにおけるクリーンな出力予測を行うオンライン自己蒸留フレームワークとして導入する。
SD 3.5-Mとステップ蒸留したZ-Image-Turboを用いて、2つのバックボーンと10個の評価器で20の報酬マッチング設定のうち19のファイナルホールトアウトスコアを達成した。
論文 参考訳(メタデータ) (2026-08-25T14:55:24Z) - Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 [53.71882250666667]
エージェント最適化法で報告されているほとんどの利得はワンショットである。
これは、デプロイされたエージェントにとって重要な設定をテストするものではない。
エージェントハーネス最適化に対する3つのアプローチを比較する。
論文 参考訳(メタデータ) (2026-07-15T16:36:04Z) - Towards Robust Training in NNGPT AutoML Pipeline: A Loss-Optimizer Pairing Selection Study [48.83701310501069]
本稿では, 一つのレシピがヘテロジニアスなアーキテクチャプールに十分であるか, 最適ペアリングが構造的に多様なモデルによって異なるかを検討する。
我々は,CEL(Cross-Entropy),NLL(Negative Log-Likelihood),および最近導入された遺伝学的に進化したNGL損失を,LEMURヘテロジニアス・アーキテクチャー・プールの6つの画像分類データセット上に提示したベースモデル間で比較検討した。
我々の結果は、単一のペアリングが普遍的に最適でないことを確認した。AdamやAdamWとのクロスエントロピーは、最も堅牢な選択である。
論文 参考訳(メタデータ) (2026-06-18T20:51:42Z) - Spokes: Optimizing for Diverse Pretraining Data Selection [82.66872118512403]
本稿ではG-Vendiスコアに基づく確率的多様化フレームワークを提案する。
提案手法は, ランダムサンプリングにより得られたサブセットよりも, かなり多様なサブセットを生成する。
我々はFineWebとDCLMのアプローチを評価し、既存の手法を一貫して上回ります。
論文 参考訳(メタデータ) (2026-06-13T09:28:46Z) - ContraPrompt: Contrastive Prompt Optimization via Dyadic Reasoning Trace Analysis [0.6372261626436676]
ContraPromptは、モデルが失敗してもフィードバックで再試行を成功させる場合、その差が最適化信号を構成するという観測に基づいて構築される。
従来のコントラスト法とは異なり、完全な中間的推論過程を比較する。
ContraPromptは11日にGEPAを41で破り、同じ予算で1で敗れた。
論文 参考訳(メタデータ) (2026-04-20T08:17:15Z) - Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees [28.54776477263591]
本稿では, Prompt-Aware Online Evaluation Scheduling (POES)を提案する。
POESはIRTベースの識別ユーティリティ、施設位置のカバレッジ用語、スイッチングコストを意識したウォームスタートスワップを統一された目的に統合する。
POESは、無視できるトークンオーバーヘッドで、全体的な平均精度(最高のベースラインよりも6.2%改善)が最も高い。
論文 参考訳(メタデータ) (2026-04-13T11:31:04Z) - Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE [7.609008983716641]
我々は、一般的なネガティブ選択戦略とDPOトレーニングとの相互作用を比較するために、マルチモーダルシーケンシャルレコメンデーションの実験を行う。
我々の中心的な発見は、決定論的ハードネガティブを動的トップK候補プールからのサンプリングに置き換えた単純な修正により、常にランク付け性能が向上することである。
論文 参考訳(メタデータ) (2026-03-31T04:49:32Z) - CoT2-Meta: Budgeted Metacognitive Control for Test-Time Reasoning [17.364321308755667]
CoT2-Metaはトレーニング不要なメタ認知推論フレームワークである。
オブジェクトレベルの連鎖生成と部分的推論軌道に対するメタレベルの制御を組み合わせる。
強いシングルパス、サンプリングベース、検索ベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-03-30T07:59:47Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment [57.03947082589616]
大規模言語モデル(LLM)は、しばしばコントラスト的なアライメント目標と選好ペアデータセットを使用してアライメントされる。
これについて検討し、基礎となる応答が対照的な場合、嗜好データがより良い学習信号を与えることを示した。
我々は、よりコントラスト的な選好ペアを生み出すデータ生成手法である、AI Revisions (CLAIR) からのコントラスト学習を紹介する。
我々の最良のモデルは、APOで32K CLAIRの選好に基づいて訓練され、Llama-3-8B-Instructを7.65%改善し、GPT4-turboとのギャップを45%短縮しました。
論文 参考訳(メタデータ) (2024-08-12T16:24:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。