論文の概要: Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems
- arxiv url: http://arxiv.org/abs/2604.14585v1
- Date: Thu, 16 Apr 2026 03:23:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:31.708118
- Title: Prompt Optimization Is a Coin Flip: Diagnosing When It Helps in Compound AI Systems
- Title(参考訳): Prompt Optimizationは、複雑なAIシステムで役に立つと診断するコインフリップ
- Authors: Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He,
- Abstract要約: 複合AIシステムにおける迅速な最適化は、コインフリップと統計的に区別できないことを示す。
18,000のグリッド評価と144の最適化を実行し、エンドツーエンドの最適化ツールの背後にある2つの仮定をテストする。
エージェントカップリングのための80ドルのANOVAプリテストと10分間のヘッドルームテストである。
- 参考スコア(独自算出の注目度): 9.989306175511238
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Prompt optimization in compound AI systems is statistically indistinguishable from a coin flip: across 72 optimization runs on Claude Haiku (6 methods $\times$ 4 tasks $\times$ 3 repeats), 49% score below zero-shot; on Amazon Nova Lite, the failure rate is even higher. Yet on one task, all six methods improve over zero-shot by up to $+6.8$ points. What distinguishes success from failure? We investigate with 18,000 grid evaluations and 144 optimization runs, testing two assumptions behind end-to-end optimization tools like TextGrad and DSPy: (A) individual prompts are worth optimizing, and (B) agent prompts interact, requiring joint optimization. Interaction effects are never significant ($p > 0.52$, all $F < 1.0$), and optimization helps only when the task has exploitable output structure -- a format the model can produce but does not default to. We provide a two-stage diagnostic: an \$80 ANOVA pre-test for agent coupling, and a 10-minute headroom test that predicts whether optimization is worthwhile -- turning a coin flip into an informed decision.
- Abstract(参考訳): 72を超える最適化はClaude Haiku氏(6つのメソッド$\times$4タスク$\times$3リピート)、ゼロショット以下49%、Amazon Nova Liteでは失敗率がさらに高い。
しかし、1つのタスクでは、ゼロショットよりも最大6つのメソッドが最大6.8ドルポイント改善される。
成功と失敗を区別するものは何か?
18,000のグリッド評価と144の最適化を実行し、TextGradやDSPyのようなエンドツーエンド最適化ツールの裏側にある2つの仮定をテストする。
インタラクション効果は重要ではない(p > 0.52$, all $F <1.0$)。
エージェント結合のための80ドルのANOVA事前テストと、最適化に価値があるかどうかを予測する10分間のヘッドルームテストです。
関連論文リスト
- CodeContests-O: Powering LLMs via Feedback-Driven Iterative Test Case Generation [71.42965967582147]
既存のアプローチは、Large Language Models (LLM) を用いたテストケースの合成を試みる
包括的なテストケース構築のために、textbfFeedback-Bench Iterative Framework$を提案します。
私たちのデータセットは、平均的真正率(TPR)が89.37%、真負率(TNR)が90.89%で、CodeContestsとCodeContests+をそれぞれ4.32%、9.37%で大幅に上回っている。
論文 参考訳(メタデータ) (2026-01-20T07:32:44Z) - CarBoN: Calibrated Best-of-N Sampling Improves Test-time Reasoning [62.56541355300587]
本稿では,高逆推論経路に向けてモデルを適応的に修正する一般的なテスト時間校正フレームワークを提案する。
本フレームワークでは,まず解空間を探索し,次にロジットの校正を学習する二相法であるCarBoNを提案する。
MATH-500とAIME-2024の実験では、CarBoNは効率を向上し、同じ精度に達するために最大4倍のロールアウトが可能である。
論文 参考訳(メタデータ) (2025-10-17T14:04:37Z) - Amortized Latent Steering: Low-Cost Alternative to Test-Time Optimization [3.9311957222075935]
Amortized Latent Steering (ALS)は、反復最適化を1つのオフライン計算ベクトルに分解する。
ALSは反復的手法よりも2~5倍のスピードアップを達成し、強欲なCoT(Chain-of-Thought)と自己一貫性(Self-Consistency)のベースラインをマッチまたは超過する。
結果から,潜伏最適化のメリットの大部分はオフラインで取得可能であることが示され,高度な推論技術が本番デプロイメントに有効であることが確認された。
論文 参考訳(メタデータ) (2025-09-10T07:03:35Z) - Narrowing the Gap between Adversarial and Stochastic MDPs via Policy Optimization [11.11876897168701]
対人的マルコフ決定過程における学習の問題を考える。
本稿では,APO-MVPと呼ばれるアルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-07-08T08:06:45Z) - qPOTS: Efficient batch multiobjective Bayesian optimization via Pareto optimal Thompson sampling [0.0]
多目的最適化を解くためのサンプル効率のアプローチは、プロセス・オラクル・サロゲート(GP)とMOBOOTS$である。
我々はトンプソンサンプリング(TS)に基づくアプローチ(qtextttPOTS$)を提案する。
$qtextttPOTS$は、GP後部の安価な多目的最適化を進化的アプローチで解決する。
論文 参考訳(メタデータ) (2023-10-24T12:35:15Z) - Landscape Surrogate: Learning Decision Losses for Mathematical
Optimization Under Partial Information [48.784330281177446]
学習統合最適化の最近の研究は、最適化が部分的にのみ観察される場合や、専門家のチューニングなしに汎用性が不十分な環境では有望であることを示している。
本稿では,$fcirc mathbfg$の代替として,スムーズで学習可能なランドスケープサロゲートを提案する。
このサロゲートはニューラルネットワークによって学習可能で、$mathbfg$ソルバよりも高速に計算でき、トレーニング中に密度が高く滑らかな勾配を提供し、目に見えない最適化問題に一般化でき、交互最適化によって効率的に学習される。
論文 参考訳(メタデータ) (2023-07-18T04:29:16Z) - Progressive-Hint Prompting Improves Reasoning in Large Language Models [63.98629132836499]
本稿では,プログレッシブ・ヒント・プロンプト(PHP)と呼ばれる新しいプロンプト手法を提案する。
事前に生成された回答をヒントとして使用することで、ユーザとLLM(Large Language Models)間の自動多元的対話を可能にする。
我々は7つのベンチマークで広範囲かつ包括的な実験を行った。その結果、PHPは高い効率を保ちながら精度を大幅に向上することが示された。
論文 参考訳(メタデータ) (2023-04-19T16:29:48Z) - Optimal Stochastic Non-smooth Non-convex Optimization through Online-to-Non-convex Conversion [46.46038357597395]
本稿では,新しい解析手法を用いて,未知の非平滑な目的を最適化するアルゴリズムを提案する。
決定論的二階スムーズな目的のために、先進的な楽観的なオンライン学習技術を適用することで、新しい$O(delta0.5)All$が最適または最もよく知られた結果の回復を可能にする。
論文 参考訳(メタデータ) (2023-02-07T22:09:20Z) - Bayesian Optimistic Optimisation with Exponentially Decaying Regret [58.02542541410322]
現在の実用的なBOアルゴリズムは、$mathcalO(fraclogNsqrtN)$から$mathcalO(e-sqrtN)$まで、$N$は評価の数である。
本稿では,boと木に基づく楽観的楽観化の概念を絡み合うことにより,無音環境における後悔を改善できる可能性について検討する。
次数$mathcal O(N-sqrt)で指数的再帰を達成できる最初の実践的手法であるBOOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-05-10T13:07:44Z) - Optimizing $\alpha\mu$ [7.715389335184684]
$alphamu$は、Perfect Information Monte Carlo searchのデフォルトである戦略融合と非局所性の2つを修復する検索アルゴリズムである。
本稿では、Bridgeのゲームに$alphamu$を最適化し、無駄な計算を避ける。
論文 参考訳(メタデータ) (2021-01-29T15:20:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。