論文の概要: Equitable System-Prompt Selection via Constrained Mixed-Strategy GroupDRO
- arxiv url: http://arxiv.org/abs/2608.04339v1
- Date: Wed, 05 Aug 2026 01:35:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.684506
- Title: Equitable System-Prompt Selection via Constrained Mixed-Strategy GroupDRO
- Title(参考訳): 制約付き混合戦略群DROによる等価システムプロンプト選択
- Authors: Mengyu Xu, Qiaoxin Yang, Zhihan Liu, Ruiyao Xu, Zachary Liu, Kezhen Chen, Chongyang Gao,
- Abstract要約: システムプロンプトはレスポンスの振る舞いを制御するために広く使われているが、通常は平均ケースの品質に最適化されている。
システムプロンプト選択のための制約付き混合戦略グループDROフレームワークを定式化する。
我々のフレームワークは、最悪の情報品質の損失を最小限に抑えるために、既存のプール内のシステムプロンプトに重みを割り当てる。
- 参考スコア(独自算出の注目度): 14.116598550478722
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models are increasingly used for information seeking, yet semantically equivalent questions phrased in different ways can receive answers of considerably different quality. System prompts are widely employed to steer response behavior, but they are typically optimized for average-case quality, so some question phrasings may still receive incomplete or low-quality answers. To address this, we formulate a constrained mixed-strategy GroupDRO framework for system-prompt selection. Instead of optimizing the system-prompt text, the framework assigns weights to system prompts in an existing pool to minimize the worst-case information-quality loss across evaluation metrics and groups, while constraining the mean loss to stay close to that of average-based selection. Because pool generation and selection are decoupled, the method applies to any system-prompt pool and can leverage an ensemble of complementary system prompts rather than a single one. Across five LLMs on two bilingual medical and consumer-finance benchmarks, the constrained method reduces the Overall Mean, Worst 25% Mean, and Worst by 13.1%, 13.2%, and 13.7% on average relative to no mitigation while keeping overall quality close to Average selection. Its multi-prompt weights reveal complementarity across metric-group pairs. Code and data are available at https://github.com/Rainxu09/equitable-system-prompt-selection.
- Abstract(参考訳): 大規模な言語モデルは情報探索にますます使われていますが、意味的に等価な質問は、かなり異なる品質の回答を受け取ることができます。
システムプロンプトは反応の振る舞いを制御するために広く使われているが、通常は平均ケースの品質に最適化されているため、いくつかの疑問は、まだ不完全あるいは低品質の回答を受け取る可能性がある。
これを解決するために、システムプロンプト選択のための制約付き混合戦略グループDROフレームワークを定式化する。
システムプロンプトのテキストを最適化する代わりに、フレームワークは既存のプール内のシステムプロンプトに重みを割り当て、評価指標やグループ間で最悪の情報品質の損失を最小限に抑えると同時に、平均的な選択に近づく平均損失を制限します。
プールの生成と選択は分離されるので、この方法はどんなシステム・プロンプト・プールにも適用でき、1つのシステム・プロンプトではなく、補完的なシステム・プロンプトのアンサンブルを利用することができる。
2つのバイリンガル・メディカル・コンシューマー・ファイナンス・ベンチマークの5つのLCMで、制限された手法により、全体的な平均値、最悪の25%平均値、最悪の平均値が13.1%、13.2%、13.7%削減され、平均的な品質は平均値に近く維持される。
その多重プロンプト重みは計量群対間の相補性を示す。
コードとデータはhttps://github.com/Rainxu09/equitable-system-prompt-selectionで公開されている。
関連論文リスト
- F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking [79.49893545611779]
大規模言語モデル(LLM)はサブセットを生成し、それを1つの自己回帰パス内で順序付けることができる。
この柔軟性は、新しい最適化課題をもたらす: モデルが出力空間を検索し、完全なランクリストが生成された後にのみユーティリティフィードバックを受けなければならない。
このクレジット割り当てギャップは、エンドツーエンドの最適化を不安定にし、サンプル非効率にする。
本稿では,単一自己回帰的ロールアウト内の両方を実行する統一フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-13T04:52:33Z) - MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization [66.81594613265833]
直接選好最適化(DPO)を拡張したPlackett--Luce(PL)モデルに基づくマルチ負の選好最適化
そこで本研究では,PL固有のフィッシャー情報目的を導出し,各プロンプト内のコンパクトで情報的な負の部分集合を選択するマルチ負のアクティブサンプル選択法であるMASS-DPOを紹介する。
MASS-DPOは、既存の手法を常に精度で上回り、リコール/NDCGとマージンベースの最適化のダイナミクスを改善し、かなり少ない負のアライメントを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:18:08Z) - $p1$: Better Prompt Optimization with Fewer Prompts [49.20082664169319]
システムプロンプト間の分散が大きくなるとプロンプト最適化が成功するが,システムプロンプト間の分散がシステムプロンプトの分散を支配するとフェールすることを示す。
本稿では,ユーザプロンプトのサブセットを選択するシンプルなユーザプロンプトフィルタリング手法である$p1$を提案する。
論文 参考訳(メタデータ) (2026-04-09T22:31:15Z) - Evaluation of Multi- and Single-objective Learning Algorithms for Imbalanced Data [0.0]
機械学習タスクは、単体ではなく、しばしば反対する一連の基準のためにうまく機能するモデルを見つけることを目的としている。
1つの解決策は、集合的学習基準を提案し、多目的学習課題を単一基準最適化問題に還元することである。
本稿では,単一解を返す手法を用いた多目的アルゴリズムに基づく,新しい信頼性の高いアルゴリズム評価手法を提案する。
論文 参考訳(メタデータ) (2025-11-15T12:54:17Z) - MUSS: Multilevel Subset Selection for Relevance and Diversity [4.8254343133177295]
レコメンデーションシステムでは、さまざまなレコメンデーションを提供しながら、関連する項目を選択することに興味がある。
本稿では,このタイプの問題を解析するための新しい理論的アプローチを提案し,その手法が最適目的の定数係数近似を実現することを示す。
論文 参考訳(メタデータ) (2025-03-14T06:37:17Z) - MICINet: Multi-Level Inter-Class Confusing Information Removal for Reliable Multimodal Classification [57.08108545219043]
また,Multi-Level Inter-Class Confusing Information removal Network (MICINet) と呼ばれるマルチモーダル分類手法を提案する。
MICINetは、これらのノイズをクラス間統合情報(textitICI)の概念に統合し、グローバルレベルと個人レベルのノイズを除去することで、信頼性の高いノイズ除去を実現している。
4つのデータセットの実験により、MICINetは様々なノイズ条件下で、他の最先端の信頼性の高いマルチモーダル分類方法よりも優れていることが示された。
論文 参考訳(メタデータ) (2025-02-27T01:33:28Z) - Adaptive-RAG: Learning to Adapt Retrieval-Augmented Large Language Models through Question Complexity [59.57065228857247]
Retrieval-augmented Large Language Models (LLMs) は、質問回答(QA)のようなタスクにおける応答精度を高めるための有望なアプローチとして登場した。
本稿では,クエリの複雑さに基づいて,LLMの最適戦略を動的に選択できる適応型QAフレームワークを提案する。
オープンドメインのQAデータセットを用いて、複数のクエリの複雑さを網羅し、QAシステムの全体的な効率性と精度を高めることを示す。
論文 参考訳(メタデータ) (2024-03-21T13:52:30Z) - Minimizing Age of Information for Mobile Edge Computing Systems: A
Nested Index Approach [11.998034941401814]
モバイルエッジ計算(MEC)は、情報更新性に敏感なリアルタイムアプリケーションを実現するための効率的なアプローチを提供する。
本稿では,MECシステム内の異種エッジサーバにタスクをオフロードする複数のユーザについて検討する。
我々のアルゴリズムは、ベンチマークと比較して最大40%の最適性ギャップの削減につながる。
論文 参考訳(メタデータ) (2023-07-03T21:47:21Z) - Optimal Clustering from Noisy Binary Feedback [75.17453757892152]
本稿では,二元的ユーザフィードバックから一組のアイテムをクラスタリングする問題について検討する。
最小クラスタ回復誤差率のアルゴリズムを考案する。
適応選択のために,情報理論的誤差下界の導出にインスパイアされたアルゴリズムを開発する。
論文 参考訳(メタデータ) (2019-10-14T09:18:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。