論文の概要: Selective Ensemble Based on Preference-Directed Multi-Objective Bandits
- arxiv url: http://arxiv.org/abs/2606.21929v1
- Date: Sat, 20 Jun 2026 07:52:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 23:52:47.646883
- Title: Selective Ensemble Based on Preference-Directed Multi-Objective Bandits
- Title(参考訳): 優先指向多目的帯域に基づく選択アンサンブル
- Authors: Lanjihong Ma, Zhen-Yu Zhang, Masashi Sugiyama, Zhi-Hua Zhou,
- Abstract要約: 我々は、部分的に指定された線形選好の下で逐次決定問題を定式化する。
次に、嗜好指向の高信頼度境界(PrefUCB)アルゴリズムを提案する。
大規模な事前学習型モデル選択アンサンブルタスクと,機関委任下でのオンラインアセットアロケーションの実験により,本手法が検証された。
- 参考スコア(独自算出の注目度): 90.75513823660775
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Selective ensemble for modern machine learning systems requires choosing promising model candidates under limited evaluation budgets, while downstream tasks often specify only partial preferences over capabilities such as accuracy, robustness, and reasoning. This setting naturally gives rise to a sequential decision problem under partially specified linear preferences. We formalize it as preference-directed multi-objective bandits (PDMOB), where admissible trade-offs are represented by a polyhedral preference cone. Based on this formulation, we introduce Pareto $C$-optimality, which recovers standard Pareto optimality and single-weight scalarization as special cases. We then propose the preference-directed upper confidence bound (PrefUCB) algorithm, which maintains directional confidence intervals to guide exploration. We analyze both indicator-based and gap-weighted regret, and establish instance-dependent logarithmic bounds for both criteria, recovering the optimal logarithmic dependence on the horizon $T$ in classical special cases. Experiments on large pre-trained model selective ensemble tasks and online asset allocation under institutional mandates validate the efficacy of our method.
- Abstract(参考訳): 現代の機械学習システムの選択的なアンサンブルは、限られた評価予算の下で有望なモデル候補を選択する必要があるが、下流タスクは、正確性、堅牢性、推論などの能力よりも部分的な選好だけを規定することが多い。
この設定は自然に、部分的に指定された線形選好の下で連続的な決定問題を引き起こす。
選択指向多目的包帯 (PDMOB) として形式化し, 許容トレードオフを多面的選好コーンで表現する。
この定式化に基づいてPareto $C$-optimalityを導入する。
次に、探索を誘導する方向信頼区間を維持する優先指向上信頼境界(PrefUCB)アルゴリズムを提案する。
我々は指標ベースとギャップ重み付き後悔の両方を分析し、両基準のインスタンス依存対数境界を確立し、古典的特殊ケースでは水平線T$の最適対数依存性を回復する。
大規模な事前学習型モデル選択アンサンブルタスクと,機関委任下でのオンラインアセットアロケーションの実験により,本手法の有効性が検証された。
関連論文リスト
- Provably Efficient Personalized Multi-Objective Bandits with Proactive Conversational Queries [24.496126767935937]
ユーザクエリが構造化された嗜好信号を提供する,プロアクティブなクエリベースのフレームワークを形式化する。
提案手法は,事前の嗜好を意識したMO-MAB法よりも,提案手法により優先推定が促進され,後悔のスケーリングが向上することを証明する。
論文 参考訳(メタデータ) (2026-06-07T02:19:59Z) - Efficient Online Conformal Selection with Limited Feedback [14.326282143930769]
我々は、エージェントが最低限の選択肢のサブセットを選択して、少なくとも1つの成功が特定されるようにしなければならない共形選択の問題に対処する。
適応型コンフォーマル推論(ACI)更新ルールは、適切な制御パラメータや双対変数に適用された場合、逆向きに有効かつ効率的であることを示す。
論文 参考訳(メタデータ) (2026-05-14T15:22:46Z) - An Interactive Framework for Finding the Optimal Trade-off in Differential Privacy [20.038766371144526]
プライバシ保護分析の標準として差分プライバシー(DP)を導入し,プライバシ保証とモデル性能の基本的なトレードオフを導入する。
特に,ユーザに対して,仮説上のトレードオフ曲線を提示し,好みのトレードオフを選択するよう依頼する。
実世界の6つのデータセットにまたがる差分的ロジスティック回帰と深層移動学習実験により,本手法が最適プライバシー・正確性トレードオフに収束していることが判明した。
論文 参考訳(メタデータ) (2025-09-04T15:02:10Z) - Multi-Level Aware Preference Learning: Enhancing RLHF for Complex Multi-Instruction Tasks [81.44256822500257]
RLHFは、人工知能システムと人間の好みを結びつける主要なアプローチとして登場した。
RLHFは、複雑なマルチインストラクションタスクに直面すると、不十分なコンプライアンス機能を示す。
本稿では,マルチインストラクション能力を向上させる新しいMAPL(Multi-level Aware Preference Learning)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-19T08:33:11Z) - Calibrated Multi-Preference Optimization for Aligning Diffusion Models [90.15024547673785]
Calibrated Preference Optimization (CaPO) は、テキスト・ツー・イメージ(T2I)拡散モデルを調整する新しい手法である。
CaPOは、人間の注釈のない複数の報酬モデルからの一般的な好みを取り入れている。
実験結果から, CaPOは従来法よりも常に優れていたことが示唆された。
論文 参考訳(メタデータ) (2025-02-04T18:59:23Z) - Risk-Controlling Model Selection via Guided Bayesian Optimization [35.53469358591976]
他の競合するメトリクスに対して有用でありながら、特定のリスクに対するユーザ指定の制限に固執する構成を見つけます。
提案手法は,指定された関心領域に属する最適構成の集合を同定する。
提案手法は,低誤差率,等式予測,スプリアス相関処理,生成モデルにおける速度と歪みの管理,計算コストの削減など,複数のデシダラタを用いたタスクに対する有効性を示す。
論文 参考訳(メタデータ) (2023-12-04T07:29:44Z) - Likelihood Ratio Confidence Sets for Sequential Decision Making [51.66638486226482]
確率に基づく推論の原理を再検討し、確率比を用いて妥当な信頼シーケンスを構築することを提案する。
本手法は, 精度の高い問題に特に適している。
提案手法は,オンライン凸最適化への接続に光を当てることにより,推定器の最適シーケンスを確実に選択する方法を示す。
論文 参考訳(メタデータ) (2023-11-08T00:10:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。