論文の概要: Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing
- arxiv url: http://arxiv.org/abs/2607.09015v1
- Date: Fri, 10 Jul 2026 00:42:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.761251
- Title: Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing
- Title(参考訳): LLMルーティングにおける文脈帯域とサロゲートリワードの関係
- Abstract要約: 本研究では,機械学習モデルを用いて,相関アームによるコンテキスト的帯域幅問題と,サロゲート報酬信号へのアクセスについて検討する。
本稿では,2つの相補的な設計により,そのような代償を生かしたアルゴリズムを提案する。
- 参考スコア(独自算出の注目度): 15.152913607564876
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study contextual bandit problems with correlated arms and access to surrogate reward signals produced by a machine learning model, motivated by applications such as large language model (LLM) routing. Unlike classical contextual bandits that rely solely on bandit feedback and assume conditional independence across arms, our setting allows context-dependent inter-arm correlations and auxiliary reward information that may be noisy or misspecified. We propose algorithms that leverage such surrogate rewards through two complementary designs. A coupled reward-mixing approach pools true and surrogate rewards to accelerate learning when surrogate signals are reliable, while a decoupled prediction-mixing approach maintains separate estimators for bandit feedback and surrogate rewards and adaptively combines their predictions. This decoupling yields robustness to surrogate misspecification, recovering regret guarantees comparable to reward-only bandit methods in the worst case, while achieving improved regret when surrogate predictions are sufficiently informative. We provide theoretical regret analyses for both approaches and evaluate them on LLM routing benchmarks under varying accuracy versus cost trade-offs. The results demonstrate improved sample efficiency and consistently better accuracy-cost trade-offs compared to standard contextual bandit baselines and strong static routing methods.
- Abstract(参考訳): 本研究では,大規模言語モデル(LLM)ルーティングなどの応用を動機とした,相関アームによるコンテキスト的帯域幅問題と,機械学習モデルによって生成されたサロゲート報酬信号へのアクセスについて検討する。
古典的な文脈的盗賊は、盗賊のフィードバックにのみ依存し、武器間での条件的独立を前提としており、我々の設定では、ノイズや不特定の可能性のある、文脈依存の武器間相関と補助的な報酬情報を可能にしている。
本稿では,2つの相補的な設計により,そのような代償を生かしたアルゴリズムを提案する。
結合された報酬混合アプローチは、信号のサロゲートが信頼できる場合の学習を促進するために、真とサロゲートの報酬をプールし、一方、分離された予測混合アプローチは、ビジットフィードバックのための別々の推定器を維持し、サロゲートの報酬をアダプティブに組み合わせる。
このデカップリングは、誤特定を補うための堅牢性をもたらし、最悪の場合、報酬のみのバンディット法に匹敵する後悔の保証を回復すると同時に、代理予測が十分有益である場合に後悔の改善を達成する。
両手法の理論的後悔解析を行い,LLMルーティングベンチマークにおいて,コストトレードオフに対して異なる精度で評価する。
その結果、標準のコンテキスト帯域ベースラインや強い静的ルーティング手法と比較して、サンプル効率の向上と、精度とコストのトレードオフの整合性の向上が示された。
関連論文リスト
- Progressive Content Refinement with Decaying Reward Joint LinUCB [2.1290878226779877]
本稿では,報酬減衰モデリングを明示的に組み込んだ新しい文脈帯域幅アルゴリズムを提案する。
提案手法は,強いベースラインよりも高い性能向上を達成できることを示す。
以上の結果から,バンディット・フレームワークにおける報酬崩壊モデルの統合が過剰な露光を緩和するために重要であることが確認された。
論文 参考訳(メタデータ) (2026-08-07T03:17:22Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge [4.511996087821266]
Reasoning-capable large language model (LLM) は、最近自動判断器として採用されている。
本研究では,明示的推論により,構造化された検証を必要とするタスクの判断精度が大幅に向上することを示す。
本稿では、推論と非推論の判断を選択可能なロバスト適応コスト効率ルーティング(RACER)を提案する。
論文 参考訳(メタデータ) (2026-05-11T16:30:20Z) - Beyond Static Bias: Adaptive Multi-Fidelity Bandits with Improving Proxies [16.078266766067838]
MF-MAB(Multi-fidelity Multiarmed bandits)は、様々なフィードバックソースを用いて、コストと精度の両方で個々の腕を評価することができる。
適応的なMF-MABをプロキシソースの改善とともに検討し、低忠実度ソースが繰り返し使用することでより情報的になる正準二忠実度ケースに焦点をあてる。
本稿では,低忠実度サンプリングの費用対効果とエスカレーションのタイミングを決定するために,境界付き継続規則を用いた楽観的アルゴリズムであるThreshold-Based Adaptive Continuation Companion (TACC)を提案する。
論文 参考訳(メタデータ) (2026-05-08T23:36:53Z) - Best Arm Identification in Generalized Linear Bandits via Hybrid Feedback [23.37199172197756]
一般化線形包帯における固定信頼度最適腕同定をハイブリッドフィードバックモデルにより検討した。
不均一な一般化線形観測を統一する確率比に基づく信頼シーケンスを導入する。
アームとペアの共同動作空間上での最小最適設計を追跡することで,クエリを適応的に割り当てるハイブリッドトラック・アンド・ストップアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-05-07T06:40:42Z) - Semi-Parametric Batched Global Multi-Armed Bandits with Covariates [0.48342038441006807]
マルチアームバンディット(MAB)フレームワークは、シーケンシャルな意思決定に広く使われているアプローチである。
本稿では,コパラメトリックと腕間の共有パラメータを持つバッチバンドの半パラメトリックフレームワークを提案する。
Batched Single-Index Dynamic binning and Successive arm elimination (BIDS) というアルゴリズムでは、バッチ化された逐次アームの除去戦略を採用している。
論文 参考訳(メタデータ) (2025-03-01T17:23:55Z) - Jailbreaking as a Reward Misspecification Problem [80.52431374743998]
本稿では,この脆弱性をアライメントプロセス中に不特定性に対処する新たな視点を提案する。
本稿では,報酬の相違の程度を定量化し,その有効性を実証する指標ReGapを紹介する。
ReMissは、報酬ミスの空間で敵のプロンプトを生成する自動レッドチームリングシステムである。
論文 参考訳(メタデータ) (2024-06-20T15:12:27Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Robust Lottery Tickets for Pre-trained Language Models [57.14316619360376]
本稿では,従来の言語モデルに隠されたロバストなチケットを識別するために,二分重マスクの学習に基づく新しい手法を提案する。
実験結果から, 従来の対向ロバスト性評価法に比べて, 提案手法の大幅な改善が示された。
論文 参考訳(メタデータ) (2022-11-06T02:59:27Z) - Bias-Robust Bayesian Optimization via Dueling Bandit [57.82422045437126]
ベイジアン最適化は、観測が逆偏りとなるような環境において考慮する。
情報指向サンプリング(IDS)に基づくダリングバンディットの新しい手法を提案する。
これにより、累積的後悔保証を伴う帯域幅の並列化のための、最初の効率的なカーネル化アルゴリズムが得られる。
論文 参考訳(メタデータ) (2021-05-25T10:08:41Z) - Output-Weighted Sampling for Multi-Armed Bandits with Extreme Payoffs [11.1546439770774]
極度のペイオフを伴うバンディット問題におけるオンライン意思決定のための新しいタイプの獲得機能を提示する。
我々は,最も関連性が高いと考えられる盗賊を探索する新しいタイプの上位信頼境界(UCB)取得関数を定式化する。
論文 参考訳(メタデータ) (2021-02-19T18:36:03Z) - Robustness Guarantees for Mode Estimation with an Application to Bandits [131.21717367564963]
平均ではなく報酬分布のモードを値とするマルチアームバンディットの理論を導入する。
我々は,我々のアルゴリズムが逆雑音列による腕の摂動に頑健であることを示すシミュレーションで示す。
論文 参考訳(メタデータ) (2020-03-05T21:29:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。