論文の概要: Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA
- arxiv url: http://arxiv.org/abs/2607.26052v2
- Date: Sun, 02 Aug 2026 21:52:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:23.979373
- Title: Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA
- Title(参考訳): 専門家が不確実か:LORAの信頼性に適応したルーティング
- Abstract要約: CARE(Confidence-Adaptive Routing of Experts)を紹介します。
CAREは一致した計算における固定トップkのMoE-LoRAよりも改善され、固定k=4のベースラインと一致し、専門家のアクティベートは少ない。
同じ信頼と不一致の信号は、MSP、エントロピー、マルチパスプロキシに対する分布外検出も改善する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mixture-of-Experts (MoE) variants of Low-Rank Adaptation (LoRA) route every token to a fixed number of experts $k$. Tokens differ in how uncertain the model is about them, so a single k over-spends on easy tokens and under-serves hard ones. We observe that the router's output distribution is already a per-token uncertainty signal: peaked mass indicates confidence, while a flat distribution indicates ambiguity. We introduce CARE (Confidence-Adaptive Routing of Experts), which admits experts in a nucleus fashion. Experts are activated in decreasing router weight until their cumulative mass reaches a threshold, with a small extension when the admitted experts disagree. A budget thermostat calibrates the threshold so that the average number of active experts matches any target. CARE is a drop-in, single-forward-pass rule with no extra parameters. Across eight commonsense benchmarks on LLaMA-3.1-8B and Qwen2.5-7B, as well as math, code, and knowledge tasks, CARE improves over fixed top-k MoE-LoRA at matched compute and matches the fixed-k=4 baseline while activating fewer experts. The same confidence and disagreement signals also improve out-of-distribution detection over MSP, entropy, and multi-pass proxies. We support the design with nucleus fidelity, budget optimality, and an epistemic reading of disagreement, and we release code.
- Abstract(参考訳): Mixture-of-Experts (MoE) 変種である Low-Rank Adaptation (LoRA) は、すべてのトークンを一定数のエキスパートにルートする。
トークンはモデルがどの程度不確実であるかが異なるため、単一のkが簡単なトークンをオーバースペンドし、ハードトークンをアンダーサーブする。
我々は、ルータの出力分布が、既にトーケン1つの不確実性信号であり、ピーク質量は信頼を示すが、フラット分布はあいまいであることを示した。
CARE(Confidence-Adaptive Routing of Experts)を紹介します。
専門家は、累積質量がしきい値に達するまでルーター重量を減少させることで活性化される。
予算のサーモスタットは閾値を調整し、アクティブな専門家の平均数がどの目標とも一致するようにします。
CAREは、余分なパラメータを持たないドロップインのシングルフォワードパスルールである。
LLaMA-3.1-8BとQwen2.5-7Bの8つのコモンセンスベンチマークと数学、コード、知識タスクに加えて、CAREは一致した計算における固定トップkのMoE-LoRAよりも改善され、固定k=4のベースラインと一致し、より少ない専門家を活性化する。
同じ信頼と不一致の信号は、MSP、エントロピー、マルチパスプロキシに対する分布外検出も改善する。
我々は、核の忠実度、予算の最適性、不一致のエピステマティクス読解による設計をサポートし、コードをリリースする。
関連論文リスト
- RAPTOR: Role-Aware Private Training for Mixture-of-Experts [68.5626338219096]
RAPTORはRole-Aware Private Trainingフレームワークである。
RAPTORは共有と専門家の最適化を交互に行い、各障害を直接ターゲットする。
GLUEタスク間でのSwitch TransformerとOLMoEの微調整およびDeepSeek-VL2-Tinyの実験では、標準のDPベースラインよりも一貫した利得を示している。
論文 参考訳(メタデータ) (2026-09-04T23:16:12Z) - From Positionwise Confidence to Prefix Scheduling: Verifier Skipping in Speculative Decoding [41.41611499810411]
投機拡散復号(SDD)は、離散拡散モデルと並行してドラフトブロック内のすべての位置を生成する。
本稿では,これが新しい制御ハンドルを生成することを認識している。
論文 参考訳(メタデータ) (2026-08-14T18:00:08Z) - Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation [49.8459545291965]
Mixture-of-experts (MoE)モデルは、最近、一定数の完全なエキスパートをルーティングする以上の動きをしている。
我々は、この依存度を、わずかにリサイクルされたフィードフォワードの専門家をキーバリューチャネルに分解することで研究する。
トークン適応型MoE計算のための統一フレームワークであるUniF-MoEでインスタンス化する。
論文 参考訳(メタデータ) (2026-08-11T02:40:58Z) - Reward-Free Evolving Agents via Pairwise Validator [12.6053820984668]
自己進化型エージェントループは、エージェントの微調整されたバージョンを何度も提案する。
項目ごとの品質信号に基づいて変更を受理または拒否する。
本稿では,アクセプション/リジェクトゲートのスカラーをペアワイズ検証器で置き換えることを提案する。
論文 参考訳(メタデータ) (2026-07-15T22:50:32Z) - Best-Arm Identification with Generative Proxy [10.674965991983974]
固定信頼度ベストアーム識別法について検討し,各報酬の引き分けを,安価だが相関の取れたプロキシスコアと組み合わせて検討した。
本稿では,最小二乗法に適合する残差の上限値を維持する位相除去アルゴリズム PROBE を提案する。
我々は PROBE が$-PAC であり、一定の乗算係数と一定の加法キャリブレーションコストまで、既知の相関オラクルサンプルの複雑さが得られることを証明した。
論文 参考訳(メタデータ) (2026-07-08T00:41:43Z) - ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate [0.0]
言語モデル強化学習のためのトークンレベルの信用割当は通常、政策が完全に訓練可能であるかのように定式化される。
本稿では,アダプタ自体の隠れ状態残余からトークンサリエンスを導出する軽量な代替手段を提案する。
コンパクトMATH/Qwen3-1.7B GRPOスイープにおいて、ARCAは、一致したロールアウト予算の下で予測された非退化ミドルレジの信用分布を示す。
論文 参考訳(メタデータ) (2026-05-29T18:42:06Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models [52.61023005303122]
低信頼度再マッシングは、誘導配列分布のエントロピーを制約しながら、品質のプロキシを改善することを示す。
我々は,デコード時に,この分布をほぼ対象とする簡易なインディペンデント・ハスティングス・サンプリング器を開発した。
論文 参考訳(メタデータ) (2026-04-01T02:01:30Z) - Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B [1.948261185683419]
本研究では,「評価香り」がコンメンシュレート能力を得ることなく測定性能を膨らませるかどうかを考察する。
6つのペアのA/Bシナリオを実行し、タスク内容を保持し、フレーミングの異なる状態でデコードします。
再現可能なA/Bフレームワーク(バンキング、バリデータ、ラン毎のスコア、スクリプト)と実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2025-10-08T09:49:05Z) - Sample Smart, Not Hard: Correctness-First Decoding for Better Reasoning in LLMs [72.82403830490084]
我々は、復号規則は正確さによって校正されるべきであり、自信だけではならないと論じている。
Greedy-Threshold はこの目標を達成するための単純な戦略を提案します。
この結果から,不確実性の下での復号化が問題視され,数学や一般推論のベンチマークで有意な差がみられた。
論文 参考訳(メタデータ) (2025-10-07T14:46:12Z) - From Score Distributions to Balance: Plug-and-Play Mixture-of-Experts Routing [52.01745035243826]
Mixture-of-Experts (MoE)モデルは、各トークンを専門家のサブセットにルーティングすることで、パラメータキャパシティをスケールすることができる。
条件付きルーティングは、推論メモリの負荷をシフトし、デバイスごとに専門家の数を制限する。
本稿では,精度を保ちながら負荷のバランスをとるプラグイン・アンド・プレイ型推論時ルーティングアルゴリズムLASERを提案する。
論文 参考訳(メタデータ) (2025-09-29T16:29:17Z) - Continuous K-Max Bandits [54.21533414838677]
我々は、連続的な結果分布と弱い値-インデックスフィードバックを持つ、$K$-Maxのマルチアームバンディット問題について検討する。
この設定は、レコメンデーションシステム、分散コンピューティング、サーバスケジューリングなどにおいて重要なアプリケーションをキャプチャします。
我々の重要な貢献は、適応的な離散化とバイアス補正された信頼境界を組み合わせた計算効率の良いアルゴリズムDCK-UCBである。
論文 参考訳(メタデータ) (2025-02-19T06:37:37Z) - Patch-level Routing in Mixture-of-Experts is Provably Sample-efficient
for Convolutional Neural Networks [74.68583356645276]
ディープラーニングでは、Mixix-of-experts(MoE)が、サンプル単位またはトーケン単位で専門家(サブネットワーク)を活性化する。
我々は,pMoEが適切な一般化を実現するために,必要なトレーニングサンプル数を確実に削減できることを初めて示す。
論文 参考訳(メタデータ) (2023-06-07T00:16:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。