論文の概要: When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking
- arxiv url: http://arxiv.org/abs/2606.31087v2
- Date: Wed, 01 Jul 2026 11:41:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.077996
- Title: When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking
- Title(参考訳): 転位時:不確実性に基づく下級転位
- Abstract要約: 通常、検索した例を再列挙するとパフォーマンスが向上すると仮定するショットは少ない。
本稿では,モデルの不確実性に基づいて,いくつかの例を再現するかどうかを判断するemphTraining-Free Gated Re rankを提案する。
- 参考スコア(独自算出の注目度): 14.842969694664914
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Few-shot selection typically assumes that reranking retrieved examples always improves performance. We challenge this view by identifying that the expensive reranking step can in fact degrade performance. Instead, we propose \emph{Training-Free Gated Reranking}, which decides whether to rerank the few-shot examples based on the model's uncertainty. Extensive experiments across 8 LLMs, covering 7 NLU datasets and 9 MT domain-language combinations, demonstrate that our approach reduces computational costs by 15\%-80\% while improving average performance by up to 2\%. These findings indicate that higher computational cost does not guarantee better performance, and that reranking is most beneficial when targeted at high-uncertainty instances.
- Abstract(参考訳): 通常、検索した例を再列挙するとパフォーマンスが向上すると仮定するショットは少ない。
我々は、高価なリグレードステップが実際にパフォーマンスを低下させる可能性があると認識することで、この見方に挑戦する。
代わりに、モデルの不確実性に基づいて、少数ショット例をリランクするかを判断する「emph{Training-Free Gated Re rank}」を提案する。
7つのNLUデータセットと9つのドメイン言語の組み合わせを網羅した大規模実験により,提案手法は計算コストを15 %~80 %削減し,平均性能を最大2 %向上させることを示した。
これらの結果から,高い計算コストで性能が向上せず,不確実性の高いインスタンスを対象とする場合,再ランク付けが最も有用であることが示唆された。
関連論文リスト
- Efficient Data Selection for Multimodal Models via Incremental Optimization Utility [6.698411108146732]
本稿では,データ選択をインクリメンタルな最適化ユーティリティランキング問題として再定義するフレームワークであるOne-Step-Train(OST)を提案する。
トップ50サブセットを選択することで、OSTはトレーニングコストを43%削減し(トータルタイム消費は17)、強力なLCM-as-a-Judgeベースラインを1.8ポイント上回る。
論文 参考訳(メタデータ) (2026-05-08T09:28:26Z) - ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation [17.57025670370604]
ProEvalは、転送学習を利用して効率よくパフォーマンスを推定し、障害ケースを識別する、積極的な評価フレームワークである。
真理の1%以内の見積もりを達成するには8~65倍のサンプルが必要ですが、同時により多様な障害ケースを明らかにします。
論文 参考訳(メタデータ) (2026-04-25T01:33:57Z) - ODAR: Principled Adaptive Routing for LLM Reasoning via Active Inference [60.958331943869126]
ODAR-Expertは、原則化されたリソース割り当てによる精度と効率のトレードオフを最適化する適応的なルーティングフレームワークである。
我々は、MATHの98.2%の精度、HumanityのLast Examの54.8%を含む、強く一貫した利得を示している。
論文 参考訳(メタデータ) (2026-02-27T05:22:01Z) - Rethinking LLM Evaluation: Can We Evaluate LLMs with 200x Less Data? [82.09573568241724]
EssenceBenchは反復遺伝的アルゴリズム(GA)を利用した粗粒度フレームワーク
提案手法は, 再構成誤差が低く, 効率が著しく向上した, 優れた圧縮結果が得られる。
HellaSwagベンチマーク(10Kサンプル)では,25倍少ないサンプルを用いて,全モデルが5%以内の順位を保ち,わずか200倍少ないサンプルを用いて,95%未満のランキング保持シフトを達成している。
論文 参考訳(メタデータ) (2025-10-12T05:38:10Z) - OneRec-V2 Technical Report [93.91714323473678]
OneRecは、自己回帰生成タスクとしてレコメンデーションを再構築し、高いモデルFLOPの利用を達成する。
Lazy Decoder-Only Architecture: エンコーダボトルネックを排除し、全体の計算を94%削減し、トレーニングリソースを90%削減する。
現実のユーザインタラクションによる優先度調整: ユーザの好みに合うように、継続意識のリワードシェイピングとアダプティブ比クリッピングを組み込む。
論文 参考訳(メタデータ) (2025-08-28T15:29:51Z) - COSMOS: Predictable and Cost-Effective Adaptation of LLMs [21.91455944905485]
大規模言語モデル(LLM)は、多種多様な適応戦略を用いることで、多くのタスクにわたって顕著なパフォーマンスを達成する。
最小限のコストで適応結果を効率的に推定する統合予測フレームワークであるCOSMOSを紹介する。
論文 参考訳(メタデータ) (2025-04-30T02:06:26Z) - Return Capping: Sample-Efficient CVaR Policy Gradient Optimisation [16.74312997149021]
本稿では,学習に用いた軌道のトータルリターンをカプセル化することにより,最適化問題の修正を提案する。
キャップが適切に設定された場合、これは元の問題と等価であることを示す。
論文 参考訳(メタデータ) (2025-04-29T16:04:16Z) - Is Best-of-N the Best of Them? Coverage, Scaling, and Optimality in Inference-Time Alignment [54.787826863212146]
推論時間計算は、言語モデルのパフォーマンスをスケールするための強力な軸を提供する。
我々は, (i) 応答品質, (ii) 計算量の観点から, 推論時アライメントアルゴリズムの性能を解析する。
我々は$textttInferenceTimePessimism$を紹介した。これは推論時間計算の故意使用を通じて報酬ハッキングを緩和する新しいアルゴリズムである。
論文 参考訳(メタデータ) (2025-03-27T18:00:08Z) - An Early FIRST Reproduction and Improvements to Single-Token Decoding for Fast Listwise Reranking [50.81324768683995]
FIRSTは、学習からランクへの目的を統合し、最初の生成されたトークンのみのロジットを活用する新しいアプローチである。
我々は、FIRSTの評価をTRECディープラーニングデータセット(DL19-22)に拡張し、様々な領域でその堅牢性を検証する。
我々の実験は、単一トークンの高速リランクは、ドメイン外リランクの品質を損なうものではないことを確認した。
論文 参考訳(メタデータ) (2024-11-08T12:08:17Z) - Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation [46.61909578101735]
AdvPO(Adversarial Policy Optimization)は、人間からの強化学習における報酬過度最適化の問題に対する新しい解決策である。
本稿では,報酬モデルの最後の層埋め込みにのみ依存して,報酬の不確実性を定量化する軽量な手法を提案する。
論文 参考訳(メタデータ) (2024-03-08T09:20:12Z) - Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in
Self-Refined Open-Source Models [53.859446823312126]
SoTAは7Bから65Bまでのさまざまなサイズのオープンソースモデルを平均して、ベースラインのパフォーマンスから8.2%改善している。
厳密に言えば、Vicuna-7Bのような非常に小さなメモリフットプリントを持つモデルでさえ、全体的な11.74%の改善と、高い創造性、オープンエンドタスクの25.39%の改善を示している。
論文 参考訳(メタデータ) (2023-10-11T15:56:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。