論文の概要: Efficient Sequential Evaluation of Large Language Models
- arxiv url: http://arxiv.org/abs/2607.17409v1
- Date: Sun, 19 Jul 2026 21:01:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.461156
- Title: Efficient Sequential Evaluation of Large Language Models
- Title(参考訳): 大規模言語モデルの効率的な逐次評価
- Abstract要約: 本研究では,過去のパフォーマンスデータを用いた固定質問セットに基づいて,新たな大規模言語モデル(LLM)を逐次評価する問題について検討する。
我々のゴールは,モデルの信頼性シーケンス(CS)を構築し,CS幅をできるだけ早く縮小するアクティブクエリルールを設計することである。
- 参考スコア(独自算出の注目度): 10.520659921457629
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We study the problem of sequentially evaluating a new large language model (LLM) on a fixed question set using historical performance data from prior LLMs. Our goal is to construct a confidence sequence (CS) for the model's capability on this question set and to design active querying rules that shrink the CS width as quickly as possible. For CS construction, we invert a family of test supermartingales and focus on two representative approaches: a reverse information projection (RIPr)-based approach and a testing-by-betting-based approach. We first study these approaches under an oracle setting, and demonstrate the oracle optimality of the RIPr-based construction. We then propose a growth-oriented querying rule that aims to maximize the worst-case one-step expected log-increment over the endpoints of the current CS. In practice, we build these test supermartingales and the querying rule on predictions of question-level correctness learned from historical data. We then analyze the shrinkage behavior of the resulting CSs and identify two key factors that slow the shrinkage rate of CSs: accumulated prediction mismatch and the spikiness of the querying distribution. Finally, motivated by this analysis, we propose several mixture querying rules that combine growth-oriented querying, prediction refinement, and uniform exploration, trying to mitigate the effects that slow the shrinkage rate. We provide experiments comparing different querying rules for the RIPr-based and testing-by-betting-based CSs across several synthetic testing datasets. Interestingly, we observe that the simplest querying rule, uniform sampling, can sometimes outperform more adaptive querying rules for both methods.
- Abstract(参考訳): 本研究では,従来のLLMの履歴性能データを用いて,新しい大規模言語モデル(LLM)を固定された質問セット上で逐次評価する問題について検討する。
我々のゴールは,モデルの信頼性シーケンス(CS)を構築し,CS幅をできるだけ早く縮小するアクティブクエリルールを設計することである。
CS構築では,テストスーパーマーチングのファミリーを逆転させ,リバース情報投影法(RIPr)とテストバイベッティング法という2つの代表的なアプローチに焦点をあてる。
まず、これらのアプローチをオラクル設定下で研究し、RIPrに基づく構築のオラクル最適性を実証する。
そこで我々は,現在のCSのエンドポイント上での,最悪の1ステップのログインクリメントを最大化することを目的とした,成長指向のクエリルールを提案する。
実際に,これらのテストスーパーマーチングラを構築し,過去のデータから得られた質問レベルの正確性を予測するためのクエリルールを構築した。
次に、得られたCSの収縮挙動を分析し、CSの収縮速度を遅くする2つの重要な要因を同定する。
最後に、この分析を動機として、成長指向のクエリリング、予測の洗練、一様探索を組み合わせた混合クエリルールを提案し、収縮速度を遅くする効果を緩和する。
我々は、RIPrベースの異なるクエリルールとベッティングベースのCSを、複数の総合的なテストデータセットで比較する実験を行った。
興味深いことに、最も単純なクエリ規則である一様サンプリングは、両方のメソッドに対してより適応的なクエリ規則よりも優れていることがある。
関連論文リスト
- Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization [20.259122922188126]
大規模言語モデル(LLM)は、入力要素の配列順序に影響される順序バイアスに悩まされる。
textbfDGAOはモデル精度と順序安定性を同時に向上することを目的としている。
論文 参考訳(メタデータ) (2026-05-12T11:31:18Z) - TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering [80.93487993878836]
現実世界のクエリの一般的なクラスは暗黙的に予測され、単に検索するのではなく、歴史的パターンから観測されていない回答を推測する必要がある。
これらのクエリには、潜在意図を認識することと、大規模テーブル上での信頼性の高い予測推論という2つの課題がある。
単点予測から意思決定,処理効果分析,複雑な推論に至るまで,4つのサブタスクにわたる779のサンプルからなるベンチマークであるTopBenchを紹介する。
論文 参考訳(メタデータ) (2026-04-30T16:22:51Z) - Retrieve-then-Adapt: Retrieval-Augmented Test-Time Adaptation for Sequential Recommendation [17.159956938670174]
逐次レコメンデーション(SR)モデルは、推論中にリアルタイムの選好シフトに適応するのに苦労することが多い。
提案するRetrieve-then-Adapt(ReAd)は,ユーザ嗜好信号を抽出して,SRモデルをテスト分布に動的に適用する新しいフレームワークである。
5つのベンチマークデータセットにわたる大規模な実験は、ReAdが既存のSRメソッドを一貫して上回っていることを示している。
論文 参考訳(メタデータ) (2026-04-07T03:24:56Z) - Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning [37.40951956513094]
大規模言語モデル(LLM)における推論は、しばしば、冗長な自己探索と検証を伴う非効率な長い連鎖トレースに悩まされる。
過去の事例を利用して検索空間を制約し、試行錯誤を減らすという人間の推論パターンに着想を得て、先行インフォームド推論(PIR)を提案する。
PIRは、LEMの推論パラダイムを、徹底的な自己探索から、前例からの指導的学習に転換する。
論文 参考訳(メタデータ) (2026-02-16T04:17:46Z) - Conformal Information Pursuit for Interactively Guiding Large Language Models [68.16703423481935]
本稿では,クエリ数の最小化を目的としたシーケンシャルクエリ戦略について検討する。
そのような戦略の1つは情報探索(IP)であり、各反復で情報ゲインを最大化または同等に不確実性を最小化するクエリを選択する。
本稿では,コンフォーマル情報探索法(C-IP)を提案する。
論文 参考訳(メタデータ) (2025-07-04T03:55:39Z) - Conformal Prediction Beyond the Seen: A Missing Mass Perspective for Uncertainty Quantification in Generative Models [20.810300785340072]
Conformal Prediction with Query Oracle (CPQ)は、これらの目的間の最適な相互作用を特徴付けるフレームワークである。
本アルゴリズムは2つの基本原理に基づいて構築されている。一方は最適なクエリポリシーを規定し、他方はクエリされたサンプルから予測セットへの最適マッピングを定義する。
論文 参考訳(メタデータ) (2025-06-05T18:26:14Z) - TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs [50.820065021136024]
DeepSeek R1には、大規模言語モデル(LLM)のためのかなり高度な複雑な推論がある。
最近の手法は、R1の推論能力をマルチモーダルな設定で再現しようと試みている。
視覚推論のための新しい強化学習アルゴリズムTACOを提案する。
論文 参考訳(メタデータ) (2025-05-27T06:30:48Z) - Chain-of-Retrieval Augmented Generation [91.02950964802454]
本稿では,o1-like RAGモデルを学習し,最終回答を生成する前に段階的に関連情報を抽出・推論する手法を提案する。
提案手法であるCoRAGは,進化状態に基づいて動的にクエリを再構成する。
論文 参考訳(メタデータ) (2025-01-24T09:12:52Z) - Progressive End-to-End Object Detection in Crowded Scenes [96.92416613336096]
以前のクエリベースの検出器は2つの欠点に悩まされていた: まず、複数の予測が1つのオブジェクトに対して推論される。
具体的には、まず受理されたクエリを選択して正の予測を生成し、その後、受理された予測に従って残雑音のあるクエリを精査する。
提案手法は,混み合ったシーンにおける問合せ型検出器の性能を大幅に向上させることができることを示す。
論文 参考訳(メタデータ) (2022-03-15T06:12:00Z) - Pre-training Is (Almost) All You Need: An Application to Commonsense
Reasoning [61.32992639292889]
事前学習されたトランスモデルの微調整は、一般的なNLPタスクを解決するための標準的なアプローチとなっている。
そこで本研究では,可視性ランキングタスクをフルテキスト形式でキャストする新たなスコアリング手法を提案する。
提案手法は, ランダム再起動にまたがって, より安定した学習段階を提供することを示す。
論文 参考訳(メタデータ) (2020-04-29T10:54:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。