論文の概要: Keep Guessing? When Considering Inference Scaling, Mind the Baselines
- arxiv url: http://arxiv.org/abs/2410.15466v1
- Date: Sun, 20 Oct 2024 18:43:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2024-11-28 17:07:38.119492
- Title: Keep Guessing? When Considering Inference Scaling, Mind the Baselines
- Title(参考訳): ガイダンスを継続する? 推論のスケーリングを考えるとき、ベースラインを意識する
- Abstract要約: 大規模言語モデルにおける推論計算のスケーリングは、サンプルの数が増えるにつれて、常にカバレッジ(問題解決の限界)を増大させる。
我々は、この観察された改善は、標準評価ベンチマークの回答分布が比較的小さな共通回答の集合に傾いていることによるものであると推測する。
- 参考スコア(独自算出の注目度): 45.21178011740911
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Scaling inference compute in large language models (LLMs) through repeated sampling consistently increases the coverage (fraction of problems solved) as the number of samples increases. We conjecture that this observed improvement is partially due to the answer distribution of standard evaluation benchmarks, which is skewed towards a relatively small set of common answers. To test this conjecture, we define a baseline that enumerates answers according to their prevalence in the training set. Experiments spanning two domains -- mathematical reasoning and factual knowledge -- reveal that this baseline outperforms repeated model sampling for some LLMs, while the coverage for others is on par with that of a mixture strategy that obtains $k$ answers by using only $10$ model samples and similarly guessing the remaining $k-10$ attempts via enumeration. Our baseline enables a more accurate measurement of how much repeated sampling improves coverage in such settings beyond prompt-agnostic guessing.
- Abstract(参考訳): 大規模言語モデル (LLM) における反復サンプリングによる推論計算のスケーリングは、サンプルの数が増えるにつれて、常にカバー範囲(問題の分断)を増大させる。
我々は、この観察された改善は、標準評価ベンチマークの回答分布が比較的小さな共通回答の集合に傾いていることによるものであると推測する。
この予想をテストするために、トレーニングセットにおける回答の頻度に応じて答えを列挙するベースラインを定義する。
数学的推論と事実知識という2つの領域にまたがる実験は、このベースラインがいくつかのLSMの繰り返しモデルサンプリングよりも優れており、他の領域のカバレッジは、10ドルモデルサンプルのみを使用して、そして同様に、列挙による残りの$k-10$試行を推測する混合戦略と同等であることを示している。
本研究のベースラインは, 繰り返しサンプリングが, 即時予測以上の範囲で, どれだけの頻度でカバー範囲を向上するかを, より正確に測定することを可能にする。
関連論文リスト
- QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling [35.00824891749274]
推論計算のスケーリングは、問題毎に複数の並列試行を生成することで、言語モデル機能を改善するためのコストがかかるが信頼性の高いレバーである。
相関サンプルをi.d.サンプルのドロップイン置換として利用するQuialiMoTToを紹介する。
我々の実証分析は、QuasiMoTToがいかに効率的に計算を性能に変換できるかを理解することに重点を置いている。
論文 参考訳(メタデータ) (2026-07-01T17:10:08Z) - Mind the Unseen Mass: Unmasking LLM Hallucinations via Soft-Hybrid Alphabet Estimation [1.1230191950153754]
ブラックボックスアクセス下の大規模言語モデルの不確実性定量化について検討する。
効果的な意味的アルファベットサイズ - すなわち、サンプルされた応答で表される異なる意味の数 - を推定すると、下流のリスクに有用なプロキシを提供する。
そこで我々は,Good-Turingカバレッジと正規化ラプラシアンの熱カーネルトレースを組み合わせた簡易かつ解釈可能な推定器SHADEを提案する。
論文 参考訳(メタデータ) (2026-04-21T07:16:05Z) - Query Lower Bounds for Diffusion Sampling [5.541583428822629]
我々は、$d$次元の分布に精度でスコア推定へのアクセスを与えられる場合、サンプリングには$widetilde(sqrtd)$スコアクエリが必要であることを証明した。
我々の証明は、どのサンプルも$widetilde(sqrtd)$の異なるノイズレベルを探索しなければならないことを示し、実際なぜマルチスケールノイズスケジュールが必要なのかを正式な説明を提供する。
論文 参考訳(メタデータ) (2026-04-12T23:47:46Z) - Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models [78.68818219506313]
本稿では,複数解に対する分布推論を行うための多解補足学習手法について述べる。
質問応答, 診断, コーディングベンチマークを通じて, 単一回答学習ベースラインと比較して, 多様性, カバレッジ, 設定レベルの校正スコアが向上した。
論文 参考訳(メタデータ) (2026-03-25T22:20:25Z) - Almost Asymptotically Optimal Active Clustering Through Pairwise Observations [59.20614082241528]
そこで本研究では, ノイズと能動的に収集された応答を用いて, M$アイテムを未知数の$K$個別グループにクラスタリングするための新しい分析フレームワークを提案する。
クラスタリングの精度に対する望ましい信頼性を達成するのに必要なクエリ数の基本的下位境界を確立する。
我々は、一般化された同値比統計の計算可能な変種を開発し、その下限に対する性能ギャップを正確に推定できることを実証的に示す。
論文 参考訳(メタデータ) (2026-02-05T14:16:47Z) - Score-based sampling without diffusions: Guidance from a simple and modular scheme [0.0]
本稿では, (a) 端末分布, (b) それぞれが強対数凹凸(SLC)分布で定義される前方軌道を設計する方法を示す。
このモジュラーリダクションは,後方進路を横切るために,空想的なSLCサンプリングアルゴリズムを利用することができる。
高精度ルーチンを使用すると、KL または Wasserstein 距離において $varepsilon$-accurate の答えが得られる。
論文 参考訳(メタデータ) (2025-12-30T11:34:59Z) - Large Language Monkeys: Scaling Inference Compute with Repeated Sampling [81.34900892130929]
生成したサンプルの数を増やすことで、別の軸として推論計算を探索する。
すべての回答を自動的に検証できるコーディングや形式証明のようなドメインでは、カバレッジの増加は直接的にパフォーマンスの向上に変換される。
多くの世代から正しいサンプルを同定することは、自動検証のない領域における将来の研究にとって重要な方向である。
論文 参考訳(メタデータ) (2024-07-31T17:57:25Z) - Regression-aware Inference with LLMs [52.764328080398805]
提案手法は,一般的な回帰と評価指標に準最適であることを示す。
本稿では,ベイズ最適解を推定し,サンプル応答からクローズド形式の評価指標を推定する代替推論手法を提案する。
論文 参考訳(メタデータ) (2024-03-07T03:24:34Z) - An Efficient Rehearsal Scheme for Catastrophic Forgetting Mitigation during Multi-stage Fine-tuning [55.467047686093025]
このような忘れを緩和するための一般的なアプローチは、微調整中に以前のタスクからサンプルをリハーサルすることである。
側方損傷のリハーサルを優先するサンプリング手法である textttbf mix-cd を提案する。
我々の手法は計算効率が高く、実装が容易で、計算制約のある設定においていくつかの主要な連続学習手法より優れています。
論文 参考訳(メタデータ) (2024-02-12T22:32:12Z) - Collapsed Inference for Bayesian Deep Learning [36.1725075097107]
本稿では,崩壊サンプルを用いたベイズモデル平均化を行う新しい崩壊予測手法を提案する。
崩壊したサンプルは、近似後部から引き出された数え切れないほど多くのモデルを表す。
提案手法は, スケーラビリティと精度のバランスをとる。
論文 参考訳(メタデータ) (2023-06-16T08:34:42Z) - Saliency Grafting: Innocuous Attribution-Guided Mixup with Calibrated
Label Mixing [104.630875328668]
ミックスアップスキームは、強化されたトレーニングサンプルを作成するために、サンプルのペアを混ぜることを提案する。
両世界のベストを捉えた、斬新だがシンプルなミックスアップ版を提示する。
論文 参考訳(メタデータ) (2021-12-16T11:27:48Z) - Learning with Comparison Feedback: Online Estimation of Sample
Statistics [2.7158841992922875]
本研究では,無作為な雑音ではなく非確率的にフィードバックが生成される雑音二分探索問題のオンライン版について検討する。
我々は、整数の逆対数列の中央値の正確な推定を維持する。
論文 参考訳(メタデータ) (2021-01-11T20:28:32Z) - Optimal Off-Policy Evaluation from Multiple Logging Policies [77.62012545592233]
我々は,複数のロギングポリシからオフ政治評価を行い,それぞれが一定のサイズ,すなわち階層化サンプリングのデータセットを生成する。
複数ロガーのOPE推定器は,任意のインスタンス,すなわち効率のよいインスタンスに対して最小分散である。
論文 参考訳(メタデータ) (2020-10-21T13:43:48Z) - Multinomial Sampling for Hierarchical Change-Point Detection [0.0]
本稿では,検出率を向上し,遅延を低減する多項サンプリング手法を提案する。
実験の結果, 基準法よりも優れた結果が得られ, また, 人間の行動研究を指向した事例も提示した。
論文 参考訳(メタデータ) (2020-07-24T09:18:17Z) - Multi-label Contrastive Predictive Coding [125.03510235962095]
差分相互情報(MI)推定器は、コントラスト予測符号化(CPC)のような教師なし表現学習法で広く利用されている。
本稿では,複数の正のサンプルを同時に同定する必要がある多ラベル分類問題に基づく新しい推定器を提案する。
同一量の負のサンプルを用いて複数ラベルのCPCが$log m$boundを超えることができる一方で、相互情報の有意な下限であることを示す。
論文 参考訳(メタデータ) (2020-07-20T02:46:21Z) - Learning Entangled Single-Sample Distributions via Iterative Trimming [28.839136703139225]
そこで本研究では, 反復トリミング標本に基づいて, 簡便かつ効率的な手法を解析し, トリミング標本集合上のパラメータを再推定する。
対数反復法では, 誤差が$lceil alpha n rceil$-th ノイズ点の雑音レベルにのみ依存する推定値が出力されることを示す。
論文 参考訳(メタデータ) (2020-04-20T18:37:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。