論文の概要: Forecasting Downstream Performance of LLMs With Proxy Metrics
- arxiv url: http://arxiv.org/abs/2605.18607v1
- Date: Mon, 18 May 2026 16:17:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:50.01011
- Title: Forecasting Downstream Performance of LLMs With Proxy Metrics
- Title(参考訳): プロキシメトリックによるLLMの下流性能予測
- Abstract要約: 本稿では,トークンレベルの統計値(エントロピー,トップk精度,エキスパートトークンランクなど)を集約することで,プロキシメトリクスを構築することを提案する。
3つの設定で、我々のプロキシは損失ベースのベースラインと計算ベースのベースラインを一貫して上回ります。
- 参考スコア(独自算出の注目度): 37.61408486519996
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Progress in language model development is often driven by comparative decisions: which architecture to adopt, which pretraining corpus to use, or which training recipe to apply. Making these decisions well requires reliable performance forecasts, yet the two commonly used signals are fundamentally limited. Cross-entropy loss is poorly aligned with downstream capabilities, and direct downstream evaluation is expensive, sparse, and often uninformative at early training stages. Instead, we propose to construct proxy metrics by aggregating token-level statistics, such as entropy, top-k accuracy, and expert token rank, from a candidate model's next token distribution over expert-written solutions. Across three settings, our proxies consistently outperform loss- and compute-based baselines: 1) For cross-family model selection, they rank a heterogeneous population of reasoning models with mean Spearman Rho = 0.81 (vs. Rho = 0.36 for cross-entropy loss); 2) For pretraining data selection, they reliably rank 25 candidate corpora for a target model at roughly $10{,}000\times$ less compute than direct evaluation, pushing the Pareto frontier beyond existing methods; and 3) for training-time forecasting, they extrapolate downstream accuracy across an $18\times$ compute horizon with roughly half the error of existing alternatives. Together, these results suggest that expert trajectories are a broadly useful source of signal for assessing model capabilities, enabling reliable performance forecasting throughout the model development life cycle.
- Abstract(参考訳): 言語モデル開発の進展は、どのアーキテクチャを採用するか、どのコーパスを事前訓練するか、どのトレーニングレシピを適用するかという比較的な決定によって引き起こされることが多い。
これらの決定を適切に行うには、信頼性の高い性能予測が必要であるが、一般的に使用される2つの信号は基本的に制限されている。
クロスエントロピー損失は下流の能力と不一致であり、下流の直接評価は高価であり、疎外であり、初期の訓練段階では非形式的であることが多い。
代わりに、候補モデルの次のトークン分布から、エントロピー、トップk精度、エキスパートトークンランクなどのトークンレベルの統計情報を集約することで、プロキシメトリクスを構築することを提案する。
3つの設定で、我々のプロキシは損失ベースのベースラインと計算ベースのベースラインを一貫して上回ります。
1) クロスファミリーモデル選択においては、平均スピアマンRho = 0.81 (vs. Rho = 0.36, クロスエントロピー損失) の推論モデルの異種集団をランク付けする。
2)データ選択の事前訓練には,対象モデルに対する25の候補コーパスを,直接評価よりも少ない計算で確実にランク付けし,Paretoフロンティアを既存のメソッドを超えて押し付ける。
3) トレーニング時間予測では、既存の代替案の約半分のエラーで、18\times$計算地平線を越えて下流の精度を推定する。
これらの結果から,専門家の軌跡は,モデル開発ライフサイクルを通じて信頼性の高い性能予測を可能にするため,モデル能力評価に有用な信号源であることが示唆された。
関連論文リスト
- Rethinking One-Shot Federated Graph Learning: Training-Free Statistical Estimation [12.66442044096499]
ワンショットフェデレーショングラフ学習は一般的に、単一の通信ラウンドで非接続のサブグラフを持つクライアント間でグラフニューラルネットワーク(GNN)をトレーニングすることを目的としている。
極度の非IID条件下では、局所的なGNN訓練は、厳しい横断的表現の不一致に悩まされる。
本研究では,局所グラフからトポロジー平滑なクラスプロトタイプを直接計算する学習自由フレームワークSPEARを提案する。
論文 参考訳(メタデータ) (2026-09-05T15:55:22Z) - RIDE: An Open Dataset and Benchmark for Train Delay Prediction [1.7793982512455193]
RIDEは、ベルギーの鉄道網上に全国規模で構築された列車遅延予測のためのオープンデータセットとベンチマークである。
94.5万の列車イベント、3.6万回の旅行、2023年から2025年までの35.7万回の気象記録をカバーしている。
生の鉄道と気象源から、再利用可能な中間関係データセットとモデル対応ベンチマークデータセットの2つのパブリックリリースまでの、階層化されたデータパイプラインとして組織されている。
論文 参考訳(メタデータ) (2026-06-03T16:29:50Z) - How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines [21.57090069950487]
トラジェクトリに基づくデータ帰属法は、トレーニングの軌跡をアンロールすることで、モデル予測に対するトレーニングサンプルの影響を推定する。
これらの手法の包括的なエラー解析が欠如しており、メソッドの忠実性に対する懸念を高め、信頼性の高いデプロイメントを妨げる。
本稿では,トラジェクトリに基づくデータ属性における誤り源の体系的解析と,これらを緩和するための具体的対策,および下流利用のための実践的ガイドラインについて述べる。
論文 参考訳(メタデータ) (2026-05-12T09:50:45Z) - Prescriptive Scaling Reveals the Evolution of Language Model Capabilities [22.14002750185524]
我々は、ログ事前学習FLOPの関数として、機能境界、ベンチマークスコアの高条件量子化を推定する。
我々は、初期のモデル世代に適合し、後のリリースを評価することで、時間的信頼性を検証する。
本稿では,評価予算の約20%を用いて,全データフロンティア付近を復元する効率的なアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-02-17T03:13:51Z) - Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training [11.179110411255708]
トレーニング予算からベンチマークパフォーマンスのスケーリングをモデル化するための直接的なフレームワークを提案する。
その結果, 直接的アプローチは従来提案していた2段階の手順よりも優れていることがわかった。
事前学習損失と下流評価結果の完全なセットを公表する。
論文 参考訳(メタデータ) (2025-12-09T18:33:48Z) - Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training [68.94373533768501]
我々は、知識保持をモデル化し、そのコーパスから事実情報を記憶するための事前学習言語モデルの能力を示し、学習前にそれを推定する原則的手法を導入する。
本稿では,知識周波数,知識特異度,モデルサイズを統合し,クローズドブック質問応答(QA)の精度を予測する情報理論予測器である,サイズ依存型相互情報(SMI)を提案する。
論文 参考訳(メタデータ) (2025-02-06T13:23:53Z) - Rejection via Learning Density Ratios [50.91522897152437]
拒絶による分類は、モデルを予測しないことを許容する学習パラダイムとして現れます。
そこで我々は,事前学習したモデルの性能を最大化する理想的なデータ分布を求める。
私たちのフレームワークは、クリーンでノイズの多いデータセットで実証的にテストされます。
論文 参考訳(メタデータ) (2024-05-29T01:32:17Z) - DE$^3$-BERT: Distance-Enhanced Early Exiting for BERT based on
Prototypical Networks [43.967626080432275]
BERT(DE$3$-BERT)のための新しい遠隔拡張早期実行フレームワークを提案する。
我々は,古典的エントロピーに基づく地域情報と距離に基づくグローバル情報とを補完するハイブリッドエグジット戦略を実装した。
GLUEベンチマークの実験では、De$3$-BERTが最先端モデルより一貫して優れていることが示されている。
論文 参考訳(メタデータ) (2024-02-03T15:51:17Z) - Towards Motion Forecasting with Real-World Perception Inputs: Are
End-to-End Approaches Competitive? [93.10694819127608]
実世界の知覚入力を用いた予測手法の統一評価パイプラインを提案する。
我々の詳細な調査では、キュレートされたデータから知覚ベースのデータへ移行する際の大きなパフォーマンスギャップが明らかになりました。
論文 参考訳(メタデータ) (2023-06-15T17:03:14Z) - How to Estimate Model Transferability of Pre-Trained Speech Models? [84.11085139766108]
事前学習音声モデルの伝達可能性推定のためのスコアベースアセスメントフレームワーク
ベイズ確率推定と最適輸送という2つの表現理論を利用して、PSM候補のランクスコアを生成する。
本フレームワークは,候補モデルやレイヤを実際に微調整することなく,転送可能性スコアを効率的に計算する。
論文 参考訳(メタデータ) (2023-06-01T04:52:26Z) - Learning Sample Difficulty from Pre-trained Models for Reliable
Prediction [55.77136037458667]
本稿では,大規模事前学習モデルを用いて,サンプル難易度を考慮したエントロピー正規化による下流モデルトレーニングを指導する。
我々は、挑戦的なベンチマークで精度と不確実性の校正を同時に改善する。
論文 参考訳(メタデータ) (2023-04-20T07:29:23Z) - Surrogate uncertainty estimation for your time series forecasting black-box: learn when to trust [2.0393477576774752]
本研究では不確実性推定手法を紹介する。
妥当な不確実性推定を伴うベース回帰モデルを強化する。
各種時系列予測データを用いて, 代理モデルに基づく手法により, 精度の高い信頼区間が得られることがわかった。
論文 参考訳(メタデータ) (2023-02-06T14:52:56Z) - Leveraging Unlabeled Data to Predict Out-of-Distribution Performance [63.740181251997306]
実世界の機械学習デプロイメントは、ソース(トレーニング)とターゲット(テスト)ディストリビューションのミスマッチによって特徴づけられる。
本研究では,ラベル付きソースデータとラベルなしターゲットデータのみを用いて,対象領域の精度を予測する手法を検討する。
本稿では,モデルの信頼度をしきい値として学習し,精度をラベルなし例のごく一部として予測する実践的手法である平均閾値保持信頼度(ATC)を提案する。
論文 参考訳(メタデータ) (2022-01-11T23:01:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。