論文の概要: What properties of reasoning supervision are associated with improved downstream model quality?
- arxiv url: http://arxiv.org/abs/2605.13290v1
- Date: Wed, 13 May 2026 10:04:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-14 23:30:27.969533
- Title: What properties of reasoning supervision are associated with improved downstream model quality?
- Title(参考訳): 下流モデルの品質改善に伴う推論監督の特性について
- Authors: Mikołaj Langner, Dzmitry Pihulski, Jan Eliasz, Michał Rajkowski, Przemysław Kazienko, Maciej Piasecki, Jan Kocoń, Teddy Ferdinan,
- Abstract要約: ポーランドの推論データセットを意味的に異なる変種に基づいて8B,11Bモデルを微調整し,その予測力を評価・評価する。
解析の結果,これらの内在的指標は,下流モデルの性能と強い有意な相関を示すことが明らかとなった。
- 参考スコア(独自算出の注目度): 3.5354214473997225
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Validating training data for reasoning models typically requires expensive trial-and-error fine-tuning cycles. In this work, we investigate whether the utility of a reasoning dataset can be reliably predicted prior to training using intrinsic data metrics. We propose a suite of quantitative measures and evaluate their predictive power by fine-tuning 8B and 11B models on semantically distinct variants of a Polish reasoning dataset. Our analysis reveals that these intrinsic metrics demonstrate strong and significant correlations with downstream model performance. Crucially, we find that the predictors of utility are scale-dependent: smaller models rely on alignment-focused metrics to ensure precision, whereas larger models benefit from high redundancy, utilizing verbose traces to solve complex tasks. These findings establish a scale-aware framework for validating reasoning data, enabling practitioners to select effective training sets without the need for exhaustive empirical testing.
- Abstract(参考訳): 推論モデルのトレーニングデータを検証するには、通常、高価な試行錯誤の微調整サイクルが必要となる。
本研究では,本研究において,本質的なデータメトリクスを用いたトレーニングに先立って,推論データセットの有用性を確実に予測できるかどうかを検討する。
ポーランドの推論データセットを意味的に異なる変種に基づいて8B,11Bモデルを微調整し,その予測力を評価・評価する。
解析の結果,これらの内在的指標は,下流モデルの性能と強い有意な相関を示すことが明らかとなった。
より小さなモデルは、精度を確保するためにアライメントにフォーカスしたメトリクスに依存しますが、大きなモデルは、複雑なタスクを解決するために冗長トレースを利用することで、高い冗長性から恩恵を受けています。
これらの知見は,実践者が経験的試験を必要とせずに効果的なトレーニングセットを選択できるように,推論データの検証のためのスケールアウェアフレームワークを確立した。
関連論文リスト
- STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction [78.0692157478247]
本稿では,知識駆動型エージェント推論を用いて,データ駆動型静的予測を橋渡しするフレームワークSTARを提案する。
STARはスコアベースとランクベースの両方の基準線を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-12T16:30:07Z) - Revisiting the Scaling Properties of Downstream Metrics in Large Language Model Training [11.179110411255708]
トレーニング予算からベンチマークパフォーマンスのスケーリングをモデル化するための直接的なフレームワークを提案する。
その結果, 直接的アプローチは従来提案していた2段階の手順よりも優れていることがわかった。
事前学習損失と下流評価結果の完全なセットを公表する。
論文 参考訳(メタデータ) (2025-12-09T18:33:48Z) - Prior Distribution and Model Confidence [0.0]
本稿では、再学習を必要とせずに、未知のデータに対するモデル予測の信頼性を理解するための枠組みを提案する。
本手法は,埋め込み空間におけるトレーニング分布からの距離に基づいて,低信頼度予測をフィルタリングする。
提案手法はモデルに依存しない一般化可能であり,コンピュータビジョン以外の応用の可能性がある。
論文 参考訳(メタデータ) (2025-09-05T20:17:26Z) - Analysis of Transferability Estimation Metrics for Surgical Phase Recognition [3.3285108719932555]
微調整された事前学習モデルは現代の機械学習の基盤となり、限られたラベル付きデータで実践者がハイパフォーマンスを達成できるようになった。
専門的アノテーションが特に時間がかかり費用がかかる外科的ビデオ解析では、下流タスクに最適な事前学習モデルを特定することが重要かつ困難である。
我々は,2つの多様なデータセット上で,LogME,H-Score,TransRateの3つの代表的な指標の総合ベンチマークを行った。
論文 参考訳(メタデータ) (2025-08-22T18:05:33Z) - SPaRFT: Self-Paced Reinforcement Fine-Tuning for Large Language Models [51.74498855100541]
大規模言語モデル(LLM)は、強化学習(RL)による微調整時に強い推論能力を示す。
トレーニング対象のモデルの性能に基づいて,効率的な学習を可能にする自己評価学習フレームワークである textbfSPaRFT を提案する。
論文 参考訳(メタデータ) (2025-08-07T03:50:48Z) - Optimizing Sequential Recommendation Models with Scaling Laws and Approximate Entropy [104.48511402784763]
SRモデルの性能法則は,モデルの性能とデータ品質の関係を理論的に調査し,モデル化することを目的としている。
データ品質を評価するために、従来のデータ量メトリクスと比較して、より曖昧なアプローチを示すために、近似エントロピー(ApEn)を提案する。
論文 参考訳(メタデータ) (2024-11-30T10:56:30Z) - Think Twice: Measuring the Efficiency of Eliminating Prediction
Shortcuts of Question Answering Models [3.9052860539161918]
そこで本研究では,任意の特徴量に対するモデルのスケール依存度を簡易に測定する手法を提案する。
質問回答(QA: Question Answering)における各種事前学習モデルとデバイアス法について、既知の予測バイアスと新たに発見された予測バイアスの集合に対するロバスト性を評価する。
既存のデバイアス法は、選択された刺激的特徴への依存を軽減することができるが、これらの手法のOOD性能向上は、偏りのある特徴への依存を緩和することによって説明できない。
論文 参考訳(メタデータ) (2023-05-11T14:35:00Z) - Exploring validation metrics for offline model-based optimisation with
diffusion models [50.404829846182764]
モデルベース最適化(MBO)では、マシンラーニングを使用して、(基底真理)オラクルと呼ばれるブラックボックス関数に対する報酬の尺度を最大化する候補を設計することに興味があります。
モデル検証中に基底オラクルに対する近似をトレーニングし、その代わりに使用することができるが、その評価は近似的であり、敵の例に対して脆弱である。
本手法は,外挿量を測定するために提案した評価フレームワークにカプセル化されている。
論文 参考訳(メタデータ) (2022-11-19T16:57:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。