論文の概要: Training seeds and model-selection stability in recommender-system evaluation
- arxiv url: http://arxiv.org/abs/2609.02499v1
- Date: Wed, 02 Sep 2026 12:06:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.325906
- Title: Training seeds and model-selection stability in recommender-system evaluation
- Title(参考訳): 推薦システム評価における訓練種子とモデル選択安定性
- Abstract要約: 種子の訓練はアルゴリズムに依存したいくつかのメカニズムに影響を及ぼす可能性がある。
我々は,ユーザレベルのメトリクス感度,バリデーションベースのモデル選択,レコメンデーションリストの3つのレベルにおいてシード効果を分析する。
その結果,シングルシード結果の報告は,レコメンダシステム評価の安定性を過大評価する可能性が示唆された。
- 参考スコア(独自算出の注目度): 1.6877390079162282
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Recommender-system experiments often rely on a single random training seed, assuming that run-to-run stochasticity has limited impact on evaluation conclusions. This assumption is risky, as a training seed may influence several algorithm-dependent mechanisms, including parameter initialization, mini-batch ordering, dropout, masking, latent sampling, and training-time negative sampling. We examine this assumption by fixing the data partition and varying the training seed across hyperparameter configurations. We analyze seed effects at three levels: user-level metric sensitivity, validation-based model selection and recommendation-list agreement. Results show that seed variation is often detectable. Its impact depends on whether configurations are clearly separated, whether validation results transfer to test, and whether similar scores lead to similar top-$k$ lists. Findings suggest that reporting single-seed results can overstate the stability of recommender system evaluation, and that training seeds should be treated as part of the evaluation protocol rather than as incidental implementation noise.
- Abstract(参考訳): Recommender-system 実験は、実行から実行までの確率性が評価の結論に限られた影響を及ぼすと仮定して、単一のランダムなトレーニングシードに依存することが多い。
この仮定は、トレーニングシードがパラメータ初期化、ミニバッチ順序付け、ドロップアウト、マスキング、潜時サンプリング、トレーニング時間負サンプリングなど、アルゴリズム依存のメカニズムに影響を与える可能性があるため、リスクが高い。
この仮定は、データパーティションを固定し、トレーニングシードをハイパーパラメータ構成で変更することで検証する。
我々は,ユーザレベルのメトリクス感度,バリデーションベースのモデル選択,レコメンデーションリストの3つのレベルにおいてシード効果を分析する。
その結果,種子の変動がしばしば検出できることが示唆された。
その影響は、構成が明確に分離されているか、検証結果がテストに転送されるか、同様のスコアが類似のトップ$k$リストにつながるかどうかに依存する。
その結果, 単系統評価結果の報告は, 推薦システム評価の安定性を過度に表すことができ, 訓練種子は, 偶発的な実装ノイズとしてではなく, 評価プロトコルの一部として扱われるべきであることが示唆された。
関連論文リスト
- Overcoming Selection Bias in Statistical Studies With Amortized Bayesian Inference [1.9709458230153813]
選択バイアスは、観測がデータセットに入る確率が興味の量に関連する変数に依存するときに生じる。
我々は、選択を神経後部推定に明示的に組み込むバイアス対応シミュレーションベースの推論フレームワークを開発した。
論文 参考訳(メタデータ) (2026-04-20T14:20:16Z) - Combating Noisy Labels through Fostering Self- and Neighbor-Consistency [120.4394402099635]
ラベルノイズは様々な現実世界のシナリオで広まり、教師付きディープラーニングの課題を提起する。
我々は、Jo-SNC(textbfSelf- と textbfNeighbor-textbfConsistency に基づくサンプル選択とモデル正規化)というノイズロバスト手法を提案する。
我々は、クラスごとの選択閾値を調整するための自己適応型データ駆動しきい値設定方式を設計する。
論文 参考訳(メタデータ) (2026-01-19T07:55:29Z) - Paired Seed Evaluation: Statistical Reliability for Learning-Based Simulators [0.16969585732319237]
機械学習システムは決定論的にランダムであり、シードされた擬似乱数生成器は実行全体にわたって同一の実現を生成する。
競合するシステムを同一のランダムなシードで評価するペア型シード評価設計を定式化する。
これにより、より厳密な信頼区間、高い統計力、固定された計算予算での効果的なサンプルサイズゲインが得られる。
論文 参考訳(メタデータ) (2025-12-30T11:15:04Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Can We Validate Counterfactual Estimations in the Presence of General Network Interference? [13.49152464081862]
我々は、因果推論における推定と検証の両方に機械学習ツールを使うことを容易にするフレームワークを導入する。
新しい分布保存ネットワークブートストラップは、単一実験のデータから統計的に有意なサブポピュレーションを生成する。
ファクトファクトのクロスバリデーション手順は、モデル検証の原則を因果的設定のユニークな制約に適応させる。
論文 参考訳(メタデータ) (2025-02-03T06:51:04Z) - Measuring training variability from stochastic optimization using robust nonparametric testing [5.519968037738177]
本稿では,モデル類似度を測定するために,ロバストな仮説テストフレームワークと,新たな要約統計量である$alpha$-trimmingレベルを提案する。
仮説を$alpha$-trimmingレベルで直接適用することは、null仮説の下で分布を正確に記述できないため、難しい。
モデル変数の測定に$alpha$-trimmingレベルを使用する方法を示し、パフォーマンス指標よりも表現力が高いことを実験的に実証する。
論文 参考訳(メタデータ) (2024-06-12T15:08:15Z) - Noisy Correspondence Learning with Self-Reinforcing Errors Mitigation [63.180725016463974]
クロスモーダル検索は、実際は精力的な、十分に整合した大規模データセットに依存している。
我々は、新しい雑音対応学習フレームワーク、textbfSelf-textbfReinforcing textbfErrors textbfMitigation(SREM)を導入する。
論文 参考訳(メタデータ) (2023-12-27T09:03:43Z) - Double machine learning for sample selection models [0.12891210250935145]
本稿では,サンプル選択や帰属によるサブポピュレーションに対してのみ結果が観察される場合の個別分散処理の評価について考察する。
a)Neyman-orthogonal, Duubly robust, and efficient score function, which suggests the robustness of treatment effect Estimation to moderate regularization biases in the machine learning based Estimation of the outcome, treatment, or sample selection model and (b) sample splitting ( or cross-fitting) to prevent overfitting bias。
論文 参考訳(メタデータ) (2020-11-30T19:40:21Z) - A One-step Approach to Covariate Shift Adaptation [82.01909503235385]
多くの機械学習シナリオにおけるデフォルトの前提は、トレーニングとテストサンプルは同じ確率分布から引き出されることである。
予測モデルと関連する重みを1つの最適化で共同で学習する新しいワンステップアプローチを提案する。
論文 参考訳(メタデータ) (2020-07-08T11:35:47Z) - Towards Model-Agnostic Post-Hoc Adjustment for Balancing Ranking
Fairness and Algorithm Utility [54.179859639868646]
Bipartiteランキングは、ラベル付きデータから正の個人よりも上位の個人をランク付けするスコアリング機能を学ぶことを目的としている。
学習したスコアリング機能が、異なる保護グループ間で体系的な格差を引き起こすのではないかという懸念が高まっている。
本稿では、二部構成のランキングシナリオにおいて、それらのバランスをとるためのモデル後処理フレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-15T10:08:39Z) - Fine-Tuning Pretrained Language Models: Weight Initializations, Data
Orders, and Early Stopping [62.78338049381917]
教師付き下流タスクのための微調整済み文脈単語埋め込みモデルは、自然言語処理において一般的なものとなっている。
GLUEベンチマークから得られた4つのデータセットを実験し、無作為な種だけを変えながら、それぞれに数百回微調整されたBERTを実験した。
これまでに報告した結果と比較すると,性能が大幅に向上し,微調整試行回数の関数としてベストファウンドモデルの性能がどう変化するかが定量化される。
論文 参考訳(メタデータ) (2020-02-15T02:40:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。