論文の概要: When Does Machine Learning Beat Value Sorting? A Three-Dataset Diagnostic of Exposure-Weighted Shipment Prioritization
- arxiv url: http://arxiv.org/abs/2607.18573v1
- Date: Mon, 20 Jul 2026 23:11:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.270368
- Title: When Does Machine Learning Beat Value Sorting? A Three-Dataset Diagnostic of Exposure-Weighted Shipment Prioritization
- Title(参考訳): 機械学習はいつ値ソーティングに勝つか : 露出重み付け出荷優先化の3値診断
- Authors: Jize Li,
- Abstract要約: 機械学習が要求のないモデルベースラインをクリアするかどうかを評価する。
実際の3つのサプライチェーンのコンテキストにおいて,リーク制御された圧延オリジン評価と1000サンプルペアブートストラップ信頼区間を用いる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Delay-risk models are usually judged by predictive accuracy. What matters in practice is narrower: with capacity to review only a few shipments, which ones should a manager check first? We evaluate whether machine learning clears a demanding no-model baseline: inspect the highest-value shipments first. Across three real supply-chain contexts: SCMS procurement, DataCo logistics, and Olist e-commerce, we use leakage-controlled rolling-origin evaluation and 1000-sample paired bootstrap confidence intervals. Ranking by predicted delay severity times known value (M1) beats severity-only ranking in all three datasets, yet it does not generally beat value sorting. At a 10% review budget, M1 minus VALUE_ONLY is -5.5 percentage points (pp) for SCMS, +10.1 pp for DataCo, and -4.9 pp for Olist. The divide is consistent with severity learnability: DataCo has R^2 = 0.27 and calibration bias of +0.01 days, whereas SCMS and Olist have R^2 of approximately -0.02 and negative calibration bias. Nested-CV cost-sensitive retraining does not deliver a stable improvement over M1. Rather than proposing a new learning algorithm, this paper presents a deployment diagnostic and evaluation protocol. Value sorting should remain a permanent benchmark, and ML should be deployed only after severity learnability and calibration have been audited and the model clears that gate under leakage-controlled rolling-origin evaluation.
- Abstract(参考訳): 遅延リスクモデルは通常、予測精度によって判断される。
少数の出荷をレビューする能力があるので、マネージャが最初にチェックすべきものはどれでしょう?
機械学習が要求のないモデルベースラインをクリアするかどうかを評価する。
SCMS調達、DataCoロジスティクス、Olisteコマースの3つの真のサプライチェーンコンテキストにおいて、リーク制御されたローリングオリジン評価と1000サンプルのブートストラップ信頼区間を使用する。
予測遅延重大回数既知の値(M1)によるランキングは、3つのデータセットすべてにおいて重大度のみのランキングを上回っているが、一般的には値ソートを上回っているわけではない。
10%の審査予算で、M1マイナスVALUE_ONLYはSCMSが5.5ポイント(pp)、DataCoが+10.1pp、Olistが4.9ppである。
DataCoはR^2 = 0.27でキャリブレーションバイアス+0.01日、SCMSとOlistはR^2で約0.02、負のキャリブレーションバイアス。
Nested-CVのコスト感受性の再トレーニングはM1よりも安定した改善をもたらすことはない。
本稿では,新しい学習アルゴリズムを提案するのではなく,デプロイメントの診断・評価プロトコルを提案する。
値ソートは恒久的なベンチマークであり、MLは厳密な学習可能性と校正が監査された後にのみデプロイされるべきであり、モデルはリーク制御されたローリングオリジン評価の下でゲートをクリアする。
関連論文リスト
- Anticipating the Optimism Gap: Predicting Distribution-Shift Degradation of RF-Impairment Detectors from In-Distribution Statistics [0.0]
電波障害の検知器は、通常、調整された分布で測定された単一のAUCで報告される。
アウト・オブ・ディストリビューション・データを見る前に、この楽観主義が予測できるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-20T14:10:59Z) - Fast Unlearning at Scale via Margin Self-Correction [52.46927918952516]
言語モデルアンラーニングは、トレーニングモデルを更新して、選択したトレーニング例を見ていないかのように振る舞う。
MASCは、既存のベースラインの計算コストのごく一部で、競争力のある忘れがちなトレードオフを達成する。
論文 参考訳(メタデータ) (2026-06-01T21:49:54Z) - Metric Unreliability in Multimodal Machine Unlearning: A Systematic Analysis and Principled Unified Score [14.579552536669217]
一般データ保護規制法に準拠するためには、ビジョンランゲージモデル(VLM)のアンラーニングが必要である。
マルチモーダル・アンラーニングにおける信頼性の最初の研究について述べる。
統一品質スコア(Unified Quality Score, UQS)は, 各計量のスピアマン相関と距離の関係から得られる重みを持つ計量である。
論文 参考訳(メタデータ) (2026-05-04T04:13:00Z) - Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance [9.771590610969918]
WMF-AM(Working Memory Fidelity-Active Manipulation)を紹介する。
その結果,20種類のオープンウェイトモデル (0.5B-35B, 13ファミリー) で10タスク・エージェント・バッテリを発売した。
論文 参考訳(メタデータ) (2026-03-28T17:25:11Z) - gSASRec: Reducing Overconfidence in Sequential Recommendation Trained
with Negative Sampling [67.71952251641545]
負のサンプリングで訓練されたモデルは、正の相互作用の確率を過大評価する傾向がある。
本稿では, 一般化二項クロスエントロピー損失関数(gBCE)を提案する。
本稿では,gSASRecが過信問題を示さない3つのデータセットについて詳細な実験を行った。
論文 参考訳(メタデータ) (2023-08-14T14:56:40Z) - Bridging Precision and Confidence: A Train-Time Loss for Calibrating
Object Detection [58.789823426981044]
本稿では,境界ボックスのクラス信頼度を予測精度に合わせることを目的とした,新たな補助損失定式化を提案する。
その結果,列車の走行時間損失はキャリブレーション基準を超過し,キャリブレーション誤差を低減させることがわかった。
論文 参考訳(メタデータ) (2023-03-25T08:56:21Z) - Sequential Kernelized Independence Testing [77.237958592189]
我々は、カーネル化依存度にインスパイアされたシーケンシャルなカーネル化独立試験を設計する。
シミュレーションデータと実データの両方にアプローチのパワーを実証する。
論文 参考訳(メタデータ) (2022-12-14T18:08:42Z) - Recommendation Systems with Distribution-Free Reliability Guarantees [83.80644194980042]
我々は、主に良いアイテムを含むことを厳格に保証されたアイテムのセットを返す方法を示す。
本手法は, 擬似発見率の厳密な有限サンプル制御によるランキングモデルを提供する。
我々はYahoo!のランキングとMSMarcoデータセットの学習方法を評価する。
論文 参考訳(メタデータ) (2022-07-04T17:49:25Z) - Certified Error Control of Candidate Set Pruning for Two-Stage Relevance
Ranking [57.42241521034744]
本稿では、妥当性ランキングのための候補セットプルーニングの認証エラー制御の概念を提案する。
提案手法は,第1段階から抽出した候補集合を抽出し,第2段階の復位速度を向上する。
論文 参考訳(メタデータ) (2022-05-19T16:00:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。