論文の概要: Optimizing for the decision not the prediction: an exploration of Smooth Net Benefit as a training objective
- arxiv url: http://arxiv.org/abs/2609.12752v1
- Date: Fri, 11 Sep 2026 12:01:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-15 07:38:31.735005
- Title: Optimizing for the decision not the prediction: an exploration of Smooth Net Benefit as a training objective
- Title(参考訳): 予測ではなく意思決定の最適化--学習目標としてのスムースネットベネフィットの探索
- Abstract要約: 客観的予測モデルは、ベルヌーイ負対数類似度(NLL)のような目的を用いて一般的に訓練される
Smooth Net Benefit(NB)は、モデルトレーニングとしきい値固有の臨床ユーティリティを整合させるように設計されたNet Benefitの微分可能な近似である。
- 参考スコア(独自算出の注目度): 1.5246852698474351
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Objective Prediction models are commonly trained using objectives such as Bernoulli negative log-likelihood (NLL), although downstream clinical decisions may depend on specific risk thresholds. We introduce Smooth Net Benefit ($σ$NB), a differentiable approximation of Net Benefit designed to align model training with threshold-specific clinical utility. Materials and Methods We evaluated $σ$NB as a training objective for logistic regression, generalized additive models (GAMs), and XGBoost with three Hessian implementations. Experiments used the Framingham cardiovascular risk dataset and 44 TabZilla datasets comprising 72 dataset-threshold combinations. Results $σ$NB training did not consistently improve Net Benefit in Framingham. Across the TabZilla benchmark, mean standardized Net Benefit for logistic regression increased from 0.5669 with NLL to 0.5765 with $σ$NB (mean difference 0.0096, 95% CI -0.0001 to 0.0193). For GAMs, mean standardized Net Benefit decreased from 0.5921 to 0.5625 (mean difference -0.0296, 95% CI -0.0721 to 0.0129). For XGBoost, NLL achieved 0.6745 compared with 0.6723--0.6735 across $σ$NB implementations. In logistic regression, $σ$NB gains were positively associated with the performance advantage of XGBoost over NLL-trained logistic regression. Discussion The effect of $σ$NB was context dependent, with modest gains concentrated in logistic regression and little benefit for more flexible model classes. This suggests that decision-focused optimization may be most useful when limited model flexibility leaves greater scope for improvement. Conclusion Our results do not support $σ$NB as a general replacement for NLL training, but support further investigation of decision-focused objectives in settings where conventional likelihood-based training may not adequately capture decision-relevant structure.
- Abstract(参考訳): 客観的予測モデルはBernoulli negative log-likelihood (NLL)のような目標を用いて一般的に訓練されるが、下流の臨床的決定は特定のリスク閾値に依存する可能性がある。
Smooth Net Benefit (σ$NB) は, モデルトレーニングとしきい値特異的臨床ユーティリティの整合性を考慮したネットベネフィットの微分可能近似である。
材料と方法 私たちは,3つのヘッセン系実装を用いたロジスティック回帰,一般化加法モデル(GAM),XGBoostのトレーニング目標として$σ$NBを評価した。
実験では、Framinghamの心臓血管リスクデータセットと、72のデータセット-閾値の組み合わせからなる44のTabZillaデータセットを使用した。
その結果、$σ$NBのトレーニングはフラミンハムのネットベネフィットを常に改善しなかった。
TabZillaベンチマークでは、ロジスティック回帰のための標準ネットベネフィットが0.5669から0.5765に増加し、σ$NB(差は0.0096、95% CI -0.0001から0.0193)となった。
GAMの標準ネットベネフィットは0.5921から0.5625に減少した(差は0.0296、95%CI-0.0721から0.0129)。
XGBoost の場合、NLL は 0.6745 を、$σ$NB の実装に比べて 0.6723--0.6735 と比較した。
ロジスティック回帰では、$σ$NBゲインは、NLL学習ロジスティック回帰に対するXGBoostの性能優位性と正の相関を示した。
議論 $σ$NB の効果は文脈依存であり、ロジスティック回帰に集中し、より柔軟なモデルクラスにはほとんど利益が得られなかった。
これは、モデルフレキシビリティが制限され、改善のスコープが大きくなると、決定にフォーカスした最適化が最も有用であることを示している。
結論:NLLトレーニングの一般的な代替として$σ$NBをサポートしないが,従来の確率ベーストレーニングでは決定関連構造を適切に把握できないような設定において,意思決定対象のさらなる調査を支援する。
関連論文リスト
- FIPO: Eliciting Deep Reasoning with Future-KL Influenced Policy Optimization [84.58281577727566]
本稿では,大規模言語モデルにおける推論ボトルネックを克服する強化学習アルゴリズムであるFuture-KL Influenced Policy Optimization (FIPO)を提案する。
FIPOは、割引先KLの分岐をポリシー更新に組み込むことでこの問題に対処し、その後の軌道行動への影響に基づいてトークンを再重み付けする密集した有利な定式化を作成する。
Qwen2.5-32Bで評価され、FIPOは平均チェーン長を約4,000から10,000以上のトークンに拡張し、AIME 2024 Pass@1の精度を50.0%から58.0%に向上させた。
論文 参考訳(メタデータ) (2026-03-20T10:24:50Z) - REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge [83.2858110368572]
回帰報酬を最適化するための原則的RLフレームワークである textbfREAL (underlineREgression-underlineAware Reinforcement underlineLThought) を提案する。
我々は,REALがレグレッション対応SFTベースラインと標準RL法の両方を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-03-17T21:19:08Z) - $V_{0.5}$: Generalist Value Model as a Prior for Sparse RL Rollouts [81.48669089692189]
一般値モデル(例えば$V_0.5$)は、コンテキスト内のモデル機能を明示的にエンコードすることで、事前訓練された値推定を実現する。
本稿では,このような値モデルにより予測されるベースラインと,スパースロールアウトから導出される経験的平均とを適応的に融合する$V_0.5$を提案する。
V_0.5$はGRPOとDAPOを大きく上回り、より高速な収束と約10%のパフォーマンス向上を実現している。
論文 参考訳(メタデータ) (2026-03-11T14:57:41Z) - The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL [39.23942538769713]
大規模言語モデルのための強化学習(LLMs)は、勾配のばらつきが爆発的に広がるため、長い水平タスクのトレーニング崩壊に悩まされることが多い。
我々は、最適トークンベースライン(OTB)を第一原理から導出し、勾配更新が累積勾配ノルムに逆向きに重み付けされるべきであることを証明した。
提案手法はトレーニングの安定性を達成し,N=32$の大規模グループサイズとの性能を一致させ,シングルターンおよびツール統合推論タスクにおけるトークン消費量を65%以上削減する。
論文 参考訳(メタデータ) (2026-02-06T03:16:04Z) - Efficient and Reliable Estimation of Named Entity Linking Quality: A Case Study on GutBrainIE [3.361293040161506]
名前付きエンティティリンク(NEL)は、バイオメディカル情報抽出(IE)パイプラインの中核となるコンポーネントである。
大規模IEコーパスのNEL精度を推定するためのサンプリングベースフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-10T17:18:03Z) - Beyond Log Likelihood: Probability-Based Objectives for Supervised Fine-Tuning across the Model Capability Continuum [88.90314335542281]
確率に基づく目的のファミリーを研究し、異なる条件下での有効性を特徴付ける。
客観的行動を管理する重要な次元、すなわちモデル能力の連続性を明らかにする。
我々の理論的分析は、目的が連続体を横断してどのように取引されるかをさらに解明し、目的をモデル能力に適応するための原則的な基盤を提供する。
論文 参考訳(メタデータ) (2025-10-01T05:17:47Z) - NGRPO: Negative-enhanced Group Relative Policy Optimization [8.641009168869195]
代表的RLVRアルゴリズムであるGRPOは、グループ内の全ての応答が完全に正しいか完全に間違っている場合、臨界的な制限に悩まされる。
これは、GRPO の優位関数が 0 の値を生成する等質的不正確な群に対して特に問題となる。
等質な誤りを頑健な学習信号に変換するアルゴリズムであるNGRPOを提案する。
論文 参考訳(メタデータ) (2025-09-23T09:38:10Z) - DiffusionNFT: Online Diffusion Reinforcement with Forward Process [99.94852379720153]
Diffusion Negative-aware FineTuning (DiffusionNFT) は、フローマッチングを通じて前方プロセス上で直接拡散モデルを最適化する新しいオンラインRLパラダイムである。
DiffusionNFTは、CFGフリーのFlowGRPOよりも25倍効率が高い。
論文 参考訳(メタデータ) (2025-09-19T16:09:33Z) - Constraining cosmological parameters from N-body simulations with
Variational Bayesian Neural Networks [0.0]
乗法正規化フロー (MNFs) はBNNのパラメータの近似後流の族である。
我々は,標準BNNとフリップアウト推定器についてMNFの比較を行った。
MNFは、変動近似によって導入されたバイアスを緩和する真の後部へのより現実的な予測分布を提供する。
論文 参考訳(メタデータ) (2023-01-09T16:07:48Z) - Learning GFlowNets from partial episodes for improved convergence and
stability [56.99229746004125]
生成フローネットワーク(GFlowNets)は、非正規化対象密度の下で離散オブジェクトのシーケンシャルサンプリングを訓練するアルゴリズムである。
GFlowNetsの既存のトレーニング目的は、状態または遷移に局所的であるか、あるいはサンプリング軌道全体にわたって報酬信号を伝達する。
強化学習におけるTD($lambda$)アルゴリズムにインスパイアされたサブトラジェクティブバランス(subtrajectory balance, SubTB($lambda$)を導入する。
論文 参考訳(メタデータ) (2022-09-26T15:44:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。