論文の概要: Can LLMs Learn to Reason Robustly under Noisy Supervision?
- arxiv url: http://arxiv.org/abs/2604.03993v1
- Date: Sun, 05 Apr 2026 06:30:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.865795
- Title: Can LLMs Learn to Reason Robustly under Noisy Supervision?
- Title(参考訳): LLMはうるさいスーパービジョンの下でロバストな推論を学べるか?
- Authors: Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng, Yingfan Ma, Zhongqi Chen, Weiqiang Wang, Gang Chen,
- Abstract要約: RLVRにおけるノイズラベル機構の体系的解析に向けた第一歩を踏み出す。
データ効率を低下させる非アクティブノイズラベルと、モデルを強化し、リスク回避するアクティブノイズラベルの2種類のノイズを区別する。
この力学によって動機づけられたオンラインラベルリファインメント(OLR)を提案する。
- 参考スコア(独自算出の注目度): 31.39996460068968
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) effectively trains reasoning models that rely on abundant perfect labels, but its vulnerability to unavoidable noisy labels due to expert scarcity remains critically underexplored. In this work, we take the first step toward a systematic analysis of noisy label mechanisms in RLVR. In contrast to supervised classification, most RLVR algorithms incorporate a rollout-based condition: a label's influence on training is contingent on whether the current policy can generate rollouts that realize it, a property that naturally extends to noisy labels. Based on this observation, we distinguish two types of noise: inactive noisy labels, which reduce data efficiency, and active noisy labels, which are reinforced and risk skewing the model toward incorrect distributions. From experiments on training with noisy samples, we identify an Early Correctness Coherence phenomenon: although noisy samples begin to lag behind in later stages, accuracy on both clean and noisy samples increases similarly in early training. Motivated by this dynamic, we propose Online Label Refinement (OLR), which progressively corrects potentially noisy labels with majority-voted answers when two conditions hold: a positive slope in the majority answer's rollout pass rate and stable historical consistency across updates, enabling gradual self-correction as the policy improves. We evaluate OLR on six in-distribution mathematical reasoning benchmarks (AIME24/25, AMC, MATH-500, Minerva, and Olympiad) and three out-of-distribution tasks (ARC-c, GPQA-diamond, and MMLU-pro). Across noise ratios from 0.1 to 0.9, OLR consistently improves robustness under both inactive and active noisy-label settings, achieving average gains of 3.6% to 3.9% on in-distribution benchmarks and 3.3% to 4.6% on out-of-distribution evaluations.
- Abstract(参考訳): RLVR(Reinforcement Learning with Verifiable Rewards)は、豊富な完全ラベルに依存する推論モデルを効果的に訓練するが、専門家の不足による避けられないノイズラベルに対する脆弱性は、いまだに過小評価されている。
本研究では,RLVRにおけるノイズラベル機構の体系的解析に向けた第一歩を踏み出す。
教師付き分類とは対照的に、ほとんどのRLVRアルゴリズムはロールアウトベースの条件を取り入れている。
この観測から,データ効率を低下させる非アクティブノイズラベルと,モデルが不正確な分布に向かうリスクの高いアクティブノイズラベルの2種類のノイズを識別する。
ノイズのあるサンプルを用いたトレーニング実験から、早期精度のコヒーレンス現象を同定する: ノイズの多いサンプルは後期に遅れ始めるが、クリーンなサンプルとノイズの多いサンプルの精度は早期トレーニングでも同様に増加する。
この力学によって動機づけられたオンラインラベルリファインメント(OLR)は、2つの条件が成立すると、潜在的にノイズの多いラベルを多数投票で段階的に修正する。
AIME24/25, AMC, MATH-500, Minerva, Olympiad) と3つの分布外タスク (ARC-c, GPQA-diamond, MMLU-pro) でOLRを評価した。
0.1から0.9までのノイズ比全体において、OLRは非アクティブおよびアクティブなノイズラベル設定下でのロバスト性を一貫して改善し、分布内ベンチマークでは平均3.6%から3.9%、分布外評価では3.3%から4.6%となる。
関連論文リスト
- Pre-train to Gain: Robust Learning Without Clean Labels [1.1582652820340928]
ノイズの多いラベルでディープネットワークを訓練すると、一般化が悪く、精度が低下する。
ラベルなしで特徴抽出器のバックボーンを事前トレーニングすることで、クリーンなラベルのサブセットを必要とせずに、よりノイズの強いモデルをトレーニングできる。
提案手法は,低雑音レベルにおけるImageNet事前学習モデルに匹敵する結果を得たが,高雑音条件下ではかなり優れていた。
論文 参考訳(メタデータ) (2025-11-25T20:48:07Z) - Semi-Supervised Regression with Heteroscedastic Pseudo-Labels [50.54050677867914]
両レベル最適化の観点から,疑似ラベルの影響を動的に調整する不確実性認識型擬似ラベル化フレームワークを提案する。
我々は、様々なベンチマークSSRデータセットにまたがって、我々のアプローチを検証するための理論的洞察と広範な実験を提供する。
論文 参考訳(メタデータ) (2025-10-17T03:06:23Z) - Correcting Noisy Multilabel Predictions: Modeling Label Noise through Latent Space Shifts [6.0882756122009996]
ほとんどの現実世界の機械学習アプリケーションでは、データのノイズは避けられないように思える。
マルチラベル分類における雑音ラベル学習の分野について検討した。
我々のモデルは、雑音のラベル付けは潜伏変数の変化から生じると仮定し、より堅牢で有益な学習手段を提供する。
論文 参考訳(メタデータ) (2025-02-20T05:41:52Z) - Learning with Imbalanced Noisy Data by Preventing Bias in Sample
Selection [82.43311784594384]
実世界のデータセットには、ノイズの多いラベルだけでなく、クラス不均衡も含まれている。
不均衡なデータセットにおけるノイズラベルに対処する,単純かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-02-17T10:34:53Z) - Neighborhood Collective Estimation for Noisy Label Identification and
Correction [92.20697827784426]
ノイズラベルを用いた学習(LNL)は,ノイズラベルに対するモデルオーバーフィットの効果を軽減し,モデル性能と一般化を改善するための戦略を設計することを目的としている。
近年の進歩は、個々のサンプルのラベル分布を予測し、ノイズ検証とノイズラベル補正を行い、容易に確認バイアスを生じさせる。
提案手法では, 候補サンプルの予測信頼性を, 特徴空間近傍と対比することにより再推定する。
論文 参考訳(メタデータ) (2022-08-05T14:47:22Z) - S3: Supervised Self-supervised Learning under Label Noise [53.02249460567745]
本稿では,ラベルノイズの存在下での分類の問題に対処する。
提案手法の核心は,サンプルのアノテートラベルと特徴空間内のその近傍のラベルの分布との整合性に依存するサンプル選択機構である。
提案手法は,CIFARCIFAR100とWebVisionやANIMAL-10Nなどの実環境ノイズデータセットの両方で,従来の手法をはるかに上回っている。
論文 参考訳(メタデータ) (2021-11-22T15:49:20Z) - Noise-Resistant Deep Metric Learning with Probabilistic Instance
Filtering [59.286567680389766]
ノイズラベルは現実世界のデータによく見られ、ディープニューラルネットワークの性能劣化を引き起こす。
DMLのための確率的ランク付けに基づくメモリを用いたインスタンス選択(PRISM)手法を提案する。
PRISMはラベルがクリーンである確率を計算し、潜在的にノイズの多いサンプルをフィルタリングする。
論文 参考訳(メタデータ) (2021-08-03T12:15:25Z) - Open-set Label Noise Can Improve Robustness Against Inherent Label Noise [27.885927200376386]
オープンセットノイズラベルは非毒性であり, 固有ノイズラベルに対するロバスト性にも寄与することを示した。
本研究では,動的雑音ラベル(ODNL)を用いたオープンセットサンプルをトレーニングに導入することで,シンプルかつ効果的な正規化を提案する。
論文 参考訳(メタデータ) (2021-06-21T07:15:50Z) - A Second-Order Approach to Learning with Instance-Dependent Label Noise [58.555527517928596]
ラベルノイズの存在は、しばしばディープニューラルネットワークのトレーニングを誤解させる。
人間による注釈付きラベルのエラーは、タスクの難易度レベルに依存する可能性が高いことを示しています。
論文 参考訳(メタデータ) (2020-12-22T06:36:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。