論文の概要: DE-Venus: A Data-Efficient RLVR Framework for Large Language Models
- arxiv url: http://arxiv.org/abs/2609.03324v1
- Date: Thu, 03 Sep 2026 03:23:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.902593
- Title: DE-Venus: A Data-Efficient RLVR Framework for Large Language Models
- Title(参考訳): DE-Venus:大規模言語モデルのためのデータ効率の良いRLVRフレームワーク
- Abstract要約: 検証可能な報酬(RLVR)による強化学習は,大規模な言語モデル推論を改善するが,その実践的スケーリングは,高額なオンラインロールアウトと,信頼性の高い目標を大規模に獲得するコストによって制約される。
我々は、データ準備とポリシー最適化をまたいで、監督を進化状態として扱う、データ効率のよいRLVRのための統合フレームワークDE-Venusを提案する。
- 参考スコア(独自算出の注目度): 58.53135628199626
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reinforcement learning with verifiable rewards (RLVR) improves large language model reasoning, but its practical scaling is constrained by expensive on-policy rollouts and the cost of obtaining reliable targets at scale. Existing methods address sample selection, incomplete supervision, or noisy labels separately, often entangling supervision logic with distributed training and hindering controlled comparison and reuse. We present DE-Venus, a unified framework for data-efficient RLVR that treats supervision as evolving state across data preparation and policy optimization. It organizes this lifecycle into three modules: Active Data Selection allocates training and annotation budgets; Weak Supervision Construction derives learning signals from unlabeled examples; and Training-Time Supervision Refinement filters or corrects unreliable supervision. DE-Venus supports seven representative methods and a data-selection pipeline by expressing method-specific decisions as offline dataset transitions or online transformations of targets, rewards, batches, and advantages while preserving verl's distributed execution contracts. Across public benchmarks and three business scenarios, separate configurations preserve or improve model quality with only 10% of labels or as little as 13% of relevant data; selected business configurations also reduce observed convergence steps by 63%--75%. DE-Venus thus reduces annotation and training costs without sacrificing scalable RL execution.
- Abstract(参考訳): 検証可能な報酬(RLVR)による強化学習は,大規模な言語モデル推論を改善するが,その実践的スケーリングは,高額なオンラインロールアウトと,信頼性の高い目標を大規模に獲得するコストによって制約される。
既存の手法では、サンプルの選択、不完全な監督、ノイズラベルを別々に扱うことができ、しばしば、分散トレーニングと制御された比較と再利用を妨げる。
我々は、データ準備とポリシー最適化をまたいで、監督を進化状態として扱う、データ効率のよいRLVRのための統合フレームワークDE-Venusを提案する。
Active Data Selectionはトレーニングとアノテーションの予算を割り当て、Weak Supervision Constructionはラベルのない例から学習信号を導き、Training-Time Supervision Refinementフィルタは信頼性の低い監視を補正する。
DE-Venusは7つの代表的メソッドとデータ選択パイプラインをサポートし、メソッド固有の決定をオフラインのデータセット移行やターゲット、報酬、バッチ、アドバンテージのオンライン変換として表現し、Verlの分散実行契約を保存する。
公開ベンチマークと3つのビジネスシナリオを通じて、別々の構成では、ラベルの10%または関連データの13%でモデル品質を維持または改善する。
したがって、DE-Venusは拡張性のあるRLの実行を犠牲にすることなく、アノテーションとトレーニングコストを削減できる。
関連論文リスト
- Selectivity Drives Efficiency: Dataset Pruning for Visual Place Recognition [52.52131290631774]
視覚的位置認識(VPR)に適したプレースワイズ・データセット・プルーニング・フレームワークを提案する。
本手法は,各場所を基本刈取単位として扱い,IPD(Intra-place diversity)とIPS(Inter-place similarity)の2つの新しい指標を導入する。
実験により, 提案手法は, 最先端のDPベースラインを異なるプルーニング比で連続的に上回ることを示した。
論文 参考訳(メタデータ) (2026-07-16T12:16:00Z) - Optimizing Visual Generative Models via Distribution-wise Rewards [57.46109819595665]
本稿では,実世界のデータ分布との整合性を確保するために,分布ワイド報酬を用いた生成モデルを微調整する新しいフレームワークを提案する。
提案手法は,SiTでは5.77,EDM2では3.74から3.52まで,様々なベースモデルでFID-50Kを大幅に改善する。
論文 参考訳(メタデータ) (2026-07-02T15:08:56Z) - GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling [29.20321049470364]
検証可能な報酬(RLVR)による強化学習はLLM推論を著しく向上させる。
標準的な教師なしスケーリングは高いアノテーションコストによって妨げられ、教師なしの代替手段は深刻なモデル崩壊に悩まされる。
最近の半教師付きRLVR法は、ラベルのないデータをガイドする小さなラベル付きセットを使用してこの問題に対処し、トレーニングの有効性とアノテーションコストの間の有望なトレードオフを実現する。
ラベル付きデータに対するグローバルな特徴をモデル化したGeoMinを提案する。
論文 参考訳(メタデータ) (2026-06-03T06:47:50Z) - Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots [29.141492387722963]
RLVRの「暗黒のピック」設定は、事前の監督なしに、トレーニングに最も有益でアノテーションに相応しいラベルなしサンプルを選択することを目的としている。
本稿では,3方向データトリアージフレームワークであるPivotTraceを提案する。
論文 参考訳(メタデータ) (2026-06-03T06:34:42Z) - When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards [49.25249414962884]
能動検証リワードを用いた強化学習(RLAVR)を提案する。
RLAVRは、少数のサンプルの接地木ラベルを積極的に取得し、擬似ラベルと統合する。
これに基づいて、RLAVR(CARE)の補正認識信頼性推定を導入する。
論文 参考訳(メタデータ) (2026-05-25T13:55:12Z) - How Faithful Is Trajectory-Based Data Attribution? Error Sources, Remedies, and Practical Guidelines [21.57090069950487]
トラジェクトリに基づくデータ帰属法は、トレーニングの軌跡をアンロールすることで、モデル予測に対するトレーニングサンプルの影響を推定する。
これらの手法の包括的なエラー解析が欠如しており、メソッドの忠実性に対する懸念を高め、信頼性の高いデプロイメントを妨げる。
本稿では,トラジェクトリに基づくデータ属性における誤り源の体系的解析と,これらを緩和するための具体的対策,および下流利用のための実践的ガイドラインについて述べる。
論文 参考訳(メタデータ) (2026-05-12T09:50:45Z) - Adaptive Data Selection for Multi-Layer Perceptron Training: A Sub-linear Value-Driven Method [10.014138113199616]
データ選択は、ニューラルネットワークトレーニングの基本的な問題のひとつだ。
Data Value Contributionは、トレーニング用のデータを選択するための、新しい予算対応の方法である。
我々の手法は、様々な予算制約の下で、既存のアプローチよりも一貫して優れている。
論文 参考訳(メタデータ) (2025-10-24T09:33:19Z) - RL-Selector: Reinforcement Learning-Guided Data Selection via Redundancy Assessment [10.284993431741377]
サンプル間の関係に基づいてサンプル冗長性を定量化する,エプシロン・サンプル被覆の概念を導入する。
我々は、強化学習プロセスとしてデータ選択を再構成し、RLセレクタを提案する。
我々の手法は、既存の最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-06-26T06:28:56Z) - Data-Driven Offline Decision-Making via Invariant Representation
Learning [97.49309949598505]
オフラインのデータ駆動意思決定は、アクティブなインタラクションなしで最適化された決定を合成する。
オフラインデータからトレーニングされたモデルへの入力に関して最適化する場合、誤って良いように見えるアウト・オブ・ディストリビューション(OOD)インプットを生成するのは簡単です。
本稿では、オフラインデータ駆動意思決定をドメイン適応として定式化し、最適化された決定値の正確な予測を行うことを目標とする。
論文 参考訳(メタデータ) (2022-11-21T11:01:37Z) - VFed-SSD: Towards Practical Vertical Federated Advertising [53.08038962443853]
本稿では,2つの制限を緩和する半教師付き分割蒸留フレームワーク VFed-SSD を提案する。
具体的には,垂直分割された未ラベルデータを利用する自己教師型タスクMatchedPair Detection (MPD) を開発する。
当社のフレームワークは,デプロイコストの最小化と大幅なパフォーマンス向上を図った,リアルタイム表示広告のための効率的なフェデレーション強化ソリューションを提供する。
論文 参考訳(メタデータ) (2022-05-31T17:45:30Z) - Open-Set Semi-Supervised Learning for 3D Point Cloud Understanding [62.17020485045456]
半教師付き学習(SSL)では、ラベル付きデータと同じ分布からラベル付きデータが引き出されることが一般的である。
サンプル重み付けによりラベルなしデータを選択的に活用することを提案する。
論文 参考訳(メタデータ) (2022-05-02T16:09:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。