論文の概要: CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training
- arxiv url: http://arxiv.org/abs/2609.00892v1
- Date: Tue, 01 Sep 2026 08:22:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.478762
- Title: CARE: Contrastive Anchor-based Rubric Evolution for Large Language Model Post-Training
- Title(参考訳): CARE: 大規模言語モデルに対するコントラストアンカーベースルーブリック進化
- Authors: Siyuan Li, Xinxin Song, Chen Ruinian, Jingjing Fan, Tingxiong Xiao, Yangen Hu, Ke Zeng, Jinli Suo,
- Abstract要約: 強化学習は、オープンエンド命令をプロンプト固有の柔軟なルーリックに分解する。
静的なルーリックは 必然的にハックされる ポリシーが進化するにつれて
我々は、高品質なアンカー応答において、すべてのルーブリック進化ステップを基盤とする$textbfCARE$を提案する。
- 参考スコア(独自算出の注目度): 19.798998515276523
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Rubric-based reinforcement learning decomposes open-ended instructions into prompt-specific, flexible rubrics, making it better suited than reinforcement learning with verifiable rewards for post-training LLMs on open-ended tasks. However, static rubrics are inevitably hacked as the policy evolves, and existing dynamic approaches introduce new problems: undirected rubric extraction, unreliable hack detection, and unbounded rubric proliferation. We propose $\textbf{CARE}$ ($\textbf{C}$ontrastive $\textbf{A}$nchor-based $\textbf{R}$ubric $\textbf{E}$volution), which grounds every rubric evolution step in a high-quality anchor response generated by a frontier model conditioned on the prompt and its rubrics. At each training step, CARE contrasts the highest-scoring rollout against the anchor, enabling two complementary mechanisms: an Adaptive branch that reactively repairs reward misspecification; and a Chase branch that proactively converts frontier-level quality gaps into sharper rubrics. Together, the two branches $\textbf{maintain discriminative accuracy in the high-reward region}$---the precise region where reward over-optimization mostly originates. Experiments on WildChecklist-9K with Qwen2.5-7B-Base and Qwen2.5-7B-Instruct show that CARE achieves state-of-the-art performance on Arena-Hard-2.0, InfoBench, and FollowBench, and is the $\textbf{only}$ method whose win rate against GPT-4.1 anchor responses shows sustained improvement throughout 300 training steps; additional results on Llama-3.1-8B-Instruct and Qwen3-8B further indicate that CARE generalizes across model families.
- Abstract(参考訳): ルーブリックをベースとした強化学習は、オープンエンド命令をプロンプト特異的で柔軟なルーブリックに分解する。
しかし、ポリシーが進化するにつれて静的ルーリックは必然的にハックされ、既存の動的アプローチでは、非ダイレクトルーリック抽出、信頼できないハック検出、非バウンドルーリック増殖といった新しい問題が発生する。
我々は、プロンプトとルーブリックに条件付けされたフロンティアモデルによって生成された高品質なアンカー応答において、すべてのルーブリック進化ステップを基盤とする、$\textbf{CARE}$$$$\textbf{C}$ontrastive $\textbf{A}$nchor-based $\textbf{R}$ubric $\textbf{E}$volutionを提案する。
トレーニングの各ステップにおいて、CAREはアンカーに対して最高レベルのロールアウトを対比し、2つの補完的なメカニズムを可能にする: 報酬の特定を反応的に修復するアダプティブブランチと、フロンティアレベルの品質ギャップをよりシャープなルーブリックに積極的に変換するチェイスブランチである。
2つの枝は共に、高逆領域における差別的精度を保ち、----報酬過最適化が主に生じる正確な領域である。
Qwen2.5-7B-BaseとQwen2.5-7B-InstructによるWildChecklist-9Kの実験では、CAREはArena-Hard-2.0、InfoBench、FollowBenchの最先端のパフォーマンスを達成し、GPT-4.1アンカー応答に対する勝利率が300のトレーニングステップを通して持続的な改善を示す$\textbf{only}$メソッドである。
関連論文リスト
- ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents [12.091072999307622]
ARCOは強化学習のための適応型ルーリックフレームワークである。
強い結果、ルーブリック、プロセス・リワードのベースラインよりも、すべての設定で最高のEMを改善する。
そのルーブリックは、ステップ特異的で、設計上の選択に対して堅牢であり、エージェントの挙動の診断に有用である。
論文 参考訳(メタデータ) (2026-06-19T09:38:02Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward [69.99652051809737]
本研究では,検証自由な内在性勾配項再帰(VIGOR)を提案する。
VIGORはポリシーモデルのみを使用する単純な報酬です。
数学データのみに基づいてトレーニングされた場合、コードベンチマークへのクロスドメイン転送を示す。
論文 参考訳(メタデータ) (2026-05-11T03:15:37Z) - CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring [0.0]
本稿では,入力とシステム間の相互アテンションを利用してルールを構造的に分離・アンカーするCALYREXを提案する。
トレーニングデータ、バックボーン、パラメータ予算を8Bスケールで制御すると、CALYREXは命令追跡(IFEval)で$+7.4%、マルチターン命令順守で$+16.3%となる。
この利点は、専用ルーティング経路をより効果的に活用するより大規模なモデルと整合して、モデルスケールで拡大しているように見える。
論文 参考訳(メタデータ) (2026-05-10T20:12:39Z) - Near-Future Policy Optimization [51.760544033045726]
検証可能な報酬(RLVR)による強化学習は、学習後の中核的なレシピとなっている。
textbfNear-Future textbfPolicy textbfOptimization (textbfNPO)を提案する。
論文 参考訳(メタデータ) (2026-04-22T16:20:41Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models [56.055015597319674]
検証可能な報酬(RLVR)を用いた強化学習は,大規模言語モデル(LLM)の推論能力の向上に有効である
近年の自己回帰法は LLM の推論能力を解き放つためのラベルフリーな代替手段について検討している。
我々は、他の視点から補完的な監督を求めることにより、トレーニングの安定性を向上させる新しい自己監督型RLフレームワークであるtextitCo-rewardingを提案する。
論文 参考訳(メタデータ) (2025-08-01T08:09:14Z) - SATORI-R1: Incentivizing Multimodal Reasoning with Spatial Grounding and Verifiable Rewards [23.02076024811612]
DeepSeek-R1は、安定強化学習(RL)を通じてテキスト領域で強力な推論能力を示した
本稿では、VQAを3つの検証段階に分解するSATORI(textbfSpatially$ $textbfAnchored$ $textbfTask$ $textbfOptimization$ with $textbfRetextbfInforcement$ Learning)を紹介する。
実験では、7つのVQAベンチマークで一貫したパフォーマンス改善が示され、最大15.7%の改善が達成された。
論文 参考訳(メタデータ) (2025-05-25T11:11:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。