論文の概要: MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2610.02824v1
- Date: Fri, 02 Oct 2026 05:16:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.215677
- Title: MetaRubric: Learning to Reward for Rubric-Based Reinforcement Learning
- Title(参考訳): MetaRubric: ルーブリックに基づく強化学習のためのリワード学習
- Abstract要約: そこで,MetaRubricを導入し,エビデンスを意識したポリシー最適化と応答誘導適応を交互に行う。
複数のバックボーン全体で、MetaRubricは、静的ジャッジGRPOよりもPubMedQAの精度を6.00-20.40ポイント向上させる。
- 参考スコア(独自算出の注目度): 25.293359481992013
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: Rubric-based reinforcement learning extends reward-driven optimization to open-ended tasks by assigning partial credit to individual response requirements. However, rubric judges can assign a high criterion score even when the information or action it requires is absent from the response, a failure mode we term Vacuous Credit. Such awards persist after the required information is removed and can reverse the sign of a response's GRPO advantage. To address this problem, we introduce MetaRubric, which alternates evidence-aware policy optimization with response-guided rubric adaptation. We construct counterfactual counterparts by changing one task-relevant fact in each prompt. During policy optimization, credit is assigned only when the response contains sufficient evidence to satisfy the required rubric criterion. After each policy-optimization stage, current policy responses guide revisions to original and counterfactual criteria while preserving the meaning of the original prompt's initial rubric as interpreted under each prompt's facts. We also adapt criterion weights at stage boundaries to better address observed policy errors. Across multiple backbones, MetaRubric improves PubMedQA accuracy by 6.00--20.40 percentage points over static-judge GRPO, with further gains on HealthBench-Hard and two multimodal medical benchmarks.
- Abstract(参考訳): ルーブリックベースの強化学習は、個々の応答要求に部分クレジットを割り当てることで、報酬駆動の最適化をオープンエンドタスクに拡張する。
しかし、ルーブリック審査員は、必要な情報やアクションが応答から欠落している場合でも高い基準スコアを割り当てることができ、これはVacuous Creditと呼ばれる失敗モードである。
このような賞は、必要な情報が削除された後に継続され、応答のGRPO優位性のサインを反転させることができる。
この問題に対処するため,MetaRubricを導入し,応答誘導ルーブリック適応とエビデンス対応ポリシーの最適化を交互に行う。
各プロンプトで1つのタスク関連事実を変更することで、対物関係を構築する。
政策最適化中は、応答が要求されるルーリック基準を満たす十分な証拠を含む場合にのみ信用が割り当てられる。
各政策最適化段階の後、現在の政策対応は、各プロンプトの事実に基づいて解釈された元のプロンプトの最初のルーリックの意味を保ちながら、原文および反ファクトの基準を改訂する。
また、ステージ境界における基準重みに適応して、観測された政策エラーに対処する。
複数のバックボーン全体で、MetaRubricは、静的ジャッジGRPOよりもPubMedQAの精度を6.00-20.40ポイント向上し、HealthBench-Hardと2つのマルチモーダル医療ベンチマークがさらに向上した。
関連論文リスト
- Momentum-Coupled Rubric Adaptation for Detailed Image Captioning [37.30965077089983]
ルーブリックに基づく強化学習を用いて,役割間のキャプション品質を向上する。
MoCoと呼ばれる2段階のフレームワークがこれらの役割を調整する。
5つのベンチマークで、MoCoの平均勝利率は72.83%であり、ハイランゲージランキングでは最高である。
論文 参考訳(メタデータ) (2026-09-29T07:22:09Z) - SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning [14.505575259468053]
テスト時強化学習(TTRL)により、ラベル付きフィードバックなしで推論時に言語モデルを自己進化させることができる。
SERPOを導入し、回答投票をクローズドループに置き換え、レスポンスエビデンス、クエリトケン、ポリシーパラメータを共進化させる。
新しいアクターロールアウトはアーカイブとルーリックの両方をリフレッシュし、3方向の進化ループを閉じる。
論文 参考訳(メタデータ) (2026-07-29T13:03:07Z) - Co-Evolving LLM Evaluators and Policies via DynamicRubric [67.2962847914162]
政策によって引き起こされたサンプルに対する評価者フィードバックによるポストトレーニングは、大きな言語モデルを改善するための主要なメカニズムとなる。
反応条件付き評価器であるDynamicRubricを提案する。
8Bバックボーンを用いた実験では、DynamicRubricは評価器のパフォーマンスを改善し、ベースラインよりも強力なポリシー管理を提供する。
論文 参考訳(メタデータ) (2026-07-22T12:35:40Z) - LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL [64.4276583943816]
検証不能な指導のための強化学習は、報酬信号としてプロンプト固有のルーリックを持つ裁判官に依存している。
最近の手法は、トレーニング中にこれらのルーリックを進化するポリシーに適応させるが、トレーニングのプロンプト自体は静的のままである。
この静的なアプローチは、しばしば急激な困難と政策能力の間に重大なミスアライメントをもたらし、裁判官は差別的な報酬信号を取り戻すことができない。
論文 参考訳(メタデータ) (2026-07-05T17:05:13Z) - SocraticPO: Policy Optimization via Interactive Guidance [64.7524628699057]
大規模言語モデルのための強化学習(RL)は通常、二項正当性のようなスカラー結果の報酬を伴う推論を監督する。
我々は、ソクラティックスタイルの自然言語ガイダンスでRLロールアウトを強化する政策最適化フレームワークであるtextbf SocraticPO(Socratic Policy Optimization)を提案する。
論文 参考訳(メタデータ) (2026-06-03T09:08:29Z) - Prompt-Level Reward Specifications for Open-Ended Post-Training [43.215398565987265]
訓練後のオープンエンドのメリットは、迅速な成功条件を明確にする報酬である。
本稿では、報酬仕様と報酬仕様を分離するプロンプトレベル報酬仕様フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-28T02:52:06Z) - RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards [76.17893114021757]
長い形式のレポートを計画し、調査し、エビデンスを評価し、合成する深層研究システムには、根本的な答えがなく、多くのツール強化された決定にまたがる。
本研究では,ルーブリックは最終回答評価者だけでなく,ポリシーの実行,判断フィードバック,エージェントメモリを構成する共有インターフェースとして機能すべきである,と論じる。
我々は、段階的な政策分解とリフレクションに基づくメタ政治進化を組み合わせたルーリック誘導強化学習フレームワークEMを導入する。
論文 参考訳(メタデータ) (2026-05-11T17:40:38Z) - Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning [1.517713730645682]
我々は,構造的かつ多条件の報酬に対してポリシを最適化するフレームワークとして,経験的地下強化学習(RL: Emphrubric-grounded reinforcement learning)を定式化する。
我々は、約10万の科学・技術文書からなるOSTI(Office of Scientific and Technical Information)由来のコーパスから潤滑剤を抽出して、この枠組みをインスタンス化する。
論文 参考訳(メタデータ) (2026-05-08T17:48:58Z) - FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation [73.22935457705057]
時間的動的文脈における再ランカ評価のためのベンチマークであるFRESCOを紹介する。
レクエンシ検索クエリと過去のウィキペディアのリビジョンを組み合わせることで、FRESCOは、セマンティックな関連性を維持しながら、リランカが事実として最新の証拠を優先順位付けできるかどうかをテストする。
我々の評価では、既存の再ランカ間で一貫した障害モードが明らかになっている。
論文 参考訳(メタデータ) (2026-04-14T17:04:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。