論文の概要: CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.09324v1
- Date: Mon, 10 Aug 2026 09:06:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.175445
- Title: CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning
- Title(参考訳): CoRE: テスト時間強化学習のための平衡によるコンセンサスリワード
- Abstract要約: emphCoREはトレーニングされていないベースを平均で+21.7ドル、多数投票で$20.4ドルで改善する。
投票ボックスではなくグラフとしてロールアウトグループを扱い、不安定な投票を、余分なロールアウトコストなしで、校正され、格付けされ、自己監督された報酬に変える。
- 参考スコア(独自算出の注目度): 6.071121358322323
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: On unlabeled test data, reinforcement learning lacks a ground-truth reward; test-time RL methods derive one from the model's own roll-outs, rewarding those that match the majority vote over $N$ sampled answers. That vote discards a correct answer whenever it is a minority and scores every majority-matching roll-out identically. We replace it with \emph{CoRE} (Consensus Rewards via Equilibrium): the $N$ roll-outs form a graph whose edges combine answer agreement, reasoning similarity, and generation confidence, and replicator dynamics extract its dominant set, yielding a refined pseudo-label, a graded per-roll-out reward, and a per-question cohesiveness gate. CoRE strictly generalizes voting: majority voting is recovered as a special case; a block-value analysis gives a sharp threshold for when consensus recovers a correct minority against a larger wrong plurality; and confidence calibration provably lowers that threshold multiplicatively. Across seven backbones and five benchmarks (42 model--benchmark cells, three seeds each), \emph{CoRE} improves the untrained base by $+21.7$ points on average versus $+20.4$ for majority-vote TTRL, wins wherever agreement is contestable with margins over the vote of up to $+7.5$ points, and reaches the voting baseline's plateau accuracy in $54$--$70$\% fewer steps. Consensus, not counting: treating the roll-out group as a graph rather than a ballot box turns a brittle vote into a calibrated, graded, self-supervised reward at no extra roll-out cost.
- Abstract(参考訳): テストタイムのRLメソッドは、モデル自身のロールアウトから派生したもので、N$サンプルの回答よりも過半数の投票にマッチする人たちに報酬を与える。
この投票は、少数派であるたびに正しい答えを破棄し、すべての多数派一致のロールアウトを同一に得点する。
我々はそれを \emph{CoRE} (Consensus Rewards via Equilibrium) に置き換える:$N$のロールアウトは、応答の一致、類似性の推論、生成信頼を結合したグラフを形成し、複製子ダイナミクスはその支配的な集合を抽出し、洗練された擬ラベル、次数付きロールアウトの報酬、要求ごとの凝集度ゲートを生成する。
CoREは投票を厳密に一般化する: 多数決は特別な場合として回収される; ブロック値解析は、コンセンサスが正しいマイノリティを、より大きな間違った複数に対して回復するときに鋭い閾値を与える; 信頼度校正は、確実にその閾値を乗法的に低下させる。
7つのバックボーンと5つのベンチマーク(それぞれ42のモデル-ベンチマークセル、3つのシード)で、emph{CoRE} はトレーニングされていないベースを平均で+21.7ドル、多数決投票TTRLで$+20.4ドル、最大で$7.5ドル、投票ベースラインの高原精度を54ドル--70ドル\%で改善している。
投票ボックスではなく、ロールアウトグループをグラフとして扱うことで、不安定な投票は、余分なロールアウトコストなしで、キャリブレーションされ、グレードされ、自己管理された報酬に変わります。
関連論文リスト
- TTPO: Test-Time Policy Optimization [53.81524570216593]
テストタイムポリシー最適化(TTPO)は、OPSDを介してロールアウトに同意し、Grouped RLと不一致なロールアウトを罰する非対称な目的である。
TTPOは5つの競合レベルのベンチマークでラベル管理されたOPSDと一致し、Qwen3-1.7Bは38.0%から45.2%まで上昇し、思考せずに+25.2%から+36.4%に上昇し、クロスタスクの一般化を示す。
論文 参考訳(メタデータ) (2026-08-27T17:58:10Z) - Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL [11.857468467125505]
トレーニング中に2つのスコアが分岐していることが分かりました。
一定のバイアスを持つ審査員は、トレーニングスコアが上昇している間に、金の曲線を一定にシフトさせる。
我々は、ニューロンのドロップアウトから借りた1行の修正であるDropoutを提案する。
論文 参考訳(メタデータ) (2026-08-12T05:29:21Z) - Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short [51.667769734342635]
検証可能な報酬付き強化学習(RLVR)は,大規模言語モデルの推論能力向上のための主要なパラダイムとなっている。
本研究では,非多変量報酬群を判定システムにルーティングする適応学習フレームワークであるReasoning Arenaを提案する。
我々は、Reasoning Arenaが、競争数学やコーディングベンチマークにおいて、RLVRベースラインを平均で7.6%上回っていることを示す。
論文 参考訳(メタデータ) (2026-06-08T11:57:17Z) - A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR [1.2958054117511815]
報酬からの強化学習は、報酬信号が刺激的であっても推論を改善する。
実践者は一般的に、報酬-設計効果として naive = acc(TRUE) - acc(R) を解釈する。
我々はこの推定が体系的に偏っていることを証明している。
論文 参考訳(メタデータ) (2026-06-04T09:35:54Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Pause and Reflect: Conformal Aggregation for Chain-of-Thought Reasoning [8.024041325202612]
自己整合性を考慮した思考の連鎖(CoT)推論は、複数のサンプル推論パスを集約することで性能を向上させる。
集約不確実性に直接対処するCoT推論のコンフォメーション手順を導入する。
提案手法は,多数決を推理経路よりも重み付けしたスコアアグリゲーションに置き換え,共形リスク制御を用いた棄権規則を校正する。
論文 参考訳(メタデータ) (2026-05-13T20:33:59Z) - JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR [39.03968285406107]
JURY-RLはラベルのないRLVRフレームワークで、報酬処理から回答提案を分離する。
数学的推論ベンチマークにおいて、ラベルなしのベースラインを一貫して上回る。
Pass@1パフォーマンスは、教師付き地道トレーニングに匹敵する。
論文 参考訳(メタデータ) (2026-04-28T09:29:00Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision [26.922922043969958]
我々は、コンピュータ・アズ・教師(CaT)による調査を監督に転換することを提案する。
CaTは平行ロールアウトのグループから単一の参照を合成し、それに向けて最適化する。
テストタイムの手順として、CaTはGemma 3 4B、Qwen 3 4B、Llama 3.1 8Bを改善している。
論文 参考訳(メタデータ) (2025-09-17T17:59:42Z) - The Majority is not always right: RL training for solution aggregation [53.1050856072799]
我々はアグリゲータモデルをトレーニングし、最終的な正解をレビューし、精査し、合成する。
重要な要素は、簡単なトレーニング例と厳しいトレーニング例のバランスを取ることだ。
我々の手法であるAggLMは、強いルールベースと報酬モデルベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2025-09-08T16:39:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。