論文の概要: Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- arxiv url: http://arxiv.org/abs/2607.07690v1
- Date: Wed, 08 Jul 2026 17:49:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.48209
- Title: Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning
- Title(参考訳): Agon: 競合的クロスモデルRL: 推論の入念なRival Grading
- Authors: Vladislav Beliaev,
- Abstract要約: Agonは、互いに競合する2つのモデルのグレーダーを作成する。
役割の交互に、ひとつのソリューションをドラフトし、もう1つは解決しながらそれを読み、それぞれが他方を解き放つことで報酬を得る。
今のところ、モデルはテキストで話し、次のステップは、潜在空間で一緒に推論できるようにすることです。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning from verifiable rewards (e.g. GRPO) is the engine behind today's reasoning models, yet it grades only the final answer. On hard problems this trains models to write more rather than to think better, since the trace itself is never graded and no label for good thinking exists. We introduce Agon, which makes two competing models each other's graders. Both attempt the same problem; in alternating roles, one drafts a solution and the other reads it while solving, and each is rewarded for out-solving the other. To win, a model must out-reason a rival that has seen its work, so reasoning is judged implicitly during training, with no process labels and no reward model. Because both models are optimized, each faces a progressively stronger rival, which single-model RL cannot provide. The two need only be comparably strong and behaviorally different. At inference the pair deploys as it trains, a two-stage cascade in which one model drafts and the other answers after reading the draft. On the hard split of DeepMath with Qwen3, this doubles GRPO's pass@1, roughly eight times the gain of an untrained Mixture-of-Agents pass over the same base. The ordering replicates on competitive-programming code and across model families (Qwen3.5, Gemma 4). For now the models talk in text; the next step is to let them reason together in latent space.
- Abstract(参考訳): 検証可能な報酬(例えばGRPO)からの強化学習は、今日の推論モデルの背後にあるエンジンですが、最終回答のみを評価します。
難しい問題では、トレース自体がグレードされず、良い思考のラベルも存在しないため、よりよく考えるよりももっと書くことを訓練する。
Agonは、互いに競合する2つのモデルのグレーダーを作成する。
どちらも同じ問題を試行する — 役割の交互に、ソリューションをドラフトし、解決しながら読み上げ、それぞれが他方を解き放つことで報奨を受ける。
勝利するためには、モデルは、その仕事を見たライバルを圧倒しなければならないので、推論はトレーニング中に暗黙的に判断され、プロセスラベルがなく、報酬モデルも存在しない。
どちらのモデルも最適化されているため、それぞれのモデルは、シングルモデルRLが提供できない、徐々に強力なライバルに直面している。
両者は互いに強く行動的に異なるだけである。
推論時に、ペアは訓練中にデプロイされ、2段階のカスケードで、1つのモデルドラフトと、もう1つのモデルドラフトを読んだ後に回答する。
Qwen3とのDeepMathのハード分割では、GRPOのpass@1が倍になり、トレーニングされていないMixture-of-Agentsの利得の約8倍になる。
注文は競合プログラミングコードとモデルファミリ(Qwen3.5, Gemma 4)間で複製される。
今のところ、モデルはテキストで話し、次のステップは、潜在空間で一緒に推論できるようにすることです。
関連論文リスト
- Think Twice: Branch-and-Rethink Reasoning Reward Model [32.70732791642558]
本稿では,2ターンのRMであるブランチ・アンド・リコンプリート(BR-RM)について紹介する。
我々は、厳密なフォーマットチェックによる単純なバイナリ結果報酬を用いて、構造化された2ターントレース上でGRPOスタイルの強化学習を訓練する。
All-at-oncescoringinto focus, second-lookreasoning を変換することにより、BR-RMreducesjudgmentdiffusionand は微妙で連続的な誤りに対する感受性を高める。
論文 参考訳(メタデータ) (2025-10-27T17:58:07Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - Don't Throw Away Your Pretrained Model [68.63558351111303]
私たちは、モデルコラボレーションを通じて両方の世界を最大限に活用することを目指しています。
そこで我々は,事前訓練されたモデルバージョンが,応答シーケンスで「話し方」を交互に行うスイッチ生成を提案する。
論文 参考訳(メタデータ) (2025-10-10T23:12:20Z) - J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning [54.85131761693927]
意思決定前にLLM審査員に思考を教えるための強化学習フレームワークであるJ1を紹介する。
私たちのコアコントリビューションは、検証不可能で検証可能なプロンプトのすべての判断タスクを、検証可能な報酬を持った統一フォーマットに変換することです。
次に、RLを用いて8B、32B、70Bのスケールで思考判断を訓練し、彼らが最先端のパフォーマンスを得ることを示す。
論文 参考訳(メタデータ) (2025-05-15T14:05:15Z) - Self-supervised Analogical Learning using Language Models [59.64260218737556]
自己教師型アナログ学習フレームワークであるSALを提案する。
SALは人間の類推過程を模倣し、高品質な記号解を明示的に伝達するようモデルを訓練する。
得られたモデルは、幅広い推論ベンチマークでベース言語モデルより優れていることを示す。
論文 参考訳(メタデータ) (2025-02-03T02:31:26Z) - SuperCorrect: Advancing Small LLM Reasoning with Thought Template Distillation and Self-Correction [89.56181323849512]
SuperCorrectは、大きな教師モデルを使用して、より小さな学生モデルの推論と反映の両方を監督し、修正する新しい2段階のフレームワークである。
第1段階では、教師モデルから階層的な高レベルかつ詳細な思考テンプレートを抽出し、よりきめ細かい推論思考を導き出す学生モデルを指導する。
第2段階では、学生モデルの自己補正能力を高めるために、クロスモデル協調直接選好最適化(DPO)を導入する。
論文 参考訳(メタデータ) (2024-10-11T17:25:52Z) - The Model Counting Competition 2020 [3.7706789983985303]
モデルカウント(MC)コンペティションは2019年秋に考案された。
このコンペティションは、アプリケーションを育成し、新しい挑戦的なベンチマークを特定し、新しいソルバを促進することを目的としている。
合計で,8グループから34バージョンで,驚くべき数の解答者を得た。
論文 参考訳(メタデータ) (2020-12-02T16:52:07Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。