論文の概要: Consensus as Privileged Context for Label-Free Self-Distillation
- arxiv url: http://arxiv.org/abs/2607.13643v1
- Date: Wed, 15 Jul 2026 09:39:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-16 16:39:12.721628
- Title: Consensus as Privileged Context for Label-Free Self-Distillation
- Title(参考訳): ラベルなし自己蒸留のための主観的文脈としてのコンセンサス
- Authors: John Gkountouras, Josip Jukić, Ivan Titov,
- Abstract要約: CANON(Consensus-Anchored Self-distillation)は、コンセンサスを密集したトークンレベルの監視に転換するラベルフリーのトレーニング手法である。
CanONはpass@1を最大12ポイント改善し、ラベルなしの強化学習を計算の7分の1で6ポイント上回る。
- 参考スコア(独自算出の注目度): 12.523025093871304
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Sampling multiple solutions and returning the majority answer is among the most reliable ways to improve the reasoning accuracy of large language models without labels, and a growing family of methods converts this consensus signal into training supervision. However, existing approaches use consensus only in restricted forms: as a filter that selects solutions for fine-tuning, as a preference between answers, or as a scalar reward for reinforcement learning, discarding most of the information that the agreeing solutions contain. We present CANON (Consensus-ANchored self-distillatiON), a label-free training method that turns consensus into dense, token-level supervision. For each unlabeled prompt, CANON samples multiple solutions, extracts the majority answer, and conditions a frozen snapshot of the model on a solution that reaches it; this consensus-anchored teacher then supervises the model on its own rollouts at every token. Experiments on mathematical and scientific reasoning benchmarks show that CANON improves pass@1 by up to 12 points, outperforming label-free reinforcement learning by 6 points at a seventh of its compute and approaching a teacher conditioned on gold solutions; trained on pooled unlabeled data, it transfers to held-out benchmarks, matching training methods that use gold labels. Analysis suggests that the improvements are not pure distribution sharpening: after training, the model solves problems it previously never solved in 32 attempts, and its majority vote itself becomes more accurate.
- Abstract(参考訳): 複数のソリューションをサンプリングし、大多数の回答を返すことは、ラベルなしで大きな言語モデルの推論精度を改善する最も信頼できる方法の1つである。
しかし、既存のアプローチではコンセンサスを制限された形でのみ利用しており、微調整のソリューションを選択するフィルターとして、回答の選好として、あるいは強化学習のためのスカラー報酬として、合意されたソリューションが持つ情報の大半を破棄する。
本稿では,CANON(Consensus-ANchored Self-distillation)について述べる。
ラベル付けされていない各プロンプトに対して、CANONは複数のソリューションをサンプリングし、多数回答を抽出し、それに到達するソリューション上でモデルの凍結スナップショットを条件付けます。
数学的および科学的推論ベンチマークの実験によると、CANONはパス@1を最大12ポイント改善し、計算の7分の1でラベルなしの強化学習を6ポイント向上し、ゴールドソリューションに条件付けられた教師に近づく。
トレーニング後、モデルは32回の試行で未解決の問題を解決し、多数決自体がより正確になる。
関連論文リスト
- Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution [52.691495954442985]
CoVerRLは1つのモデルがジェネレータと検証ロールを交換するフレームワークで、各機能が他方をブートストラップする。
Qwen と Llama のモデルファミリーでの実験では、CoVerRL は数理推論のベンチマークで4.7-5.9% でラベルなしのベースラインを上回っている。
自己検証の精度は55%から85%以上改善され、両方の能力が真に共存することを確認した。
論文 参考訳(メタデータ) (2026-03-18T14:38:55Z) - Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning [48.14470449860784]
テスト時強化学習(TTRL)は、推論時に合成信号のみを使用してモデルを適応するためのラベルなしパラダイムを提供する。
簡単な直感に基づくフレームワークであるSelf-Harmonyを紹介します。
論文 参考訳(メタデータ) (2025-11-03T03:34:34Z) - Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers [63.99316853136304]
ミラー・クリティク(Mirror-Critique)は、情報的批評で検証者を訓練する枠組みである。
我々は、高品質な批判データを合成するために、小さな命令調整モデルを展開する。
結果として得られるミラー検証は、ソリューション毎に複数の批判を生成することで、候補ソリューションを評価するためにデプロイされる。
論文 参考訳(メタデータ) (2025-09-27T06:50:24Z) - The Majority is not always right: RL training for solution aggregation [53.1050856072799]
我々はアグリゲータモデルをトレーニングし、最終的な正解をレビューし、精査し、合成する。
重要な要素は、簡単なトレーニング例と厳しいトレーニング例のバランスを取ることだ。
我々の手法であるAggLMは、強いルールベースと報酬モデルベースラインの両方を上回ります。
論文 参考訳(メタデータ) (2025-09-08T16:39:38Z) - Rationale-Aware Answer Verification by Pairwise Self-Evaluation [11.763229353978321]
信頼性のある検証器の訓練には,最終回答の正しさに加えて,有理数の有効性の確保が必要であることを示す。
本結果から, 信頼性検証には, 正解の正確性に加えて, 有理数の有効性の確保が必要であることが示唆された。
論文 参考訳(メタデータ) (2024-10-07T08:53:00Z) - A Mutual Information Maximization Approach for the Spurious Solution
Problem in Weakly Supervised Question Answering [60.768146126094955]
弱々しい教師付き質問応答は通常、最終的な答えのみを監督信号として持つ。
偶然に正解を導出する刺激的な解が多数存在するかもしれないが、そのような解の訓練はモデルの性能を損なう可能性がある。
本稿では,質問応答対と予測解間の相互情報の最大化により,このような意味的相関を明示的に活用することを提案する。
論文 参考訳(メタデータ) (2021-06-14T05:47:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。