論文の概要: Questioning the Questions: Sustaining Self-Evolution in Reasoning Models
- arxiv url: http://arxiv.org/abs/2610.04299v1
- Date: Sat, 03 Oct 2026 05:24:47 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:42:18.131673
- Title: Questioning the Questions: Sustaining Self-Evolution in Reasoning Models
- Title(参考訳): 質問:推論モデルにおける自己進化の持続
- Abstract要約: 自己進化的推論モデルは、自分自身が生成した質問から学習するが、繰り返し自己学習はパフォーマンスの崩壊につながる。
本分析では, 自己生成質問における2つの繰り返し品質問題, 無効質問と同じ数学的質問の繰り返し変種を同定する。
質問の妥当性と新規性フィードバックを用いて自己進化を導くR-Questを紹介する。
- 参考スコア(独自算出の注目度): 14.813374747313373
- License:
- Abstract: Self-evolving reasoning models learn from their own generated questions, yet repeated self-training can lead to performance collapse. In this paper, we investigate why performance deteriorates over successive rounds and how to sustain self-evolution. Our analysis identifies two recurring quality problems in self-generated questions: invalid questions and repeated variants of the same mathematical questions. First, invalid questions become more prevalent across rounds, and answer-consistency filtering further increases their proportion in training data. Second, existing question diversity controls based on lexical similarity can miss mathematically equivalent questions expressed in different ways, which leads to question diversity collapse in later training rounds. Building on these findings, we introduce R-Quest, which uses question validity and novelty feedback to guide self-evolution. We first train the solver to recognize and reject invalid questions, then use its judgments to guide questioner rewards and filter solver training data. To avoid question repetition, we use a frozen base model to compare sampled question pairs and provide novelty feedback. Empirically, our method consistently achieves the highest average performance on 12 benchmarks in mathematical reasoning, general-domain reasoning, and code generation across two model families. Additionally, R-Quest maintains stable performance gains over ten rounds of self-evolution, peaking in the final round and outperforming R-Zero by 17.32 points.
- Abstract(参考訳): 自己進化的推論モデルは、自分自身が生成した質問から学習するが、繰り返し自己学習はパフォーマンスの崩壊につながる。
本稿では,連続ラウンドで性能が悪化する理由と自己進化の維持方法について検討する。
本分析では, 自己生成質問における2つの繰り返し品質問題, 無効質問と同じ数学的質問の繰り返し変種を同定する。
第一に、不正な質問はラウンド間でより広まり、回答一貫性のフィルタリングはトレーニングデータの比率をさらに高めます。
第二に、語彙的類似性に基づく既存の質問の多様性制御は、数学的に等価な様々な方法で表現された質問を見逃しかねないため、後の訓練ラウンドで質問の多様性が崩壊する。
これらの知見に基づいて,質問の妥当性と新規性フィードバックを用いて自己進化を導くR-Questを紹介した。
まず、不正な質問を認識して拒否するように、そしてその判断を使って質問者の報酬を導き、解決者のトレーニングデータをフィルタリングする。
質問の繰り返しを避けるため、凍結ベースモデルを用いて、サンプルの質問対を比較し、新しいフィードバックを提供する。
理論的推論,一般領域推論,および2つのモデルファミリ間のコード生成において,本手法は,12ベンチマークにおいて常に高い平均性能を達成している。
さらに、R-Questは10ラウンド以上の自己進化の安定的なパフォーマンス向上を維持し、最終ラウンドでピークを迎え、R-Zeroを17.32ポイント上回った。
関連論文リスト
- Beyond Uncertainty: Multi-Solver Disagreement Rewards for Self-Evolving Reasoning Curricula [0.0]
自己進化的推論フレームワークは、チャレンジャーに、解決者の弱点を明らかにする質問を生成するように訓練する。
既存のアプローチでは、チャレンジャーの報酬として1つのソルバのサンプリングの不確実性を用いる。
モデル容量とサンプリング温度に異なる異種アンサンブルを用いたマルチソルバ不一致報酬を提案する。
論文 参考訳(メタデータ) (2026-08-30T20:49:16Z) - Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics [4.56953073429622]
トレーニングデータは乏しく、地道的な推論の痕跡は通常利用できないため、モデルはしばしば、追加のデータが更なる改善をもたらすことのない、明らかな天井を示す。
コンペティション数学(AIME)におけるQwen2.5-Math-7Bを微調整した制御環境でのこれらの困難について検討する。
本稿では,各ラウンドで現在のチェックポイントの評価を行い,その問題からQbQの種を抽出し,その結果の変種を学習する自己進化カリキュラムを提案する。
論文 参考訳(メタデータ) (2026-08-02T22:19:01Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training [65.13759782915164]
反復的なチャレンジャーブートストラップループによる自己再生LDM推論。
R-Diverseは、より多くのイテレーション以上のゲインを持続し、常に以前のセルフプレイメソッドより優れています。
論文 参考訳(メタデータ) (2026-02-13T17:07:42Z) - TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement [7.122068644799895]
テストタイムトレーニングは、テスト質問のみを使用してモデル適応を可能にする。
自己回帰テスト時自己進化学習フレームワークである textbfTTSR を提案する。
論文 参考訳(メタデータ) (2026-02-06T18:55:40Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - Boosting Process-Correct CoT Reasoning by Modeling Solvability of Multiple-Choice QA [10.122669382758122]
モデルに対して質問が効果的に解決できない場合、思考の急激な連鎖(CoT)が出現しがちであることを示す。
結果監督型報酬モデルと強化学習をグループ相対的優位性で適用し,その目的に可解性を取り入れた。
本結果は,CoT推論における幻覚の低減と信頼性向上の鍵要因として可溶性を強調した。
論文 参考訳(メタデータ) (2025-09-30T08:34:16Z) - An Empirical Comparison of LM-based Question and Answer Generation
Methods [79.31199020420827]
質問と回答の生成(QAG)は、コンテキストが与えられた質問と回答のペアのセットを生成することで構成される。
本稿では,シーケンス・ツー・シーケンス言語モデル(LM)を微調整する3つの異なるQAG手法を用いて,ベースラインを確立する。
実験により、学習時間と推論時間の両方で計算的に軽量なエンドツーエンドQAGモデルが一般に堅牢であり、他のより複雑なアプローチよりも優れていることが示された。
論文 参考訳(メタデータ) (2023-05-26T14:59:53Z) - Toward Unsupervised Realistic Visual Question Answering [70.67698100148414]
現実的なVQA(RVQA)の問題について検討し、モデルが答えられない質問(UQ)を拒絶し、答えられる質問(AQ)に答えなければならない。
1)データセットには不整合UQが多すぎること,(2)多数の注釈付きUQがトレーニングに必要とされること,の2つの欠点を最初に指摘した。
我々は、既存のVQAデータセットのAQと約29万の人間の注釈付きUQを組み合わせた新しいテストデータセットRGQAを提案する。
これは、画像と質問をランダムにペアリングして得られる擬似UQと、それを結合する。
論文 参考訳(メタデータ) (2023-03-09T06:58:29Z) - Learning with Instance Bundles for Reading Comprehension [61.823444215188296]
質問応答スコアを複数の関連インスタンスで比較する新しい監視手法を提案する。
具体的には、密接に対照的な質問や回答のさまざまな近所でこれらのスコアを正規化します。
2つのデータセット上のインスタンスバンドルによるトレーニングの有効性を実証的に実証する。
論文 参考訳(メタデータ) (2021-04-18T06:17:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。