論文の概要: DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory
- arxiv url: http://arxiv.org/abs/2609.00768v1
- Date: Tue, 01 Sep 2026 05:54:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.407226
- Title: DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory
- Title(参考訳): DiagEvo:階層的エラーメモリによる診断ガイドによる自己進化
- Authors: Xincheng Wei, Yifan Ding, Yoshua Li, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Wenjian Ding, Yao Zhang,
- Abstract要約: セルフプレイは言語モデルによる自己進化の効果的なパラダイムであるが、ガイダンスがなければ、ソルバのパフォーマンスは低下または低下する可能性がある。
そこで我々はDiagEvoを紹介し、その診断者がこの履歴から繰り返し発生するエラーの原因を抽出し、それらを階層的なエラー原因記憶に格納する。
DiagEvoは、各3つのソルバの9つのベンチマークの平均的精度で、すべてのベースラインを上回ります。
- 参考スコア(独自算出の注目度): 27.45807368624313
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-play is an effective paradigm for language-model self-evolution, but without guidance, solver performance can plateau or decline across rounds. Unguided methods steer question generation with signals such as difficulty, learnability, or diversity. These signals keep questions challenging and varied but do not specify which unresolved reasoning weaknesses later rounds should target. Guided methods obtain direction from external task resources, including human examples, document corpora, or specified difficulty targets, and therefore rely on task information supplied outside the self-play loop. We show that the needed direction can instead be derived from the solver's own failure history. We introduce DiagEvo, whose diagnostician extracts recurring error causes from this history and stores them in a hierarchical error-cause memory. The memory groups related causes under skill nodes and tracks each as Active or Mastered according to self-consistency on targeted questions. The challenger uses these states and recurrence counts to balance cause-targeted generation with free exploration. Double-confidence filtering retains intermediate-difficulty questions only when the most common solver answer has a clear vote lead. DiagEvo derives its curriculum from information produced during self-play, without external task resources. With the default 4B diagnostician, DiagEvo outperforms every baseline in mean accuracy across all nine benchmarks for each of the three solvers: Qwen3-4B, Qwen3-8B, and OctoThinker-8B. On Qwen3-8B, it reaches 72.3% mean accuracy across five mathematical reasoning benchmarks, 4.5 percentage points above R-Zero. Its mean accuracy across all nine benchmarks is 57.4%, 1.1 percentage points above DARC. Ablations show that the hierarchical error-cause memory and double-confidence filtering both contribute to these gains.
- Abstract(参考訳): セルフプレイは、言語モデルによる自己進化の効果的なパラダイムであるが、ガイダンスがなければ、ソルバのパフォーマンスは、ラウンド全体で低下または低下する可能性がある。
無指導の手法は、難易度、学習可能性、多様性などの信号で質問生成を操る。
これらの信号は、疑問を挑戦し、変化させ続けるが、後続のラウンドがどの未解決の推論弱点を標的にするかは特定しない。
ガイドされた方法は、人間の例、文書コーパス、特定困難目標を含む外部のタスクリソースから指示を得るため、セルフプレイループの外で提供されるタスク情報に依存する。
必要な方向は、代わりに、解決者自身の失敗履歴から導出できることが示されます。
診断者がこの履歴から繰り返し発生するエラーの原因を抽出し、それらを階層的なエラー原因記憶に格納するDiagEvoを紹介する。
メモリグループに関連する原因は、スキルノードの下で発生し、ターゲットとする質問に対する自己整合性に応じて、それぞれをアクティブまたはマスタとして追跡する。
挑戦者はこれらの状態と再発数を使って、原因を標的とした世代と自由な探索のバランスをとる。
二重信頼フィルタリングは、最も一般的な解答者が明確な得票率を持つ場合にのみ、中間差分質問を保持する。
DiagEvoは、外部のタスクリソースを使わずに、セルフプレイ時に生成された情報からカリキュラムを導出する。
デフォルトの4B診断器では、DiagEvoは、Qwen3-4B、Qwen3-8B、OctoThinker-8Bという3つのソルバのそれぞれで、平均9つのベンチマークで、すべてのベースラインを平均精度で上回る。
Qwen3-8Bでは、5つの数学的推論ベンチマークの平均精度が72.3%に達し、R-Zeroよりも4.5ポイント高い。
9つのベンチマークの平均精度は57.4%であり、DARCよりも1.1ポイント高い。
アブレーションは、階層的エラーの原因となるメモリと二重信頼フィルタリングの両方がこれらの利得に寄与していることを示している。
関連論文リスト
- Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Scaling Self-Play with Self-Guidance [62.13619253976748]
Self-Guided Self-Play (SGS)は、Conjecturerをジェネラシーから遠ざけるセルフプレイアルゴリズムである。
SGSは80ラウンド未満のセルフプレイで、最強のベースラインの解決率を上回っています。
論文 参考訳(メタデータ) (2026-04-22T05:50:23Z) - HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help? [32.54022440678003]
コーディングエージェントは、完全なコンテキストが与えられたときに複雑なタスクを解決します。
現在のベンチマークは、この障害モードに盲目です。
我々はこの選択的エスカレーションスキルを測定するためにHiL-Benchを提案する。
論文 参考訳(メタデータ) (2026-04-10T15:21:44Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory [52.44029486173232]
Dynamic Cheatsheet(DC)は、永続的で進化するメモリを備えたブラックボックス言語モデルを提供する軽量フレームワークである。
DCは、蓄積した戦略、コードスニペット、および推論時に一般的な問題解決の洞察をモデルが保存し再利用することを可能にする。
このテストタイム学習は、明確な地味なラベルや人間のフィードバックを必要とせずに、幅広いタスクのパフォーマンスを大幅に向上させる。
論文 参考訳(メタデータ) (2025-04-10T17:57:33Z) - DCR: Divide-and-Conquer Reasoning for Multi-choice Question Answering with LLMs [9.561022942046279]
大規模言語モデル(LLM)の推論能力を高めるため,DCR(Divide and Conquer Reasoning)を提案する。
まず、信頼性スコア(mathcalCS$)に基づいて質問を2つのサブセットに分類する。
特に,質問を信頼性スコア(mathcalCS$)に基づいて2つのサブセットに分類する。
論文 参考訳(メタデータ) (2024-01-10T14:38:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。