論文の概要: Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
- arxiv url: http://arxiv.org/abs/2608.05148v1
- Date: Wed, 05 Aug 2026 17:59:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:44.078221
- Title: Reasoning Core: Designing Broad Procedural Data for Completion-Supervised Reasoning Training
- Title(参考訳): Reasoning Core: 補完監督型Reasoning Trainingのための広義の手続きデータの設計
- Authors: Damien Sileo, Valentin Lacombe, Dimitri Kachler,
- Abstract要約: Reasoning Coreは、数学、論理学、計画、状態追跡、形式言語、構造化データ、ゲーム、因果性、コードにまたがる50のジェネレータのコレクションである。
Reasoning CoreとProcedural Warmup, Reasoning Gym, SynLogicを比較した。
Reasoning Coreは、DROP、LogiQA、ARC-Challengeで最高スコアを達成している。
- 参考スコア(独自算出の注目度): 2.62112541805429
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Procedural generators produce useful verifiable reasoning problems at scale, but have received less attention as data for completion-supervised fine-tuning. We introduce Reasoning Core, a collection of 50 generators spanning mathematics, logic, planning, state tracking, formal languages, structured data, games, causality, and code, with semantic scorers, difficulty controls, and task evaluators. Under a matched completion-supervised protocol, we compare Reasoning Core with Procedural Warmup, Reasoning Gym, and SynLogic across four base-model settings and multiple training durations. In the primary 3B comparison, Reasoning Core achieves the highest mean scores on DROP, LogiQA, and ARC-Challenge, exceeding both the baseline without procedural data and all three alternative procedural collections. Task-level analyses show that semantic validity alone does not ensure training utility, highlighting compact targets and calibrated difficulty as important design factors. We ran audits combining model-assisted review, human adjudication, and regression testing. Applied throughout Reasoning Core development and to the other collections, they reveal subtle mismatches among generation, rendering, targets, and scoring, a reminder that procedural generation alone does not guarantee correctness. The library, generated datasets, and audit material are publicly available.
- Abstract(参考訳): プロシージャジェネレータは、大規模に検証可能な推論問題を生成するが、補修監督された微調整のためのデータとしてはあまり注目されていない。
数学、論理学、計画、状態追跡、形式言語、構造化データ、ゲーム、因果性、コードにまたがる50個のジェネレータからなるReasoning Coreを紹介します。
一致した完了管理プロトコルの下では、Reasoning CoreとProcedural Warmup、Reasoning Gym、SynLogicを4つのベースモデル設定と複数のトレーニング期間で比較する。
第一の3B比較では、Reasoning CoreはDROP、LogiQA、ARC-Challengeで最高スコアを達成し、プロシージャデータなしでベースラインを上回り、3つの代替プロシージャコレクション全てを上回ります。
タスクレベルの分析では、セマンティックな妥当性だけではトレーニングユーティリティを保証せず、コンパクトなターゲットとキャリブレーションの難しさを重要な設計要因として強調している。
モデル支援レビュー,ヒトの判断,回帰テストを組み合わせた監査を行った。
Reasoning Core開発と他のコレクションに適用すると、生成、レンダリング、ターゲット、スコアの微妙なミスマッチが明らかになる。
ライブラリ、生成されたデータセット、監査資料が公開されている。
関連論文リスト
- RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents [0.0]
RigorBenchは、AIコーディングエージェントのプロセス規律を測定する最初のベンチマークである。
プランニングフィデリティ、検証カバレッジ、回復効率、吸収品質、原子遷移積分の5つの柱にまたがるハーネスを評価している。
その結果,構造化プロセスの規律はプロセス品質のスコアを平均41%向上させ,下流結果の正しさを17%向上させることがわかった。
論文 参考訳(メタデータ) (2026-06-21T21:41:34Z) - What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code [72.9921566968371]
ドメイン分離のきめ細かい10T-tokenコーパスにおける事前学習の制御実験により,コードが推論を改善するという主張を再考する。
コードはプログラミング能力を大幅に改善するが、一般的な推論エンハンサーとして機能しない。
コード-テキストと数学-テキストの混合のようなドメイン間構造的推論トレースがよりうまく説明されている。
論文 参考訳(メタデータ) (2026-05-19T12:37:01Z) - Evian: Towards Explainable Visual Instruction-tuning Data Auditing [14.93566912726999]
本稿では,モデル応答を構成的認知要素に分解する「分解的評価」パラダイムを提案する。
このパラダイムを、画像テキスト一貫性、論理コヒーレンス、ファクチュアル正確性の軸に沿ってこれらのコンポーネントを評価する自動化フレームワークであるEVIANを介してインスタンス化する。
論文 参考訳(メタデータ) (2026-04-22T13:28:27Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection [53.988759250627425]
HeROD(Heuristic-inspired ROD)は、明示的で解釈可能な空間的および意味的推論を注入する軽量でモデルに依存しないフレームワークである。
HeRODは、スカーセラベル体制において強い接地ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-03-25T10:33:22Z) - Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training [2.62112541805429]
Reasoning Coreは、コア形式ドメイン間で検証可能なシンボリック推論データを手続き的に生成するスケーラブルなスイートである。
各タスクは厳密な検証のための外部解決器と組み合わせられ、カリキュラム設計のための継続的な難易度制御が認められる。
実験によると、Reasoning Coreのデータを事前トレーニングに混ぜることによって、下流の推論が改善され、保存されたり、わずかに改善された言語モデリングの品質が向上する。
論文 参考訳(メタデータ) (2026-03-02T18:59:29Z) - BRIDGE: Building Representations In Domain Guided Program Verification [67.36686119518441]
BRIDGEは、検証をコード、仕様、証明の3つの相互接続ドメインに分解する。
提案手法は, 標準誤差フィードバック法よりも精度と効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-11-26T06:39:19Z) - Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning [65.20602712957725]
Cacoは、高品質で検証可能な多様な命令-CoT推論データの合成を自動化する新しいフレームワークである。
我々の研究は、人間の介入なしに自己持続的で信頼できる推論システムを構築するためのパラダイムを確立します。
論文 参考訳(メタデータ) (2025-10-05T07:59:24Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - Reasoning Through Execution: Unifying Process and Outcome Rewards for Code Generation [27.484259938667776]
大規模言語モデルはコード生成に優れていますが、推論を必要とする複雑なプログラミングタスクに苦労します。
本稿では,実行可能検証を活用することで,プロセスと結果の監視を統一するアウトカム・リフィニング・プロセス・スーパービジョンを紹介する。
5つのモデルと3つのベンチマークによる実験では、26.9%の精度でコード効率が42.2%向上した。
論文 参考訳(メタデータ) (2024-12-19T17:59:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。