論文の概要: SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2608.26550v2
- Date: Tue, 01 Sep 2026 23:46:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:17.340957
- Title: SPEAR: Distilling Domain-Adaptive Reasoning Skeletons via Sequential Symbolic Alignment in Reinforcement Learning
- Title(参考訳): SPEAR:強化学習における逐次記号アライメントによるドメイン適応推論骨格の蒸留
- Authors: Zhuochun Li, Yuelyu Ji, Yiming Zeng, Daqing He,
- Abstract要約: SPEARは、シークエンスレベルのオンライン蒸留のための訓練不要でプラグアンドプレイなプロセス報酬法である。
より密集した順序対応の報酬信号を提供し、外部のニューラルネットワーク検証を必要とせずに論理的一貫性を強制する。
数学、科学、コモンセンス推論タスクにわたる実験により、SPEARは学生モデルと教師モデルの間の推論ギャップを効果的に橋渡しすることを示した。
- 参考スコア(独自算出の注目度): 7.049218752607406
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning-based knowledge distillation has the potential to transfer complex reasoning from teacher to student models, yet it currently faces a critical dilemma: researchers must choose between sparse outcome-based rewards, which provide insufficient logical guidance, or expensive neural Process Reward Models (PRMs) for dense signals. We resolve this by introducing SPEAR (Symbolic Process Evaluation and Alignment Reward), a training-free and plug-and-play process reward method for sequence-level on-policy distillation. SPEAR projects natural-language reasoning traces into domain-adaptive symbolic milestones, providing an efficient proxy for process-level reasoning alignment. By utilizing the longest common subsequence (LCS) to align student explorations with teacher milestones, SPEAR provides a dense, order-aware reward signal that enforces logical consistency without the need for an external neural verifier. Our experiments across math, science, and commonsense reasoning tasks demonstrate that SPEAR effectively bridges the reasoning gap between student and teacher models via sequence-level distillation with efficient dense process rewards. Our code and data are available at: https://github.com/zhuochunli/SPEAR.
- Abstract(参考訳): 強化学習に基づく知識蒸留は、教師から学生モデルへの複雑な推論を伝達する可能性があるが、現時点では重要なジレンマに直面している。
本研究では,SPEAR(Symbolic Process Evaluation and Alignment Reward)を導入した。
SPEARは自然言語推論をドメイン適応型シンボリックマイルストーンにトレースし、プロセスレベルの推論アライメントのための効率的なプロキシを提供する。
学生の探索を教師のマイルストーンと整合させるのに最も長い共通サブシーケンス(LCS)を利用することで、SPEARは、外部のニューラルネットワーク検証を必要とせずに論理的一貫性を強制する、密集した秩序対応報酬信号を提供する。
数学,科学,コモンセンス推論の課題にまたがる実験により,SPEAR は学生と教師のモデル間の推論のギャップを,効率的な高密度プロセス報酬によるシーケンスレベルの蒸留によって効果的に埋めることを示した。
私たちのコードとデータは、https://github.com/zhuochunli/SPEAR.comで公開されています。
関連論文リスト
- Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence [70.8951332710039]
マルチモーダル大言語モデル (MLLM) は複雑な空間的シーン理解と推論タスクにおいて有意な可能性を証明している。
しかし、彼らのオープンな推論プロセスは、意思決定の誤りやエラーの蓄積を招きやすいため、回答の品質が不安定になる。
本稿では,推論過程において動的に介入し,偏差を補正するアドバンテージ誘導型ゲーティングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-08T07:46:04Z) - Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding [25.81162875653095]
我々は,予測パープレキシティに基づくスコアリングとビームサーチによって導かれるステップワイズ推論合成を行う,協調型マルチ教師デコーディングフレームワークであるCoRDを紹介する。
実験の結果,CoRDは質の高い推論データを生成し,教師レベルに近い成績を得られた。
論文 参考訳(メタデータ) (2026-05-04T07:26:41Z) - Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training [76.12556589212666]
学習後のカリキュラムは指数関数的複雑性のボトルネックを回避していることを示す。
結果のみの報酬信号の下では、強化学習の微調整は、サンプルの複雑さを高い精度で達成する。
カリキュラムを意識したクエリにより、報奨託書の呼び出しとサンプリングコストの両方を指数関数的に削減するテストタイムスケーリングの保証を確立する。
論文 参考訳(メタデータ) (2025-11-10T18:29:54Z) - Aligning Reasoning LLMs for Materials Discovery with Physics-aware Rejection Sampling [12.538562255934123]
本稿では,物理認識型リジェクションサンプリング(PaRS)について紹介する。
PaRSは基礎物理学と整合したトレースを好んでおり、計算を制御するために軽量に停止する。
本手法は精度と校正性を向上し,物理違反率を低減し,基準値に対するサンプリングコストを低減させる。
論文 参考訳(メタデータ) (2025-08-31T09:46:20Z) - Reinforced Latent Reasoning for LLM-based Recommendation [92.56166822197919]
大きな言語モデル(LLM)は、複雑な問題解決タスクにおいて印象的な推論能力を示している。
既存の手法は通常、明示的なチェーン・オブ・シント(CoT)データによる微調整に依存している。
本研究では, 明示的なCoT推論から, コンパクトで情報密度の高い潜伏推論へ移行する代替手法について検討する。
論文 参考訳(メタデータ) (2025-05-25T11:03:45Z) - Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing [61.98556945939045]
収集された軌道上でのDPO(Direct Preference Optimization)を通して計画に基づく推論を学習するフレームワークを提案する。
論理的推論ベンチマークの挑戦的な結果から,学習フレームワークの有効性が示された。
論文 参考訳(メタデータ) (2024-02-01T15:18:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。