論文の概要: CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning
- arxiv url: http://arxiv.org/abs/2608.03673v1
- Date: Tue, 04 Aug 2026 13:49:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.226444
- Title: CausalOPD: First-Wrong-Step Supervision for Distilling Causal Chain Reasoning
- Title(参考訳): CausalOPD:Causal Chain Reasoning用第1Wrong-Step Supervision
- Abstract要約: CausalOPDはオンラインプロセス蒸留フレームワークである。
知識を付加した教師は、まずドメイン固有の因果規則に基づく軌跡を提供する。
因果段階のカリキュラムはエビデンスレベルからメカニズムレベル、結論レベルのエラーへと進化する。
- 参考スコア(独自算出の注目度): 5.241146164724621
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Many critical reasoning tasks, including clinical diagnosis, legal judgment, and industrial fault diagnosis, require step-dependent causal chains in which early errors propagate and correct conclusions can mask invalid reasoning. Although large language models perform well on such tasks, privacy, latency, and controllability motivate distillation into locally deployable models. Standard trajectory imitation does not correct process errors on the student's own rollout distribution. We propose CausalOPD, a curriculum online process distillation framework. A knowledge-augmented teacher first provides trajectories grounded in domain-specific causal rules, entity relations, and structural constraints. The student then generates on-policy trajectories, and the teacher identifies the first wrong step, defined as the earliest transition that verifiably violates available constraints. Starting from the verified prefix, short-horizon reinforcement learning repairs this localized failure. A causal-stage curriculum advances from evidence-level to mechanism-level and conclusion-level errors, following their propagation order. Across three domains, CausalOPD improves average path correctness by 23.4 percentage points over sequence-level online process distillation and reduces the right-label-wrong-reasoning rate from 15.7% to 4.4%. The domain-specific 8B students also surpass both evaluated proprietary references in path correctness across all domains.
- Abstract(参考訳): 臨床診断、法的判断、工業的欠陥診断を含む多くの重要な推論タスクは、早期エラーが伝播し、正しい結論が不正な推論を隠蔽するステップ依存因果連鎖を必要とする。
大規模な言語モデルはそのようなタスクでうまく機能するが、プライバシー、レイテンシ、制御性は、ローカルにデプロイ可能なモデルに蒸留を動機付ける。
標準軌跡模倣は、学生自身のロールアウト分布のプロセスエラーを補正しない。
オンラインプロセス蒸留フレームワークCausalOPDを提案する。
知識を付加した教師は、まずドメイン固有の因果規則、エンティティの関係、構造的制約に基づく軌道を提供する。
そして、教師は、利用可能な制約に確実に違反する最初期の移行として定義される最初の間違ったステップを特定する。
確認済みプレフィックスから始めると、短水平強化学習は、この局所的な障害を修復する。
因果的な段階のカリキュラムは、その伝播順序に従って、エビデンスレベルからメカニズムレベル、結論レベルのエラーへと進化する。
3つの領域で、CausalOPDは、シーケンスレベルのオンラインプロセス蒸留よりも平均パスの正確さを23.4ポイント改善し、右ラベルの空調率を15.7%から4.4%に下げている。
ドメイン固有の8Bの学生は、すべてのドメインにわたるパスの正確性において、両方の評価されたプロプライエタリな参照を上回ります。
関連論文リスト
- BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries [82.41764922522565]
BOUNDは、永続的な探索ドリフトのための短いガイド付き修正選好蒸留フレームワークである。
Trajectory SFT は Bamboogle で 5.6 EM 、BrowseComp-Plus で 4.8 の精度で上回っている。
論文 参考訳(メタデータ) (2026-08-09T15:32:16Z) - DiagLoop: A Counterfactual Data Flywheel with Stage-Localized Reinforcement for Diagnostic LLMs [5.241146164724621]
DiagLoopは、認知された物理的関係や臨床ガイドラインをトレーニングの監督に変換する、反ファクト的なデータフライホイールである。
訓練のみの教師は様々な原因、文脈、観察によって反現実の世界を提案し、一方独立したハイブリッドチェッカーは有効な世界しか認めない。
非終端障害に対しては、境界付き修復プローブが下流のコンピテンスを探索し、その結果の弱点プロファイルがその後のデータ生成を導く。
論文 参考訳(メタデータ) (2026-08-04T13:49:41Z) - Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming [5.951101028540166]
Chain-of-Thought(CoT)プロンプトにより、大規模な言語モデルが多段階推論タスクに取り組むことができる。
本稿では、帰納的論理プログラミング(ILP)を用いて関係合成規則を学習するニューロシンボリック・フレームワークであるReason Popper-lyを紹介する。
論文 参考訳(メタデータ) (2026-07-25T03:24:05Z) - H$^2$SD: Hybrid Hindsight Self-Distillation [61.71131241473028]
検証可能な報酬付き強化学習(RLVR)は、言語モデル推論のための信頼性の高い結果監視を提供する。
既存の自己蒸留法は特権教師を追加するが、通常は一定の役割を割り当てる。
本稿では,教師のコンテキストに適応し,トラジェクタの正当性を更新するHybrid Hindsight Self-Distillation(MathrmH2mathrmSD$)を紹介する。
論文 参考訳(メタデータ) (2026-07-21T10:47:27Z) - Purified OPSD: On-Policy Self-Distillation Without Losing How to Think [52.879387744920415]
オンライン自己蒸留(OPSD)は長いチェーン・オブ・ソート(Long-CoT)推論モデルでは一貫して失敗する。
まず,教師が指導信号の非伝達可能成分を分離するために,参照のみの教師を構築する。
第2に、この残差をよく形成されたPMIターゲット分布に変換するメカニズムとして、ポイントワイズ相互情報(PMI)を用いる。
論文 参考訳(メタデータ) (2026-07-02T14:33:07Z) - Trajectory-Refined Distillation [25.346810464266497]
トラジェクトリ精製蒸留(Trjectory-Refined Distillation, TRD)は、教師指導下で生徒のロールアウトをオンライン支援中に修正するトラジェクトリレベルの補正法である。
TRDは、特権情報に規定された学生モデルを教師として使用するパラメータ共有型である、オンライン自己蒸留(OPSD)にも適用することができる。
論文 参考訳(メタデータ) (2026-06-07T03:17:25Z) - When Attribution Patching Lies: Diagnosis and a Second-Order Correction [9.338965648455238]
本研究は, 下流ネットワークの非直線性に起因する誤差が, パッチ成分の局所曲率よりも大きいことを示す。
この洞察は、(i)信頼できない見積もりを検出するための信頼性スコア、(ii)エラー境界がポテンシャル属性の誤特定を定量化すること、(iii)Hessian-vector-product correctが1つの後進パスで先行エラーを除去すること、の3つの実用的なツールをもたらす。
論文 参考訳(メタデータ) (2026-06-05T05:20:32Z) - Validity-Calibrated Reasoning Distillation [4.277471273303775]
推論蒸留は、大規模言語モデルからより小さく、より効率的なものへの多段階推論能力を伝達することを目的としている。
近年の手法は静的教師の階層化と軌道模倣としてのフレーム蒸留に依存している。
本稿では, 局所的な学習信号割り当ての問題として, 推論蒸留を取り扱う枠組みである妥当性校正推論蒸留を提案する。
論文 参考訳(メタデータ) (2026-04-14T12:32:12Z) - Learn to Rank: Visual Attribution by Learning Importance Ranking [58.69028273772474]
コンピュータビジョンモデルのための視覚属性マップを生成する新しい手法を提案する。
提案手法は, 任意の数段階の勾配補正を施した1つの前方通過において, 密度の高い画素レベルの属性を生成する。
我々の実験は、一貫した定量的改善と、よりシャープで境界に沿った説明を示す。
論文 参考訳(メタデータ) (2026-04-07T12:53:22Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。