論文の概要: Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road
- arxiv url: http://arxiv.org/abs/2605.17026v1
- Date: Sat, 16 May 2026 14:55:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:47.497765
- Title: Why Do Reasoning Models Lose Coverage? The Role of Data and Forks in the Road
- Title(参考訳): 推論モデルがカバーを失う理由 : 道路におけるデータとフォークの役割
- Authors: Ngoc-Hieu Nguyen, Parshin Shojaee, Phuc Minh Nguyen, Nan Zhang, Chandan K Reddy, Khoa D Doan, Rui Zhang,
- Abstract要約: 本研究は,SFTをベースとしたポストトレーニングにおけるスリム化の原因について検討する。
設定中のトレーニング後のダイナミクスを追跡することで、縮小現象がトレーニングデータにおける意思決定シナリオの頻度と密接な相関があることが分かる。
本研究は,データ中心因子を推論モデルにおける縮小の鍵要因とみなし,その制御に有効なレバーとして多様性を考慮した設計を強調した。
- 参考スコア(独自算出の注目度): 26.088108937790167
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in large language models has led to the emergence of reasoning models, which have shown strong performance on complex tasks through specialized fine-tuning procedures. While these methods reliably improve pass@1 accuracy, prior works have observed that they show a coverage shrinkage behavior, where pass@k degrades relative to the base model. In this paper, we investigate the reasoning shrinkage arise under SFT-based post-training. We hypothesize that this behavior is driven by properties of the fine-tuning data, specifically related to decision points or "forks in the road" scenarios where model faces indecipherable patterns with multiple valid reasoning paths. To test this hypothesis, we design controlled case studies that simulate such decision-point settings, spanning indecipherable nodes in graph branching, and reasoning modes. By tracking post-training dynamics in these settings, we find that the shrinkage phenomenon is tightly correlated with the prevalence of decision-point scenarios in the training data. We also demonstrate that this shrinkage behavior can be partially mitigated through targeted data synthesis design of decision-points, and a more systematic diversity-encouraging decoding mechanism. Our findings identify data-centric factors as a key driver of shrinkage in reasoning models and highlight diversity-aware designs as an effective lever for controlling it.
- Abstract(参考訳): 大規模言語モデルの最近の進歩により推論モデルが出現し、特殊な微調整手順によって複雑なタスクに強い性能を示すようになった。
これらのメソッドは Pass@1 の精度を確実に改善するが、以前の研究では、pass@k がベースモデルに対して低下するカバレッジの縮小動作を示している。
本稿では,SFTをベースとしたポストトレーニングで発生した推論の縮小について検討する。
この振る舞いは、微調整データの特性、特に複数の有効な推論パスを持つ非解読可能なパターンに直面する決定ポイントや「道路のフォーク」シナリオによって引き起こされる、という仮説を立てる。
この仮説を検証するために、このような決定ポイントの設定をシミュレートする制御されたケーススタディを設計し、グラフ分岐における非解読可能なノードと推論モードにまたがる。
これらの環境でのトレーニング後のダイナミクスを追跡することで、縮小現象がトレーニングデータにおける意思決定シナリオの頻度と密接な相関があることが分かる。
また、この縮小挙動は、決定点のターゲットデータ合成設計や、より体系的な多様性を増進する復号機構によって部分的に緩和できることを示す。
本研究は,データ中心因子を推論モデルにおける縮小の鍵要因とみなし,その制御に有効なレバーとして多様性を考慮した設計を強調した。
関連論文リスト
- CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention [24.03101162891974]
計画指向のエンドツーエンド駆動モデルは、真の因果関係ではなく統計的相関を学習する。
この脆弱性は因果的混乱を引き起こし、モデルがショートカットとしてデータセットバイアスを利用する。
CausalVADは因果的介入を生かした非融合トレーニングフレームワークである。
論文 参考訳(メタデータ) (2026-03-19T07:21:01Z) - InjectRBP: Steering Large Language Model Reasoning Behavior via Pattern Injection [12.65760977924031]
推論は大規模言語モデルの性能を大幅に向上させることができる。
モデルの推論行動は,行動パターンの観点から,どのように推論を形成するかを検討する。
InjectCorrect と InjectRLOpt の2つのパラメータ更新を必要としない最適化手法を提案する。
論文 参考訳(メタデータ) (2026-02-12T14:44:40Z) - Attuned to Change: Causal Fine-Tuning under Latent-Confounded Shifts [32.989526411946606]
遅れた構築されたシフトに適応することは、現代AIにおける中核的な課題である。
1つの実用的障害モードは、構築されたデータに基づいて訓練済みの基礎モデルを微調整するときに発生する。
我々は、因果微調整を識別問題として捉え、入力を低レベルなスプリアス特徴に分解する明示的な因果モデルを示す。
論文 参考訳(メタデータ) (2024-10-18T11:06:23Z) - Influence Functions for Scalable Data Attribution in Diffusion Models [52.92223039302037]
拡散モデルは、生成的モデリングに大きな進歩をもたらした。
しかし、彼らの普及はデータ属性と解釈可能性に関する課題を引き起こす。
これらの課題に対処するための影響関数フレームワークを開発する。
論文 参考訳(メタデータ) (2024-10-17T17:59:02Z) - Causal Analysis for Robust Interpretability of Neural Networks [0.2519906683279152]
我々は、事前学習されたニューラルネットワークの因果効果を捉えるための頑健な介入に基づく手法を開発した。
分類タスクで訓練された視覚モデルに本手法を適用した。
論文 参考訳(メタデータ) (2023-05-15T18:37:24Z) - Revisiting Design Choices in Model-Based Offline Reinforcement Learning [39.01805509055988]
オフライン強化学習により、エージェントは環境遷移の大規模な収集済みデータセットを利用して制御ポリシーを学習することができる。
本稿では、モデル数や仮想ロールアウト地平線など、他のハイパーパラメータとの相互作用を研究するための新しいプロトコルを比較し、設計する。
論文 参考訳(メタデータ) (2021-10-08T13:51:34Z) - Variational Causal Networks: Approximate Bayesian Inference over Causal
Structures [132.74509389517203]
離散DAG空間上の自己回帰分布をモデル化したパラメトリック変分族を導入する。
実験では,提案した変分後部が真の後部を良好に近似できることを示した。
論文 参考訳(メタデータ) (2021-06-14T17:52:49Z) - Structural Causal Models Are (Solvable by) Credal Networks [70.45873402967297]
因果推論は、干潟網の更新のための標準的なアルゴリズムによって得ることができる。
この貢献は, 干潟ネットワークによる構造因果モデルを表現するための体系的なアプローチと見なされるべきである。
実験により, 実規模問題における因果推論には, クレーダルネットワークの近似アルゴリズムがすぐに利用できることがわかった。
論文 参考訳(メタデータ) (2020-08-02T11:19:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。