論文の概要: Weight-Space Geometry of Offline Reasoning Training
- arxiv url: http://arxiv.org/abs/2606.23740v1
- Date: Sun, 21 Jun 2026 15:34:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.593359
- Title: Weight-Space Geometry of Offline Reasoning Training
- Title(参考訳): オフライン推論訓練における重量空間形状
- Authors: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova,
- Abstract要約: 単一ベースモデル(Qwen3-4B)と注意のみのLoRAを用いた同一の数学的ロールアウトにおける6つの方法(SFT, RFT, DFT, RIFT, Offline GRPO, DPO)を,コサイン類似性,主角部分空間解析,線形モード接続性,CKAを用いて解析した。
i) SFT, RFT, RIFTは、ほぼコリニアウェイトデルタ(cosine >= 0.97, top-1 principal angle 7 deg median over 144 module)と同等のGSM8K精度(87-88%, n=1)を持つ。
- 参考スコア(独自算出の注目度): 39.20113202952282
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Offline reinforcement-learning losses (RFT, RIFT, DFT, Offline GRPO, DPO) are widely used to distill reasoning from large teachers into smaller students, and are typically compared on downstream accuracy alone. We ask whether they are mechanistically distinct or converge to a similar weight update. Training six methods (SFT, RFT, DFT, RIFT, Offline GRPO, DPO) on identical math rollouts from a single base model (Qwen3-4B) with attention-only LoRA, we analyze the resulting deltas via cosine similarity, principal-angle subspace analysis, linear mode connectivity, and CKA. We observe: (i) SFT, RFT, and RIFT have nearly colinear weight deltas (cosine >= 0.97, top-1 principal angle ~7 deg median over 144 modules) and comparable GSM8K accuracy (87-88%, n=1319; pairwise McNemar p >= 0.15); (ii) DFT diverges further in direction than any reward-weighted method despite using the same data; (iii) Offline GRPO adds a substantial component orthogonal to the SFT direction (~67% globally, up to ~86% in late layers) while staying in the SFT loss basin; (iv) DPO sits in a near-orthogonal subspace, shows a mode-connectivity barrier, and collapses late-layer CKA to ~0.46. DPO also reaches the highest accuracy in our protocol on both GSM8K (93.5%, McNemar p < 10^-9 vs. each other method) and AIME26 (30.0% vs. 3.3-10.0%); its training uses a 10x smaller learning rate than the others (the standard convention), so the update-norm and accuracy gaps reflect loss-function and optimizer choices jointly, and a learning-rate-matched DPO comparison is left for future work.
- Abstract(参考訳): オフライン強化学習損失(RFT, RIFT, DFT, Offline GRPO, DPO)は、大規模教師の推論を小学生に蒸留するために広く用いられ、典型的には下流の精度で比較される。
メカニカルに区別されているのか、あるいは同様の重み更新に収束しているのかを問う。
単一ベースモデル(Qwen3-4B)と注意のみのLoRAを用いた同一の数学的ロールアウトにおける6つの方法(SFT, RFT, DFT, RIFT, Offline GRPO, DPO)を,コサイン類似性,主角部分空間解析,線形モード接続性,CKAを用いて解析した。
観察する。
(i) SFT, RFT, RIFTは、ほぼコリニアウェイトデルタ(cosine >= 0.97, top-1 principal angle ~7 deg average over 144 module)を持ち、GSM8Kの精度(87-88%, n= 1319, pairwise McNemar p >= 0.15)に匹敵する。
2 DFTは、同じデータを用いても、報酬重み付け方法よりも方向を異にする。
3 オフラインGRPOは、SFT損失盆地に留まりながら、SFT方向(全世界で約67%、後期層で最大86%)に実質的な直交成分を付加する。
(iv)DPOは直交部分空間に位置し、モード接続障壁を示し、後期層CKAは ~0.46 に崩壊する。
DPOは、GSM8K (93.5%、McNemar p < 10^-9 vs. other method) と AIME26 (30.0% vs. 3.3-10.0%) の2つのプロトコルで最も精度が高い。
関連論文リスト
- Report the Floor: A Training-Free Conformal Interval Is a Mandatory Baseline for Probabilistic Time-Series Forecasting [0.0]
有限個のスプリット・コンフォーマルな残留量子化でラップされた最後の値点予測値である最も単純な共形間隔は、その近距離不在よりもはるかに強い基底線であることを示す。
この ConformalNaive インターバルは、単純値量子基底線を決定的に破る。
ConformalNaive+は、一直線で、トレーニング不要で、水平順応性のあるセレクタで、各地平線上の2つの相補的なフロアを改善できる。
論文 参考訳(メタデータ) (2026-06-08T13:30:18Z) - Beyond Inference-Only Deployment: Comparing Weight-Based Consolidation Against Cascading Compaction [1.6214121783846343]
本研究は,1つのコンシューマ上でのLow-Rank Adaptation (LoRA)ファインチューニングにより,インタラクション知識をモデルウェイトに夜間に集約することを評価する。
10つの現実的なソフトウェア開発の会話の中で、カスケードのコンパクト化は36.8 +/-3.0%の知識を保持する。
LoRAは、相互作用知識を合成、合成、Low-Rank Adaptation (LoRA)ファインチューニングを通じてモデルウェイトに集約する。
論文 参考訳(メタデータ) (2026-05-23T16:57:25Z) - Bug or Feature$^2$: Weight Drift, Activation Sparsity and Spikes [53.726365933748134]
標準損失と正に偏りのある活性化関数の相互作用によって引き起こされる負の重みのドリフトを解析する。
79の構成にまたがるスパシティ・精度のトレードオフを特徴付けるとともに、$sim$70%のアクティベーション・スパシティよりも高い精度の崖を識別する。
論文 参考訳(メタデータ) (2026-05-17T21:29:20Z) - DISA: Offline Importance Sampling for Distribution-Matching LLM-RL [56.9445657766829]
本稿では、このキャリブレーション問題をRLループの外に移動させるdisAを紹介する。
DISAは提案トラジェクトリをオフラインに描画し、重要サンプリングによってパーティション関数を推定し、結果として発生するパーティション関数の推定を凍結する。
6つの数学と3つのコードベンチマークにまたがる2つのオープンウェイトなバックボーンでは、DisdisAはオンラインに結合した分散マッチングベースラインフローにマッチするか、超えている。
論文 参考訳(メタデータ) (2026-05-17T07:14:44Z) - SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning [54.393763477932474]
Supervised Fine-Tuning (SFT) と Reinforcement Learning (RL) は、大規模言語モデル(LLM)の標準訓練パラダイムとして登場した。
本稿では,トークン探索空間に基づく多様性を適応的に促進するSED-SFTを提案する。
このフレームワークは、選択的なマスキング機構を備えた選択エントロピー正規化項を最適化目的に導入する。
論文 参考訳(メタデータ) (2026-02-07T09:39:21Z) - Temporal Zoom Networks: Distance Regression and Continuous Depth for Efficient Action Localization [6.908972852063454]
時間的行動の局所化は、正確な境界検出と計算効率の両方を必要とする。
我々は、境界距離回帰(BDR)と適応時間制限(ATR)という2つの補完的なイノベーションを通じてこの問題に対処する。
THUMOS14では、ActionFormer++ (55.7% mAP@0.7 at 235G) よりも36%少ないFLOPを用いて、151GのFLOPで56.5% mAP@0.7を達成する。
論文 参考訳(メタデータ) (2025-11-06T00:41:54Z) - Environment-Aware Indoor LoRaWAN Path Loss: Parametric Regression Comparisons, Shadow Fading, and Calibrated Fade Margins [3.776919981139063]
内部のLoRaWAN伝播は、構造的および時間的変化の文脈因子によって形成される。
リークセーフなクロスバリデーションを用いて評価した,環境に配慮した統計的に規律のある経路損失フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-05T20:14:48Z) - Tactile Grasp Refinement using Deep Reinforcement Learning and Analytic
Grasp Stability Metrics [70.65363356763598]
解析的把握安定性指標が強化学習アルゴリズムの強力な最適化目標であることを示す。
幾何的および力量に依存しないグリップ安定性の指標を組み合わせることで、カブイドの平均成功率は95.4%となることを示す。
第2の実験では,触覚情報を持たないベースラインよりも,接触フィードバックで訓練したグリップリファインメントアルゴリズムが最大6.6%向上することを示した。
論文 参考訳(メタデータ) (2021-09-23T09:20:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。