論文の概要: The Gradient Does Not See Rank: Rank-Indifference in Matrix-CODI on ProsQA
- arxiv url: http://arxiv.org/abs/2609.03090v1
- Date: Wed, 02 Sep 2026 19:03:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 18:28:38.840383
- Title: The Gradient Does Not See Rank: Rank-Indifference in Matrix-CODI on ProsQA
- Title(参考訳): グラディエントはランクを見ない: ProsQAにおけるMatrix-CODIのランク差
- Abstract要約: マトリックス値の変種は、各潜在トークンをdxdマトリクスのボトルネックにルーティングし、潜在マトリクスZ上の単一サンプル構造としてランクを導入する。
行列-CODIモデルの4つの訓練条件の中で、ランク-k射影アブレーション曲線は0.6ポイント以内に平坦である。
バニラ GPT-2 SFT に対する負の制御は、プール平均範囲 0.20pp と同じ介入パラダイムの下で平坦なランク-k曲線を再現する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Continuous chain-of-thought models compress reasoning into latent tokens. Matrix-valued variants, which route each latent token through a d x d matrix bottleneck, introduce rank as a single-sample structural observable on the latent matrix Z. If matrix latents carry parallel reasoning paths via superposition, rank should track them, and truncating Z to low rank should hurt accuracy on tasks whose solutions plausibly require multiple components. Across four training regimes of a matrix-CODI model (three on ProsQA, one on GSM8K-Aug below the learning threshold), the rank-k projection ablation curve is flat to within 0.6 percentage points. A three-seed replication yields 81.0 +/- 2.0 percentage points accuracy while the final effective rank of Z spans {4, 12, 13}; the loss does not reward any particular rank. To test whether rank-blindness arises from the flatten-then-project readout alone, we trained four readouts: a bilinear reparametrization, a bilinear-plus-GELU readout nonlinear in Z, an SVD-augmented readout feeding singular values through an MLP, and a quadratic readout in Z Z^T. All four rank-k curves remain flat (Spearman p-values 0.63, 0.14, 0.82, 0.46). The flat curves persist for readouts nonlinear in Z. A linear probe on Z underperforms a raw pretrained hidden state at target prediction (AUC 0.673 vs. 0.846). A negative control on vanilla GPT-2 SFT (no matrix bottleneck, no Z, three seeds, n=500) reproduces a flat rank-k curve under the same intervention paradigm with pooled-mean range 0.20pp, and a random-h sensitivity floor lands at the same accuracy: the rank-k ablation alone conflates rank-blindness with position-irrelevance.
- Abstract(参考訳): 連続連鎖モデルでは、推論を潜在トークンに圧縮する。
行列値の変種は、各潜伏トークンをdxd行列のボトルネックにルートするが、潜伏行列 Z 上で観測可能な単一サンプル構造としてランクを導入する。
行列-CODIモデル(ProsQAでは3つ、学習しきい値よりGSM8K-Augでは1つ)の4つのトレーニング規則のうち、ランク-kプロジェクションアブレーション曲線は0.6ポイント以内に平坦である。
三列複製は 81.0 +/-2.0 パーセンテージの精度を得るが、Z の最終的な有効ランクは {4, 12, 13} である。
本研究は,2次線形再パラメータ化,Zの双線形+GELU非線形読み出し,MLPによるSVD拡張読み出し,ZZ^Tの2次読み出しの4つの読み出しを学習した。
4つの階数-k 曲線はすべて平坦である(スピアマン p-値 0.63, 0.14, 0.82, 0.46)。
A linear probe on Z underforms a raw pretrained hidden state at target prediction (AUC 0.673 vs. 0.846)。
バニラGPT-2 SFT(行列ボトルネックなし、Zなし、種3種、n=500)の負の制御は、プール平均距離0.20ppの干渉パラダイムの下で平坦なランク-k曲線を再現し、ランダムなh感度の床が同じ精度で着陸する。
関連論文リスト
- Hints, Critics, and Teachers: Prior Injection for Sparse-Reward RL in Vision-Language Math Reasoning [0.0]
Qwen2-VL-2Bが3.6%のロールアウトを正しく答える20,830のビジュアルマス問題のプールでは、GRPOロールアウトの85-97%は完全に間違っており、勾配はゼロである。
我々は、この体制で同じ条件下で11のメソッドを訓練し、それぞれ異なる事前を注入する。
これらの方法のうち、ヒント誘導による探索はヒントゲインを誘導し、批評家のMSE損失をHL-Gaussクロスエントロピーに置き換える価値は+14.4ポイントである。
論文 参考訳(メタデータ) (2026-08-22T07:17:14Z) - WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training [48.290951447286744]
WDL-OPDは2つの訓練可能なポリシーを持つ混合制約付き協調訓練法である。
アンカーポリシはロールアウト毎に生成し、補助ポリシは同じ訪問状態を評価し、それらのトークン分布の幾何学的混合を逆KLで凍結教師にマッチングする。
凍結はPD$2とW2S-OPDと密接に関連するアンカープラスコントラストのプロキシターゲットを回復させるが,ジョイントトレーニングは静的デルタが表現できない分岐レベル自由度を生成する。
論文 参考訳(メタデータ) (2026-08-10T11:22:53Z) - Exact Rank-Space KL Projection for Shared-Marginal Low-Rank Factors: Application to Doubly Stochastic Clustering [0.7614628596146601]
等しい全質量の任意の正の行辺に対して、合同KL射影はちょうど$r-1の有効変数のみを持つ厳密な凸ゲージ固定双対に還元される。
この幾何学を専門とし、$W=UnameDiag(g)-1Vtop$で2倍グラフ学習を誘導する。
観察されたスパースフィッティング、アンカーエッジ多様体正規化器、ブレグマンのバックトラックと組み合わせることで、ミラー・ディフレッシュ法は受け入れられたステップごとに正確な実現可能性を維持する。
論文 参考訳(メタデータ) (2026-08-09T11:29:05Z) - Variance Reduction on the Camera Axis: Multi-View Score Distillation for 3D [0.30586855806896046]
スコア蒸留は事前訓練された2次元拡散モデルを3次元生成器に変えるが、ステップごとの勾配はランダムに選択された1つの視点から推定される。
以前の作業では、マルチビューデータに先立って拡散をトレーニングすることで、この問題に対処している。
代わりにサンプリング軸を分離する。
論文 参考訳(メタデータ) (2026-06-29T08:41:42Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol [0.0]
この行列を形成するための明らかな方法を示す。
整列モデルはチャットテンプレートで評価され、ベースモデルは見なかった。
我々は、アライメントの活性化差研究のための測定勧告にそれを蒸留する。
論文 参考訳(メタデータ) (2026-05-23T13:47:17Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs [52.709361620508595]
ListOPDは、パラメータの5分の1で8B-SFTベースラインで、学生をドメイン内に持ち込む。
Amazon Fashionでは、3つの事前登録テスト — 細粒度崖間隔テスト、小さなクリップのクロス予測 — がロックされた予測ウィンドウ内に落下し、グリッド解像度以下のクローズドフォーム予測に一致する小さなクリップ値が設定されている。
論文 参考訳(メタデータ) (2026-05-09T06:48:00Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - Improved techniques for deterministic l2 robustness [63.34032156196848]
畳み込みニューラルネットワーク(CNN)を$l_2$ノルムの下で厳密な1-Lipschitz制約で訓練することは、対向的堅牢性、解釈可能な勾配、安定した訓練に有用である。
我々は,最後の線形層を1重層に置き換えることで,1-Lipschitz CNNのロバスト性を証明する手法を提案する。
我々は,CIFAR-10およびCIFAR-100における標準および証明可能な堅牢な精度の最先端化を図る。
論文 参考訳(メタデータ) (2022-11-15T19:10:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。