論文の概要: The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning
- arxiv url: http://arxiv.org/abs/2607.20952v2
- Date: Mon, 27 Jul 2026 07:48:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 14:56:47.038383
- Title: The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning
- Title(参考訳): The Weight of Silence: Causal Case of Weights over the Scratchpad in Latent Chess Reasoning
- Abstract要約: 本研究は, チェス演奏モデルにおいて, 段階的学習と強化学習を併用して, チェス演奏モデルを訓練する。
正当性は単調に61%まで上昇し(48%の事前RLベースラインから)、チェックメイトの妥協は完全に排除される。
また,チェスにおいて,複数のグループが同一の潜伏+RLレシピを報告し,SFTの精度向上に失敗したことを実証した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Latent, or silent, reasoning lets language models carry out intermediate computation in continuous vector space instead of words, and is widely assumed to function as an internal scratchpad the model consults during inference. Whether that assumption survives reinforcement learning has not been tested directly: existing causal analyses of latent reasoning are confined to math and logic tasks, comparing reliance on thoughts within one checkpoint, never before and after RL. We train a chess-playing model through a staged latent-reasoning curriculum followed by reinforcement learning, and find legality climbs monotonically to 61% (from a 48% pre-RL baseline) while checkmate confabulation is eliminated entirely. To locate this gain, we run a six-condition causal intervention suite on the same model before and after RL: substituting or noising the thought vectors leaves performance unchanged, ablating them costs only mild degradation, and only exact-zero vectors cause collapse. This robustness gap is itself the finding: under exact-zero corruption, legality collapses to 1% pre-RL versus 9% post-RL, a gap that survives correction across the full battery. A 10x-larger replication of the post-RL checkpoint's own battery confirms this: removing the thoughts, with or without restoring sequence length, also reaches significance; substitution and noise remain indistinguishable from baseline. RL appears to add robustness to disruption, not reliance on thought content. These results push back against the field's default assumption that latent thoughts function as an actively consulted inference-time scratchpad, and instead indicate latent reasoning's principal effect here is shaping the model's parameters during training. We also demonstrate a working RL gain in chess, where multiple groups report the same latent-reasoning-plus-RL recipe failing to improve accuracy over SFT.
- Abstract(参考訳): 潜在的、あるいはサイレントな推論により、言語モデルは単語の代わりに連続ベクトル空間で中間計算を実行でき、推論中にモデルが参照する内部スクラッチパッドとして機能すると広く考えられている。
既存の因果解析は数学や論理的なタスクに限られており、RLの前や後のような1つのチェックポイント内の思考に依存している。
チェス・プレイング・モデルは、段階的な潜伏学習と強化学習によって訓練され、正当性は単調に61%まで上昇し(48%の事前RLベースラインから)、チェックメイト・コラボレーションは完全に排除される。
この利得を見つけるために、RLの前と後という同じモデルで6条件の因果介入スイートを実行する:思考ベクトルの置換やノイズ付けは、性能を損なうことなく、わずかに劣化し、正確なゼロのベクトルだけが崩壊する。
この堅牢性ギャップは、その発見そのものである: 正確なゼロの汚職の下では、合法性は1%のプレRLに崩壊し、9%のポストRLに崩壊する。
ポストRLチェックポイントのバッテリーの10倍大きい複製は、このことを裏付けている: 思考を削除し、シーケンス長を復元せずに、意味を持つ; 置換とノイズは、ベースラインと区別できない。
RLは、思考内容に頼らず、破壊に堅牢さをもたらすように見える。
これらの結果は、潜在思考が積極的にコンサルティングされた推論時間スクラッチパッドとして機能するというフィールドのデフォルトの仮定を押し返し、代わりに、潜在推論の主な効果は、トレーニング中にモデルのパラメータを形作ることであることを示す。
また,チェスにおいて,複数のグループが同一の潜伏+RLレシピを報告し,SFTの精度向上に失敗したことを実証した。
関連論文リスト
- Understanding Reasoning from Pretraining to Post-Training [53.890128750021375]
チェスは前訓練から後訓練までのパイプライン全体にわたって推論を研究するための制御テストベッドとして使用します。
所定のRL計算レベルでのポストRL性能は、事前学習損失からよく予測できる。
さらに,数学領域のテキスト上での1B言語モデルの訓練により,我々の研究結果がチェスを超えるか否かを検証した。
論文 参考訳(メタデータ) (2026-07-17T16:31:58Z) - Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Reasoning Through Chess: How Reasoning Evolves from Data Through Fine-Tuning and Reinforcement Learning [7.920254637344918]
理論的に着想を得たデータセットの集合がチェスにおける言語モデルのパフォーマンスにどのように影響するかを分析する。
最良の動きを直接予測するための微調整が、効率的なRLと最強のダウンストリーム性能につながることが分かりました。
RLは移動品質の分布にかなりの正の変化をもたらし, 副次効果として幻覚率を低下させることを示した。
論文 参考訳(メタデータ) (2026-04-06T19:53:39Z) - Beyond Correctness: Learning Robust Reasoning via Transfer [51.403609251508904]
我々は単純な哲学的見解を採用するが、堅牢な推論はそれを作った心を超えて有用であるべきである。
本稿では,トランスファーブル・リワードを用いた強化学習を紹介し,トランスファーブル・リワードによるロバストネスの運用について述べる。
提案手法は,最終回答精度を向上しながらサンプリング一貫性を向上し,ほぼ少ないトレーニングステップで同等のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-02-09T10:41:44Z) - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards [61.52322047892064]
テスト時間スケーリング(TTS)は、Large Reasoning Models(LRM)の機能を大幅に強化した。
我々は, LRM が推論過程において最終回答を得た後も, 再検討なしに反復的自己検証を頻繁に行うことを観察した。
本稿では,Anchor-based Process Reward (APR)を提案する。
論文 参考訳(メタデータ) (2026-01-31T14:53:20Z) - Local Coherence or Global Validity? Investigating RLVR Traces in Math Domains [13.626335241662977]
Reinforcement Learning with Verifiable Rewards (RLVR)-based post-training of Large Language Models (LLMs) は、推論タスクの精度を向上させることが示されている。
直接インセンティブのない中間トークンに対するRLポストトレーニングの効果について検討する。
論文 参考訳(メタデータ) (2025-10-20T23:58:31Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。