論文の概要: Do Models Read What They Write? Causal Registers in Scratchpad Reasoning
- arxiv url: http://arxiv.org/abs/2606.29522v1
- Date: Sun, 28 Jun 2026 17:32:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.949765
- Title: Do Models Read What They Write? Causal Registers in Scratchpad Reasoning
- Title(参考訳): モデルは書き物を読み取るか?スクラッチパッド推論における因果名簿
- Authors: Benjamin Shih, John Winnicki, Eric Darve,
- Abstract要約: 制御された状態追跡タスクと既知の更新ルールを使用して、この要件をテストする。
我々は、可視的スクラッチパッドのテキストを固定しながら、1つの書き込み状態の内部表現を編集する。
Qwen2.5-Coder-7Bでは、状態記述モデルは、編集された状態によって入力される次のフェーズビットを、保持されたサンプルの80%と91%で予測する。
- 参考スコア(独自算出の注目度): 2.61135281451375
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A central hope behind process supervision is that models can expose intermediate variables that matter for their later behavior. For this to help with alignment, a scratchpad must be tied to the computation: when the model writes a state, later steps should compute from that state. To test this requirement, we use a controlled state-tracking task with a known update rule, comparing models trained to report only the final state with models trained to write intermediate states before giving the final answer. At evaluation, we edit the internal representation of one written state while leaving the visible scratchpad text fixed. Because the transition rule is known, the edit has a single correct downstream consequence. In Qwen2.5-Coder-7B, the state-writing model predicts the next phase bit implied by the edited state on 80% and 91% of held-out examples across the two task variants, while pretrained and final-answer-only controls remain near baseline. Additional controls rule out generic next-token steering and copying another continuation: the prediction depends on both the edited state and the current move. The same causal-use pattern replicates across model families. Together, these results suggest a sharper goal for scratchpad oversight: not just to make intermediate reasoning legible, but to train written states that the model uses as part of its computation.
- Abstract(参考訳): プロセス監視の背後にある中心的な希望は、モデルが後の振る舞いに重要な中間変数を公開できることである。
このアライメントを支援するために、スクラッチパッドは計算に結び付けられなければならない。モデルがステートを書き込み、後のステップはその状態から計算すべきである。
この要件をテストするために、制御された状態追跡タスクを既知の更新ルールで使用し、最終状態のみを報告するように訓練されたモデルと、最終応答を与える前に中間状態を記述するように訓練されたモデルを比較した。
評価では、可視的スクラッチパッドのテキストを固定しながら、1つの書き込み状態の内部表現を編集する。
遷移規則が知られているので、編集は単一の正しい下流結果を持つ。
Qwen2.5-Coder-7Bでは、状態記述モデルは、編集された状態によって入力される次のフェーズビットを、2つのタスクの変形に対して80%と91%で予測する。
追加のコントロールは、一般的な次世代のステアリングを除外し、別の継続をコピーする:予測は、編集された状態と現在の動作の両方に依存する。
同じ因果パターンはモデルファミリ間で複製される。
これらの結果から、スクラッチパッドの監視は、中間的推論を合理的に行うだけでなく、モデルがその計算の一部として使用する記述状態のトレーニングという、よりシャープな目標を示唆している。
関連論文リスト
- World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models [3.1727619150610837]
視覚言語モデル(VLM)は、物理シーンに関する質問に答えるためにますます使われている。
本稿では,VLMの物理コミットメントを評価するための評価フレームワークwmwを紹介する。
ハイブリッド検証器は、スキーマの妥当性、状態基底、遷移整合性、応答-トレース互換性をチェックする。
論文 参考訳(メタデータ) (2026-05-28T08:29:32Z) - Semantic Granularity Navigation in Image Editing [4.8073791571301125]
NaviEditは、リアルタイム編集のためのトレーニング不要の推論時間コントローラである。
厳密な自己整合契約を通じて、モデルスケールから編集の進捗を分離する。
スケールを制御入力として扱い、意味的に応答する中間スケールに向けて固定ステップ予算を割り当てる。
論文 参考訳(メタデータ) (2026-05-20T13:53:13Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - PrefixNLI: Detecting Factual Inconsistencies as Soon as They Arise [60.63315470285562]
MiniTruePrefixesは、テキストプレフィックスよりも事実上の矛盾をよりよく検出する、新しい特殊モデルである。
制御されたデコードフレームワークにMiniTruePrefixesを組み込むことで,抽象的な要約における現実の一貫性が大幅に向上することを示す。
論文 参考訳(メタデータ) (2025-11-03T09:07:44Z) - Thutmose Tagger: Single-pass neural model for Inverse Text Normalization [76.87664008338317]
逆テキスト正規化(ITN)は自動音声認識において重要な後処理ステップである。
本稿では,ITN例の粒度アライメントに基づくデータセット作成手法を提案する。
タグと入力語との1対1対応により、モデルの予測の解釈性が向上する。
論文 参考訳(メタデータ) (2022-07-29T20:39:02Z) - Memory-Based Model Editing at Scale [102.28475739907498]
既存のモデルエディタは、編集対象のスコープを正確にモデル化するのに苦労する。
SERAC(Retrieval-Augmented Counterfactal Model)を用いた半パラメトリック編集を提案する。
SERACは、編集を明示的なメモリに格納し、必要に応じてベースモデルの予測を変更できるように、それらを推論することを学ぶ。
論文 参考訳(メタデータ) (2022-06-13T23:40:34Z) - Sketch and Customize: A Counterfactual Story Generator [71.34131541754674]
条件と終了に関係のある因果関係を導いたスケッチ・アンド・カスタマイズ生成モデルを提案する。
実験結果から,従来のシーケンス・ツー・シーケンスモデルと比較して,提案モデルの方がより優れたエンディングを生成することがわかった。
論文 参考訳(メタデータ) (2021-04-02T08:14:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。