論文の概要: Training Continuous Chain of Thought Models: A Tale of Two Regimes
- arxiv url: http://arxiv.org/abs/2607.16972v1
- Date: Sat, 18 Jul 2026 21:32:06 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.313324
- Title: Training Continuous Chain of Thought Models: A Tale of Two Regimes
- Title(参考訳): 思考モデルの連続的な連鎖のトレーニング:2つのレジームの物語
- Abstract要約: 連続チェイン・オブ・ソート法は、冗長な推論トレースを、密度の高い潜在表現の短い列に置き換える。
C-MTPは、圧縮対象のCoTトレースへの埋め込みの平均として、各遅延をモデル化する、よりシンプルで高速な直接監督手法である。
我々は、連続CoT法の評価を、より長い推論トレースを持つ複雑なタスクに拡張する。
- 参考スコア(独自算出の注目度): 39.805252492017715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Continuous Chain-of-Thought methods replace verbose reasoning traces with a short sequence of dense latent representations. Earlier continuous CoT methods indirectly supervise the latent representations such that its final state match that of verbose reasoning traces, requiring autoregressive, slow generation during training. We introduce C-MTP, a simpler, faster direct supervision approach that models each latent as an average of the embeddings in the CoT traces to be compressed. Our approach outperforms a prior direct supervision method that approximates the distribution of compressed tokens, and performs competitively to slower indirect supervision approaches in existing evaluation setup with simplified CoT traces (less than 100 tokens). Lastly, we extend the evaluation of Continuous CoT methods to complex tasks with longer reasoning traces ($\ge$ few hundreds reasoning tokens). We find both direct and indirect supervision training methods perform poorly (roughly 65\% performance drop) in this setting, revealing the limitations of current continuous CoT methods. The code and checkpoints are released at https://github.com/Varun221/cmtp_research
- Abstract(参考訳): 連続チェイン・オブ・ソート法は、冗長な推論トレースを、密度の高い潜在表現の短い列に置き換える。
初期の連続CoTメソッドは、トレーニング中に自己回帰的で遅い生成を必要とする冗長な推論トレースと最終状態が一致するように、遅延表現を間接的に監督する。
C-MTPは、圧縮対象のCoTトレースへの埋め込みの平均として、各遅延をモデル化する、よりシンプルで高速な直接監督手法である。
提案手法は,圧縮トークンの分布を近似する従来の直接監督手法よりも優れており,100トークン未満のCoTトレースを簡略化した既存の評価設定において,間接監督手法の遅延を競合的に行う。
最後に、Continuous CoTメソッドの評価を、より長い推論トレース(数百ドルの推論トークン)で複雑なタスクに拡張します。
この設定では、直接と間接の両方の監督訓練手法が不十分(約65%のパフォーマンス低下)であることに気付き、現在のCoTメソッドの限界を明らかにします。
コードとチェックポイントはhttps://github.com/Varun221/cmtp_researchで公開されている。
関連論文リスト
- Structural Process Supervision for Latent Chain-of-Thought Reasoning [45.1922274576773]
Prototype-Mediated Process Supervision (PMPS) は、遅延埋め込みと明示的なチェーンオブ思考を共有プロトタイプ空間に組み込むプロジェクトである。
PMPSはGSM8K-Aug上で出力トークン長を明示的なCoTの50%以下に圧縮する。
より大きなモデルとより困難なタスクにおいて、PMPSは出力長に匹敵する潜在的推論手法の中で、常に高い精度を達成している。
論文 参考訳(メタデータ) (2026-09-09T09:17:46Z) - Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning [17.893249958828218]
疑似推論監視を構築するために,ラベルのない質問を用いたフレームワークを提案する。
Semi-CoTは、ラベルのない質問ごとに複数の擬似CoTをサンプリングし、回答レベルのセマンティックエントロピーを推定し、信頼性の高い擬似CoTデモとして低エントロピー推論チェーンを選択する。
AQuA、SVAMP、GSM8K、MultiArithの試験実験では、エントロピーゲートが高い精度の擬似CoTを選択し、擬似応答精度は911.36%$から100%$である。
論文 参考訳(メタデータ) (2026-07-01T22:17:39Z) - Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning [10.87972575497941]
思考の連鎖(CoT)推論は言語モデルを監視するのに有用である。
モデルはCoTをバイパスするプロンプト・ツー・アンサー・ショートカットに依存することができる。
構造的情報フローの観点からCoTの忠実性を考察する。
論文 参考訳(メタデータ) (2026-05-22T23:37:29Z) - Do Latent-CoT Models Think Step-by-Step? A Mechanistic Study on Sequential Reasoning Tasks [37.23113613155819]
Latent Chain-of-Thought (Latent-CoT) は、長い論理を出力することなくステップバイステップの計算を可能にすることを目的としている。
本研究では, 連続的思考型教師学生蒸留モデルであるCODIについて, 厳密なシーケンシャル・イット・タスクについて検討する。
論文 参考訳(メタデータ) (2026-01-31T01:48:23Z) - PROMISE: Process Reward Models Unlock Test-Time Scaling Laws in Generative Recommendations [52.67948063133533]
生成レコメンデーションは有望なパラダイムとして現れ、階層的なセマンティックIDよりもシーケンス・ツー・シーケンス生成タスクとしてレコメンデーションを改革している。
既存の手法は、セマンティックドリフト(Semantic Drift)と呼ばれる重要な問題に悩まされ、初期、高レベルのトークンのエラーは、生成軌道を無関係な意味部分空間に不可逆的に分散させる。
本稿では,高密度なステップバイステップ検証を生成モデルに統合する新しいフレームワークPromiseを提案する。
論文 参考訳(メタデータ) (2026-01-08T07:38:46Z) - Parallel Test-Time Scaling for Latent Reasoning Models [58.428340345068214]
並列テスト時間スケーリング(TTS)は、大規模言語モデル(LLM)の拡張のための重要なアプローチである。
連続ベクトル空間において中間的推論が展開する潜在的推論の最近の進歩は、明示的なチェーン・オブ・サート(Chain-of-Thought)に対するより効率的な代替手段を提供する。
この作業は、上記の問題に対処することで、潜在推論モデルに対する並列TSを可能にする。
論文 参考訳(メタデータ) (2025-10-09T03:33:00Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought [64.43689151961054]
連続CoTのD$ステップを持つ2層トランスが有向グラフ到達可能性問題を解くことができることを証明した。
我々の構成では、各連続思考ベクトルは複数の探索フロンティアを同時に符号化する重ね合わせ状態である。
論文 参考訳(メタデータ) (2025-05-18T18:36:53Z) - Chain-of-Thought Reasoning Without Prompting [40.92854235219315]
CoT推論パスは、テキストデコーディングプロセスを変更するだけで、事前訓練された言語モデルから引き出すことができる。
復号経路におけるCoTの存在は、モデルの復号解に対する高い信頼と相関する。
論文 参考訳(メタデータ) (2024-02-15T18:55:41Z) - Training Chain-of-Thought via Latent-Variable Inference [30.21067593018967]
大規模言語モデル(LLM)は、チェーン・オブ・シンクレットのプロンプトを使って解答ステップを実行するように指示されたときに、より正確かつ解釈可能な問題を解決する。
CoTと教師付きチューニングを組み合わせるには、正しい回答だけでなく、それらの答えにつながる詳細な根拠の監督が必要である。
そこで本研究では,CoTプロンプトを用いて正しい回答を生成することで,電子対数類似度を最大化するための微調整戦略を提案する。
論文 参考訳(メタデータ) (2023-11-28T17:47:32Z) - Semi-DETR: Semi-Supervised Object Detection with Detection Transformers [105.45018934087076]
半教師付き物体検出(SSOD)におけるDETRに基づくフレームワークの解析
本報告では,第1次変圧器を用いたエンド・ツー・エンド半教師対象検出器であるSemi-DETRについて述べる。
我々の手法は、最先端の手法をクリアマージンで上回る。
論文 参考訳(メタデータ) (2023-07-16T16:32:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。