論文の概要: Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning
- arxiv url: http://arxiv.org/abs/2607.01511v1
- Date: Wed, 01 Jul 2026 22:17:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.607438
- Title: Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning
- Title(参考訳): 限定監督下でのチェーン・オブ・ソート・推論の再検討:半教師付きチェーン・オブ・ソート・ラーニング
- Abstract要約: 疑似推論監視を構築するために,ラベルのない質問を用いたフレームワークを提案する。
Semi-CoTは、ラベルのない質問ごとに複数の擬似CoTをサンプリングし、回答レベルのセマンティックエントロピーを推定し、信頼性の高い擬似CoTデモとして低エントロピー推論チェーンを選択する。
AQuA、SVAMP、GSM8K、MultiArithの試験実験では、エントロピーゲートが高い精度の擬似CoTを選択し、擬似応答精度は911.36%$から100%$である。
- 参考スコア(独自算出の注目度): 17.893249958828218
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Chain-of-thought (CoT) reasoning has emerged as an effective approach for activating latent reasoning capabilities in large language models. However, most existing CoT methods use reasoning chains mainly as inference-time prompts, while the generated reasoning traces are rarely reused as semi-supervised learning signals. In this report, we define \textbf{Semi-supervised Chain-of-Thought Learning} and propose \textbf{Semi-CoT}, a simple framework that uses unlabeled questions to construct pseudo reasoning supervision. Semi-CoT samples multiple pseudo-CoTs for each unlabeled question, estimates answer-level semantic entropy, and selects low-entropy reasoning chains as reliable pseudo-CoT demonstrations. This extends the self-training view of CoT from inference-time refinement to semi-supervised pseudo-supervision. Pilot experiments on AQuA, SVAMP, GSM8K, and MultiArith show that the entropy gate selects high-precision pseudo-CoTs, with pseudo-answer precision ranging from $91.36\%$ to $100\%$. Semi-CoT also gives small gains on SVAMP and GSM8K, while AQuA shows negative transfer and MultiArith reaches a ceiling. These results suggest that unlabeled questions can provide reliable pseudo reasoning signals, but their effective use still requires stronger demonstration selection or student training.
- Abstract(参考訳): CoT推論(Chain-of-Thought reasoning)は、大規模言語モデルにおける潜在推論能力を活性化するための効果的なアプローチとして登場した。
しかし、既存のほとんどのCoT手法は推論時プロンプトとして推論連鎖を用いるが、生成した推論トレースは半教師付き学習信号として再利用されることは稀である。
本報告では, 疑似推論指導を構築するために, ラベルのない質問を用いた簡単なフレームワークである textbf{Semi-supervised Chain-of-Thought Learning} を定義し, 提案する。
Semi-CoTは、ラベルのない質問ごとに複数の擬似CoTをサンプリングし、回答レベルのセマンティックエントロピーを推定し、信頼性の高い擬似CoTデモとして低エントロピー推論チェーンを選択する。
これにより、CoTの自己学習的視点は、推論時の洗練から半教師付き擬似スーパービジョンへと拡張される。
AQuA、SVAMP、GSM8K、MultiArithの試験実験では、エントロピーゲートが高精度の擬似CoTを選択し、擬似応答精度は911.36\%から100\%である。
Semi-CoTはSVAMPとGSM8Kに小さな利得を与え、AQuAは負の転送を示し、MultiArithは天井に達する。
これらの結果は、ラベルのない質問は、信頼できる疑似推論信号を提供できることを示唆しているが、その効果的な使用には、より強力なデモ選択や学生の訓練が必要であることを示唆している。
関連論文リスト
- Demystifying Entropy-based Selection for Chain-of-Thought Compression in Large Reasoning Models [16.372524974789492]
エントロピーに基づくプルーニングは, チェイン・オブ・ソート(CoT)推論を非無視精度で圧縮する方法として提案されている。
エントロピーは任意の評価条件においてランダムプルーニングよりも有利であることを示す。
論文 参考訳(メタデータ) (2026-07-30T15:59:51Z) - WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models [51.88075626243057]
基礎推薦モデル(FRM)のための効率的な潜在推論フレームワークであるWhisperRecを提案する。
WhisperRecは教師生成のChain-of-Thought(CoT)を学習可能な潜在推論トークンに圧縮する。
WhisperRecは明示的なCoT法と従来のベースラインを一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-07-29T08:48:35Z) - Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing [14.176238828329952]
大規模言語モデル(LLM)は、その答えを駆動する実際の要因を正確に反映しない思考の連鎖(CoT)を生成することができる。
内的アクティベーションの探索により動機付け推論が識別可能であることを示す。
論文 参考訳(メタデータ) (2026-03-17T23:03:21Z) - CoLT: Reasoning with Chain of Latent Tool Calls [31.228763375347608]
CoT(Chain-of-Thought)は、大規模言語モデル(LLM)の推論能力を高める重要な手法である。
ツールコールとして潜伏推論を実装する新しいフレームワークである「CoLT」を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:12:53Z) - ChainV: Atomic Visual Hints Make Multimodal Reasoning Shorter and Better [59.29940512530982]
推論プロセスに視覚的ヒントを動的に統合するフレームワークChainVを提案する。
提案手法は,特に算数集約ベンチマークにおいて,推論精度と効率を大幅に向上させる。
論文 参考訳(メタデータ) (2025-11-21T10:11:17Z) - Reinforced Latent Reasoning for LLM-based Recommendation [92.56166822197919]
大きな言語モデル(LLM)は、複雑な問題解決タスクにおいて印象的な推論能力を示している。
既存の手法は通常、明示的なチェーン・オブ・シント(CoT)データによる微調整に依存している。
本研究では, 明示的なCoT推論から, コンパクトで情報密度の高い潜伏推論へ移行する代替手法について検討する。
論文 参考訳(メタデータ) (2025-05-25T11:03:45Z) - CoT Information: Improved Sample Complexity under Chain-of-Thought Supervision [10.29575414214269]
チェーン・オブ・思想(CoT)の監督は、最終的なアウトプットとともに中間的推論ステップを提供する。
本稿では,CoT監督下での学習の統計的理論について述べる。
論文 参考訳(メタデータ) (2025-05-21T18:28:54Z) - Fractured Chain-of-Thought Reasoning [61.647243580650446]
完全CoTと解のみのサンプリングを補間する統合推論時間戦略であるフラクチャードサンプリングを導入する。
フラクチャードサンプリングは、Pass@kとトークンの予算に対して、急激なログ線形スケーリングゲインをもたらすため、優れた精度とコストのトレードオフを一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-05-19T11:30:41Z) - Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought [64.43689151961054]
連続CoTのD$ステップを持つ2層トランスが有向グラフ到達可能性問題を解くことができることを証明した。
我々の構成では、各連続思考ベクトルは複数の探索フロンティアを同時に符号化する重ね合わせ状態である。
論文 参考訳(メタデータ) (2025-05-18T18:36:53Z) - Reasoning Models Don't Always Say What They Think [48.05987314492555]
CoT(Chain-of-Thought)は、モデルの意図と推論プロセスの監視を可能にする。
提案する6つの推論ヒントにまたがる最先端推論モデルのCoT忠実度を評価した。
論文 参考訳(メタデータ) (2025-05-08T16:51:43Z) - Mitigating Misleading Chain-of-Thought Reasoning with Selective Filtering [59.495717939664246]
大規模言語モデルは、複雑な問題を解くためにチェーン・オブ・ソート(CoT)推論技術を活用することで、顕著な能力を示した。
本稿では,選択フィルタリング推論(SelF-Reasoner)と呼ばれる新しい手法を提案する。
SelF-ReasonerはScienceQA、ECQA、LastLetterタスクに対して、微調整されたT5ベースラインを一貫して改善する。
論文 参考訳(メタデータ) (2024-03-28T06:28:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。