論文の概要: Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces
- arxiv url: http://arxiv.org/abs/2609.25643v1
- Date: Tue, 22 Sep 2026 03:54:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.200072
- Title: Ladders of Thought: A Self-Evolving Curriculum of Progressively Simplified Reasoning Traces
- Title(参考訳): 思考の遅延: 段階的に単純化された推論トレースの自己進化型カリキュラム
- Abstract要約: 進化的質問書き直しと自己進化型カリキュラムを組み合わせることで推論を改善するフレームワークであるLadders-of-Thought(LoT)を提案する。
LoTは意味論的に忠実だがより容易な推論問題の変種を自動生成し、ステップベースの測度を用いて難易度バケットに整理し、適応的にトレーニングを割り当てるために自己進化型バンディットスケジューラを使用する。
- 参考スコア(独自算出の注目度): 55.31881110525802
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) excel at reasoning when scaled to hundreds of billions of parameters, but small- and mid-scale models remain brittle reasoners even with knowledge distillation (KD). We present Ladders-of-Thought (LoT), a framework that improves reasoning by combining progressive question rewrites with a self-evolving curriculum. LoT automatically generates semantically faithful but easier variants of reasoning problems, organizes them into difficulty buckets using step-based measures, and employs a self-evolving bandit scheduler to allocate training adaptively. Evaluated on two reasoning domains, math and multi-hop reasoning, across 1-8B models from different families, LoT consistently improves over KD. It delivers large gains on arithmetic tasks (e.g., +32 percentage points on AddSub, +25pp on SVAMP), +2-8pp improvements on in-domain test splits, and strong though dataset-dependent benefits on multi-hop reasoning (e.g., +16pp on QASC, +25pp on StrategyQA). LoT also converges faster than staged curricula, highlighting the value of adaptive progression. These results show that progressive rewrites coupled with adaptive curricula provide a simple yet effective recipe for strengthening reasoning in smaller LLMs.
- Abstract(参考訳): 大規模言語モデル(LLM)は、数十億のパラメータにスケールされた場合、推論において優れているが、知識蒸留(KD)でさえ、小規模および中規模モデルは不安定な推論器のままである。
進化的質問書き直しと自己進化型カリキュラムを組み合わせることで推論を改善するフレームワークであるLadders-of-Thought(LoT)を提案する。
LoTは意味論的に忠実だがより容易な推論問題の変種を自動生成し、ステップベースの測度を用いて難易度バケットに整理し、適応的にトレーニングを割り当てるために自己進化型バンディットスケジューラを使用する。
数学とマルチホップ推論という2つの推論領域に基づいて、異なるファミリーの1-8Bモデルで評価され、LoTは一貫してKDよりも改善されている。
演算タスク(SVAMPではAddSubで+32パーセンテージ、SVAMPで+25pp、ドメイン内テスト分割で+2-8pp、マルチホップ推論で強いデータセット依存の利点(QASCで+16pp、StrategyQAで+25pp)に大きな利益をもたらす。
LoTはまた、段階的キュリキュラよりも早く収束し、適応的な進行の値を強調する。
これらの結果から,適応的キュリキュラと組み合わせたプログレッシブリライトは,より小さなLCMにおける推論を強化するための単純かつ効果的なレシピであることがわかった。
関連論文リスト
- AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering [76.52199013231484]
マルチホップ質問回答(QA)における適応的インターリーブド思考のための強化学習(RL)に基づくフレームワークAdaptR1を紹介する。
Graph-R1設定では、AdaptR1は平均的なシンクトークンを69.71%削減し、HotpotQAは90.35%削減された。
分析の結果,マルチホップ推論における過度な思考は,一様分布ではなく,初期計画段階で主に発生することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-29T09:34:45Z) - Encode, Think, Decode: Scaling test-time reasoning with recursive latent thoughts [19.518525241726916]
Encode-Think-Decode (ETD) は、トレーニング中の推論関連レイヤの小さなサブセットを反復するようにトレーニングすることで、ベースモデルの推論能力を向上する手法である。
ETDモデルは、GSM8Kで+28.4%、OLMo-2 1Bベースモデルで+36%の相対精度の改善を含む17の推論ベンチマークで大幅に向上した。
論文 参考訳(メタデータ) (2025-10-08T15:58:35Z) - The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models [54.88805865447848]
モデルが全体の効率を向上し,問題の難しさが効率に影響を及ぼすことを示す。
インストラクションモデルが簡単なアウトラインをドラフトし,思考モデルがそれを拡張する,シンプルな2段階パイプラインであるCOTHINKを提案する。
GSM8K、MATH500、AIME24では、COTHINKはトークンの使用量を21.1%削減し、4つの思考モデルの精度を維持し、強力な効率のベースラインと競争し続ける。
論文 参考訳(メタデータ) (2025-05-28T06:24:45Z) - Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketching [64.74765550805024]
Chain-of-Thoughtはステップバイステップの問題解決を促すが、中間出力の過剰な冗長性を犠牲にすることが多い。
我々は,認知にインスパイアされた推論パラダイムを言語制約と統合する促進フレームワークであるSketch-of-Thought(SoT)を提案する。
SoTはトークンを最大84%削減し、18の推論データセットで最小限の精度ロスを達成している。
論文 参考訳(メタデータ) (2025-03-07T06:57:17Z) - Think Beyond Size: Adaptive Prompting for More Effective Reasoning [0.0]
本稿では,動的かつ反復的なフレームワークであるAdaptive Promptingを紹介する。
その結果、Adaptive Promptingは、算術的推論(GSM8K、MultiArithm)、論理的推論、コモンセンスタスクなど、様々な推論ベンチマークのパフォーマンスを著しく向上させることを示した。
提案手法は,計算効率を維持しつつ,GPT-4などの大規模モデルと競合する性能を実現する。
論文 参考訳(メタデータ) (2024-10-10T17:14:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。