論文の概要: Protoreasoning in Tiny Transformers
- arxiv url: http://arxiv.org/abs/2608.04980v1
- Date: Wed, 05 Aug 2026 15:51:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.980559
- Title: Protoreasoning in Tiny Transformers
- Title(参考訳): チタン変圧器のプロトレゾン化
- Authors: Eduardo Valle, Fergal Reid,
- Abstract要約: 我々は、小さなトランスフォーマーが単純なChain of Thoughtを使って利益を上げることを示しています。
自然言語能力のしきい値よりはるかに低いモデルスケールで作業するために、Dyck言語上の推論フレンドリなタスクを定義します。
- 参考スコア(独自算出の注目度): 6.603115898671461
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We show that tiny transformers can profitably employ a simple form of Chain of Thought, which we call protoreasoning, allowing us to study step-by-step reasoning on ~1M-parameter models and opening up opportunities for much more detailed experimentation and analysis than is feasible for larger models. Current Large Language Models exhibit impressive step-by-step reasoning, but we have yet to understand its generality, i.e., when and how LLMs learn genuinely general algorithms rather than "bags of heuristics." Such questions are hard to settle on compute-intensive frontier models trained on opaque data. To work at model scales far below the threshold for natural-language competence, we define reasoning-friendly tasks on Dyck languages (sentences of correctly nested brackets). We find that protoreasoning traces substantially close the out-of-distribution generalization gap, and ablations confirm that the trace's content, not merely its extra tokens, drives the gain.
- Abstract(参考訳): 小型トランスフォーマーは、プロトレゾニング(protoreasoning)と呼ばれる単純な形態の思考の連鎖(Chain of Thought)を用いて、約1Mパラメーターモデル上でステップバイステップの推論を学習し、より大きなモデルで実現可能なよりもはるかに詳細な実験と分析を行う機会を開くことができることを示す。
現在の大規模言語モデルでは、ステップ・バイ・ステップの推論が目覚ましいが、LLMが「ヒューリスティックスのバグ」ではなく、真に一般的なアルゴリズムをいつ、どのように学習するかをまだ理解していない。
このような疑問は、不透明なデータに基づいてトレーニングされた計算集約的なフロンティアモデルに解決するのは難しい。
自然言語能力のしきい値よりはるかに低いモデルスケールで作業するために、Dyck言語上の推論フレンドリなタスク(正確にネストされた括弧の文)を定義します。
プロトレアソン化トレースは分布外一般化ギャップをかなり閉じており、そのトレースの内容は単なる余分なトークンではなく、利得を駆動していることを示す。
関連論文リスト
- Learning to Recall with Transformers Beyond Orthogonal Embeddings [42.18876773867171]
簡単なトークン検索タスクにおいて,勾配降下法で学習したランダム埋め込みを用いた変圧器を解析する。
我々の分析は、勾配降下の初期段階'を追跡分析し、モデル記憶容量の明示的な公式を導出する。
論文 参考訳(メタデータ) (2026-03-16T21:17:01Z) - Probing the Trajectories of Reasoning Traces in Large Language Models [4.599673637363014]
本研究では,大規模言語モデルにおける推論トレースの軌跡を探索するプロトコルを提案する。
得られた推論トークンの比率が大きくなるにつれて、精度と決定のコミットメントが一貫して増加することが分かっています。
軌道探索が推論モデルのより効率的かつ安全な展開のための診断を提供することを示す。
論文 参考訳(メタデータ) (2026-01-30T16:45:16Z) - Pretraining Language Models to Ponder in Continuous Space [50.52734567589996]
単一のトークン生成ステップ内で,前処理を繰り返し呼び出すことによって,この思考プロセスを言語モデルに導入する。
人間のアノテーションを使わずに、自己教師付き学習を通じて、この方法でモデルを学習できることが示される。
論文 参考訳(メタデータ) (2025-05-27T03:47:33Z) - AutoElicit: Using Large Language Models for Expert Prior Elicitation in Predictive Modelling [53.54623137152208]
我々はAutoElicitを導入し、大規模言語モデルから知識を抽出し、予測モデルのための事前構築を行う。
これらの先行情報は情報的であり、自然言語を用いて洗練できることを示す。
AutoElicitは、非形式的な事前よりもエラーを大幅に減らし、ラベルを減らし、コンテクスト内学習を一貫して上回ります。
論文 参考訳(メタデータ) (2024-11-26T10:13:39Z) - Promises and Pitfalls of Generative Masked Language Modeling: Theoretical Framework and Practical Guidelines [74.42485647685272]
GMLM(Generative Masked Language Models)に焦点を当てる。
我々は,マルコフ連鎖の入力として使用されるマスキングにより,データ分布の条件付き確率に適合するモデルを訓練し,モデルからサンプルを抽出する。
我々は,T5モデルを並列デコーディングに適応させ,最小品質の犠牲を伴って機械翻訳における2~3倍の高速化を実現した。
論文 参考訳(メタデータ) (2024-07-22T18:00:00Z) - Interpretability at Scale: Identifying Causal Mechanisms in Alpaca [62.65877150123775]
本研究では、Boundless DASを用いて、命令に従う間、大規模言語モデルにおける解釈可能な因果構造を効率的に探索する。
私たちの発見は、成長し、最も広くデプロイされている言語モデルの内部構造を忠実に理解するための第一歩です。
論文 参考訳(メタデータ) (2023-05-15T17:15:40Z) - Masked Language Modeling and the Distributional Hypothesis: Order Word
Matters Pre-training for Little [74.49773960145681]
マスク言語モデル(MLM)トレーニングの印象的なパフォーマンスの可能な説明は、そのようなモデルがNLPパイプラインで広く普及している構文構造を表現することを学びました。
本稿では,先行訓練がダウンストリームタスクでほぼ完全に成功する理由として,高次単語共起統計をモデル化できることを挙げる。
以上の結果から,純粋分布情報は,事前学習の成功を主に説明し,深い言語知識を必要とする難易度評価データセットのキュレーションの重要性を強調する。
論文 参考訳(メタデータ) (2021-04-14T06:30:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。