論文の概要: Math Reasoning in LLMs is Organized by Approach, Not Topic
- arxiv url: http://arxiv.org/abs/2609.27041v2
- Date: Thu, 24 Sep 2026 02:31:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.337999
- Title: Math Reasoning in LLMs is Organized by Approach, Not Topic
- Title(参考訳): LLMにおける数学推論はアプローチによって構成されるが、トピックではない
- Abstract要約: 数学対応言語モデル(LLM)は、ベンチマークトピックの代わりに再利用可能な推論アプローチによって内部計算を整理することができる。
本稿では,オープンな数学能力を持つLLMが,トピックのサブスキルや推論手法によって内部的に構成されているかを検討する。
実際のクラスタの77~82%にアプローチレベルのコヒーレンスがあるのに対して,内部ソースコントロールでは6~11%,トピック純粋クラスタではトピック自体よりも詳細なラベルを受け取るのが普通である。
- 参考スコア(独自算出の注目度): 2.099922236065961
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mathematical reasoning benchmarks are typically organized by topic, but language models may organize their internal computation by reusable reasoning approach instead. In this paper, we investigate whether open math-capable LLMs organize internally by topical sub-skill or by reasoning approach, and we present evidence that the approach is the key. We introduce a generation-replay protocol: a model first generates a solution, after which we replay the exact prompt-plus-generation trajectory and extract activation-importance signatures over the reasoning tokens. We cluster these signatures without supervision across eight models and five mathematical reasoning sources, then evaluate the recovered structure with structural, semantic, and intervention tests. Across all 40 model-source cells, the recovered clusters outperform matched-size random baselines. Two independent frontier-LLM judges find approach-level coherence in 77-82% of real clusters versus 6-11% in within-source controls, and topic-pure clusters usually receive labels finer than the topic itself. In approach-controlled prompting, changing the requested reasoning approach shifts cluster assignment in seven of eight model conditions, whereas paraphrases largely preserve it. These results indicate that math-capable LLMs organize internal mathematical computation by reasoning approach rather than benchmark topic. The implication is that topic-stratified benchmarks and topic-balanced training corpora can still miss the axis that matters: even deliberately topic-balanced corpora may remain imbalanced over reasoning approaches.
- Abstract(参考訳): 数学的推論ベンチマークは通常トピックによって構成されるが、言語モデルは再利用可能な推論アプローチによって内部計算を整理することができる。
本稿では,オープンな算術能力を持つLLMが,トピックのサブスキルによって内部的に構成されているか,あるいは推論手法によって構成されているかを検討し,そのアプローチが鍵となる証拠を示す。
モデルが解を最初に生成し、その後、正確なプロンプト・アンド・ジェネレーションの軌跡をリプレイし、推論トークン上でアクティベーション・インパタンス・シグネチャを抽出する。
我々は、これらのシグネチャを8つのモデルと5つの数学的推論源にまたがらずにクラスタリングし、構造、意味、介入テストによって復元された構造を評価する。
40のモデルソースセル全体において、回復されたクラスタは一致したサイズのランダムなベースラインよりも優れていた。
2人の独立したフロンティア・LLM判事は、実際のクラスタの77~82%でアプローチレベルのコヒーレンスを、ソース内部のコントロールでは6~11%と認識している。
アプローチ制御プロンプトでは、要求された推論アプローチを変更することで、8つのモデル条件のうち7つのクラスタ割り当てがシフトする。
これらの結果から,算数可能な LLM は,ベンチマークトピックではなく推論アプローチによって内部の数学的計算を整理することを示した。
意味するところは、トピック階層化されたベンチマークとトピックバランスのトレーニングコーパスは、それでも重要な軸を見逃す可能性があるということだ。
関連論文リスト
- Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation [17.1797342726399]
我々は,複数の大規模言語モデル(LLM)の回答だけでなく,推論構造を組み込むフレームワークを提案する。
我々は「合意推論」を返すために、何つのトレースが独立して証明されているかによって各ステップを重み付けする。
法解釈、大学院レベルの科学、物語的マルチホップ推論、一階述語論理にまたがる6つのベンチマークで、我々のアンサンブルは一致した予算の多数決投票基準よりも優れています。
論文 参考訳(メタデータ) (2026-07-30T07:14:50Z) - ReasonOps: Operator Segmentation for LLM Reasoning Traces [29.17171274711201]
大きな推論モデルからのチェーンオブシントトレースは、数万のトークンにまたがる可能性がある。
ReasonOpsは教師なし, 表現力のない, 思考の連鎖をアノテートする手法である。
我々は、8つの推論ベンチマークで6つのファミリーにまたがる12のLLMから44,662のトレースを分析した。
論文 参考訳(メタデータ) (2026-05-28T00:08:35Z) - Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning [56.48520300004217]
本稿では、文脈干渉を内部の訓練信号に変換するセルフプレイのRLフレームワークであるSeyrnesを紹介する。
単一のモデルでは、可視的かつ気を散らすようなコンテキストの構築と、それ自身で盲点を露呈するように訓練されている。
これらの競合する目標を互いに衝突させることで、Sailnes氏は、表面的なパターンマッチングを超えてモデルを補完する。
論文 参考訳(メタデータ) (2026-05-12T06:58:35Z) - Cluster-R1: Large Reasoning Models Are Instruction-following Clustering Agents [81.79110139097297]
汎用埋め込みモデルは意味的類似性を認識するのに優れているが、ユーザ命令で指定されたテキストの特徴を捉えることができない。
我々は、命令追従クラスタリングを生成タスクとして再編成し、大規模推論モデルを自律的なクラスタリングエージェントとして訓練する。
我々の推論駆動学習パイプラインは、LEMがハイレベルクラスタリング命令を解釈し、対応する潜在グループを推測することを可能にする。
論文 参考訳(メタデータ) (2026-03-06T10:15:54Z) - CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching [50.65932158912512]
そこで我々は,新しい大言語モデルの開発を促進するために,因果推論ベンチマークCausalFlipを提案する。
CaulFlipは、イベントトリプル上に構築された因果判断の質問で構成されており、共同創設者、チェーン、コライダーの関係が異なっている。
回答のみのトレーニング,明示的なチェーン・オブ・ソート監視,そして内在型因果推論アプローチなどを含む,複数の訓練パラダイムによるLCMの評価を行った。
論文 参考訳(メタデータ) (2026-02-23T18:06:15Z) - DAG-Math: Graph-Guided Mathematical Reasoning in LLMs [54.231935013127206]
大型言語モデル (LLM) は, CoT (Chain-of-Thought) による数学的問題に対して高い性能を示す
我々は、有向非巡回グラフ(DAG)上の一定の規則に基づくプロセスとしてCoTをモデル化することを提案する。
ここでは,モデルのCoT軌道がDAG構造にどの程度よく依存するかを定量化する計量である論理的近接性を導入する。
論文 参考訳(メタデータ) (2025-10-19T21:05:17Z) - Implicit Reasoning in Large Language Models: A Comprehensive Survey [67.53966514728383]
大規模言語モデル(LLM)は、幅広いタスクにまたがる強力な一般化を実証している。
最近の研究は、暗黙の推論に拍車をかけた、明示的な思考の連鎖から注意を向けている。
本調査では,表現形式から計算戦略へ焦点を移し,実行パラダイムを中心とした分類を紹介した。
論文 参考訳(メタデータ) (2025-09-02T14:16:02Z) - Beyond Chains of Thought: Benchmarking Latent-Space Reasoning Abilities in Large Language Models [0.0]
大規模言語モデル(LLM)は、潜在空間内と外部の両方で推論計算を行うことができる。
本研究では,異なる領域におけるモデル内部推論を定量化するベンチマークを提案する。
論文 参考訳(メタデータ) (2025-04-14T18:15:27Z) - Evaluating Human Alignment and Model Faithfulness of LLM Rationale [66.75309523854476]
大規模言語モデル(LLM)が,その世代を理論的にどのように説明するかを考察する。
提案手法は帰属に基づく説明よりも「偽り」が少ないことを示す。
論文 参考訳(メタデータ) (2024-06-28T20:06:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。