論文の概要: Mathematical Transfer in LLMs Follows Reasoning Approach More Than Topic
- arxiv url: http://arxiv.org/abs/2610.00331v1
- Date: Tue, 29 Sep 2026 13:50:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.61294
- Title: Mathematical Transfer in LLMs Follows Reasoning Approach More Than Topic
- Title(参考訳): LLMにおける数学的伝達 : トピック以上の推論手法
- Abstract要約: 推論アプローチは、数学的領域が異なる場合でも、ターゲットと解法を共有する。
我々は2つの相反する2時間2ドルの設計を評価した。
5つのベースモデルと3つのトレーニングシードが設計され、SAは40のシードプールモデルでSTを上回っている。
- 参考スコア(独自算出の注目度): 1.9573380763700712
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When selecting mathematical training data for LLMs, a natural organizing principle is topic: probability examples for probability targets. An alternative is reasoning approach: worked solutions that share a solution method with the target, even when the mathematical domain differs. We ask which relation produces greater transfer after fine-tuning. We evaluate two counterbalanced $2\times2$ designs: probability and combinatorics crossed with invariant reasoning and double counting (2,000 problems), and number theory and geometry crossed with complement and pigeonhole reasoning (800 problems). In each design, every cell serves as the held-out target in turn: same-approach (SA) sources share the target's method but change the topic, while same-topic (ST) sources share the topic but change the method. Every source appears once in each role, so additive source-quality effects cancel from the equally weighted aggregate contrast. Across five base models and three training seeds per design, SA outperforms ST in all 40 seed-pooled model--target comparisons. Model-level advantages range from 8.2 to 16.2 percentage points in the primary design (mean: 10.8) and from 12.0 to 16.0 in the second design (mean: 14.3); all ten model-level 95% confidence intervals exclude zero. In both designs, ST sources are more similar to targets under embedding and lexical measures, so the SA advantage runs opposite to the measured ordering of statement-level resemblance. These findings identify reasoning approach as a more effective matching criterion than topic for mathematical transfer across the evaluated topic--approach combinations.
- Abstract(参考訳): LLMの数学的トレーニングデータを選択する際には、自然な編成原理がトピックであり、確率目標の確率例である。
別の方法として、数学的領域が異なっても、対象と解法を共有する作業解がある。
微調整後、どの関係がより大きな伝達をもたらすか尋ねる。
確率とコンビネータは不変推論と二重数え上げ(2000問題)、数論と幾何は補的推論とピジョンホール推論(800問題)で交わる。
各設計では、すべてのセルが保持対象として機能し、同じアパッチ(SA)ソースが対象のメソッドを共有し、トピックを変更する一方、同じトピック(ST)ソースはトピックを共有し、メソッドを変更する。
すべてのソースが各ロールに一度現れるので、加法的なソース品質効果は、同じ重み付けされた集合コントラストからキャンセルされる。
5つのベースモデルと3つのトレーニングシードが設計され、SAは40のシードプールモデルでSTを上回っている。
モデルレベルの利点は、一次設計では8.2から16.2ポイント(平均10.8ポイント)、第二設計では12.0から16.0ポイント(平均14.3ポイント)、モデルレベルの95%信頼区間では0を除いた。
両方の設計において、ST源は埋め込みおよび語彙測度の下でターゲットとより類似しているので、SAの利点はステートメントレベルの類似性の測定順序とは逆である。
これらの結果から, 推論アプローチは, 評価されたトピック間の数学的伝達のトピックよりも, より効果的なマッチング基準であることがわかった。
関連論文リスト
- Math Reasoning in LLMs is Organized by Approach, Not Topic [2.099922236065961]
数学対応言語モデル(LLM)は、ベンチマークトピックの代わりに再利用可能な推論アプローチによって内部計算を整理することができる。
本稿では,オープンな数学能力を持つLLMが,トピックのサブスキルや推論手法によって内部的に構成されているかを検討する。
実際のクラスタの77~82%にアプローチレベルのコヒーレンスがあるのに対して,内部ソースコントロールでは6~11%,トピック純粋クラスタではトピック自体よりも詳細なラベルを受け取るのが普通である。
論文 参考訳(メタデータ) (2026-09-22T20:36:01Z) - How reliable are LLMs when it comes to playing dice? [0.0]
離散確率問題に対する制御ベンチマークによる大規模言語モデルの推論能力について検討する。
モデルの平均精度は標準問題では0.96であるが、直観に反するものでは0.59である。
このプロンプトに誤解を招く提案を埋め込むことで、パフォーマンスが最大34%低下し、免疫力を示すモデルが存在しない。
論文 参考訳(メタデータ) (2026-06-05T17:59:42Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - When Shallow Wins: Silent Failures and the Depth-Accuracy Paradox in Latent Reasoning [16.505918019260964]
信頼性と信頼性の低い予測を混合することにより,最先端モデル(Qwen2.5-Math-7B)の精度が61%向上することが実証された。
正しい予測の18.4%は安定で忠実な推論を採用しており、81.6%は計算的に一貫性のない経路を通して現れる。
論文 参考訳(メタデータ) (2026-03-03T19:43:36Z) - Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching [66.39914384073145]
本稿では,安価な拡散サンプリング推論をステップレベル候補の再利用プールに変換する自己整合性フレームワークを提案する。
ステップレベルの再結合は、難しい問題に対して最も有益であることがわかった。
トレーニング不要のフレームワークは、6つの数学およびコーディングタスクの平均精度を最大2倍改善します。
論文 参考訳(メタデータ) (2026-02-26T11:08:39Z) - FairReason: Balancing Reasoning and Social Bias in MLLMs [54.26091556079722]
MLLM(Multimodal Large Language Models)は、様々なタスクやモダリティにおいて、最先端の成果をすでに達成している。
近年の研究では、推論能力をさらに推し進めるために、先進的なプロンプトスキームと後続の微調整を探求している。
論文 参考訳(メタデータ) (2025-07-30T19:57:22Z) - TIC-TAC: A Framework for Improved Covariance Estimation in Deep Heteroscedastic Regression [109.69084997173196]
奥行き回帰は、予測分布の平均と共分散を負の対数類似度を用いて共同最適化する。
近年の研究では, 共分散推定に伴う課題により, 準最適収束が生じる可能性が示唆されている。
1)予測共分散は予測平均のランダム性を真に捉えているか?
その結果, TICは共分散を正確に学習するだけでなく, 負の対数類似性の収束性の向上も促進することがわかった。
論文 参考訳(メタデータ) (2023-10-29T09:54:03Z) - Scalable Personalised Item Ranking through Parametric Density Estimation [53.44830012414444]
暗黙のフィードバックから学ぶことは、一流問題の難しい性質のために困難です。
ほとんどの従来の方法は、一級問題に対処するためにペアワイズランキングアプローチとネガティブサンプラーを使用します。
本論文では,ポイントワイズと同等の収束速度を実現する学習対ランクアプローチを提案する。
論文 参考訳(メタデータ) (2021-05-11T03:38:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。