論文の概要: Generalization in LLM Problem Solving: The Case of the Shortest Path
- arxiv url: http://arxiv.org/abs/2604.15306v1
- Date: Thu, 16 Apr 2026 17:59:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-17 21:29:32.04838
- Title: Generalization in LLM Problem Solving: The Case of the Shortest Path
- Title(参考訳): LLM問題の解法における一般化:最短経路の場合
- Authors: Yao Tong, Jiayuan Ye, Anastasia Borovykh, Reza Shokri,
- Abstract要約: 最短経路計画に基づく制御された合成環境を導入する。
モデルは強い空間移動を示すが、常に長尺スケールで失敗する。
学習パイプラインの異なる段階が系統的な問題解決にどのように影響するかを分析する。
- 参考スコア(独自算出の注目度): 20.04578544593786
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Whether language models can systematically generalize remains actively debated. Yet empirical performance is jointly shaped by multiple factors such as training data, training paradigms, and inference-time strategies, making failures difficult to interpret. We introduce a controlled synthetic environment based on shortest-path planning, a canonical composable sequential optimization problem. The setup enables clean separation of these factors and supports two orthogonal axes of generalization: spatial transfer to unseen maps and length scaling to longer-horizon problems. We find that models exhibit strong spatial transfer but consistently fail under length scaling due to recursive instability. We further analyze how distinct stages of the learning pipeline influence systematic problem-solving: for example, data coverage sets capability limits; reinforcement learning improves training stability but does not expand those limits; and inference-time scaling enhances performance but cannot rescue length-scaling failures.
- Abstract(参考訳): 言語モデルが体系的に一般化できるかどうかについては、現在も活発に議論が続けられている。
しかし、経験的なパフォーマンスは、トレーニングデータ、トレーニングパラダイム、推論時の戦略など、複数の要因によって共同で形成され、障害の解釈が困難になります。
本稿では,標準構成可能な逐次最適化問題である最短経路計画に基づく制御された合成環境を提案する。
この設定はこれらの因子をきれいに分離することができ、空間を見えない地図に転送する2つの直交軸と、長い水平問題への長さスケーリングをサポートする。
モデルが強い空間移動を示すが, 再帰的不安定性のため, 連続的に長大化に失敗することがわかった。
さらに、学習パイプラインの異なる段階が、体系的な問題解決にどのように影響するかを分析する。例えば、データカバレッジが能力制限を設定すること、強化学習はトレーニングの安定性を向上するが、それらの制限を拡張しないこと、推論時間スケーリングはパフォーマンスを向上するが、長さスケーリングの失敗を救えないこと、などである。
関連論文リスト
- Compensating Visual Insufficiency with Stratified Language Guidance for Long-Tail Class Incremental Learning [50.795452298625996]
ロングテールクラスのインクリメンタルラーニング(LT CIL)は、テールクラスのサンプルの不足が学習を妨げているため、依然として非常に困難である。
これらの問題に対処するために、言語知識の情報性とスケーラビリティを活用します。
階層化適応型言語指導を導入し、学習可能な重みを利用してマルチスケールの意味表現をマージする。
論文 参考訳(メタデータ) (2026-03-23T08:50:00Z) - Bidirectional Curriculum Generation: A Multi-Agent Framework for Data-Efficient Mathematical Reasoning [16.95900718416944]
各トレーニングサンプルの教育的価値を最大化するために,新しい双方向カリキュラム生成フレームワークを導入する。
剛性軌道とは異なり、我々のマルチエージェントエコシステムは適応的な教育を模倣し、閉じたフィードバックループを確立する。
このメカニズムは、モデルが任意の段階で最も効果的なデータのみを消費することを保証します。
論文 参考訳(メタデータ) (2026-03-05T12:49:21Z) - Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training [76.12556589212666]
学習後のカリキュラムは指数関数的複雑性のボトルネックを回避していることを示す。
結果のみの報酬信号の下では、強化学習の微調整は、サンプルの複雑さを高い精度で達成する。
カリキュラムを意識したクエリにより、報奨託書の呼び出しとサンプリングコストの両方を指数関数的に削減するテストタイムスケーリングの保証を確立する。
論文 参考訳(メタデータ) (2025-11-10T18:29:54Z) - Structural Information-based Hierarchical Diffusion for Offline Reinforcement Learning [13.839214658191038]
本稿では,効率的なオフライン政策学習のための構造情報に基づく階層的拡散フレームワークを提案する。
オフライン軌道に埋め込まれた構造情報を解析して拡散階層を適応的に構築する。
SIHDは意思決定性能において最先端のベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2025-09-26T06:24:06Z) - Text-Trained LLMs Can Zero-Shot Extrapolate PDE Dynamics [10.472535430038759]
大規模言語モデル(LLM)は、様々なタスクにまたがる創発的なコンテキスト内学習(ICL)機能を示している。
テキスト学習基礎モデルは, 離散偏微分方程式(PDE)の解から, ダイナミックスを正確に予測できることを示す。
我々はトークンレベルの出力分布を分析し、一貫したICL進行を明らかにする:まず、構文パターンの模倣から始まり、探索的高エントロピーフェーズを遷移し、自信と数値的な基底予測を達成する。
論文 参考訳(メタデータ) (2025-09-08T04:08:50Z) - Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems [6.859965454961918]
本研究では,LQ制御問題に対する強化学習について検討する。
本稿では, モデルフリーでデータ駆動型探索機構を提案し, 批判者によるエントロピー正規化を適応的に調整する。
本手法は,LQ問題のクラスにおいて,最もよく知られたモデルフリーな結果と一致するサブ線形後悔境界を実現する。
論文 参考訳(メタデータ) (2025-07-01T01:09:06Z) - RL for Reasoning by Adaptively Revealing Rationales [36.50924054394857]
監督された微調整(SFT)は密度の高い地下構造ラベルに依存しており、シーケンスの長さが大きくなるにつれてコストが増大する。
AdaBack(アダプティブ・バックトラック)は,学習中の目標出力の部分的なプレフィックスのみを明らかにする,サンプルごとのカリキュラム学習アルゴリズムである。
部分解に対する適応的なカリキュラムは、そうでなければ難解な問題を確実に解決することを示します。
論文 参考訳(メタデータ) (2025-06-22T17:46:14Z) - Growing Through Experience: Scaling Episodic Grounding in Language Models [67.27024505353384]
言語モデル(LM)は、物理的な計画タスクに長けるために、堅牢なエピソジックグラウンドを必要とする。
現在のエピソジックな基盤アプローチは、スケーラビリティと統合に苦労しています。
本稿では,より小規模から大規模にエピソジックな動作を効果的に伝達する,スケーラブルな弱から強のエピソジックな学習フレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-02T04:52:19Z) - LESA: Learnable LLM Layer Scaling-Up [57.0510934286449]
LLM(Large Language Models)をスクラッチからトレーニングするには膨大な計算資源が必要であるため、非常に高価である。
モデルスケーリングアップは、より小さなモデルのパラメータを活用してより大きなモデルを作成することで、有望なソリューションを提供する。
深度スケールアップのための新しい学習方法である textbfLESA を提案する。
論文 参考訳(メタデータ) (2025-02-19T14:58:48Z) - SHERL: Synthesizing High Accuracy and Efficient Memory for Resource-Limited Transfer Learning [63.93193829913252]
本稿では,リソース制限シナリオに対するSHERLと呼ばれる革新的なMETL戦略を提案する。
初期経路では、中間出力は反冗長動作によって統合される。
遅延ルートでは、最小限の遅延事前トレーニングされたレイヤを利用することで、メモリオーバーヘッドのピーク需要を軽減できる。
論文 参考訳(メタデータ) (2024-07-10T10:22:35Z) - Provable Reinforcement Learning with a Short-Term Memory [68.00677878812908]
我々はPMDPsの新しいサブクラスについて研究し、その潜在状態は、最近の短い長さ$m$の履歴によって復号化することができる。
特に、リッチ・オブザーブレーション・セッティングにおいて、指数関数的にスケールするサンプル複雑性を持つ新しい「モーメントマッチング」アプローチを用いて、新しいアルゴリズムを開発する。
以上の結果から,これらの環境下での強化学習には短期記憶が十分であることが示唆された。
論文 参考訳(メタデータ) (2022-02-08T16:39:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。