論文の概要: Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards
- arxiv url: http://arxiv.org/abs/2607.10474v1
- Date: Sat, 11 Jul 2026 20:53:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.438273
- Title: Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards
- Title(参考訳): 検証可能な物理による強化学習--連続逆戻りによる後学習LLM
- Authors: Pengfei Cai, Utkarsh Utkarsh, Alan Edelman, Christopher Vincent Rackauckas, Rafael Gomez-Bombarelli,
- Abstract要約: RLVP: Reinforcement Learning with Verifiable Physics, RL post-training framework for multi-PDE solver code generation。
単一のポリシーは、双曲系、放物型、楕円型、非圧縮性フロー系にまたがる多種多様なPDEファミリーで後から訓練される。
RLVPは、PDEベンチマークのトレーニング済みベースラインと教師付きベースラインの両方を改善し、ホールドアウトPDEへのゼロショット改善転送を示す。
- 参考スコア(独自算出の注目度): 3.593890190223936
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Partial differential equations (PDEs) are foundational to modeling in science and engineering, but constructing reliable numerical solvers remains labor-intensive, demanding expert knowledge of discretization schemes, stability conditions, and boundary treatments. Recent work has begun to frame PDE solving as a code-generation task for large language models (LLMs), yet existing approaches operate primarily at inference time: relying on prompting, debugging, self-refinement, and test-time scaling rather than adapting the model itself. In parallel, reinforcement learning with verifiable rewards has emerged as a post-training paradigm for code and math reasoning, but its verifiers are typically binary: a compiler runs, or a test passes. Such signals discard the graded structure of scientific correctness, where two solvers may both execute and yet differ in solution accuracy by orders of magnitude. In this work, we introduce RLVP: Reinforcement Learning with Verifiable Physics, an RL post-training framework for multi-PDE solver code generation. RLVP addresses this verifiability gap with a hybrid verifier: hard program-validity checks ensure executability, while continuous physics rewards score function-space accuracy and PDE-residual consistency. A single policy is post-trained across diverse PDE families spanning hyperbolic, parabolic, elliptic, and incompressible-flow systems. RLVP improves over both pre-trained and supervised-only baselines on PDE benchmarks, and shows zero-shot improvement transfer to held-out PDEs. We show that a smaller LLM post-trained with RLVP can outperform prompting a frontier model on in-distribution PDE solver generation. The trained policy shows evidence of compositionality in numerical motifs: it recombines stencils, time-stepping schemes, and boundary-handling primitives learned from the PDEs used in training into generated solvers for unseen PDE problems.
- Abstract(参考訳): 偏微分方程式 (Partial differential equation, PDE) は、科学や工学におけるモデリングの基礎であるが、信頼性のある数値解法の構築には労働集約的であり、離散化スキーム、安定性条件、境界処理に関する専門家の知識を必要とする。
最近の作業では、PDE解決を大規模言語モデル(LLM)のコード生成タスクとして捉え始めているが、既存のアプローチは、モデル自体を適応するのではなく、プロンプト、デバッギング、セルフリファインメント、テストタイムスケーリングに頼っている。
並列的に、検証可能な報酬を伴う強化学習は、コードと数学推論の訓練後のパラダイムとして登場したが、検証は一般的にバイナリである:コンパイラが実行されるか、テストが通過する。
このような信号は、科学的正当性の段階的な構造を捨て、そこでは2つの解法が同時に実行されながら、桁違いの精度で解の精度が異なる。
本稿では,マルチPDEソルバコード生成のためのRLポストトレーニングフレームワークであるReinforcement Learning with Verifiable Physicsを紹介する。
RLVPはこの検証可能性ギャップをハイブリッド検証器で解決し、ハードプログラム妥当性チェックは実行可能性を保証する一方、連続物理学は関数空間の精度とPDE残差の整合性を評価する。
単一のポリシーは、双曲系、放物型、楕円型、非圧縮性フロー系にまたがる多種多様なPDEファミリーで後から訓練される。
RLVPは、PDEベンチマークのトレーニング済みベースラインと教師付きベースラインの両方を改善し、ホールドアウトPDEへのゼロショット改善転送を示す。
RLVPでポストトレーニングされた小さなLLMは、分散PDEソルバ生成におけるフロンティアモデルよりも優れていることを示す。
トレーニングされたポリシーは、ステンシル、タイムステッピングスキーム、およびトレーニングで使用されるPDEから学習された境界処理プリミティブを、未知のPDE問題のための生成した解決器に再結合する、数値モチーフにおける構成性の証拠を示す。
関連論文リスト
- AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies [13.63605095777436]
本稿では,解決プロセス全体を通じて明示的に表現されたオブジェクトとしてソルバ戦略を維持するコードエージェントであるAutoPDEを提案する。
AutoPDEは、再利用可能なPDE解決スキルのライブラリから、このオブジェクトを3段階で構築し、メンテナンスする。
実験の結果、AutoPDEのパスレートは54.5%で、最強のベースラインよりも14.2ドルポイント向上している。
論文 参考訳(メタデータ) (2026-06-09T12:02:58Z) - DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models [55.01951088768769]
DiffusionOPDはオンライン政策蒸留(OPD)に基づく拡散モデルのための新しいマルチタスクトレーニングパラダイムである
本研究では,DiffusionOPDがトレーニング効率と最終性能において,マルチリワードRLとカスケードRLのベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2026-05-14T16:49:09Z) - PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving [50.54386756067269]
偏微分方程式 (Partial Differential Equations, PDE) は、工学と科学研究の基盤である。
PDE解決の従来の手法は、手作業のセットアップとドメインの専門知識に依存するため、煩雑である。
本研究では, PDE を LLM 駆動エージェントによるツール呼び出しとして扱う。
PDE-Agentはツールチェーンで拡張された最初のマルチエージェントコラボレーションフレームワークです。
論文 参考訳(メタデータ) (2025-12-18T06:02:50Z) - CodePDE: An Inference Framework for LLM-driven PDE Solver Generation [57.15474515982337]
偏微分方程式(PDE)は物理系のモデリングの基本である。
従来の数値解法は専門家の知識に頼って実装し、計算コストがかかる。
大規模言語モデルを用いてPDEソルバを生成するための最初の推論フレームワークであるCodePDEを紹介する。
論文 参考訳(メタデータ) (2025-05-13T17:58:08Z) - Unisolver: PDE-Conditional Transformers Towards Universal Neural PDE Solvers [53.79279286773326]
我々は、多様なデータに基づいて訓練され、多様なPDEで条件付けされた新しいトランスフォーマーモデルUnisolverを提案する。
Unisolverは3つの挑戦的な大規模ベンチマークで一貫した最先端を実現し、優れたパフォーマンスと一般化性を示している。
論文 参考訳(メタデータ) (2024-05-27T15:34:35Z) - Physics-constrained robust learning of open-form partial differential equations from limited and noisy data [1.50528618730365]
本研究では,自由形式偏微分方程式(PDE)を有限・雑音データから頑健に解明する枠組みを提案する。
ニューラルネットワークに基づく予測モデルは、システム応答に適合し、生成されたPDEに対する報酬評価器として機能する。
数値実験により, 非線形力学系から, 極めてノイズの多いデータで支配方程式を発見できることを示す。
論文 参考訳(メタデータ) (2023-09-14T12:34:42Z) - Solver-in-the-Loop: Learning from Differentiable Physics to Interact
with Iterative PDE-Solvers [26.444103444634994]
認識されたPDEが捉えない効果を補正することにより、機械学習が解の精度を向上させることができることを示す。
従来使用されていた学習手法は,学習ループにソルバを組み込む手法により大幅に性能が向上していることがわかった。
これにより、以前の補正を考慮に入れたリアルな入力分布がモデルに提供される。
論文 参考訳(メタデータ) (2020-06-30T18:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。