論文の概要: From Execution to Capability: Scientific Experience Consolidation via Procedural Knowledge Synthesis
- arxiv url: http://arxiv.org/abs/2607.24459v2
- Date: Tue, 28 Jul 2026 04:09:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 14:13:57.680565
- Title: From Execution to Capability: Scientific Experience Consolidation via Procedural Knowledge Synthesis
- Title(参考訳): 実行から能力へ:手続き的知識合成による科学的経験の統合
- Authors: Liwei Dong, Jiahao Zhao, Nan Xu,
- Abstract要約: 我々は科学計算経験の統合について研究する。
SciConsolidateを導入し、クロスタスク手順を誘導する成功と失敗を対比する。
ターゲットモデルは、これらの抽象化を直接実行できないため、より強力なモデルは、それらを実行可能なコード監視に集約する。
- 参考スコア(独自算出の注目度): 26.13203230473646
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models increasingly solve scientific-computing tasks, but executable feedback from one problem rarely becomes durable capability on subsequent problems. We study scientific-computing experience consolidation: converting verified runtime experience into transferable procedural knowledge and persistent model improvement. This setting presents two challenges: trajectory-derived artifacts may encode source-specific repairs rather than cross-task computational mechanisms; and a weaker target model may be unable to operationalize an otherwise valid abstract procedure - an abstraction-execution gap. We introduce SciConsolidate, which contrasts verified successes and failures to induce cross-task procedures, selects them through a development-validation gate, and uses failure-informed, answer-free query synthesis to expand the consolidation data without requiring pre-existing reference answers. Because the target model may not directly execute these abstractions, a stronger model concretizes them into executable code supervision for standard, procedure-free SFT; a matched no-procedure teacher branch isolates the value of procedural guidance. On SciCode, runtime procedure injection improves Qwen3.6-27B by +3.85/+6.26 sub-step/main-problem points, but yields almost no aggregate main-problem gain for Qwen3.5-9B, providing operational evidence of the abstraction-execution gap. After procedure-guided concretization, the 9B student improves under procedure-free deployment by +3.89/+6.25 points over the no-procedure SFT control and by +5.62/+11.25 over the original 9B model. These results establish an experience-to-capability pathway for scientific computing and provide a practical starting point for scaling self-improving scientific assistance.
- Abstract(参考訳): 大規模言語モデルは、科学計算タスクをますます解決するが、ある問題からの実行可能なフィードバックは、その後の問題に対して耐え難い能力となることは滅多にない。
検証済みのランタイム体験を転送可能な手続き的知識に変換し、永続的なモデル改善を行う。
トラジェクトリ由来のアーティファクトは、クロスタスクの計算メカニズムではなく、ソース固有の修復をエンコードする可能性がある。
SciConsolidateは、クロスタスク手順を誘導する成功と失敗を対比し、開発検証ゲートを介してそれらを選択し、フェールインフォームされた応答なしクエリ合成を使用して、既存の参照応答を必要とせずに、コンソリデーションデータを拡張します。
ターゲットモデルは、これらの抽象化を直接実行できないため、より強力なモデルは、標準のプロシージャフリーのSFTのための実行可能なコード管理にそれらを拡張し、マッチした非プロデューサの教師ブランチは手続き的ガイダンスの価値を分離する。
SciCodeでは、ランタイムプロシージャインジェクションはQwen3.6-27Bを+3.85/+6.26のサブステップ/メインプロブレムポイントで改善するが、Qwen3.5-9Bの集約メインプロブレムゲインはほとんど得られず、抽象実行ギャップの運用上の証拠を提供する。
9B の学生はプロシージャ無しの配置において、プロシージャなしの SFT 制御で +3.89/+6.25 点、元の 9B モデルで +5.62/+11.25 点を改良した。
これらの結果は、科学計算のための経験から能力への道を確立し、自己改善科学支援をスケールするための実践的な出発点を提供する。
関連論文リスト
- Failure as a Process: An Anatomy of CLI Coding Agent Trajectories [21.513740407266354]
大規模言語モデル(LLM)コーディングエージェントは、端末ベースの環境でソフトウェアエンジニアリングタスクを自律的に実行するために、ますます多くデプロイされている。
既存の実証研究は、なぜコーディングエージェントが失敗するのかを調査するが、失敗を一時的なプロセスではなく最終的な結果として扱う。
本稿では、CLIコーディングエージェント障害軌跡に関する大規模な実証的研究を行い、プロセス指向のフレームワークを導入し、実行軌跡をまたいだ障害の開始、進化、回復を解析した。
論文 参考訳(メタデータ) (2026-07-10T15:25:56Z) - Controllable and Verifiable Process Data Synthesis for Process Reward Models [0.0]
プロセス報酬モデル(PRM)のためのプロセス監視データを合成するための制御可能で検証可能なフレームワークを提案する。
筆者らのフレームワークはまず,まず正しいシンボリック推論チェーンを構築し,テンプレート認識エラーを中間ステップに注入し,その後のステップを劣化状態下で再計算し,インジェクトされたステップがそのプレフィックスから導出できないことを確認する。
実験により、合成されたデータは、論理的推論ベンチマークと数理的推論への変換に基づいて、最高の8倍の精度を向上することが示された。
論文 参考訳(メタデータ) (2026-05-04T09:36:57Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Procedural Knowledge at Scale Improves Reasoning [25.36077714467684]
Reasoning Memoryは、大規模に手続き的な知識を明示的に取り出し再利用する、推論モデルのためのフレームワークである。
Reasoning Memoryは、ドキュメント、トラジェクトリ、テンプレートの知識、および計算に適合したテスト時間スケーリングベースラインで、RAGを一貫して上回ります。
論文 参考訳(メタデータ) (2026-04-01T20:01:47Z) - Training LLMs for Multi-Step Tool Orchestration with Constrained Data Synthesis and Graduated Rewards [76.49428173793386]
LLMは、中間出力を伝搬しながら、正しい順序で複数の依存APIを呼び出す必要がある。
既存の環境は、シミュレーションデータを使った単純なターン毎の関数呼び出しとバイナリ報酬に重点を置いている。
まず、実APIレスポンスの大規模キャッシュを背景とした強化学習環境を構築し、有効なマルチステップオーケストレーショントレースをサンプリングするデータ合成パイプラインを実現する。
第二に、正当性を原子の妥当性とオーケストレーションに分解する、段階的な報酬設計を提案する。
論文 参考訳(メタデータ) (2026-03-25T18:31:39Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Self-Steering Language Models [113.96916935955842]
DisCIPL は "self-steering" 言語モデル (LM) の手法である。
DisCIPLは、Followerモデルの集団によって実行されるタスク固有の推論プログラムを生成する。
我々の研究は、高度に並列化されたモンテカルロ推論戦略の設計空間を開く。
論文 参考訳(メタデータ) (2025-04-09T17:54:22Z) - SRA-MCTS: Self-driven Reasoning Augmentation with Monte Carlo Tree Search for Code Generation [14.786100203787194]
大規模な言語モデルは、単純なコード生成タスクでは例外的なパフォーマンスを示しますが、複雑な問題に対処する上での課題に直面します。
本稿では,高品質な中間推論経路を自律的に生成するモデルであるSRA-MCTSを提案する。
我々の手法は、追加の監督を必要とせず、モデル自体を通して完全に機能する。
論文 参考訳(メタデータ) (2024-11-17T12:31:04Z) - Enhancing Numerical Reasoning with the Guidance of Reliable Reasoning
Processes [55.2326738851157]
Enhancing NumeriCal reasOning with Reliable procEsses (Encore)を導入する。
我々は、モデルが合成データを用いて推論プロセスの生成を学習するのに役立つ一連の事前学習タスクを提案する。
実験の結果、Encoreは平均1.8%の5つの実験データセットに改善をもたらすことが示された。
論文 参考訳(メタデータ) (2024-02-16T13:02:11Z) - Continuous Transition: Improving Sample Efficiency for Continuous
Control Problems via MixUp [119.69304125647785]
本稿では,連続的遷移を構築するための簡潔かつ強力な手法を提案する。
具体的には、連続的な遷移を線形に補間することにより、トレーニングのための新しい遷移を合成することを提案する。
また, 建設過程を自動案内する判別器を開発した。
論文 参考訳(メタデータ) (2020-11-30T01:20:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。