論文の概要: Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming
- arxiv url: http://arxiv.org/abs/2607.04096v1
- Date: Sun, 05 Jul 2026 03:20:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.829159
- Title: Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming
- Title(参考訳): Forethought: ニューロシンボリックプリミティブプログラミングによる検証可能な推論
- Authors: Vishvesh Bhat, Jay Vaghasiya, Emmanuel Anaya Gonzalez,
- Abstract要約: Forethoughtは、推論を明示的で検証可能なプログラムとして扱う神経象徴的推論システムである。
ベースモデルの精度を約30%向上し、バニラのプロンプト、強化学習足場、即時進化法に勝る。
- 参考スコア(独自算出の注目度): 0.764671395172401
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current agentic workflows usually involve decomposing user requests into sequences of tool calls with correctly resolved parameters, the results of which are processed through reasoning traces in the language model's context window. The prevailing route to improve such reasoning is test-time scaling, which trains models to search over long chains of thought; but the resulting capability is entangled in model weights, is not verifiable step-by-step, and is costly at inference. We present Forethought, a neurosymbolic reasoning system that instead treats reasoning as an explicit, verifiable program, that builds from a library of symbolic and neural primitives which are composed through a domain-specific language. The result are reasoning programs, which are concrete representations of the model's work, and as such can be inspected and modified before deployment. Instantiated as a tool-calling execution kernel and evaluated across five benchmarks, Forethought improves base-model accuracy by about 30% relative and outperforms vanilla prompting, reinforcement learning scaffolds, and prompt-evolution methods, enabling small models to match or exceed frontier models capabilities. In a direct comparison, a non-reasoning model augmented with Forethought competes with a dedicated reasoning model while requiring roughly three orders of magnitude less post-training investment, and remains model-agnostic and auditable.
- Abstract(参考訳): 現在のエージェントワークフローでは、通常、ユーザリクエストを正しく解決されたパラメータを持つ一連のツールコールに分解する。
このような推論を改善するための一般的なルートは、長いチェーンの思考をモデルが探索するように訓練するテストタイムスケーリングであるが、結果として得られる能力はモデルの重みに絡み合っており、ステップバイステップでは検証不可能であり、推論にコストがかかる。
Forethoughtは、その代わりに推論を明示的で検証可能なプログラムとして扱うニューロシンボリック推論システムであり、ドメイン固有言語によって構成されるシンボリックプリミティブとニューラルプリミティブのライブラリから構築される。
結果は、モデル作業の具体的な表現である推論プログラムであり、デプロイ前に検査および修正が可能である。
ツールコール実行カーネルとして確立され、5つのベンチマークで評価されたForethoughtは、ベースモデルの精度を約30%向上し、バニラプロンプトや強化学習の足場、プロンプト進化の方法よりも優れている。
直接比較では、Forethoughtで強化された非推論モデルは、トレーニング後の投資を約3桁減らしながら、専用の推論モデルと競合し、モデルに依存しない、監査可能なままである。
関連論文リスト
- Playing Psychic: Using Thought Trees to Predict Reasoning Models Accuracy on Coding Tasks [7.675768582345005]
実世界のコーディングベンチマークにおいて,フロンティア推論モデルを用いてそれらの性能について考察する。
そこで我々は,論理的トレースを表現する手段として,構造化思考木を提案する。
抽出した特徴に基づく構造的異常トレースのフラグ付けと再試行により,より低い複雑性レベルで一貫した利得が得られることを示す。
論文 参考訳(メタデータ) (2026-04-18T09:30:36Z) - Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning [8.01259760303241]
部分的に完了した推論連鎖が他のモデルによって確実に継続できるかどうかを検討する。
トークンレベルのログ確率しきい値を使用して、ベースラインモデルから推論を早期、中、後期に切り離します。
我々の研究は、推論モデルの新たな行動特性としてのインターチェンジビリティを示唆している。
論文 参考訳(メタデータ) (2025-12-16T02:56:44Z) - CoSineVerifier: Tool-Augmented Answer Verification for Computation-Oriented Scientific Questions [32.14674040685995]
本稿では,外部ルーリックを利用して正確な計算と記号の単純化を行うツール拡張検証器モデルを提案する。
STEM科目、一般QA、長文推論タスクで行った実験は、モデルの強力な一般化を示している。
論文 参考訳(メタデータ) (2025-12-01T03:08:43Z) - Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling [60.63703438729223]
異なるアーキテクチャとトレーニング手法がモデル多段階推論能力にどのように影響するかを示す。
我々は,逐次計算においてモデル深度の増加が重要な役割を担っていることを確認した。
論文 参考訳(メタデータ) (2025-08-22T18:57:08Z) - Accelerated Test-Time Scaling with Model-Free Speculative Sampling [58.69141724095398]
STAND(Stochastic Adaptive N-gram Drafting)は,新しいモデルフリーな投機的デコード手法である。
従来の自己回帰復号法と比較して,STANDは推論遅延を60~65%削減することを示した。
モデルフリーのアプローチとして、STANDは追加のトレーニングなしで既存の言語モデルに適用できる。
論文 参考訳(メタデータ) (2025-06-05T07:31:18Z) - Self-Route: Automatic Mode Switching via Capability Estimation for Efficient Reasoning [36.470695895695044]
Self-Routeは、一般的な推論モードと推論モードを自動的に選択する動的推論フレームワークである。
トークン消費量を30~55%削減しながら,自己ルートが推論モデルに匹敵する精度を実現していることを示す。
論文 参考訳(メタデータ) (2025-05-27T03:18:31Z) - Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach [70.44265766483633]
本稿では,潜在空間における暗黙的推論によるテスト時間計算のスケールアップが可能な,新しい言語モデルアーキテクチャについて検討する。
我々のモデルは繰り返しブロックを繰り返すことで動作し、テスト時に任意の深さに展開する。
結果のモデルが推論ベンチマークの性能を劇的に改善できることが示される。
論文 参考訳(メタデータ) (2025-02-07T18:55:02Z) - BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning [78.63421517563056]
大規模言語モデル(LLM)は複雑な推論タスクにおいて顕著な機能を示した。
本稿では,新しいグラフィカルモデルを用いてLLM推論を定式化する統一確率的フレームワークを提案する。
本稿では,Bootstrapping Reinforced Thinking Process (BRiTE)アルゴリズムについて述べる。
論文 参考訳(メタデータ) (2025-01-31T02:39:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。