論文の概要: RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing
- arxiv url: http://arxiv.org/abs/2607.25199v2
- Date: Thu, 30 Jul 2026 16:20:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 15:03:14.095704
- Title: RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing
- Title(参考訳): RIDGE: LLM生成オプション価格の検証とメソッド発見のための自動フレームワーク
- Authors: Liexin Cheng, Xue Cheng, Shuaiqiang Liu, Cornelis W. Oosterlee,
- Abstract要約: RIDGEは、生成された価格実装のための自動検証フレームワークである。
検証証拠は診断的に解釈され、その結果の知識はリポジトリに蓄積され、モデル間で再利用される。
検出されたすべての実装欠陥を除去し、2つのケースにおいて、検証プロセスは方法論的な制限を明らかにし、代替的な数値法の開発を動機付ける。
- 参考スコア(独自算出の注目度): 0.00707044523927933
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Automated code generation is becoming an important tool in quantitative finance, where large language models can generate option pricing implementations directly from mathematical model specifications. Validating such implementations, however, requires considerably more than conventional software testing: numerical pricing methods must remain mathematically consistent, numerically stable, and reliable across a wide range of model parameters. We introduce RIDGE, an autonomous validation framework in which generated pricing implementations are subjected to structured no-arbitrage tests, stress tests, benchmark comparisons, and consistency checks. Validation evidence is interpreted diagnostically, while the resulting knowledge is accumulated in a repository and reused across models and successive validation iterations. This enables systematic refinement of both the pricing implementation and the validation methodology. The framework is applied to five stochastic volatility models. Across these studies, all detected implementation defects are removed and, in two cases, the validation process reveals methodological limitations and motivates the development of alternative numerical methods. The supplementary material is available in the GitHub repository: https://github.com/ShQiangLiu/ridge.
- Abstract(参考訳): 自動コード生成は、大規模言語モデルが数学的モデル仕様から直接オプション価格の実装を生成できる量的ファイナンスにおいて重要なツールになりつつある。
数値的な価格法は、数学的に一貫性があり、数値的に安定し、幅広いモデルパラメータにわたって信頼性を保たなければならない。
RIDGEは、自動検証フレームワークで、生成した価格の実装には、構造化された非アービタージュテスト、ストレステスト、ベンチマーク比較、一貫性チェックが適用される。
検証証拠は診断的に解釈され、その結果の知識はリポジトリに蓄積され、モデルと連続した検証を繰り返し再利用される。
これにより、価格設定と検証手法の両方を体系的に洗練することができる。
このフレームワークは5つの確率的ボラティリティモデルに適用される。
これらの研究全体を通して、検出されたすべての実装欠陥を除去し、2つのケースにおいて、検証プロセスは方法論的な限界を明らかにし、代替的な数値法の開発を動機付ける。
追加資料はGitHubリポジトリで入手できる。
関連論文リスト
- $V_1$: Unifying Generation and Self-Verification for Parallel Reasoners [69.66089681814013]
$V_$は、効率的なペアワイドランキングを通じて生成と検証を統合するフレームワークである。
V_$-Inferはポイントワイド検証でPass@1を最大10%改善する。
V_$-PairRLは、標準のRLとポイントワイドのジョイントトレーニングよりも、テストタイムのスケーリングが7ドル--9%で向上する。
論文 参考訳(メタデータ) (2026-03-04T17:22:16Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Budget-aware Test-time Scaling via Discriminative Verification [29.169164125933538]
テスト時間のスケーリングは、複雑な推論タスクにおいて、大きな言語モデルのパフォーマンスを高めるための強力な戦略です。
この作業では、焦点をより予算対応のパラダイム、差別的検証にシフトします。
固定された計算予算の下では、このハイブリッドアプローチは最先端の生成検証をかなりの差で上回る。
論文 参考訳(メタデータ) (2025-10-16T17:30:02Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - VerifyThisBench: Generating Code, Specifications, and Proofs All at Once [9.383313869205628]
本稿では,自然言語記述からエンドツーエンドのプログラム検証を評価する新しいベンチマークを提案する。
評価の結果,o3-miniのような最先端(SOTA)モデルでさえ,パスレートが4%未満であることが確認された。
論文 参考訳(メタデータ) (2025-05-25T19:00:52Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - SKADA-Bench: Benchmarking Unsupervised Domain Adaptation Methods with Realistic Validation On Diverse Modalities [50.6382396309597]
Unsupervised Domain Adaptation (DA) は、ラベル付きソースドメインでトレーニングされたモデルを適用して、ラベルなしのターゲットドメインでデータ分散シフトをうまく実行する。
本稿では,再重み付け,マッピング,部分空間アライメントなど,既存の浅層アルゴリズムの完全かつ公平な評価を行う。
本ベンチマークでは,現実的な検証の重要性を強調し,現実的なアプリケーションに対する実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2024-07-16T12:52:29Z) - Model Cascading for Code: A Cascaded Black-Box Multi-Model Framework for Cost-Efficient Code Completion with Self-Testing [20.445496441396028]
本稿では,モデルカスケーディングと推論時自己テストアルゴリズムを組み合わせた新しいフレームワークを提案する。
このアプローチでは,自己生成テストを活用して精度を高め,モデルのカスケード決定を評価する。
実験結果から, カスケード手法はコストを平均26%削減し, ベストケースでは最大70%削減できることがわかった。
論文 参考訳(メタデータ) (2024-05-24T16:20:04Z) - Exploring validation metrics for offline model-based optimisation with
diffusion models [50.404829846182764]
モデルベース最適化(MBO)では、マシンラーニングを使用して、(基底真理)オラクルと呼ばれるブラックボックス関数に対する報酬の尺度を最大化する候補を設計することに興味があります。
モデル検証中に基底オラクルに対する近似をトレーニングし、その代わりに使用することができるが、その評価は近似的であり、敵の例に対して脆弱である。
本手法は,外挿量を測定するために提案した評価フレームワークにカプセル化されている。
論文 参考訳(メタデータ) (2022-11-19T16:57:37Z) - Calibrating Over-Parametrized Simulation Models: A Framework via
Eligibility Set [3.862247454265944]
厳密な頻繁な統計的保証を満たす校正手法を開発するための枠組みを開発する。
本手法は,書籍市場シミュレータのキャリブレーションへの応用を含む,いくつかの数値例で実証する。
論文 参考訳(メタデータ) (2021-05-27T00:59:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。