論文の概要: MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code
- arxiv url: http://arxiv.org/abs/2610.03080v1
- Date: Fri, 02 Oct 2026 10:01:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.316533
- Title: MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code
- Title(参考訳): MintEval: LLMは、あなたが要求するトレーディング戦略を実装するか? - 自然言語から統計コードへの振る舞い等価ベンチマーク
- Abstract要約: 大規模な言語モデルは、トレーディングシグナルの生成から、それらを実行するコードを書くコードへと移行している。
既存のコードベンチマークは、ユニットテストとファイナンス予測で機能的正当性をテストする。
構成可能なビルディングブロックのライブラリから参照戦略が生成されるベンチマークベンチマークであるMintEvalを紹介する。
- 参考スコア(独自算出の注目度): 8.483009584981604
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.
- Abstract(参考訳): 大規模な言語モデルは、トレーディングシグナルの生成から、それらを実行するコードを書くコードへと移行している。
生成されたコードは実行され、バックテストはプロットされるが、トレーダーが説明したリスクロジックは実行されているロジックではない。
既存のコードベンチマークは、ユニットテストとファイナンスベンチマークで機能的正当性をテストします。
MintEvalは、コンポーザブルなビルディングブロックのライブラリから参照戦略をプログラム的に生成し、口語トレーダー命令に逆変換し、テスト中のモデルで再実装するベンチマークである。
生成されたプログラムと参照プログラムは、同じ市場データと摩擦に基づいてバーで実行され、コードの類似性や利益ではなく、彼らのアクションで比較される。
MintEval v0はBTCUSDT 15分のデータに800のタスクを含む。
200タスクの階層化されたサブセット(Claude Opus 5.5)ではフロンティアモデル(Claude Opus 5.5)は0.889に達し、0.575を正確に再現するが、0.275タスクでは静かに失敗する。
ビルディングブロックのメニューが与えられた場合、モデルは戦略をほぼ完全に識別するが、仕様が正しく読まれている実装の79.2%は、アクティブバーの10%以上で正しく分岐している。
最近の戦略生成ベンチマークのLCM判事は、これらのサイレント障害のすべてを受け入れている。
関連論文リスト
- TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces [49.561879967469714]
TraceDanceは、ユーザが指定した望ましくない振る舞いのデプロイメントトレースからターゲットベンチマークを構築するエージェントシステムである。
効率的な構築のために、Anchor-and-Confirmはプログラム可能な検索と、Flash大言語モデルによる候補レベルの確認を組み合わせる。
コーディングと一般的なツールの実験では、252,557のセッションで描画され、ビルドターゲット要求の95.3%を満たす4,125のインスタンスで107のベンチマークを生成する。
論文 参考訳(メタデータ) (2026-09-27T06:58:39Z) - Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - FIDES: A Concordance Protocol for LLM-Generated Trading Strategies [2.8129261352670003]
LLMはトレーディング戦略を要求され、3つのアーティファクトを同時に返却する。
本稿では、FIDESを3つのビューとして扱うための測定プロトコルについて述べる。
論文 参考訳(メタデータ) (2026-08-24T14:28:07Z) - TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows [2.435006380732194]
ノイズの多いトレースをトラジェクトリにコンパイルする,スキルガイドシステムであるTraceCompilerを提案する。
あらゆるハードエッジは監査可能な証拠を持ち、あいまいな関係が疑われる。
コールの削減を計測するが、オフラインのコンパイルコストはかからない。
論文 参考訳(メタデータ) (2026-08-03T01:05:06Z) - Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction [62.42945715963878]
リポジトリレベルの脆弱性の再現は、要求の多いソフトウェアエンジニアリング(SE)タスクである。
最近のLLMエージェントは、アプローチが正しい場合、しばしばこれらのステップを実行するが、間違った戦略を選択することで失敗する。
本論では, アクションの完全な軌跡ではなく, 戦略がSEエージェントの適切な学習単位であることを論じる。
論文 参考訳(メタデータ) (2026-07-02T06:27:27Z) - QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies [0.04660328753262074]
我々は,Backtrader フレームワークの戦略を生成する上で,現代の LLM の体系的評価のためのベンチマークである QuantCode-Bench を提案する。
現在のモデルの主な制限は構文ではなく、トレーディングロジックの適切な運用化、適切なAPI使用、タスクセマンティクスへの準拠である。
論文 参考訳(メタデータ) (2026-04-16T15:31:42Z) - AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms [54.99368693313797]
既存のベンチマークでは、個々の言語/ツールのみをテストするため、パフォーマンス番号は直接比較できない。
このギャップに対処するAlgoVeriは、Dafny、Verus、Leanで77ドルの古典的アルゴリズムのベリコーディングを評価するベンチマークです。
論文 参考訳(メタデータ) (2026-02-10T06:58:26Z) - EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation [9.472124187479915]
オンチェーントランザクションのシナリオでは、小さなエラーでさえ、ユーザにとって不可逆的な損失を引き起こす可能性がある。
EVM-QuestBenchは自然言語トランザクションスクリプト生成のための実行基盤ベンチマークである。
単一動作精度と複数ステップのワークフロー完了の間に永続的な非対称性を示す分割スコアを用いて,20のモデルを評価し,大きな性能ギャップを求める。
論文 参考訳(メタデータ) (2026-01-10T13:25:27Z) - SemGuard: Real-Time Semantic Evaluator for Correcting LLM-Generated Code [46.20378145112059]
ポストホック修復パイプラインは、実行後にのみそのような障害を検出する。
本稿では,実時間で行レベルのセマンティック監視を行うセマンティック評価フレームワークSemGuardを紹介する。
論文 参考訳(メタデータ) (2025-09-29T09:21:32Z) - CLEVER: A Curated Benchmark for Formally Verified Code Generation [53.5486188696892]
$rm Csmall LEVER$は、リーンにおけるエンドツーエンドのコード生成のための161の問題を、高品質でキュレートしたベンチマークである。
それぞれの問題は、(1)堅実な仕様と一致する仕様を生成するタスク、(2)この仕様を確実に満足するリーン実装を生成するタスクで構成されています。
論文 参考訳(メタデータ) (2025-05-20T05:15:47Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。