論文の概要: Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs
- arxiv url: http://arxiv.org/abs/2608.11232v1
- Date: Fri, 31 Jul 2026 02:37:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 01:32:04.587925
- Title: Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs
- Title(参考訳): Backtrader-Bench:自己生成MCQを用いたアルゴリズム取引におけるLLMエージェントのベンチマーク
- Abstract要約: 2つの補完パイプラインを備えたフレームワークであるBacktrader-Benchを紹介します。
決定論的多重選択問題(MCQ)パイプラインは、5つのトレーディング戦略にわたるバックテスト構成から質問を生成する。
ジェネレータ・ソルバフィルタパイプラインは、より難しい問題を自律的にマイニングする。
- 参考スコア(独自算出の注目度): 4.146672630717473
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating LLM coding agents in algorithmic trading is difficult because static benchmarks risk data contamination and numerical backtest outputs require ground truth from actual code execution. We present Backtrader-Bench, a framework with two complementary pipelines. A deterministic multiple-choice question (MCQ) pipeline generates questions from backtest configurations across five trading strategies, 33 templates, and three difficulty tiers, with an independent checker that re-derives every answer. A generator-solver filtering pipeline autonomously mines harder questions: a generator writes questions verified by executable code, converts them to MCQs, and discards any that a no-tool solver can answer without code execution. We evaluate 11 models without tools (10 runs each) and four with-tools configurations on a 30-question curated set. Tool-augmented agents reach 90.0% accuracy in a single pass (GPT-5.5 and Opus 4.7), outperforming the best no-tools baselines (73.0%, averaged over 10 runs) by 17 percentage points. On 38 separately mined questions, no-tools accuracy drops further, with half the models falling to roughly random-chance level (25%). Beyond evaluation, the scalable MCQ infrastructure is designed to produce a training corpus for reinforcement learning, with the ultimate goal of building a specialized agent for quantitative trading workflows.
- Abstract(参考訳): 静的ベンチマークのリスクデータ汚染と数値バックテスト出力は、実際のコード実行から基礎的な真理を必要とするため、アルゴリズム取引におけるLLM符号化エージェントの評価は困難である。
2つの補完パイプラインを備えたフレームワークであるBacktrader-Benchを紹介します。
決定論的多重選択問題(MCQ)パイプラインは、5つのトレーディング戦略、33のテンプレート、および3つの困難なティアにわたるバックテスト構成から質問を生成する。
ジェネレータが実行可能コードで検証された質問を書き、MCQに変換し、ノーツールソルバがコード実行なしで答えられるものを捨てる。
ツールを持たない11のモデル(それぞれ10回実行)と30回のキュレートセットで4つのウィスツール構成を評価した。
ツール強化剤は1回のパス(GPT-5.5とOpus 4.7)で90.0%の精度に達し、最高のノーツールベースライン(73.0%、平均10ラン以上)を17ポイント上回った。
38の別々に採掘された質問では、ノーツールの精度はさらに低下し、半数のモデルはほぼランダムチャンスレベル(25%)に低下した。
評価以外にも、スケーラブルなMCQインフラストラクチャは強化学習のためのトレーニングコーパスを生成するように設計されている。
関連論文リスト
- Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems [67.04448659688579]
クエリ非依存の16エントリのコードブックを開発し、上位のデコード候補を1回のバッチフォワードパスでランク付けする。
反復検索がなく、テスト時にメッセージパッシングがないため、Codebook Agentは6つのベンチマークでもっとも正確な方法である。
論文 参考訳(メタデータ) (2026-09-02T08:10:22Z) - InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy [0.9924185669370708]
InvestPhilBenchは8つの認知層にまたがる動的ベンチマークである。
v0.6リリースには118のプライマリソース認証投資原則カードが含まれている。
大規模な再現可能なスコア付けには、Benchmark Automated Scoring Pipelineを紹介します。
論文 参考訳(メタデータ) (2026-06-24T15:53:20Z) - Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents [5.689042186242701]
企業の専門家が暗黙的に適用する決定ルールは、反復的エラー分析によって体系的に回復し、改善することができる。
基本機構は textbfEISR である textbfTrace2Policy について述べる。
各ラウンドは検証セット上でルールを実行し、ルート原因によるエラーをMISSING、WRONG、CONFLICTタイプにクラスタし、ターゲットパッチを適用し、レグレッションゲートを通過するもののみをコミットする。
論文 参考訳(メタデータ) (2026-06-09T06:05:29Z) - Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline [56.53954182896384]
大規模言語モデルのための簡単な訓練後改良アルゴリズムである自己検証蒸留を提案する。
自己検証蒸留(Self-Verified Distillation)は、未ラベルの種問に対する候補解を生成する。
プロンプトベースの自己検証を使用してフィルタリングし、結果の自己計算データセットをトレーニングする。
トレーニングデータ構築中に、より多くの候補世代をサンプリングし、より大きな検証予算を使用することで、高品質な自己計算データが得られることがわかった。
論文 参考訳(メタデータ) (2026-05-20T17:26:10Z) - Code-Guided Reasoning for Small Language Models: Evaluating Executable MCQA Scaffolds [14.64394876057282]
評価プロトコルと生成プログラムリソースであるCode-Guided Reasoning (CGR)を紹介する。
CGRは6つのコンポーネントを標準化している: 正規化されたアイテムインターフェース、直接解決プロンプト、ジェネレータプロンプト、Pythonの足場、ソルバコールと抽出ヘルパー、3チャンネルの結果レコード。
20,498行のMCQAバンドルと6つのメタデータ登録ソルバモデルからの保存結果行に対して、観測された非ゼロベースライン分割は66.21%のマクロアシスト精度と38.11%の直接精度を示している。
論文 参考訳(メタデータ) (2026-05-12T20:20:06Z) - ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox [61.862814740220806]
$textbfComplexMCP$は厳格な条件下でエージェントを評価するために設計されたベンチマークである。
Model Context Protocol (MCP)上に構築された$textbfComplexMCP$は300以上の精巧にテストされたツールを提供する。
論文 参考訳(メタデータ) (2026-05-11T16:20:51Z) - DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules [4.124344125532972]
複雑な工業資産の監視は、センサーの条件に基づいて引き起こされるエンジニアによる象徴的な規則に依存している。
ルールをメンテナンスステップに変換するには、長年の実践を通じて得られた資産固有の知識が必要です。
このルール・ツー・アクション・ステップの意思決定支援としてLLMが有効か検討し,6,690名の専門家による複数選択質問をベンチマークした。
論文 参考訳(メタデータ) (2026-05-09T02:17:39Z) - BenchBench: Benchmarking Automated Benchmark Generation [10.44497524694021]
BenchBenchは、自動ベンチマーク生成をベンチマークするためのパイプラインとデータセットである。
我々は16.7Kアイテムを生成し、15Kコアアイテムをポストフィルタに保持し、152Kグレードのモデル-イテム応答を生成する。
論文 参考訳(メタデータ) (2026-03-21T13:05:32Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code [76.80306464249217]
本稿では,LLMにより良い理性を教えることを目的としたTeaRを提案する。
TeaRは、注意深いデータキュレーションと強化学習を活用して、コード関連のタスクを通じて最適な推論パスを発見するモデルをガイドする。
我々は、2つのベースモデルと3つの長いCoT蒸留モデルを用いて広範な実験を行い、モデルのサイズは15億から32億のパラメータから、Math、Knowledge、Code、Logical Reasoningにまたがる17のベンチマークにまたがる。
論文 参考訳(メタデータ) (2025-07-10T07:34:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。