論文の概要: The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?
- arxiv url: http://arxiv.org/abs/2609.30705v1
- Date: Fri, 25 Sep 2026 02:28:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.187692
- Title: The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?
- Title(参考訳): 思考の価格:LLM取引におけるテスト時間推論は有益か?
- Abstract要約: 我々は大規模言語モデル(LLM)の制御された研究を行う。
各作成日、プロンプト、アウトプットフォーマット、ポートフォリオ構築で利用可能な情報を保持しながら、推論の労力を変える。
当社の評価は、数値、識別可能なニュース、マスキングニュースの3つの入力条件の下で、米国株式の1年間をカバーしている。
DeepSeekでは、推論なしから最大推論まで、完全な進捗を調べるが、パフォーマンスはモノトニックではない。
- 参考スコア(独自算出の注目度): 6.969128256930174
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While inference-time reasoning in large language models (LLMs) promises better decision making, its higher computational cost may not yield better economic outcomes. Yet reasoning controls are rarely evaluated as economic interventions, where changes in model outputs must translate into better portfolios after trading costs. We conduct a controlled study of representative LLMs from the DeepSeek, GPT, and Gemini families. We vary reasoning effort while holding information available at each formation date, prompts, output formats, and portfolio construction fixed. Our evaluation covers a full year of U.S. equities under three input conditions: numerical, identifiable news, and masked news. It includes more than 800,000 asset predictions and repeated model generations. Across all three model families, additional reasoning does not produce a reliable improvement in net portfolio returns. For DeepSeek, where we examine the full progression from no reasoning to maximum reasoning, performance is nonmonotonic. Repeated generations also produce unstable treatment effects and portfolio selections, even when overall scores remain similar. These findings show that additional reasoning can change financial decisions without reliably improving their economic value, motivating validation for each task before deployment.
- Abstract(参考訳): 大規模言語モデル(LLM)における推論時間推論はより良い意思決定を約束するが、高い計算コストはより良い経済効果をもたらすことはない。
しかし、モデルアウトプットの変化が取引コストの後により良いポートフォリオに変換されなければならない経済介入として、推論制御が評価されることは滅多にない。
我々はDeepSeek, GPT, Geminiファミリーの代表的LSMの制御研究を行う。
各作成日、プロンプト、アウトプットフォーマット、ポートフォリオ構築で利用可能な情報を保持しながら、推論の労力を変える。
当社の評価は、数値、識別可能なニュース、マスキングニュースの3つの入力条件の下で、米国株式の1年間をカバーしている。
これには80万人以上の資産予測と反復モデル世代が含まれる。
3つのモデルファミリ全体において、追加の推論は、純ポートフォリオリターンの信頼性を損なうものではない。
DeepSeekでは、推論なしから最大推論まで、完全な進捗を調べるが、パフォーマンスはモノトニックではない。
繰り返し世代は、スコアが同じでも不安定な治療効果やポートフォリオの選択も生み出す。
これらの結果は、追加の推論が経済的価値を確実に改善することなく、経済的決定を変更できることを示し、配備前の各タスクに対する検証を動機付けている。
関連論文リスト
- Are LLMs Good Financial User Simulators? Multi-view Investor Logic Alignment (MILA) [2.50104309758398]
大規模言語モデル (LLM) は, ユーザシミュレータとしてますます利用されているが, その予測が個々のユーザの進化する決定を忠実に再現するかどうかは不明である。
我々は,貿易発生から行動構造,資産選択,下流ポートフォリオの結果に至るまで,行動の忠実度を階層的に評価する。
論文 参考訳(メタデータ) (2026-09-14T15:23:26Z) - The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts [0.5898893619901381]
トークン経済スコア(Token Economic Score, TES)は、推論モデルの精度向上を非推論ベースライン上で測定するベンチマーク指標である。
本研究では, 数学, コード生成, 科学推論, 指示追従, 専門家の知識, 知識のリコール, 研究レベルの物理を対象とする, モデルベンチマークを151のモデルベンチマークで実施する。
その結果,MMLU-Proのような知識リコールタスクは難易度にもかかわらずTESが低いのに対して,タスク構造は名目上の難易度よりも推論効率が良いことが示唆された。
論文 参考訳(メタデータ) (2026-08-26T17:44:50Z) - Evaluating Financial Sentiment in the Age of AI [0.0]
本稿では、辞書ベースの方法、金融特化トランスフォーマー、オープンソースのLCMなど、12の感情モデルを評価する。
いくつかのモデルでは、利益の予想に大きく関連しているセンチメント尺度が作成されているが、翌日の株価リターンと大きく関連しているものはない。
これらの結果は、企業業績に関する情報を財務感が捉えているが、短期的な市場反応を説明する能力は限られていることを示唆している。
論文 参考訳(メタデータ) (2026-07-29T02:33:36Z) - Budget-Aware Anytime Reasoning with LLM-Synthesized Preference Data [57.996437077411315]
計算予算に制限のある大規模言語モデル(LLM)の推論挙動について検討する。
我々は、任意の推論フレームワークとAnytime Indexを導入し、推論トークンが増加するにつれて、ソリューションの品質がいかに効果的に向上するかを定量化します。
NaturalPlan(Trip)、AIME、GPQAデータセットの実験では、Grok-3、GPT-oss、GPT-4.1/4o、LLaMAモデル間で一貫した利得を示している。
論文 参考訳(メタデータ) (2026-01-16T07:09:30Z) - LiveTradeBench: Seeking Real-World Alpha with Large Language Models [26.976122048323873]
大規模言語モデル(LLM)は、ベンチマーク全体で強力なパフォーマンスを達成する。
これらのテストは静的な設定で行われ、実際のダイナミクスと不確実性が欠如している。
LLMエージェントを現実的で発展途上国で評価するためのライブトレーディング環境であるLiveTradeBenchを紹介する。
論文 参考訳(メタデータ) (2025-11-05T16:47:26Z) - Your AI, Not Your View: The Bias of LLMs in Investment Analysis [62.388554963415906]
金融において、Large Language Models (LLMs) は、事前訓練されたパラメトリック知識とリアルタイム市場データとの相違から生じる、頻繁な知識紛争に直面している。
これらの対立は、モデル固有のバイアスが制度的目的と誤認される現実世界の投資サービスにおいて特に問題となる。
本研究では,このような紛争シナリオにおける創発的行動を調べるための実験的枠組みを提案し,投資分析におけるバイアスの定量的分析を行う。
論文 参考訳(メタデータ) (2025-07-28T16:09:38Z) - Reasoning or Overthinking: Evaluating Large Language Models on Financial Sentiment Analysis [1.3812010983144802]
我々は,様々な大規模言語モデル (LLM) が経済的文脈における人間ラベルの感情とどのように一致しているかを評価する。
本研究は, モデル設計のプロンプトや本質的設計による推論が, この課題における性能を向上させるものではないことを示唆している。
驚くべきことに、モデルと手法の最も正確かつ人間に整合した組み合わせは、CoT(Chain-of-Thought)を推進しないGPT-4oであった。
論文 参考訳(メタデータ) (2025-06-05T02:47:23Z) - FinTSB: A Comprehensive and Practical Benchmark for Financial Time Series Forecasting [58.70072722290475]
ファイナンシャル・タイム・シリーズ(FinTS)は、人間の脳を増強した意思決定の行動を記録する。
FinTSBは金融時系列予測のための総合的で実用的なベンチマークである。
論文 参考訳(メタデータ) (2025-02-26T05:19:16Z) - Can ChatGPT Forecast Stock Price Movements? Return Predictability and Large Language Models [48.87381259980254]
我々は、ChatGPTのような大規模言語モデル(LLM)が、直接の金融トレーニングなしでニュースの見出しから株式市場の反応を予測する能力について文書化している。
GPT-4は、認識後カットオフの見出しを使って、最初の市場の反応を捉え、取引不能な初期反応に対して、ポートフォリオの1日当たりのヒット率を約90%達成している。
論文 参考訳(メタデータ) (2023-04-15T19:22:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。