論文の概要: ValueAlpha: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable
- arxiv url: http://arxiv.org/abs/2604.25224v1
- Date: Tue, 28 Apr 2026 05:04:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-29 16:49:17.717641
- Title: ValueAlpha: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable
- Title(参考訳): バリューアルファ:リターンが観測される前のLLM予算投資合理化の合意付きストレステスト
- Abstract要約: 本稿では,事前登録された合意付きストレステストプロトコルである textbfValueAlpha を紹介する。
ValueAlpha は LLM-judged Investment-rationale のクレームがパブリッシュ可能、資格あり、無効であるかどうかを決定する。
- 参考スコア(独自算出の注目度): 1.8689252029357564
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon investment decisions create a pre-realization evaluation problem: realized returns are the eventual arbiter of investment quality, but they arrive too late and are too noisy to guide many model-development and governance decisions. LLM judges offer a tempting substitute for pre-deployment evaluation of AI-finance systems, but unvalidated judges may reward verbosity, confidence, or rubric mimicry rather than financial judgment. This paper introduces \textbf{ValueAlpha}, a preregistered agreement-gated stress-test protocol for deciding when LLM-judged investment-rationale claims are publishable, qualified, or invalid. In a controlled market-state capital-allocation prototype with 1,000 honest decision cycles and 100 preregistered adversarial controls (1,100 trajectories, 5,500 judge calls), ValueAlpha clears the aggregate agreement gate at \(\barκ_w = 0.7168\) but prevents several overclaims. Lower-rank systems collapse into a tie-class, one rubric dimension fails the per-dimension gate (\texttt{constraint\_awareness}, \(\barκ_w = 0.2022\)), single-judge rankings are family-dependent, and terse-correct rationales receive a \(Δ= -2.81\) rubric-point penalty relative to honest rationales. A targeted anchor-specificity probe further shows that financial constructs such as constraint awareness are operationally load-bearing. The contribution is therefore not a leaderboard and not a claim to measure true investment skill. ValueAlpha is a pre-calibration metrology layer for AI-finance evaluation: it determines whether a proposed LLM-judge-based investment-rationale claim is stable enough, agreed enough, and uncontaminated enough to be reported at all.
- Abstract(参考訳): 現実のリターンは最終的に投資品質の指標となるが、遅すぎるため、多くのモデル開発やガバナンスの決定を導くにはノイズが多すぎる。
LLMの審査員は、AIファイナンスシステムの事前デプロイ評価の誘惑的な代案を提供するが、不正な審査員は、金銭的な判断よりも冗長性、自信、または滑稽な模倣に報いる可能性がある。
本稿では, LLM-judged Investment-rationale claims が発行可能か, 適格か, 無効かを決定するための, 事前登録された合意付きストレステストプロトコルである \textbf{ValueAlpha} を紹介する。
1000の誠実な意思決定サイクルと100の事前登録された反対制御(1,100のトラジェクトリ、5,500の審査コール)を持つ市場資本配分のプロトタイプにおいて、ValueAlphaは、集合的な合意ゲートを \(\barκ_w = 0.7168\) でクリアするが、いくつかの過大評価を防ぐ。
下位階の系はタイクラスに崩壊し、1つのルーブリック次元は次元ごとのゲート(\texttt{constraint\_awareness}, \(\barκ_w = 0.2022\))に失敗し、単一のジャッジランクは家族依存であり、簡潔な正理性は真理性に対して \(Δ= -2.81\)ルーブリックポイントペナルティを受ける。
ターゲットとなるアンカー特異性調査では、制約認識などの財務構造が運用的に負荷を負担していることも示している。
したがって、貢献はリーダーボードではなく、真の投資スキルを測るクレームではない。
ValueAlphaはAIファイナンス評価のための事前校正メタロジ層であり、提案されたLSM-judgeベースの投資規制請求が十分に安定し、十分に合意され、報告できるほど汚染されていないかどうかを判断する。
関連論文リスト
- GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation [2.2936251006503]
我々は、強化学習問題として金融アドバイス生成を定式化する。
グループ相対政策最適化を用いたオープンウェイト言語モデルを微調整する。
私たちの報酬はLDM-as-a-judgeルーブリックで、アドバイス品質の複数の次元でそれぞれのレコメンデーションをスコア付けします。
論文 参考訳(メタデータ) (2026-08-12T08:28:15Z) - OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents [39.82139666997448]
ポートフォリオ管理エージェントのための監査可能なポイントインタイム評価フレームワークであるOpenPMを提案する。
OpenPMでは、エージェントが5分間隔で市場データを使用して、S&P 500宇宙上の100万ドルの長編書籍を管理する。
各ランは、汚染証明書、コスト感受性曲線、制約順守レポートを含む監査アーティファクトを生成する。
論文 参考訳(メタデータ) (2026-08-06T16:04:44Z) - CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents [0.9924185669370708]
CLQTはクローズドループ取引の評価をランキングではなく診断として再設定する。
CLQTは、完全にクローズドループで、コストを意識し、戦略に一貫性があり、時間的に制限された環境である。
論文 参考訳(メタデータ) (2026-06-29T04:26:30Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - One Size Fits None: Heuristic Collapse in LLM Investment Advice [0.0]
大規模言語モデルは、ハイテイクドメインのアドバイザとしてますます多くデプロイされている。
我々は、フロンティアLSMが実際にこれを行うか、代わりに崩壊を示すかを検討する。
投資配分の決定は、主に自己申告されたリスク寛容によって決定されるが、他の関連する要因は最小限に寄与する。
論文 参考訳(メタデータ) (2026-04-26T18:45:11Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - SCOPE: Selective Conformal Optimized Pairwise LLM Judging [16.73004625486562]
大規模言語モデル (LLMs) は、コストのかかる人間の選好ラベルをペア評価で置き換えるために、裁判官としてますます使われている。
実用性にも拘わらず、LLMの審査員は、誤校正や体系的な偏見に悩まされる傾向にある。
本稿では,有限サンプル統計保証から選択的に判断するフレームワークであるSCOPEを提案する。
論文 参考訳(メタデータ) (2026-02-13T17:10:43Z) - AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models [23.493646150407116]
リアルタイム取引性能の現在の評価は、重大な障害モードを見落としている:不確実性の下でのシーケンシャルな意思決定における厳しい行動不安定性である。
提案するAlphaForgeBenchは,大規模言語モデル(LLM)を,実行エージェントではなく定量的研究者として再構成する,原則化されたフレームワークである。
論文 参考訳(メタデータ) (2026-02-10T14:29:33Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - ZIP-RC: Optimizing Test-Time Compute via Zero-Overhead Joint Reward-Cost Prediction [57.799425838564]
ZIP-RCは、モデルに報酬とコストのゼロオーバーヘッド推論時間予測を持たせる適応推論手法である。
ZIP-RCは、同じまたはより低い平均コストで過半数投票よりも最大12%精度が向上する。
論文 参考訳(メタデータ) (2025-12-01T09:44:31Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Safe and Compliant Cross-Market Trade Execution via Constrained RL and Zero-Knowledge Audits [0.5586191108738564]
本稿では、厳格なコンプライアンスの実施と実行品質のバランスをとるクロスマーケットアルゴリズムトレーディングシステムを提案する。
アーキテクチャは、高レベルプランナー、強化学習実行エージェント、独立コンプライアンスエージェントを含む。
対t検定による95%信頼度レベルへの影響を報告し,CVaRによる尾部リスクの検討を行った。
論文 参考訳(メタデータ) (2025-10-06T15:52:12Z) - Your AI, Not Your View: The Bias of LLMs in Investment Analysis [62.388554963415906]
金融において、Large Language Models (LLMs) は、事前訓練されたパラメトリック知識とリアルタイム市場データとの相違から生じる、頻繁な知識紛争に直面している。
これらの対立は、モデル固有のバイアスが制度的目的と誤認される現実世界の投資サービスにおいて特に問題となる。
本研究では,このような紛争シナリオにおける創発的行動を調べるための実験的枠組みを提案し,投資分析におけるバイアスの定量的分析を行う。
論文 参考訳(メタデータ) (2025-07-28T16:09:38Z) - JudgeLRM: Large Reasoning Models as a Judge [80.07261839142548]
判断指向大規模言語モデル(LLM)のファミリーであるジャッジLRMを紹介する。
SFTの性能向上と推論要求サンプルの比率との間には負の相関が見られ、これらのシナリオにおけるSFTの限界が明らかになる。
判定LRMは、他のRLおよびSFTの変種と同様に、同じサイズでSFTチューニングベースラインを一貫して上回り、最先端の推論モデルを超えていることを示す。
論文 参考訳(メタデータ) (2025-03-31T02:18:51Z) - Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models [63.559461750135334]
言語モデル(LM)は、目標を達成するために自律的に行動可能なエージェントを構築するために、ますます使われています。
本研究では,人為的リスク構造を体系的に変化させる評価枠組みを用いて,この「回答または延期」問題を考察する。
回答や判断に要する独立したスキルを分離した簡易なスキル分解手法が,LMの意思決定ポリシーを一貫して改善できることがわかった。
論文 参考訳(メタデータ) (2025-03-03T09:16:26Z) - Standard Benchmarks Fail - Auditing LLM Agents in Finance Must Prioritize Risk [31.43947127076459]
標準ベンチマークでは、大規模言語モデル(LLM)エージェントが金融面でどれだけうまく機能するかを定めているが、デプロイの安全性についてはほとんど語っていない。
我々は、精度の指標とリターンベースのスコアが、幻覚的な事実、古いデータ、敵の迅速な操作などの脆弱性を見渡すことで、信頼性の錯覚をもたらすと論じている。
論文 参考訳(メタデータ) (2025-02-21T12:56:15Z) - PredictaBoard: Benchmarking LLM Score Predictability [50.47497036981544]
大きな言語モデル(LLM)は予測不能に失敗することが多い。
これは、安全なデプロイメントを保証する上で、大きな課題となる。
PredictaBoardは,新しいベンチマークフレームワークである。
論文 参考訳(メタデータ) (2025-02-20T10:52:38Z) - Chat Bankman-Fried: an Exploration of LLM Alignment in Finance [4.892013668424246]
司法管轄区域はAIの安全性に関する法律を制定するので、アライメントの概念を定義して測定する必要がある。
本稿では,大規模言語モデル(LLM)が比較的未探索の財務状況において,倫理的・法的基準に準拠するか否かを評価するための実験的枠組みを提案する。
論文 参考訳(メタデータ) (2024-11-01T08:56:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。