論文の概要: FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents
- arxiv url: http://arxiv.org/abs/2606.31522v2
- Date: Wed, 01 Jul 2026 13:27:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 15:15:53.084928
- Title: FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents
- Title(参考訳): FinPersona-Bench: 自律型金融エージェントの縦断的心理的安定性のベンチマーク
- Authors: Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie,
- Abstract要約: 大規模言語モデル(LLM)は、明示的な行動規範を持つ自律的な金融エージェントとして、ますます多くデプロイされている。
市場の状況が長い地平線を越えて蓄積するにつれて、これらの委任統治は徐々に行動的影響を失う。
衝突のシナリオでは、静的エージェントと周期的な委譲再接地を受けるエージェントの挙動ギャップは、シミュレーションの第1四半期から第4四半期まで4.4倍に増大する。
これらの結果から, 信頼性の高い長期展開には, エージェントプロファイルと市場体制に基づく選択的, 委任型再接地が必要であることが示唆された。
- 参考スコア(独自算出の注目度): 39.00852136756911
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly deployed as autonomous financial agents initialized with explicit behavioral mandates such as "preserve capital" or "avoid speculative bets" that are meant to govern every decision throughout deployment. In practice, however, as market context accumulates over long horizons, these mandates gradually lose their behavioral influence, a phenomenon we formalize as Mandate Salience Decay (MSD). To measure MSD objectively, we introduce FinPersona-Bench, a simulation benchmark in which a synthetic market decouples observable price from hidden fundamental value, enabling falsifiable evaluation across three failure modes: trading without signal in calm markets, panic-selling during crashes, and ignoring fundamental value during speculative bubbles. Evaluating 18 leading frontier and open-source LLMs, each assigned one of three behavioral profiles ranging from strict capital preservation to aggressive growth, shows that MSD compounds over time and is model-dependent. In crash scenarios, the behavioral gap between static agents and those receiving periodic mandate re-grounding grows 4.4x from the first to the final quarter of the simulation. The effects of mandate re-grounding are not uniformly positive: it consistently helps conservative agents in low-signal markets but actively worsens behavior for aggressive agents in the same setting. These findings suggest that reliable long-horizon deployment requires selective, mandate-aware re-grounding based on agent profile and market regime.
- Abstract(参考訳): 大規模言語モデル(LLM)は、展開全体を通じてすべての決定を統制することを目的とした「保存資本」や「回避的投機的賭け」のような明示的な行動規範で初期化される自律的な金融エージェントとして、ますます多くデプロイされている。
しかし実際には、市場の状況が長い地平線を越えて蓄積するにつれて、これらの委任統治は徐々に行動の影響を失い、委任救済宣言(MSD:Mandate Salience Decay)として定式化される現象である。
MSDを客観的に測定するために、合成市場が観測可能な価格を隠された基本値から切り離すシミュレーションベンチマークであるFinPersona-Benchを導入する。
厳格な資本保存からアグレッシブな成長までの3つの行動プロファイルのうちの1つに、18の先進的フロンティアとオープンソースLMを評価し、MSD化合物が時間とともにモデルに依存していることを示す。
衝突のシナリオでは、静的エージェントと周期的な委譲再接地を受けるエージェントの挙動ギャップは、シミュレーションの第1四半期から第4四半期まで4.4倍に増大する。
低信号市場における保守的なエージェントを継続的に支援するが、同じ環境での攻撃的なエージェントの振る舞いを積極的に悪化させる。
これらの結果から, 信頼性の高い長期展開には, エージェントプロファイルと市場体制に基づく選択的, 委任型再接地が必要であることが示唆された。
関連論文リスト
- SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents [11.616028403813031]
大規模言語モデル(LLM)は、自律的な金融取引のためにますます多くデプロイされている。
我々は,制約のないテキストの突然変異を構造的,象徴的なポリシー最適化に置き換える,神経象徴的な枠組みである自己進化型ヒューマン・アディタブル・ポリシー(SHARP)を導入する。
論文 参考訳(メタデータ) (2026-05-07T18:23:44Z) - From Risk to Rescue: An Agentic Survival Analysis Framework for Liquidation Prevention [46.90931293070464]
本稿では,リスクを認識し,対実的未来をシミュレートし,積極的に清算を防止するためのプロトコルに忠実な介入を行う自律エージェントを提案する。
我々は,ハイリスクユーザプロファイル4,882のコホート上で,高忠実でプロトコルに忠実なAave v3シミュレータを用いて,我々のアプローチを検証する。
論文 参考訳(メタデータ) (2026-04-16T03:22:05Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models [23.493646150407116]
リアルタイム取引性能の現在の評価は、重大な障害モードを見落としている:不確実性の下でのシーケンシャルな意思決定における厳しい行動不安定性である。
提案するAlphaForgeBenchは,大規模言語モデル(LLM)を,実行エージェントではなく定量的研究者として再構成する,原則化されたフレームワークである。
論文 参考訳(メタデータ) (2026-02-10T14:29:33Z) - Behavioral Consistency Validation for LLM Agents: An Analysis of Trading-Style Switching through Stock-Market Simulation [37.95724732592611]
我々は、金融市場シナリオを用いて、エージェントの戦略変更が金融理論と一致するかどうかをテストする。
本研究は, 長期保存と促進により設定された4つの行動金融ドライバー・アバージョン, ハーディング, 富の分化, 価格の相違を人格特性として運用する。
以上の結果から,最近のLCMのスイッチング動作は,挙動有限性理論と部分的に一致していることがわかった。
論文 参考訳(メタデータ) (2026-02-02T09:25:10Z) - Stablecoin Design with Adversarial-Robust Multi-Agent Systems via Trust-Weighted Signal Aggregation [5.151910664667141]
本稿では,リスク状態推定のための新しいストレスハーネスを組み込んだ,信頼度の高い平均変動フロンティアリザーブコントローラMVF-Composerを提案する。
私たちの重要な洞察は、マルチエージェントシミュレーションを敵のストレステスターとしてデプロイし、オンチェーンが現れる前に予備的な脆弱性を露呈することです。
ブラックスワンを注入した1200のランダム化シナリオで、MVF-Composerはピークペグの偏差を57%減らし、SASベースラインに対して平均回復時間を3.1倍減らした。
論文 参考訳(メタデータ) (2026-01-18T14:21:25Z) - LiveTradeBench: Seeking Real-World Alpha with Large Language Models [26.976122048323873]
大規模言語モデル(LLM)は、ベンチマーク全体で強力なパフォーマンスを達成する。
これらのテストは静的な設定で行われ、実際のダイナミクスと不確実性が欠如している。
LLMエージェントを現実的で発展途上国で評価するためのライブトレーディング環境であるLiveTradeBenchを紹介する。
論文 参考訳(メタデータ) (2025-11-05T16:47:26Z) - Agentic World Modeling for 6G: Near-Real-Time Generative State-Space Reasoning [70.56067503630486]
第6世代(6G)インテリジェンスは、流動的なトークン予測ではなく、想像と選択の能力を校正している、と我々は主張する。
We showed that WM-MS3M cuts mean absolute error (MAE) by 1.69% vs MS3M with 32% less parameters and similar latency, and achieve a 35-80% lower root mean squared error (RMSE) than attention/hybrid baselines with 2.3-4.1x faster inference。
論文 参考訳(メタデータ) (2025-11-04T17:22:22Z) - Robust Reinforcement Learning in Finance: Modeling Market Impact with Elliptic Uncertainty Sets [57.179679246370114]
金融分野では、強化学習(RL)エージェントは、価格に影響を与えない歴史的データに基づいて訓練されることが多い。
展開中、これらのエージェントは、自身の取引が資産価格を変えることができるライブマーケットで取引する。
従来のロバストなRLアプローチは、不確実性の集合に対して最悪のパフォーマンスを最適化することで、このモデルの誤特定に対処する。
楕円型不確実性集合の新たなクラスを開発し,効率的かつ堅牢な政策評価を可能にする。
論文 参考訳(メタデータ) (2025-10-22T18:22:25Z) - Diffusion Variational Autoencoder for Tackling Stochasticity in
Multi-Step Regression Stock Price Prediction [54.21695754082441]
長期的地平線上での多段階の株価予測は、ボラティリティの予測に不可欠である。
多段階の株価予測に対する現在の解決策は、主に単一段階の分類に基づく予測のために設計されている。
深層階層型変分オートコーダ(VAE)と拡散確率的手法を組み合わせてセック2seqの株価予測を行う。
本モデルでは, 予測精度と分散性の観点から, 最先端の解よりも優れていることを示す。
論文 参考訳(メタデータ) (2023-08-18T16:21:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。