論文の概要: Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain
- arxiv url: http://arxiv.org/abs/2605.09106v1
- Date: Sat, 09 May 2026 18:28:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.521372
- Title: Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain
- Title(参考訳): ファイナンス領域における人的バイアス下におけるLCM意思決定の総合的評価
- Abstract要約: Fin-Biasは、金融状況下での大規模言語モデル(LLM)を評価するためのベンチマークである。
Fin-Biasには8868の長期にわたる企業固有のアナリストレポートが含まれており、さまざまな業界から投資格付け(Bullish/Neutral/Bearish)を持つ高度なアナリストによって要約され分析されている。
我々は、LLMが生み出す投資評価を得るために、アナリストの投資評価と「フェイク」レーティングでさえも、ファームアナリストのレポートを付した大規模言語モデルを提示する。
- 参考スコア(独自算出の注目度): 9.104486997354178
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly deployed in financial contexts, raising critical concerns about reliability, alignment, and susceptibility to adversarial manipulation. While prior finance-related benchmarks assess LLMs' capabilities in stock trading, they are often restricted to small sample and fail to demonstrate LLM susceptibility to context with potential human bias. We introduce Fin-Bias (financial herding under long and uncertain financial context), a benchmark for evaluating LLM investment decision-making when faced with uncertainty and possible human-biased opinions. Fin-Bias includes 8868 long firm-specific analyst reports, including firm aspects summarized and analyzed by sophisticated analysts with investment ratings (Bullish/Neutral/Bearish) spanning from various industries. We present large language models with firm analyst reports with/without analyst investment ratings and even with 'fake' rating, to get investment ratings generated by LLMs. Our results reveal that LLMs tend to herd the explicit bias in context. We also develop a method to detect potential human opinions, which can encourage LLMs to think independently, some models even exceed human performance in predicting future stock return.
- Abstract(参考訳): 大規模言語モデル(LLM)は、金融状況においてますます多くデプロイされており、信頼性、アライメント、敵の操作に対する感受性に関する重要な懸念を提起している。
以前の金融関連ベンチマークでは、株式取引におけるLLMの能力を評価していたが、しばしば小さなサンプルに制限され、潜在的人間のバイアスを伴う文脈に対するLLMの感受性を示すことができなかった。
我々は、不確実性と人間のバイアスのある意見に直面する際に、LLM投資決定を評価するためのベンチマークであるFin-Biasを紹介する。
Fin-Biasには8868の長期にわたる企業固有のアナリストレポートが含まれており、さまざまな業界から投資格付け(Bullish/Neutral/Bearish)を持つ高度なアナリストによって要約され分析されている。
我々は、LLMが生み出す投資格付けを得るために、アナリストの投資格付けと「フェイク」格付けでさえも、ファーム・アナリストのレポートを付した大規模言語モデルを提示する。
以上の結果から,LLMは文脈の明確な偏見を隠蔽する傾向があることが明らかとなった。
また、LLMが独立して考えることを奨励する可能性のある人的意見を検出する方法も開発しており、一部のモデルは将来の株式返却を予測する上で、人的業績を上回るものさえある。
関連論文リスト
- Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection [64.75447949495307]
大規模言語モデル (LLM) は金融分野に広く適用されている。
行動バイアスは、意思決定における不安定性と不確実性をもたらす可能性がある。
mfmdscenは様々な経済シナリオで mfmdの行動バイアスを評価するベンチマークです
論文 参考訳(メタデータ) (2026-01-08T22:00:32Z) - FinTrust: A Comprehensive Benchmark of Trustworthiness Evaluation in Finance Domain [54.06289302468199]
FinTrust は金融アプリケーションにおける LLM の信頼性を評価するためのベンチマークである。
o4-miniのようなプロプライエタリなモデルは、安全性など、ほとんどのタスクでパフォーマンスに優れています。
DeepSeek-V3のようなオープンソースモデルは、業界レベルの公正さのような特定の分野に利点がある。
論文 参考訳(メタデータ) (2025-10-17T01:45:49Z) - StockBench: Can LLM Agents Trade Stocks Profitably In Real-world Markets? [44.10622904101254]
大規模言語モデル(LLM)は、最近、自律エージェントとして強力な能力を示した。
実時間複数ヶ月の株式トレーディング環境でLLMエージェントを評価するためのベンチマークであるStockBenchを紹介する。
我々の評価では、ほとんどのLLMエージェントは、単純な買い買い得ベースラインよりも優れているが、いくつかのモデルでは、より高いリターンをもたらし、より効果的にリスクを管理する可能性を実証している。
論文 参考訳(メタデータ) (2025-10-02T16:54:57Z) - Your AI, Not Your View: The Bias of LLMs in Investment Analysis [62.388554963415906]
金融において、Large Language Models (LLMs) は、事前訓練されたパラメトリック知識とリアルタイム市場データとの相違から生じる、頻繁な知識紛争に直面している。
これらの対立は、モデル固有のバイアスが制度的目的と誤認される現実世界の投資サービスにおいて特に問題となる。
本研究では,このような紛争シナリオにおける創発的行動を調べるための実験的枠組みを提案し,投資分析におけるバイアスの定量的分析を行う。
論文 参考訳(メタデータ) (2025-07-28T16:09:38Z) - Towards Competent AI for Fundamental Analysis in Finance: A Benchmark Dataset and Evaluation [5.892346584607669]
ファイナンシャルステートメント分析に着目したベンチマークデータセットであるFinAR-Benchを提案する。
重要な情報を抽出し、財務指標を計算し、論理的推論を適用する。
本研究は, 基礎解析におけるLLMの現在の強度と限界を明確に把握するものである。
論文 参考訳(メタデータ) (2025-05-22T07:06:20Z) - Financial Statement Analysis with Large Language Models [0.0]
我々はGPT4に標準化された匿名の財務文書を提供し、モデルを解析するように指示する。
このモデルでは、財務アナリストが収益の変化を予測できる能力を上回っている。
GPTの予測に基づく貿易戦略は、他のモデルに基づく戦略よりもシャープ比とアルファ率が高い。
論文 参考訳(メタデータ) (2024-07-25T08:36:58Z) - DnA-Eval: Enhancing Large Language Model Evaluation through Decomposition and Aggregation [75.81096662788254]
大規模言語モデル(LLM)はスケーラブルで経済的な評価指標である。
これらの評価者がどの程度信頼できるかという問題は、重要な研究課題として浮上している。
本稿では,デコンプリートとアグリゲートを提案し,その評価プロセスを教育実践に基づいて異なる段階に分解する。
論文 参考訳(メタデータ) (2024-05-24T08:12:30Z) - Benchmarking LLMs via Uncertainty Quantification [91.72588235407379]
オープンソースのLarge Language Models(LLM)の普及は、包括的な評価方法の緊急の必要性を強調している。
我々は不確実性定量化を統合した LLM のための新しいベンチマーク手法を提案する。
以上の結果より, 精度の高いLSMでは, 精度が低下する可能性があり, II) より大規模なLSMでは, より小型のLSMに比べて不確実性が高いこと, III) 命令ファインタニングではLCMの不確実性が高くなる傾向が示唆された。
論文 参考訳(メタデータ) (2024-01-23T14:29:17Z) - Enhancing Financial Sentiment Analysis via Retrieval Augmented Large
Language Models [11.154814189699735]
大規模な言語モデル (LLM) は様々なNLPタスクにおいて優れた性能を示した。
本稿では,金融感情分析のためのLLMフレームワークを提案する。
提案手法の精度は15%から48%向上し,F1得点を得た。
論文 参考訳(メタデータ) (2023-10-06T05:40:23Z) - Empowering Many, Biasing a Few: Generalist Credit Scoring through Large
Language Models [53.620827459684094]
大規模言語モデル(LLM)は、複数のタスクにまたがる強力な一般化能力を持つ信用スコアリングタスクにおいて大きな可能性を秘めている。
クレジットスコアリングのための LLM を探索する,初のオープンソース包括的フレームワークを提案する。
そこで我々は,各種金融リスク評価タスクの煩雑な要求に合わせて,指導チューニングによる最初の信用・リスク評価大言語モデル(CALM)を提案する。
論文 参考訳(メタデータ) (2023-10-01T03:50:34Z) - Sentiment Analysis in the Era of Large Language Models: A Reality Check [69.97942065617664]
本稿では,大規模言語モデル(LLM)の様々な感情分析タスクの実行能力について検討する。
26のデータセット上の13のタスクのパフォーマンスを評価し、ドメイン固有のデータセットに基づいて訓練された小言語モデル(SLM)と比較した。
論文 参考訳(メタデータ) (2023-05-24T10:45:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。