論文の概要: Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection
- arxiv url: http://arxiv.org/abs/2601.05403v1
- Date: Thu, 08 Jan 2026 22:00:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-01-12 17:41:49.783442
- Title: Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection
- Title(参考訳): 同一の主張と異なる判断:多言語財務誤報検出におけるシナリオ誘発バイアスのベンチマーク
- Abstract要約: 大規模言語モデル (LLM) は金融分野に広く適用されている。
行動バイアスは、意思決定における不安定性と不確実性をもたらす可能性がある。
mfmdscenは様々な経済シナリオで mfmdの行動バイアスを評価するベンチマークです
- 参考スコア(独自算出の注目度): 64.75447949495307
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) have been widely applied across various domains of finance. Since their training data are largely derived from human-authored corpora, LLMs may inherit a range of human biases. Behavioral biases can lead to instability and uncertainty in decision-making, particularly when processing financial information. However, existing research on LLM bias has mainly focused on direct questioning or simplified, general-purpose settings, with limited consideration of the complex real-world financial environments and high-risk, context-sensitive, multilingual financial misinformation detection tasks (\mfmd). In this work, we propose \mfmdscen, a comprehensive benchmark for evaluating behavioral biases of LLMs in \mfmd across diverse economic scenarios. In collaboration with financial experts, we construct three types of complex financial scenarios: (i) role- and personality-based, (ii) role- and region-based, and (iii) role-based scenarios incorporating ethnicity and religious beliefs. We further develop a multilingual financial misinformation dataset covering English, Chinese, Greek, and Bengali. By integrating these scenarios with misinformation claims, \mfmdscen enables a systematic evaluation of 22 mainstream LLMs. Our findings reveal that pronounced behavioral biases persist across both commercial and open-source models. This project will be available at https://github.com/lzw108/FMD.
- Abstract(参考訳): 大規模言語モデル (LLM) は金融分野に広く適用されている。
彼らのトレーニングデータは、主に人間によって認可されたコーパスに由来するため、LLMは様々な人間のバイアスを継承する可能性がある。
行動バイアスは、特に財務情報を処理する際に、意思決定における不安定性と不確実性をもたらす可能性がある。
しかし、LLMバイアスに関する既存の研究は主に、複雑な現実世界の金融環境とリスクが高く、文脈に敏感で、多言語的な金融誤情報検出タスク(\mfmd)を限定的に考慮した、直接的な質問や単純化された汎用的な設定に焦点を当てている。
本研究では,様々な経済シナリオにおける LLM の行動バイアスを評価するための総合的なベンチマークである \mfmdscen を提案する。
金融専門家と共同で3種類の複雑な金融シナリオを構築します。
(i)役割・人格
(二)役割・地域ベース、及び
(三)民族的・宗教的信条を取り入れた役割に基づくシナリオ。
さらに、英語、中国語、ギリシャ語、ベンガル語をカバーする多言語財務誤情報データセットを開発する。
これらのシナリオを誤情報クレームと統合することにより、22の主流LCMの体系的な評価を可能にした。
その結果,行動バイアスが商用モデルとオープンソースモデルの両方で持続していることが判明した。
このプロジェクトはhttps://github.com/lzw108/FMDで入手できる。
関連論文リスト
- Evaluating LLMs in Finance Requires Explicit Bias Consideration [88.38155218924999]
ファイナンス固有のバイアスは、パフォーマンスを低下させ、バックテストを汚染し、報告された結果をデプロイメントのクレームに役に立たないものにする。
一つのバイアスが28%以上の研究で議論されることはない。
本稿では,バイアス診断と将来のシステム設計のための最小限の要件を満たす構造的妥当性フレームワークと評価チェックリストを提案する。
論文 参考訳(メタデータ) (2026-02-15T17:02:01Z) - The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems [54.12165004393043]
FinMMEval 2026は、財務的理解、推論、意思決定にまたがる3つの相互接続タスクを提供する。
このラボは、堅牢で透明でグローバルに包括的な金融AIシステムの開発を促進することを目的としている。
論文 参考訳(メタデータ) (2026-02-11T14:14:06Z) - UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos [22.530796761115766]
我々は、情報密度の高い金融環境のための最初の統合マルチモーダルベンチマークUniFinEvalを提案する。
UniFinEvalは、現実世界の金融システムに根ざした5つの中核的な金融シナリオを体系的に構築する。
Gemini-3-pro-previewは、全体的なパフォーマンスは最高だが、財務の専門家と比べて大きな差がある。
論文 参考訳(メタデータ) (2026-01-09T10:15:32Z) - Fine-tuning of lightweight large language models for sentiment classification on heterogeneous financial textual data [0.8921166277011348]
財務データセットから感情理解を一般化する軽量なオープンソースの大言語モデル(LLM)について検討する。
LLM、特にQwen3 8BとLlama3 8Bは、利用可能なトレーニングデータのわずか5%を使用しても、ほとんどのシナリオで最高のパフォーマンスを発揮する。
論文 参考訳(メタデータ) (2025-11-30T15:58:22Z) - Your AI, Not Your View: The Bias of LLMs in Investment Analysis [62.388554963415906]
金融において、Large Language Models (LLMs) は、事前訓練されたパラメトリック知識とリアルタイム市場データとの相違から生じる、頻繁な知識紛争に直面している。
これらの対立は、モデル固有のバイアスが制度的目的と誤認される現実世界の投資サービスにおいて特に問題となる。
本研究では,このような紛争シナリオにおける創発的行動を調べるための実験的枠組みを提案し,投資分析におけるバイアスの定量的分析を行う。
論文 参考訳(メタデータ) (2025-07-28T16:09:38Z) - QuantMCP: Grounding Large Language Models in Verifiable Financial Reality [0.43512163406552007]
大規模言語モデル(LLM)は、財務分析と意思決定に革命をもたらすという大きな約束を持っている。
しかし、その直接的な適用は、データ幻覚の問題や、リアルタイムで検証可能な財務情報へのアクセスの欠如によって、しばしば妨げられている。
本稿では,金融現実にLLMを厳格に活用するための新しいフレームワークであるQuantMCPを紹介する。
論文 参考訳(メタデータ) (2025-06-07T01:52:39Z) - SNFinLLM: Systematic and Nuanced Financial Domain Adaptation of Chinese Large Language Models [6.639972934967109]
大規模言語モデル (LLM) は、金融業界において自然言語処理を推進するための強力なツールとなっている。
SNFinLLMという中国の金融ドメイン向けに設計された新しい大規模言語モデルを提案する。
SNFinLLMは、質問への回答、財務調査レポートの要約、感情の分析、財務計算の実行など、ドメイン固有のタスクに優れています。
論文 参考訳(メタデータ) (2024-08-05T08:24:24Z) - RiskLabs: Predicting Financial Risk Using Large Language Model based on Multimodal and Multi-Sources Data [7.76579913330606]
RiskLabsは、大規模言語モデル(LLM)を活用して、財務リスクを分析し予測する新しいフレームワークです。
マーケットのボラティリティと分散の両方を予測する上で,リスクラボの有効性が実証された。
論文 参考訳(メタデータ) (2024-04-11T03:14:50Z) - Are LLMs Rational Investors? A Study on Detecting and Reducing the Financial Bias in LLMs [44.53203911878139]
大規模言語モデル(LLM)は、複雑な市場データとトレンドを解釈する金融分析において、ますます採用されている。
Financial Bias Indicators (FBI)は、Bias Unveiler、Bias Detective、Bias Tracker、Bias Antidoteといったコンポーネントを備えたフレームワークである。
我々は、23のLLMを評価し、財務因果知識に基づく非バイアス化手法を提案する。
論文 参考訳(メタデータ) (2024-02-20T04:26:08Z) - Empowering Many, Biasing a Few: Generalist Credit Scoring through Large
Language Models [53.620827459684094]
大規模言語モデル(LLM)は、複数のタスクにまたがる強力な一般化能力を持つ信用スコアリングタスクにおいて大きな可能性を秘めている。
クレジットスコアリングのための LLM を探索する,初のオープンソース包括的フレームワークを提案する。
そこで我々は,各種金融リスク評価タスクの煩雑な要求に合わせて,指導チューニングによる最初の信用・リスク評価大言語モデル(CALM)を提案する。
論文 参考訳(メタデータ) (2023-10-01T03:50:34Z) - PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark
for Finance [63.51545277822702]
PIXIUは、命令データ付き微調整LLaMAに基づく最初の金融大規模言語モデル(LLM)を含む包括的なフレームワークである。
我々はLLaMAを細調整してFinMAを提案する。
我々は、FinMAと既存のLLMを詳細に分析し、重要な財政課題に対処する際の長所と短所を明らかにする。
論文 参考訳(メタデータ) (2023-06-08T14:20:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。