論文の概要: K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance
- arxiv url: http://arxiv.org/abs/2605.29523v1
- Date: Thu, 28 May 2026 07:40:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.959403
- Title: K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance
- Title(参考訳): K-FinHallu:韓国財務省のマルチTurn RAGの幻覚検出ベンチマーク
- Authors: Eunbyeol Cho, Yunseung Lee, Mirae Kim, Jeewon Yang, Youngjun Kwak, Edward Choi,
- Abstract要約: 幻覚は、ハイテイクな環境でのデプロイメントにとって、依然として重要な障壁である。
既存のベンチマークでは、シングルターンの英語中心のタスクに重点を置いている。
韓国の多ターン金融RAGにおける幻覚検出のための最初のベンチマークであるK-FinHalluを紹介する。
- 参考スコア(独自算出の注目度): 14.066230074588093
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have advanced financial automation through Retrieval-Augmented Generation (RAG), yet hallucinations remain a critical barrier to deployment in high-stakes environments. Existing benchmarks focus on single-turn, English-centric tasks, leaving the multi-turn dynamics and linguistic-regulatory nuances of the Korean financial domain unaddressed. We introduce K-FinHallu, the first benchmark for hallucination detection in multi-turn Korean financial RAG. We construct multi-turn dialogues from authentic Korean financial documents and inject hallucinations under a proposed hierarchical taxonomy based on context answerability that explicitly accounts for justified abstention. Benchmarking frontier and open-source LLMs as hallucination detectors, we find that even the strongest models struggle with fine-grained financial diagnostics and refusal behavior. While fine-tuning an 8B model on our training split yields performance competitive with frontier LLMs, justified abstention remains the weakest axis across all evaluated models.
- Abstract(参考訳): 大規模言語モデル (LLM) は、レトリーバル拡張世代 (RAG) を通じて高度な金融自動化を行っているが、幻覚はハイテイク環境での展開にとって重要な障壁である。
これまでのベンチマークでは、シングルターン、イングリッシュ中心のタスクに重点を置いており、韓国の金融ドメインの多ターンダイナミクスと言語規制のニュアンスをそのまま残している。
韓国の多ターン金融RAGにおける幻覚検出のための最初のベンチマークであるK-FinHalluを紹介する。
我々は,韓国の正統な財務文書から多ターン対話を構築し,正当化された棄権を明示的に考慮した文脈応答性に基づく階層型分類法に基づく幻覚を注入する。
幻覚検出装置としてフロンティアとオープンソースのLCMをベンチマークした結果、最強モデルでさえ、きめ細かい財務診断や拒絶行動に苦慮していることがわかった。
トレーニング分割における8Bモデルの微調整は、フロンティアLSMと性能的に競合するが、正当性停止は、評価された全てのモデルの中で最も弱い軸のままである。
関連論文リスト
- MultiHaluDet: Multilingual Hallucination Detection via LLM Hidden State Probing [1.3700362496838856]
大規模言語モデル(LLM)における幻覚は、信頼性の高いデプロイメントにとって重要な障壁である。
多言語幻覚を検出する新しい3段階積み重ねフレームワークであるMultiHaluDetを紹介する。
本フレームワークは,HluEvalおよびTriviaQAベンチマークで98.55%のAUROCに到達し,最先端検出性能を実現する。
論文 参考訳(メタデータ) (2026-05-24T07:50:03Z) - LAET: A Layer-wise Adaptive Ensemble Tuning Framework for Pretrained Language Models [7.216206616406649]
BloombergGPTやFinMAのような大規模言語モデル(LLM)は、さまざまな財務NLPタスクに対して新しいベンチマークを設定している。
我々は,LLMの最も効果的な層を選択的に微調整する新しい戦略であるLayer-wise Adaptive Ensemble Tuning (LAET)を提案する。
提案手法は,財務NLPタスクにおいて,既存のベンチマークや最先端のLCMよりも優れた結果を示す。
論文 参考訳(メタデータ) (2025-11-14T13:57:46Z) - FinLFQA: Evaluating Attributed Text Generation of LLMs in Financial Long-Form Question Answering [57.43420753842626]
FinLFQAは、複雑な財務問題に対する長文の回答を生成するための大規模言語モデルの能力を評価するために設計されたベンチマークである。
回答品質と属性品質の両方をカバーする自動評価フレームワークを提供する。
論文 参考訳(メタデータ) (2025-10-07T20:06:15Z) - mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning [74.97363626515236]
textbfSkill ベースの textbfCommonsense textbfReasoning (textbfmSCoRe) のための textbfMultilingual と Scalable Benchmark を提案する。
本ベンチマークでは,LLMの推論能力を体系的に評価するための3つの重要な要素を取り入れた。
本研究は,多言語多言語一般と文化的共通点に直面する場合,そのような推論強化モデルの限界を明らかにするものである。
論文 参考訳(メタデータ) (2025-08-13T18:59:02Z) - NMIXX: Domain-Adapted Neural Embeddings for Cross-Lingual eXploration of Finance [34.00870877634332]
汎用文埋め込みモデルは、しばしば専門的な財務意味論を捉えるのに苦労する。
NMIXXは18.8Kの高信頼三重項を微調整した言語間埋め込みモデルのスイートである。
KorFinSTSもリリースしています。これはニュース、開示、調査レポート、規制にまたがるベンチマークです。
論文 参考訳(メタデータ) (2025-07-13T12:14:57Z) - KFinEval-Pilot: A Comprehensive Benchmark Suite for Korean Financial Language Understanding [6.3604109210772934]
KFinEval-Pilotは、韓国の金融ドメインで大規模言語モデル(LLM)を評価するために設計されたベンチマークスイートである。
金融知識、法的推論、金融毒性の3つの重要な領域に1,000以上のキュレートされた質問が含まれている。
論文 参考訳(メタデータ) (2025-04-17T00:12:58Z) - Supervised Optimism Correction: Be Confident When LLMs Are Sure [91.7459076316849]
教師付き微調整とオフライン強化学習の間には,新たな理論的関係が確立されている。
広く使われているビームサーチ法は、許容できない過度な最適化に悩まされていることを示す。
本稿では,トークンレベル$Q$-value推定のための簡易かつ効果的な補助的損失を導入したSupervised Optimism Correctionを提案する。
論文 参考訳(メタデータ) (2025-04-10T07:50:03Z) - Benchmarking Large Language Models in Retrieval-Augmented Generation [53.504471079548]
大規模言語モデルに対する検索拡張生成の影響を系統的に検討する。
我々は、RAGに必要な4つの基本能力で、異なる大規模言語モデルの性能を解析する。
RGB(Retrieval-Augmented Generation Benchmark)は、英語と中国語の両方でRAG評価を行うための新しいコーパスである。
論文 参考訳(メタデータ) (2023-09-04T08:28:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。