論文の概要: RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation
- arxiv url: http://arxiv.org/abs/2607.01388v1
- Date: Wed, 01 Jul 2026 18:48:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.557593
- Title: RusFinChain: A Russian Benchmark for Verifiable Chain-of-Thought Reasoning in Finance with Fuzzy-Aligned Evaluation
- Title(参考訳): RusFinChain:ファジィ・アラインド・アライメントによるファイナンスにおける検証可能なチェーン・オブ・ソート・推論のベンチマーク
- Abstract要約: RusFinChainは、ファイナンスにおける検証可能なChain-of-Thought(CoT)推論のための最初のロシア語のシンボルベンチマークである。
17のドメインと172のトピックにまたがり、Pythonから5,280のパラメータ化された例で構成され、汚染のない評価を保証する。
モデルはステップアライメントのために0.65のハードF1を達成するが、最終回答の29%が正しい。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-step symbolic reasoning is essential for robust financial analysis, yet most benchmarks neglect intermediate reasoning steps. FINCHAIN introduced verifiable Chain-of-Thought (CoT) evaluation but is limited to English. FINESSE-Bench includes a Russian block but relies on multiple-choice questions without step-level supervision. We present RusFinChain, the first Russian-language symbolic benchmark for verifiable CoT reasoning in finance. It spans 17 domains, 172 topics, and comprises 5,280 parameterized examples from executable Python templates, ensuring contamination-free evaluation. Each example includes a gold-standard reasoning chain with intermediate numeric values for automatic verification. We also introduce enhanced metrics: Fuzzy Numeric Alignment and Soft-Attention Alignment. We evaluate 8 open-weight LLMs on a stratified sample, generating 8,100 responses. Results reveal a substantial reasoning gap: models achieve Hard F1 of ~0.65 for step alignment, but only ~29% of final answers are correct. Our fuzzy and soft metrics show stronger correlation with final-answer correctness (Spearman rho approx 0.48) than the original ChainEval (rho approx 0.38-0.46), demonstrating superior diagnostic power. We release dataset, code, and evaluation framework to foster verifiable financial AI for the Russian-speaking community.
- Abstract(参考訳): 多段階のシンボリック推論は、堅牢な財務分析には不可欠であるが、ほとんどのベンチマークは中間的推論ステップを無視している。
FINCHAINは、検証可能なChain-of-Thought (CoT)評価を導入したが、英語に限られている。
FINESSE-Benchはロシアのブロックを含んでいるが、ステップレベルの監督なしに複数の質問に頼っている。
我々はRusFinChainについて紹介する。RusFinChainは、ファイナンスにおける検証可能なCoT推論のための最初のロシア語のシンボルベンチマークである。
17のドメインと172のトピックにまたがり、実行可能なPythonテンプレートから5,280のパラメータ化された例で構成され、汚染のない評価を保証する。
それぞれの例は、自動検証のための中間数値を持つ金標準推論チェーンを含む。
また、Fuzzy Numeric AlignmentとSoft-Attention Alignmentという拡張メトリクスも導入しています。
8個のオープンウェイトLCMを成層試料で評価し,8100個の応答を発生させた。
モデルはステップアライメントのために ~0.65 のハード F1 を達成するが、最終回答の ~29% は正しい。
ファジィとソフトメトリクスは, 従来のChainEval (rho approx 0.38-0.46) よりも最終回答正しさ (Spearman rho approx 0.48) との相関が強く, 診断力に優れていた。
ロシア語を話すコミュニティのために、検証可能な金融AIを促進するために、データセット、コード、評価フレームワークをリリースします。
関連論文リスト
- V-FiLLM: Verified Financial LLM Reasoning Benchmark [0.37189423451031356]
V-FiLLMは,実テーブルに接地した計算木から金銭的推論ベンチマークを生成するフレームワークである。
V-FiLLMは計算深度、表現幅、財務概念の複雑さ、コンテキストサイズなど、独立に制御可能な4つの困難軸を公開する。
検証された連鎖トレースの軽量なLoRA微調整により、ホールドアウト問題において81.1%から85.6%の精度が向上することを示す。
論文 参考訳(メタデータ) (2026-08-11T15:18:47Z) - Interventional Grounding Audits: Black-Box Premise-Dependency Tests for LLM Chain-of-Thought via Predicate Substitution [0.0]
大規模言語モデルは、論理的に健全に見えるが、実際にはその前提に依存しないチェーン・オブ・シント(CoT)推論を生成する。
インベンショナル・グラウンディング・監査,ブラックボックス,ステップレベルの前提依存性テストを導入する。
すべての監査証明書、生のアウトプット、再生スクリプトは、パブリックGitHubリポジトリで利用できる。
論文 参考訳(メタデータ) (2026-07-11T01:32:22Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models [60.418191092851636]
OmanicはオープンドメインのマルチホップQAリソースであり、推論プロセスを分析するための構造アノテーションとして分解されたサブクエストと中間回答を提供する。
10,296個の機械によるトレーニング例(Omanic Synth)と967個の専門家による注釈付き評価例(OmanicBench)を含む。
論文 参考訳(メタデータ) (2026-03-17T15:23:37Z) - FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning [82.7292329605713]
FinChainは、ファイナンスにおける検証可能なChain-of-Thought評価のために特別に設計された最初のベンチマークである。
12の金融ドメインに58のトピックがあり、それぞれがパラメータ化されたシンボリックテンプレートと実行可能なPythonトレースで表現されている。
FinChainは、多段階の財務推論における永続的な弱点を明らかにし、信頼できる、解釈可能な、検証可能な金融AIを開発するための基盤を提供する。
論文 参考訳(メタデータ) (2025-06-03T06:44:42Z) - BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs [7.9458352414205295]
大規模な言語モデルは一般的なタスクでは優れていますが、ロジック重大で精度の高い、財務、法律、医療といった重要な領域での信頼性の評価は依然として難しいままです。
BizFinBenchは、実世界の金融アプリケーションにおけるLSMの評価に特化して設計された最初のベンチマークである。
BizFinBenchは中国語で6,781の注釈付きクエリで構成されており、数値計算、推論、情報抽出、予測認識、知識に基づく質問応答の5つの次元にまたがっている。
論文 参考訳(メタデータ) (2025-05-26T03:23:02Z) - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking [58.15568681219339]
大規模言語モデル(LLM)を評価するための新しいベンチマークであるEquiBenchを紹介する。
このタスクは、プログラムのセマンティクスについて推論するモデルの能力を直接テストする。
19の最先端LCMを評価し、最も難しいカテゴリでは、最高の精度は63.8%と76.2%であり、50%のランダムベースラインよりわずかに高い。
論文 参考訳(メタデータ) (2025-02-18T02:54:25Z) - MUSTARD: Mastering Uniform Synthesis of Theorem and Proof Data [85.50740598523818]
MUSTARDは、高品質で多様性のある定理と証明データの均一な合成をマスターするフレームワークである。
5,866個の有効なデータポイントを持つMUSTARDSAUCEベンチマークを示す。
我々は広範囲な解析を行い、MUSTARDが検証された高品質なステップバイステップデータを生成することを示す。
論文 参考訳(メタデータ) (2024-02-14T05:57:58Z) - Self-Evaluation Guided Beam Search for Reasoning [61.523627290397556]
我々は,Large Language Model (LLM) の推論プロセスのガイドと校正を行うための段階的自己評価機構を導入する。
本稿では,ビームサーチによる自己評価ガイダンスを統合した復号アルゴリズムを提案する。
我々のアプローチは、GSM8K、AQuA、StrategyQAにおいて、対応するCodexバックボンドベースラインをわずかに精度6.34%、9.56%、および5.46%で上回る。
論文 参考訳(メタデータ) (2023-05-01T02:37:59Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。