論文の概要: Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text
- arxiv url: http://arxiv.org/abs/2607.26368v1
- Date: Wed, 29 Jul 2026 01:03:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.504886
- Title: Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text
- Title(参考訳): 財務開示テキストにおける細粒不整合分類の診断
- Abstract要約: 財務情報開示には、数値的なクレーム、時間的ステートメント、エンティティ参照、ポリシーのコミットメント、そして質的に異なる方法で衝突する可能性のあるリスク記述が含まれる。
我々はこの問題をきめ細かい矛盾として研究する。
微調整された300Mエンコーダの精度は61.9%、ロラ適応型Qwen3.5-9Bモデルでは61.5%、GPT適応型生成モデルでは61.3%である。
- 参考スコア(独自算出の注目度): 3.2712318205295907
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Financial disclosures contain numerical claims, temporal statements, entity references, policy commitments, and risk descriptions that may conflict in qualitatively different ways. Detecting a conflict is only the first step: review workflows may also need to determine its type, since numerical, temporal, referential, factual, and normative inconsistencies require different evidence and downstream checks. We study this problem as fine-grained inconsistency classification. Using a fixed 5,940-instance snapshot of SBID-FD, a synthetic financial-disclosure benchmark with 11 inconsistency labels and paired reference evidence spans, we compare frozen embedding classifiers, fine-tuned encoders, evidence-augmented classifiers, prompted large language models, and LoRA-adapted generative models under a shared evaluation protocol. A fine-tuned 300M encoder reaches 61.9% accuracy, compared with 61.5% for a LoRA-adapted Qwen3.5-9B model and 61.3% for GPT-5.4. Because these systems differ in architecture, supervision, training objective, and input format, we interpret this as a practical efficiency result for compact supervised encoders rather than a controlled conclusion about model scale. Supplying gold evidence spans improves the fine-tuned encoder to 65.3%, whereas automatically predicted spans recover a meaningful but incomplete share of that gain, indicating that localization quality remains a bottleneck. Class-level analyses show that Referential inconsistencies are especially sensitive to localization quality, while Factual and Logical inconsistencies remain difficult even when the relevant evidence is provided. Together, the oracle, distractor, and per-class analyses separate localization errors from residual type-discrimination errors, indicating that progress requires both stronger evidence extraction and better reasoning over closely related inconsistency categories.
- Abstract(参考訳): 財務情報開示には、数値的なクレーム、時間的ステートメント、エンティティ参照、ポリシーのコミットメント、そして質的に異なる方法で衝突する可能性のあるリスク記述が含まれる。
数値的、時間的、参照的、事実的、規範的不整合は異なるエビデンスと下流チェックを必要とするため、レビューワークフローはそのタイプを決定する必要もある。
我々はこの問題をきめ細かい不整合分類として研究する。
SBID-FDの固定された5,940インスタンススナップショット、11の不整合ラベルとペアの基準エビデンスを持つ合成金融開示ベンチマークを用いて、凍結埋め込み分類器、微調整エンコーダ、エビデンス拡張分類器、大規模言語モデル、LoRA適応生成モデルの比較を行った。
微調整された300Mエンコーダの精度は61.9%、LoRA対応のQwen3.5-9Bモデルでは61.5%、GPT-5.4では61.3%である。
これらのシステムは、アーキテクチャ、監督、訓練目的、入力形式が異なるため、モデルスケールに関する制御された結論ではなく、コンパクトな教師付きエンコーダの実践的な効率性の結果であると解釈する。
ゴールドエビデンスの供給は細調整されたエンコーダを65.3%に改善する一方、自動的に予測されるスパンはその利得の有意義だが不完全なシェアを回復させ、ローカライゼーションの品質がボトルネックのままであることを示している。
クラスレベルの分析では、参照不整合は特に局所化品質に敏感であるのに対し、実物的および論理的不整合は、関連する証拠が提示された場合でも困難である。
オラクル、イントラクタ、およびクラスごとの分析は、局所化誤差と残留型判別誤差を区別し、進歩には強い証拠抽出と、密接に関連する不整合カテゴリに対するより良い推論の両方が必要であることを示す。
関連論文リスト
- IdeaAMBIG: Benchmarking Implementation-Critical Gaps in Research-Idea Specifications [52.570108663867046]
研究のアイデアは、新しく、一貫性があり、科学的に妥当であるが、その提案された手法は、忠実な実装のために不十分に指定されている。
提案手法は,実装を対象とする研究手法仕様の体系化の可否を,有能な実装者やコーディングエージェントに十分な方法論的情報を提供して,前提条件を満たさずに目的とする手法を構築することができるかを検討する。
IdeaAMBIGは660のエビデンス基底インスタンスのベンチマークで、レポートとGitHubの問題から163の現実世界のギャップと、コーディフィケーション対応のリファレンスに注入される合成ギャップを497のコントロールで管理する。
論文 参考訳(メタデータ) (2026-09-09T17:59:04Z) - Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation [0.0]
不正検出システムは、説明可能でレビュー可能なまま、トランザクションボリュームの上昇とともにスケールする必要がある。
本研究では,勾配ブースト型分類器,グラフに基づく構造特徴,オートエンコーダに基づく異常信号,および調査エージェントを組み合わせた層状パイプラインについて検討する。
我々は,各コンポーネントは特定の条件下でのみ寄与し,調査エージェントからのもっともらしい根拠は,よりよい判断の証拠ではないと結論づける。
論文 参考訳(メタデータ) (2026-07-21T16:37:41Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Fault Detection and Explainable Classification in Automotive HIL Validation via Denoising Autoencoders and In-Context Large Language Models [1.9435397960631864]
機械学習とディープラーニングは高度な故障診断を持っているが、ほとんどの教師付きモデルは大きなラベル付きデータセットを必要とする。
実時間検証における故障検出と分類のための汎用的で説明可能な2相フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-04T06:43:43Z) - When the Ruler is Broken: Parsing-Induced Suppression in LLM-Based Security Log Evaluation [0.0]
完全に機能的なモデルが完全に非機能なカテゴリに現れる可能性のある,無音で体系的な評価誤差のクラスを実証する。
SOC-Bench v0は、標準化された13のカテゴリの脅威分類、最小統計パワー要件、ファジィフィールド抽出仕様、および将来のSOC研究における特定の精度の歪みを防ぐための公開スコアリングスクリプトからなるベンチマークフレームワークである。
論文 参考訳(メタデータ) (2026-05-08T06:03:11Z) - ArgRE: Formal Argumentation for Conflict Resolution in Multi-Agent Requirements Negotiation [3.512547713134864]
ArgREは交渉段階に抽象的な議論を組み込むマルチエージェント要件システムである。
既存のフレームワークにはない引数レベルのトレーサビリティを提供する。
評価によると、ArgREは既存のフレームワークにはない引数レベルのトレーサビリティを提供する。
論文 参考訳(メタデータ) (2026-04-25T03:28:13Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Shrinking the Generation-Verification Gap with Weak Verifiers [42.538675831498715]
検証者は、生成された候補から応答をスコア付けしてランク付けすることで、言語モデル機能を改善することができる。
Weaverは、複数の弱い不完全な検証器を組み合わせることで、強力な検証器を設計するためのフレームワークである。
論文 参考訳(メタデータ) (2025-06-22T23:38:15Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - TrustLoRA: Low-Rank Adaptation for Failure Detection under Out-of-distribution Data [62.22804234013273]
本稿では,共変量および意味的シフトの両条件下での拒絶による分類を統一し,促進する,単純な故障検出フレームワークを提案する。
キーとなる洞察は、障害固有の信頼性知識を低ランクアダプタで分離し、統合することにより、障害検出能力を効果的かつ柔軟に向上できるということです。
論文 参考訳(メタデータ) (2025-04-20T09:20:55Z) - SparseCL: Sparse Contrastive Learning for Contradiction Retrieval [87.02936971689817]
コントラディション検索(Contradiction Search)とは、クエリの内容に明示的に異を唱える文書を識別し、抽出することである。
類似性探索やクロスエンコーダモデルといった既存の手法には、大きな制限がある。
文間の微妙で矛盾したニュアンスを保存するために特別に訓練された文埋め込みを利用するSparseCLを導入する。
論文 参考訳(メタデータ) (2024-06-15T21:57:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。