論文の概要: Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR
- arxiv url: http://arxiv.org/abs/2604.27374v1
- Date: Thu, 30 Apr 2026 03:39:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-01 16:31:53.907738
- Title: Measurement Risk in Supervised Financial NLP: Rubric and Metric Sensitivity on JF-ICR
- Title(参考訳): 監督型金融NLPにおける測定リスク:JF-ICRの潤滑性および計量感度
- Authors: Sidi Chang, Peiying Zhu, Yuxiao Chen, Rongdong Chai,
- Abstract要約: 我が国の金融インシシデント・コミット認識における測定リスクについて検討する。
ルーブリックな単語は、モデル指定ラベルを根本的に変えることが判明した。
すべての計量は、JF-ICRクラス分布の下では情報的ではない。
- 参考スコア(独自算出の注目度): 1.7107991816118835
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As LLMs become credible readers of earnings calls, investor-relations Q\&A, guidance, and disclosure language, supervised financial NLP benchmarks increasingly function as decision evidence for model selection and deployment. A hidden assumption is that gold labels make such evidence objective. This assumption breaks down when the benchmark ruler itself is sensitive to rubric wording, metric choice, or aggregation policy. We study this measurement risk on Japanese Financial Implicit-Commitment Recognition (JF-ICR; a pinned 253-item test split x 4 frontier LLMs x 5 rubrics x 3 temperatures x 5 ordinal metrics). Three findings follow. First, rubric wording materially changes model-assigned labels: R2--R3 agreement ranges from 70.0% to 83.4%, with the dominant movement near the +1 / 0 implicit-commitment boundary. This pattern is consistent with a pragmatic-boundary interpretation, but is not a validated linguistic-causality claim because the present rubric variants confound semantics, examples, and verbosity. Second, not every metric remains informative under the JF-ICR class distribution. Within-one accuracy is too easy because near misses receive credit and the majority class dominates; worst-class accuracy is too noisy because the rarest class has only two examples. Exact accuracy, macro-F1, and weighted \k{appa} are therefore the identifiable metrics under our operational rule. Third, ranking claims become more defensible only after this metric-identifiability audit: Bradley--Terry, Borda, and Ranked Pairs agree on the identifiable metric subset, while the full five-metric sweep produces disagreement on the closest pair. The contribution is not a new leaderboard, but a reporting discipline for supervised financial benchmarks whose gold labels exist and whose evaluation ruler still requires governance.
- Abstract(参考訳): LLMが決算報告、投資家関係Q&A、ガイダンス、開示言語などの信頼できる読者になるにつれ、金融NLPベンチマークはモデル選択と展開の決定的証拠としてますます機能している。
隠された仮定は、金のラベルがそのような証拠を客観的にしているということである。
この仮定は、ベンチマーク定規自体が粗末な言い回し、メートル法選択、あるいは集約ポリシーに敏感であるときに破滅する。
本測定のリスクは,日本金融インシシット・コミット認識(JF-ICR,ピン付253-item test split x 4 frontier LLMs x 5 rubrics x 3 temperature x 5 Ordinal metrics)に当てはまる。
以下の3つの発見がある。
R2-R3合意は70.0%から83.4%の範囲で、+1 / 0 の暗黙のコミット境界付近で支配的な動きがある。
このパターンはプラグマティック・バウンダリの解釈と一致しているが、現在のルーリックな変種は意味論、例、および冗長性を混同しているため、検証された言語・因果関係の主張ではない。
第二に、JF-ICRクラス分布の下では、すべての計量が情報的であるとは限らない。
一番低いクラスは2つの例しか持たないため、最悪のクラスの精度はうるさい。
したがって、正確な精度、マクロF1、重み付けされた \k{appa} は、我々の運用ルールの下で識別可能な指標である。
ブラッドリー=テリー、ボルダ、ランク付きペアは、識別可能なメートル法部分集合について合意する一方、フル5メートルスイープは、最も近いペアについて不一致をもたらす。
このコントリビューションは、新しいリーダーボードではなく、ゴールドラベルが存在し、評価の支配者がまだガバナンスを必要としている監督された金融ベンチマークに関する報告書の規律である。
関連論文リスト
- Criterion-referenceability determines LLM-as-a-judge validity across physics assessment formats [0.01116979912801043]
我々は、GPT-5.2、Grok 4.1、Claude Opus 4.5、DeepSeek-V3.2、Gemini Pro 3、および盲目、解答、偽解、そして模範的な条件下でのヒトマーカーに対する委員会集計を比較した。
n=771ドルのブラインド大学試験の質問に対して、モデルは差別的妥当性の強い分数平均絶対誤差(fMAE)$approx 0.22$を達成する。
$n=55$スクリプト全体において、盲目のAIマーキングは人間のマーキングよりも厳格で可変的であり、差別的妥当性はすでに貧弱である。
論文 参考訳(メタデータ) (2026-03-16T02:09:06Z) - The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation [17.386684382460242]
大規模言語モデル(LLM)は、推論、質問応答、創造的記述といったタスクにおけるシステムの出力を評価するために、ますます使われてきている。
6つの判定モデルに対する評価プロンプトに挿入された制御キュー摂動合成メタデータラベルを用いて,この理想を検証した。
情報源,時間,年齢,性別,民族,教育的地位の6つのキュー族を調査する。
論文 参考訳(メタデータ) (2026-02-08T14:45:23Z) - Do LLMs Know They Are Being Tested? Evaluation Awareness and Incentive-Sensitive Failures in GPT-OSS-20B [1.948261185683419]
本研究では,「評価香り」がコンメンシュレート能力を得ることなく測定性能を膨らませるかどうかを考察する。
6つのペアのA/Bシナリオを実行し、タスク内容を保持し、フレーミングの異なる状態でデコードします。
再現可能なA/Bフレームワーク(バンキング、バリデータ、ラン毎のスコア、スクリプト)と実践的なガイダンスを提供する。
論文 参考訳(メタデータ) (2025-10-08T09:49:05Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - TrustJudge: Inconsistencies of LLM-as-a-Judge and How to Alleviate Them [58.04324690859212]
自動評価器(LLM-as-a-judge)としての大規模言語モデル(LLM)は、現在の評価フレームワークにおいて重大な矛盾を明らかにしている。
スコア比較不整合とペアワイズ・トランジティビティ不整合という2つの基本的不整合を同定する。
我々は2つの重要なイノベーションを通じてこれらの制限に対処する確率的フレームワークであるTrustJudgeを提案する。
論文 参考訳(メタデータ) (2025-09-25T13:04:29Z) - Uncertainty in Language Models: Assessment through Rank-Calibration [65.10149293133846]
言語モデル(LM)は、自然言語生成において有望な性能を示している。
与えられた入力に応答する際の不確実性を正確に定量化することは重要である。
我々は、LMの確実性と信頼性を評価するために、Rank$-$Calibration$と呼ばれる斬新で実用的なフレームワークを開発する。
論文 参考訳(メタデータ) (2024-04-04T02:31:05Z) - Goodhart's Law Applies to NLP's Explanation Benchmarks [57.26445915212884]
ERASER(Comprehensiveness and sufficiency)メトリクスとEVAL-X(EVAL-X)メトリクスの2つのセットを批判的に検討する。
実験結果の予測や説明を変えることなく,モデル全体の包括性と充足率を劇的に向上させることができることを示す。
我々の結果は、現在のメトリクスが説明可能性の研究をガイドする能力に疑問を呈し、これらのメトリクスが正確に捉えるものを再評価する必要性を強調します。
論文 参考訳(メタデータ) (2023-08-28T03:03:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。