論文の概要: FinVector-Market-4B: A Controlled Study of LoRA Adaptation for Structured Financial Tasks
- arxiv url: http://arxiv.org/abs/2610.08882v1
- Date: Tue, 06 Oct 2026 10:46:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 21:58:22.524208
- Title: FinVector-Market-4B: A Controlled Study of LoRA Adaptation for Structured Financial Tasks
- Title(参考訳): FinVector-Market-4B:構造化金融業務におけるLoRA適応の制御に関する研究
- Abstract要約: Fin-Market-4Bは、Qwen/Qwen3.5-4Bにランク16のLoRAを22,000のサンプルコーパスに適合させ、構造的な金融業務を行う。
暗黙的および明示的な形式スキーマ契約の下で,600例のベンチマークでベースモデルと適応モデルを評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: FinVector-Market-4B adapts Qwen/Qwen3.5-4B with rank-16 LoRA on a 22,000-example corpus for structured financial tasks. We evaluate the base and adapted models on the same 600-example benchmark under implicit and explicit JSON-schema contracts. Supplying the schema alone raises base-model JSON validity from 0% to 91.3%. Under matched explicit prompting, the frozen scores improve from 14.7% to 40.0% for FinQA answer exact match, from 48.0% to 82.7% for calculator-expression correctness, from 20.1% to 89.5% for scenario branch-label agreement, and from 52.4% to 87.2% for implication-direction agreement. A post-hoc policy-scoring audit shows that the reported macro-F1 decline reflects a changing label set; using the same three target classes gives 77.4% for the base and 83.1% for the adapter. Filing overlap and calculator-target inconsistencies qualify the benchmark's generalization claims. The results show that compact financial domain adaptation can produce substantial task-specific gains beyond output-format learning under matched prompting, with gains bounded by the evaluated task distribution and prompt contract.
- Abstract(参考訳): FinVector-Market-4BはQwen/Qwen3.5-4Bにランク16のLoRAを22,000サンプルのコーパスで適合させる。
我々は、暗黙的かつ明示的なJSONスキーマ契約の下で、同じ600サンプルのベンチマークでベースモデルと適応モデルを評価した。
スキーマのみの供給は、ベースモデルJSONの有効性を0%から91.3%に引き上げる。
一致した明示的なプロンプトの下では、凍結したスコアはFinQAの回答の正確な一致で14.7%から40.0%に改善され、計算器の圧縮精度は48.0%から82.7%に、シナリオ分岐ラベルの合意で20.1%から89.5%に、含意方向の合意で52.4%から87.2%に改善された。
ポストホックのポリシースコア監査では、報告されたマクロF1の減少はラベルセットの変更を反映しており、同じ3つのターゲットクラスを使用することでベースが77.4%、アダプタが83.1%となる。
フィリングオーバーラップと電卓とターゲットの不整合はベンチマークの一般化の主張を認定する。
その結果、コンパクトな金融ドメイン適応は、評価されたタスク分布に縛られ、契約書がプロンプトされることにより、マッチしたプロンプト下での出力形式学習以上の実質的なタスク固有ゲインが得られることが示された。
関連論文リスト
- Agent Error Dataset: Scaling 50,000 Error--Diagnosis Pairs for Failure Analysis and Error-Aware Post-Training [45.727227890697556]
我々は,9,961のソースタスクから50,228のエラー診断ペアからなるエージェントエラーデータセット(AED)を紹介した。
5段階のAgenic Error-to-Trainingパイプラインは自然の故障を収集し、診断と修正案を生成し、記録された証拠と照合する。
アクタートレーニングのレシピの比較において、アクションオンリーの修復トレーニングは成功オンリーのトレーニングよりもWebShop-liteの方が6.67ポイント高い。
論文 参考訳(メタデータ) (2026-09-30T16:40:22Z) - Can Language Models Learn to Forecast Stock Prices [64.57057883175987]
ポストトレーニングでは、検証可能な結果のタスクにおける言語モデルの性能が大幅に向上することが示されている。
ポストトレーニングは、財務予測性能を大幅に改善できることを示す。
論文 参考訳(メタデータ) (2026-09-29T07:34:39Z) - State of Thought Enables Endogenous Reasoning [48.902117018115256]
大規模言語モデル(LLM)の能力向上のための主要なアプローチとして、テスト時推論が登場した。
LLMにおける内在的推論を可能にする新しい推論パラダイムであるState of Thoughtを提案する。
SoTは平均ベースライン精度を一貫して改善し,生成トークンを62.6%,エンドツーエンドのレイテンシを44.6%削減した。
論文 参考訳(メタデータ) (2026-09-13T05:55:03Z) - FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems [0.0]
FinRCA-Benchは、14の運用テーブルにまたがる2250の口座支払い可能な銀行間和解ケースのベンチマークである。
その結果,構造的検索の失敗は,95~15の精度で推理的検索の失敗をはるかに上回っていることがわかった。
FinRCA-Benchでは、検索アーキテクチャがAIシステムの性能を強く観察し、ルート原因ラベルは聴覚診断の弱いプロキシである。
論文 参考訳(メタデータ) (2026-08-19T04:36:01Z) - AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets [4.193537335690018]
本稿では,構造抽出とサブプリンシプル固有評価器を組み合わせたマルチエージェントフレームワークであるAgentFAIRを提案する。
それぞれが0-3の成熟度スコア、エビデンス、レコメンデーションを生成します。
15データセットの専門家による予備的な研究では、フライスのカッパは0.71で、82%が専門家のコンセンサスと一致している。
論文 参考訳(メタデータ) (2026-07-17T09:32:54Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation [1.8345614451086532]
RLHF 対応言語モデルは TruthfulQA 上で応答均質化を示す。
40-79%の質問は、10のi.i.d.サンプルに対して単一のセマンティッククラスタを生成する。
論文 参考訳(メタデータ) (2026-03-25T09:35:15Z) - NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models [0.15039745292757667]
NewsScopeは、スキーマ付きニュースクレーム抽出のためのクロスドメインデータセット、ベンチマーク、微調整モデルである。
データセットには政治、健康、科学/環境、ビジネスに関する455の記事が含まれている。
LLaMA 3.1 8Bは、LoRAを315のトレーニング例で微調整し、保持領域内(80記事)とアウト・オブ・ソース(60記事)のテストセットで評価した。
論文 参考訳(メタデータ) (2025-12-26T19:17:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。