論文の概要: Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text
- arxiv url: http://arxiv.org/abs/2607.14709v1
- Date: Thu, 16 Jul 2026 08:18:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.041081
- Title: Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text
- Title(参考訳): ハイブリッドテーブルとテキスト上での金融推論のためのゴールドガイド型プログラム蒸留法
- Abstract要約: 我々は,大規模教師モデルから実行検証Pythonプログラムを用いて,信頼性の高い数値推論をコンパクトな生徒に伝達する手法を開発した。
TAT-QAの実験は、我々のフレームワークがハイブリット・ファイナンシャル・推論に非常に有効であることを示している。
- 参考スコア(独自算出の注目度): 5.187020963919454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Financial question answering over hybrid tabular and textual data may require multi-source reasoning and precise numerical computation. While large language models (LLMs) can generate intermediate reasoning steps, natural-language rationales remain prone to arithmetic errors, making them an unreliable supervision source for distillation. Building on programmatic distillation, we develop an approach that transfers reliable numerical reasoning from a large teacher model to a compact student using execution-verified Python programs instead of free-form textual rationales. It leverages gold derivations to guide teacher-side program synthesis and retains only programs that execute correctly and produce the gold answer, ensuring high-quality supervision. We further introduce an iterative recovery stage that revisits teacher-failed examples, enabling the student to recover and incorporate newly verified programs into training. Experiments on TAT-QA show that our framework is highly effective for hybrid financial reasoning. Our best 7B student achieves 87.00 EM / 87.18 F1 on the test set, substantially outperforming the 72B teacher (78.46 EM) as well as traditional and strong LLM-based baselines, including TAGOP and TAT-LLM. These results demonstrate that execution-verified programmatic distillation provides an effective and extensible framework for training smaller models to perform reliable numerical reasoning.
- Abstract(参考訳): 表表とテキストのハイブリッドデータに対する金銭的質問応答には、多元的推論と正確な数値計算が必要となる可能性がある。
大規模言語モデル(LLM)は中間的推論ステップを生成することができるが、自然言語の理性は算術的誤りを生じやすいため、蒸留の信頼性が低い。
そこで我々は,プログラムによる蒸留を基礎として,大規模教師モデルからコンパクトな学生への信頼性のある数値推論を,自由形式テキスト論理ではなく,実行検証Pythonプログラムを用いて伝達する手法を開発した。
金の導出を利用して教師側のプログラム合成をガイドし、正しく実行し、金の答えを生成するプログラムのみを保持し、高品質な監督を保証する。
さらに,教師が失敗した事例を再考する反復的回復段階を導入し,新たに検証されたプログラムを学習に組み込むことを可能にした。
TAT-QAの実験は、我々のフレームワークがハイブリット・ファイナンシャル・推論に非常に有効であることを示している。
我々の最高の7B学生は、テストセットで87.00 EM / 87.18 F1を達成し、72Bの教師(78.46 EM)と、TAGOPやTAT-LLMを含む従来の強力なLCMベースのベースラインをかなり上回った。
これらの結果から, 実行検証型プログラム蒸留は, 信頼性の高い数値推論を行うために, より小型モデルの訓練に有効かつ拡張可能な枠組みを提供することが示された。
関連論文リスト
- Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning [59.74608632210439]
そこで本研究では,ツール使用の自然な動作を,ツールなし推論能力を犠牲にすることなく,強力な思考モデルに注入する方法を示す。
提案手法は,オープンソースモデル間のベンチマークにおいて,最先端のパフォーマンスを実現するモデルを生成する。
論文 参考訳(メタデータ) (2026-05-07T14:23:21Z) - Once Upon an Input: Reasoning via Per-Instance Program Synthesis [19.86168542588911]
PIPS(Per-Instance Program Synthesis)は、構造的フィードバックを用いて、インスタンスレベルでプログラムを生成し、洗練する手法である。
パフォーマンスをさらに向上するため、PIPSは直接推論とプログラム合成を動的に選択する信頼度基準をインスタンス毎に組み込んでいる。
論文 参考訳(メタデータ) (2025-10-26T21:58:33Z) - Leveraging Test Driven Development with Large Language Models for Reliable and Verifiable Spreadsheet Code Generation: A Research Framework [0.0]
本稿では、テスト駆動開発(TDD)の実証済みのソフトウェアエンジニアリングプラクティスとLLM(Large Language Model)による生成を統合する、構造化された研究フレームワークを提案する。
テスト駆動思考を強調することで、計算思考の改善、エンジニアリングスキルの促進、ユーザエンゲージメントの実現を目指す。
論文 参考訳(メタデータ) (2025-10-17T12:28:16Z) - TableMind: An Autonomous Programmatic Agent for Tool-Augmented Table Reasoning [10.267950603662776]
TableMindは、データ分析と正確な数値推論のために、セキュアなサンドボックス環境で、マルチターンツールの実行、書き込み、実行を自律的に実行する、ツール統合テーブル推論エージェントである。
これらの機能を実現するために、我々は強力な事前学習言語モデルの上に構築された2段階の微調整パラダイムを採用する。
論文 参考訳(メタデータ) (2025-09-08T02:00:31Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - BRiTE: Bootstrapping Reinforced Thinking Process to Enhance Language Model Reasoning [78.63421517563056]
大規模言語モデル(LLM)は複雑な推論タスクにおいて顕著な機能を示した。
本稿では,新しいグラフィカルモデルを用いてLLM推論を定式化する統一確率的フレームワークを提案する。
本稿では,Bootstrapping Reinforced Thinking Process (BRiTE)アルゴリズムについて述べる。
論文 参考訳(メタデータ) (2025-01-31T02:39:07Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z) - OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning [15.59540726867483]
我々は、ガイド付き復号法では、ステップごとの正当性を保証するよりも、不完全推論経路の可能性を評価する方が有利であると主張している。
誘導復号化のための$textitoutcomeの監督が本質的に価値モデルとして機能するという発見に触発されて、アウトカム管理価値モデル(OVM)を提案する。
GSM8KとGame of 24の2つの多段階数学的推論データセットに対する実験により,OVMモデルの優れた性能が示された。
論文 参考訳(メタデータ) (2023-11-16T09:56:28Z) - SatLM: Satisfiability-Aided Language Models Using Declarative Prompting [68.40726892904286]
本研究では,大規模言語モデル (LLM) の推論能力を向上させるために,新しい満足度支援言語モデリング (SatLM) 手法を提案する。
我々はLLMを用いて命令型プログラムではなく宣言型タスク仕様を生成し、既製の自動定理証明器を利用して最終解を導出する。
我々はSATLMを8つの異なるデータセット上で評価し、命令パラダイムにおいてプログラム支援されたLMよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2023-05-16T17:55:51Z) - SCOTT: Self-Consistent Chain-of-Thought Distillation [68.40232422158569]
大規模言語モデル(LM)は、チェーン・オブ・シークレット・プロンプトを通じて予測のための自由テキスト論理を生成する。
そこで本研究では,教師モデルから,小規模で自己整合的なCoTモデルを学習するための忠実な知識蒸留法を提案する。
忠実蒸留を確実にするために,教師生成の合理性を用いて,反実的推論目的の学生LMを学習する。
論文 参考訳(メタデータ) (2023-05-03T03:47:00Z) - APOLLO: An Optimized Training Approach for Long-form Numerical Reasoning [31.252979262232124]
我々は,長文の数値推論フレームワークを改善するためにAPOLLOを提案する。
検索者に対しては,検索者が重要な数値的事実に対してより識別しやすくするために,無認識の負のサンプリング戦略を採用する。
ジェネレータに対しては、一貫性に基づく強化学習と目標プログラム拡張戦略を設計する。
論文 参考訳(メタデータ) (2022-12-14T14:34:15Z) - NAPG: Non-Autoregressive Program Generation for Hybrid Tabular-Textual
Question Answering [52.10214317661547]
現在の数値推論法はプログラムシーケンスを自己回帰的にデコードする。
プログラム生成の精度は、デコードステップがエラー伝搬によって展開されるにつれて急激に低下する。
本稿では,非自己回帰型プログラム生成フレームワークを提案する。
論文 参考訳(メタデータ) (2022-11-07T11:25:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。