論文の概要: Architecture Matters More Than Scale: A Comparative Study of Retrieval and Memory Augmentation for Financial QA Under SME Compute Constraints
- arxiv url: http://arxiv.org/abs/2604.17979v1
- Date: Mon, 20 Apr 2026 08:59:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.780859
- Title: Architecture Matters More Than Scale: A Comparative Study of Retrieval and Memory Augmentation for Financial QA Under SME Compute Constraints
- Title(参考訳): 規模以上のアーキテクチャ:中小企業計算制約下における財務QAの検索と記憶増強の比較研究
- Authors: Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang, Mengwei Yuan,
- Abstract要約: 大規模言語モデル (LLM) が, 現実的な財務業務においてどのように機能するかを示す。
本稿では,数値精度,監査可能性,インフラストラクチャ効率のバランスをとるための推論戦略を動的に選択するハイブリッドデプロイメントフレームワークを提案する。
- 参考スコア(独自算出の注目度): 8.036549927091286
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid adoption of artificial intelligence (AI) and large language models (LLMs) is transforming financial analytics by enabling natural language interfaces for reporting, decision support, and automated reasoning. However, limited empirical understanding exists regarding how different LLM-based reasoning architectures perform across realistic financial workflows, particularly under the cost, accuracy, and compliance constraints faced by small and medium-sized enterprises (SMEs). SMEs typically operate within severe infrastructure constraints, lacking cloud GPU budgets, dedicated AI teams, and API-scale inference capacity, making architectural efficiency a first-class concern. To ensure practical relevance, we introduce an explicit SME-constrained evaluation setting in which all experiments are conducted using a locally hosted 8B-parameter instruction-tuned model without cloud-scale infrastructure. This design isolates the impact of architectural choices within a realistic deployment environment. We systematically compare four reasoning architectures: baseline LLM, retrieval-augmented generation (RAG), structured long-term memory, and memory-augmented conversational reasoning across both FinQA and ConvFinQA benchmarks. Results reveal a consistent architectural inversion: structured memory improves precision in deterministic, operand-explicit tasks, while retrieval-based approaches outperform memory-centric methods in conversational, reference-implicit settings. Based on these findings, we propose a hybrid deployment framework that dynamically selects reasoning strategies to balance numerical accuracy, auditability, and infrastructure efficiency, providing a practical pathway for financial AI adoption in resource-constrained environments.
- Abstract(参考訳): 人工知能(AI)と大規模言語モデル(LLMs)の急速な採用は、レポート、意思決定支援、自動推論のための自然言語インターフェースを提供することで、財務分析を変革している。
しかしながら、LLMに基づく異なる推論アーキテクチャが、特に中小企業(中小企業)が直面するコスト、正確性、コンプライアンスの制約の下で、現実的な金融ワークフローでどのように機能するかについて、限定的な経験的理解が存在する。
一般的に中小企業は、クラウドGPU予算の欠如、専用のAIチーム、APIスケールの推論能力など、厳しいインフラストラクチャ制約の中で運用されるため、アーキテクチャ効率が第一級の懸念事項となる。
そこで本研究では,クラウドスケールのインフラを使わずに,ローカルにホストされた8Bパラメータの命令調整モデルを用いて,すべての実験を実施可能な,SME制約による明示的な評価設定を導入する。
この設計は、現実的なデプロイメント環境におけるアーキテクチャの選択の影響を分離する。
我々は,ベースラインLLM,検索拡張生成(RAG),構造化長期記憶,FinQAおよびConvFinQAベンチマーク間のメモリ拡張会話推論の4つの推論アーキテクチャを体系的に比較した。
構造化メモリは、決定論的、オペランド-明示的なタスクの精度を向上する一方、検索ベースのアプローチは、対話型、参照-単純化された設定においてメモリ中心のメソッドより優れている。
これらの知見に基づいて,数値精度,監査可能性,インフラストラクチャ効率のバランスをとるための推論戦略を動的に選択するハイブリッドデプロイメントフレームワークを提案する。
関連論文リスト
- Unifying Ontology Construction and Semantic Alignment for Deterministic Enterprise Reasoning at Scale [1.5446818009325962]
オントロジー構築,セマンティックアライメント,論理的推論をシームレスに統合する統合フレームワークである大規模オントロジーモデル(LOM)を導入する。
LOMはコンストラクト・アライン・レアソン(CAR)パイプラインを採用しており、3つのステージにまたがる統一アーキテクチャを活用している。
我々は,様々な実世界のエンタープライズデータセットから構築した総合的なベンチマークでLOMを評価する。
論文 参考訳(メタデータ) (2026-03-11T09:45:17Z) - Doc2AHP: Inferring Structured Multi-Criteria Decision Models via Semantic Trees with LLMs [7.026862437055361]
AHPの原理を導いた新しい構造推論フレームワークDoc2AHPを提案する。
重み付けの数値的整合性を確保するために,多エージェント重み付け機構と適応整合性最適化戦略を導入する。
実験の結果,Doc2AHPは非熟練ユーザに対して,スクラッチから高品質な意思決定モデルを構築する権限を与えるだけでなく,論理的完全性とダウンストリームタスク精度の両方において,直接生成ベースラインを著しく上回ることを示した。
論文 参考訳(メタデータ) (2026-01-23T06:20:23Z) - Agentic AI Reasoning for Mobile Edge General Intelligence: Fundamentals, Approaches, and Directions [74.35421055079655]
大規模言語モデル(LLM)は、強力な推論と自律的な意思決定能力を備えたエージェント人工知能(AI)の出現を可能にした。
Mobile Edge General Intelligence (MEGI)は、リアルタイムでプライバシ保護の推論をネットワークエッジにもたらす。
本稿では,MEGIにおけるLLM推論の効率的な展開のための共同最適化フレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:53:48Z) - Technical Report: Facilitating the Adoption of Causal Inference Methods Through LLM-Empowered Co-Pilot [44.336297829718795]
CATE-Bは,大規模言語モデル(LLM)をエージェントフレームワーク内で使用して,治療効果推定を通じてユーザを誘導する,オープンソースのコパイロットシステムである。
CATE-B は (i) 因果発見と LLM に基づくエッジオリエンテーションによる構造因果モデルの構築、 (ii) 因果構造とデータセット特性に適合した適切な回帰方法を選択することによるロバストな調整セットの同定を支援する。
論文 参考訳(メタデータ) (2025-08-14T12:20:51Z) - Computational Reasoning of Large Language Models [51.629694188014064]
textbfTuring Machine Benchは,Large Language Models(LLM)による推論プロセスの実行能力を評価するベンチマークである。
TMBenchには、自己完結型および知識に依存しない推論、最小主義的な多段階構造、制御可能な難易度、チューリングマシンに基づく理論的基礎の4つの重要な特徴が組み込まれている。
論文 参考訳(メタデータ) (2025-04-29T13:52:47Z) - On The Planning Abilities of OpenAI's o1 Models: Feasibility, Optimality, and Generalizability [59.72892401927283]
さまざまなベンチマークタスクでOpenAIのo1モデルの計画能力を評価する。
その結果,o1-preview は GPT-4 よりもタスク制約に順応していることがわかった。
論文 参考訳(メタデータ) (2024-09-30T03:58:43Z) - Mechanistic Design and Scaling of Hybrid Architectures [114.3129802943915]
我々は、様々な計算プリミティブから構築された新しいハイブリッドアーキテクチャを特定し、テストする。
本研究では,大規模計算最適法則と新しい状態最適スケーリング法則解析を用いて,結果のアーキテクチャを実験的に検証する。
我々は,MAD合成法と計算-最適パープレキシティを相関させ,新しいアーキテクチャの正確な評価を可能にする。
論文 参考訳(メタデータ) (2024-03-26T16:33:12Z) - An ontology-aided, natural language-based approach for multi-constraint
BIM model querying [0.0]
本稿では,異なる制約を含む自然言語クエリ(NLQ)を,複雑なBIMモデルを問合せするためのコンピュータ可読コードに自動的にマッピングする,新しいオントロジー支援セマンティクスを提案する。
実世界の住宅ビルの設計チェックに関する事例研究は,建設業における提案手法の実践的価値を実証している。
論文 参考訳(メタデータ) (2023-03-27T11:35:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。