論文の概要: Agentic Empirical Asset Pricing: Methodological Foundations
- arxiv url: http://arxiv.org/abs/2609.00731v1
- Date: Tue, 01 Sep 2026 05:09:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.376641
- Title: Agentic Empirical Asset Pricing: Methodological Foundations
- Title(参考訳): エージェント実証資産価格:方法論の基礎
- Authors: Yingjian Pan, Xiaowei Ding, Kay Giesecke,
- Abstract要約: LLMエージェントは、エージェント実証資産価格(AEAP)と呼ばれる資産価格の新しいパラダイムを実現する。
AEAPを定義し、その中核となるビルディングブロックを識別する。
本稿では,因子発見,参照アーキテクチャの貢献,発見要因の厳格な評価基準,発見システムのアウト・オブ・サンプルバックテスト方法に焦点をあてる。
- 参考スコア(独自算出の注目度): 1.6404022072626985
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advances in LLM agents enable a new paradigm for asset pricing, which we call Agentic Empirical Asset Pricing (AEAP): systems that autonomously conduct the scientific discovery process itself. We define AEAP and identify its core building blocks. Existing evaluation practices backtest only the outputs (factors or trades), not the autonomous discovery system that produced them. We focus on factor discovery, contributing a reference architecture, a rigorous evaluation standard for discovered factors, and a method for out-of-sample backtesting the discovery system. As a concrete instance of that architecture, we evaluate SEADS against five re-implemented baselines on two US equity panels using this standard: no single metric ranks the systems consistently, motivating evaluation on multiple axes at once. A separate rolling re-execution then asks the complementary question of whether the discovery process itself, not one static output, is reliable. We also report negative findings and limitations that surface further evaluation pitfalls for future AEAP systems.
- Abstract(参考訳): LLMエージェントの最近の進歩は、Agenic Empirical Asset Pricing (AEAP)と呼ばれる、科学的発見プロセス自体を自律的に行うシステムにおいて、資産価格の新しいパラダイムを可能にしている。
AEAPを定義し、その中核となるビルディングブロックを識別する。
既存の評価プラクティスは、アウトプット(要素や取引)のみをバックテストします。
本稿では,因子発見,参照アーキテクチャの貢献,発見要因の厳格な評価基準,発見システムのアウト・オブ・サンプルバックテスト方法に焦点をあてる。
このアーキテクチャの具体例として、我々は、この標準を用いて2つの米国株式パネルの5つの再実装ベースラインに対してSEADSを評価する。
別個のロール再実行は、発見プロセス自体が1つの静的出力ではなく、信頼できるかどうかという補完的な疑問を問う。
また,今後のAEAPシステムにおいて,さらなる評価の落とし穴となる否定的な発見や限界を報告した。
関連論文リスト
- AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems [82.01232437066487]
AgentXはプロダクションデプロイされたマルチエージェントシステムで、このプロダクション機能を再構築する。
自律的に生成し、実装し、評価し、レコメンデーション実験から学ぶ。
AgentXは4つの密結合したステージをクローズドループでオーケストレーションする。
論文 参考訳(メタデータ) (2026-06-25T10:42:28Z) - RPA-Check: A Multi-Stage Automated Framework for Evaluating Dynamic LLM-based Role-Playing Agents [4.07447364754644]
本稿では,LLM ベースの RPA の性能を客観的に評価する多段階自動評価フレームワーク RPA-Check を紹介する。
我々は,この枠組みを,いくつかの定量化ローカルモデルを含む法医学的な訓練のための真剣なゲームであるLLM Courtに適用することで検証する。
論文 参考訳(メタデータ) (2026-04-13T16:08:03Z) - AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model [1.14219428942199]
既存の自動研究システムは、ステートレスでリニアなパイプラインとして動作する。
マルチエージェントオーケストレーションフレームワークである textbfAI-Supervisor を提案する。
エージェントは、人間の関心によって駆動されるエンドツーエンドのAI研究の監督を提供する。
論文 参考訳(メタデータ) (2026-03-25T15:16:51Z) - FIRE-Bench: Evaluating Agents on the Rediscovery of Scientific Insights [63.32178443510396]
FIRE-Bench (Full-cycle Insight Rediscovery Evaluation) は、確立された発見の再検討を通じてエージェントを評価するベンチマークである。
最強のエージェントでさえ、限られた再発見成功(50 F1)を達成し、実行中に高いばらつきを示し、実験的な設計、実行、エビデンスに基づく推論において繰り返し失敗モードを表示する。
論文 参考訳(メタデータ) (2026-02-02T23:21:13Z) - ARES: Auxiliary Range Expansion for Outlier Synthesis [1.7306463705863946]
本研究では,OOD検出のための新しい手法であるAuxiliary Range Expansion for Outlier Synthesisを提案する。
さまざまなステージがARESで構成され、最終的に価値のあるOODのような仮想インスタンスを生成する。
次に、エネルギースコアに基づく判別器を訓練し、分配内データと外部データとを効果的に分離する。
論文 参考訳(メタデータ) (2025-01-11T05:44:33Z) - TestAgent: Automatic Benchmarking and Exploratory Interaction for Evaluating LLMs in Vertical Domains [19.492393243160244]
大規模言語モデル(LLM)は、高度に専門化された垂直ドメインにデプロイされることが多い。
既存の垂直領域の評価は、通常、静的な単一ターンデータセットの労働集約的な構築に依存している。
垂直領域における自動ベンチマークと探索動的評価のためのフレームワークであるTestAgentを提案する。
論文 参考訳(メタデータ) (2024-10-15T11:20:42Z) - RAGEval: Scenario Specific RAG Evaluation Dataset Generation Framework [66.93260816493553]
本稿では,様々なシナリオにまたがってRAGシステムを評価するためのフレームワークであるRAGvalを紹介する。
事実の正確性に焦点をあてて,完全性,幻覚,不適切性の3つの新しい指標を提案する。
実験結果から, RAGEvalは, 生成した試料の明瞭度, 安全性, 適合性, 豊かさにおいて, ゼロショット法とワンショット法より優れていた。
論文 参考訳(メタデータ) (2024-08-02T13:35:11Z) - Benchmarks as Microscopes: A Call for Model Metrology [76.64402390208576]
現代の言語モデル(LM)は、能力評価において新たな課題を提起する。
メトリクスに自信を持つためには、モデルミアロジの新たな規律が必要です。
論文 参考訳(メタデータ) (2024-07-22T17:52:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。