論文の概要: Agent Policy-Value Audit: Separating Transition Composition from Event Selection in Financial LLM Agents
- arxiv url: http://arxiv.org/abs/2610.04040v1
- Date: Fri, 02 Oct 2026 20:46:34 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:30:39.546294
- Title: Agent Policy-Value Audit: Separating Transition Composition from Event Selection in Financial LLM Agents
- Title(参考訳): エージェント政策価値監査:金融LLMエージェントにおけるイベント選択からの遷移構成の分離
- Abstract要約: 平らな位置から長く位置を頻繁に変更するエージェントは、上向きのイベントプールから正対のリターンを得ることができる。
本稿では,各順序付けられた行動変化型の観測回数を固定したエージェントポリシー値監査法を提案する。
これらの再割り当てによる平均的な報酬は、コンポジションベンチマークである。
- 参考スコア(独自算出の注目度): 37.33114262134344
- License:
- Abstract: Financial LLM agents are often evaluated by comparing their end-to-end returns with those of a baseline and testing the paired difference against zero. This measures whether deploying the agent changes realized performance, but it does not isolate event-selection skill. An agent that frequently changes positions from flat to long can earn a positive paired return from an upward-drifting event pool even when it selects events at random. We propose the Agent Policy-Value Audit, which holds fixed the observed count of each ordered action-change type and randomly reassigns them across eligible events. The average payoff from these reassignments is the composition benchmark; the difference between observed deployment value and this benchmark is selection value. In semi-synthetic benchmarks based on real earnings-event returns, a zero-centered paired test falsely attributes passive exposure to selection skill in $11.6\%$ of no-skill replications, while the transition-matched audit reduces this rate to $5.3\%$. Applied retrospectively to 723 earnings events at 44 U.S. consumer-facing firms, the audit decomposes the agent's gross deployment value of $+15.2$ bps/event into a $+25.8$ composition benchmark and a $-10.6$ selection value. The agent does not detectably outperform matched random assignments. Financial-agent evaluations should report deployment value separately from event-selection value.
- Abstract(参考訳): ファイナンシャルLLMエージェントは、そのエンドツーエンドのリターンとベースラインのリターンを比較し、ペアの差を0に対してテストすることでしばしば評価される。
これは、エージェントのデプロイ変更がパフォーマンスを実現するかどうかを測定するが、イベント選択スキルを分離しない。
フラットからロングに頻繁に位置を変更するエージェントは、ランダムにイベントを選択した場合でも、上向きのイベントプールから正対のリターンを得ることができる。
エージェントポリシー・バリュー監査(Agen Policy-Value Audit)を提案し、各順序のアクション・チェンジの観測回数を固定し、適格なイベント間でランダムに再割り当てする。
これらの再割り当てによる平均的な報酬は、コンポジションベンチマークであり、観察されたデプロイメント値とこのベンチマークの違いは、選択値である。
実利益率に基づく半合成ベンチマークでは、ゼロ中心のペアテストは、選択スキルに対する受動的露出を11.6 %の非熟練レプリケーションで、一方遷移適合監査は、このレートを5.3 %の値に下げる。
44の米国消費者向け企業の743回の決算イベントに振り返って適用され、監査はエージェントの総配置価値を+15.2$ bps/eventを+25.8$コンポジションベンチマークと$10.6$セレクション値に分解する。
エージェントは、一致したランダムな割り当てよりも検出的に優れているわけではない。
ファイナンシャルエージェントの評価は、イベント選択値とは別個のデプロイメント値を報告すべきである。
関連論文リスト
- How Much Can Language Models Gain from Test-Time Computation? [16.417601807279194]
SELF-POTは、競合数学、競合プログラミング、エージェント環境にわたるモデルのテスト時間ポテンシャルを測定する。
選択や批判を含むすべてのモデルコールをドルで課金する。
モデルが追加の推論から得られるゲインと、より強いモデルに対する追加の推論を伴う低コストモデルである。
論文 参考訳(メタデータ) (2026-10-01T05:49:29Z) - Auditing Agent Actions through Query-Conditioned Attribution [7.93056778736348]
既存の属性の定式化は、多様な監査対象に対して疑問特異的なトレースを提供しない。
我々は、自然言語監査クエリを入力とする新しいタスクである、クエリ条件付きエージェントアクション属性を定式化する。
提案手法は,オープンウェイトベースラインよりも推論コストの低いソースとエビデンスを一貫して達成する。
論文 参考訳(メタデータ) (2026-09-27T15:37:05Z) - TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces [49.561879967469714]
TraceDanceは、ユーザが指定した望ましくない振る舞いのデプロイメントトレースからターゲットベンチマークを構築するエージェントシステムである。
効率的な構築のために、Anchor-and-Confirmはプログラム可能な検索と、Flash大言語モデルによる候補レベルの確認を組み合わせる。
コーディングと一般的なツールの実験では、252,557のセッションで描画され、ビルドターゲット要求の95.3%を満たす4,125のインスタンスで107のベンチマークを生成する。
論文 参考訳(メタデータ) (2026-09-27T06:58:39Z) - Measurement Boundaries in LLM Financial Agent Evaluation: Fixed-Tape Execution and Multi-Defect Auditing [0.0635655952373977]
本研究では,金融エージェントの評価において,実行性能の解釈と監査スコアの2つの限界について検討する。
StudyAでは、3つの合成セッティング上での独立実行とストレスのある実行を比較することで、実行ルールと新しいモデル応答とポートフォリオフィードバックが混在する。
StudyBでは,従来のタスクをゼロ,1,2の欠陥タスクに,明示的なマルチラベルプロンプトで置き換えることによって,1から2の欠陥からの目標違反リコールの減少は,監査と情報源の組み合わせの5つのうち5つにおいて肯定的である。
論文 参考訳(メタデータ) (2026-09-26T08:54:21Z) - GLIDE: Generalized Layer-wise Intrinsic Distributional Evaluation for Heterogeneous LLM Agents [11.225427879489155]
LLMエージェントは、候補分岐を比較し、計算を効果的に割り当てるために、信頼性の高いステップレベルの評価を必要とする。
LLMエージェントに対するtextbf Generalized textbfLayer-wise textbfIntrinsic textbfDistributional textbfEvaluation (textbfGLIDE)を提案する。
論文 参考訳(メタデータ) (2026-09-26T06:37:41Z) - Speculative Evaluation of Stochastic LLMs [48.902430583833585]
投機的評価は、短い一様パイロットと、タスク毎の成功回数のプールを実行する。
HBN-asyncは、部分的なパイロットフィードバックからの継続を投機的に実行し、最終的なアロケーションによって選択されたものを保持する。
1タスクあたり8-64のロールアウト予算では、投機的評価は、Uniformに対する分散を平均12.8%から33.6%削減する。
論文 参考訳(メタデータ) (2026-09-23T09:20:22Z) - What Does an LLM-Agent Leaderboard Rank Actually Compare? [0.0]
LLMエージェントのリーダーボードは、よく知られた推論を招待する。
我々は、リーダーボードがどのスコアを見積もるか、どのようにペアワイズ優位性の結論を正当化するかを調査する。
論文 参考訳(メタデータ) (2026-09-07T17:31:22Z) - PACE: A Proxy for Agentic Capability Evaluation [60.3743414796937]
PACEは、既存の非エージェント評価からインスタンスを選択することで、プロキシベンチマークを構築するフレームワークである。
14のモデル、4つのエージェントベンチマーク、19の非エージェントベンチマークによる実験では、PACE-Benchがエージェントスコアを予測し、LOOCVは絶対誤差(MAE)を4%以下、スピアマン相関は0.80以上、ペアワイズモデルの精度は85%で、いずれもエージェント評価コストの1%以下である。
論文 参考訳(メタデータ) (2026-07-02T10:59:03Z) - Scaling Laws for Agent Harnesses via Effective Feedback Compute [53.68149869349268]
emphEffective Feedback Compute (EFC)は、情報的、有効、非冗長な場合にのみフィードバックを信用し、その後の決定のために保持するトレースレベルのスケーリング座標である。
EFCベースの座標は、生の計算ベースラインよりも失敗率を常に予測する。
論文 参考訳(メタデータ) (2026-05-28T09:45:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。