論文の概要: FORESIGHT-9: Prospective and Process-Aware Evaluation of Adaptive Trading Agents
- arxiv url: http://arxiv.org/abs/2608.29372v1
- Date: Sat, 29 Aug 2026 17:12:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.945627
- Title: FORESIGHT-9: Prospective and Process-Aware Evaluation of Adaptive Trading Agents
- Title(参考訳): FORESIGHT-9:Adaptive Trading Agentの展望とプロセスアウェア評価
- Authors: Xiangxin Luo, Chengtian Hong, Haohua Li, Yongyi Xie,
- Abstract要約: FORESIGHT-9は、9つの監査可能な対実的ストレスワールドラインから構築された、将来的でプロセス対応のベンチマークである。
共通契約は、各エージェントのネイティブ適応ループを保持しながら、観察と実行を標準化する。
我々は,36ランにわたる2つの基盤モデルバックボーンを持つ2つの適応型トレーディングエージェントフレームワークを評価した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrospective backtests provide a limited test of adaptive trading agents: they cannot rule out historical contamination, expose sensitivity to a single realized market path, or reveal internal degeneration during long-horizon adaptation. We introduce FORESIGHT-9, a prospective and process-aware benchmark built from nine auditable counterfactual stress worldlines branching from a common July 2026 information boundary. Each worldline specifies staged macro-financial events and joint multi-asset anchors; a deterministic generator realizes the trajectories, while observations are disclosed according to in-world time. A common contract standardizes observations and execution while preserving each agent's native adaptation loop. We evaluate two adaptive trading-agent frameworks with two foundation-model backbones across 36 long-horizon runs. Agent rankings vary substantially across worldlines and backbones, and a fixed equal-weight policy outperforms 31 of 36 runs. Process telemetry exposes failures that terminal returns conceal: in one high-return run, the live factor library collapsed while executed holdings converged to the equal-weight fallback, even though decision records continued to report an active factor ensemble. FORESIGHT-9 therefore evaluates not only portfolio outcomes, but whether adaptive agent state and execution remain coherent across alternative futures. We release the worldlines, trajectories, audit traces, and regeneration scripts.
- Abstract(参考訳): ふりかえりのバックテストは、適応取引エージェントの限定的なテストを提供する。それらは、歴史的な汚染を排除したり、単一の実現された市場パスに敏感さを露呈したり、長期の適応中に内部の変性を明らかにすることはできない。
forESIGHT-9は、一般的な2026年7月の情報境界から分岐した9つの聴覚的対実的ストレス世界線から構築された、予測的でプロセス対応のベンチマークである。
各ワールドラインは、ステージ化されたマクロ・ファイナンシャル・イベントとジョイント・マルチアセット・アンカーを指定し、決定論的ジェネレータは軌跡を認識し、観測は世界の時間に応じて開示される。
共通契約は、各エージェントのネイティブ適応ループを保持しながら、観察と実行を標準化する。
我々は,36ランにわたる2つの基盤モデルバックボーンを持つ2つの適応型トレーディングエージェントフレームワークを評価した。
エージェントランキングはワールドラインとバックボーンで大きく異なり、固定された等級ポリシーは36ラン中31ランを上回っている。
プロセステレメトリ(Process Telemetry)は、端末が隠蔽する障害を露呈する: あるハイリターンランでは、実行されたホールドが同じ重みのフォールバックに収束している間に、ライブファクタライブラリが崩壊する。
FORESIGHT-9は、ポートフォリオの結果だけでなく、適応的なエージェントの状態と実行が他の先物と一致しているかどうかも評価する。
ワールドライン、トラジェクトリ、監査トレース、再生スクリプトをリリースします。
関連論文リスト
- Beyond Suspicious Steps: Ontological Trust in Long-Horizon Agents [13.208673657449175]
本稿では,軌道前置詞のタスク条件特性である存在論的信頼を導入し,それを RGE としてインスタンス化する。
RGEはロール、ゴール、エビデンスに沿って信頼を分解する。
我々はOSWorld, FinanceBench, EICU-ACからクロスドメイントラジェクトリコーパスを構築する。
論文 参考訳(メタデータ) (2026-08-18T12:44:43Z) - LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation [0.0]
エージェント検索拡張生成システムは、エビデンス、ツール契約、認可、セッション状態層に失敗しながら、根拠となる答えを生成することができる。
LayerRAG-Benchは8つのエンタープライズドメイン、240のタスク、9の障害シナリオ、2のコントラクトモード、38,880のライブタスクレベルのレコードを備えた、コントロールされたクロスレイヤ信頼性ベンチマークである。
論文 参考訳(メタデータ) (2026-07-29T18:09:17Z) - Speculative Rollback Correction for Quality-Diverse Web Agent Imitation [43.603850569331975]
専門家の軌道から模倣学習を通じて対話型Webエージェントを訓練することは、非常に効果的なアプローチとして現れている。
リセット可能なエージェント環境のためのブランチレベルの模倣フレームワークであるSRC(Speculative Rollback Correction)を提案する。
論文 参考訳(メタデータ) (2026-06-10T08:56:27Z) - DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making [0.7699235580548228]
DFAH-Benchは、金融業者の意思決定における観測可能な行動不安定性を測定するリプレイベンチマークである。
同じツールパスに従っている間、フロンティアモデルは95%の時間で決定に合意できるのは77%に過ぎません。
入力によらず1つの出力に崩壊することでほぼ完全な一致を達成できるパターンマッチング,比較的一貫したツール使用プロセスを持つ安定した実行器,そして物質的に異なるツールパスとエビデンスコンタクトを通じて同じ結論に達する軌道分岐器の3つの挙動プロファイルを同定する。
論文 参考訳(メタデータ) (2026-06-10T03:31:09Z) - ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents [59.626170560327274]
textbfClawForgeは、ステートコンフリクト下で実行可能なコマンドラインカテゴリのためのジェネレータベースのベンチマークフレームワークである。
私たちはこのフレームワークをClawForge-Bench(17のシナリオ、6の能力カテゴリ)としてインスタンス化します。
論文 参考訳(メタデータ) (2026-05-13T21:34:08Z) - Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values [17.752804388034583]
Agent-ValueBenchは、エージェント値専用の最初のベンチマークである。
16ドメインにわたる394の実行可能な環境を備え、4,335のバリューコンフリクトタスクを提供する。
エージェント値は、解釈可能な反電流の下で、クロスモデル均質のバリュータイドとして最初に現れる。
論文 参考訳(メタデータ) (2026-05-11T11:09:04Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。