論文の概要: FinLifeBench: Exhaustive Life-Event History and Financial-State Reconstruction from Longitudinal Banking Dialogue
- arxiv url: http://arxiv.org/abs/2609.01198v2
- Date: Wed, 02 Sep 2026 01:41:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 15:35:44.752153
- Title: FinLifeBench: Exhaustive Life-Event History and Financial-State Reconstruction from Longitudinal Banking Dialogue
- Title(参考訳): FinLifeBench: 縦断的銀行対話による消費生活イベントの歴史と財務状態の再構築
- Abstract要約: 既存のベンチマークでは、徹底的な縦断的な再構築よりも、質問応答、境界エピソード、あるいは対象とするリコールが強調されている。
同じ累積対話上で2つのタスクを評価するFinLifeBenchを紹介する。
完全かつ時間的に有効な時系列記録の維持に失敗しながら,復元された事象の証拠を局所化できることを示す。
- 参考スコア(独自算出の注目度): 3.3999205301419266
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Repeated banking interactions require assistants to maintain complete, current, and traceable customer records as life changes emerge incidentally in routine requests. Existing benchmarks emphasize question answering, bounded episodes, or targeted recall rather than exhaustive longitudinal reconstruction. We introduce FinLifeBench, which evaluates two tasks over the same cumulative dialogue: reconstructing every life-event instance with its first-establishing session and reconstructing a complete 34-path financial state at consecutive checkpoints. The benchmark contains 6,000 eight-turn Korean banking sessions from 20 independent synthetic trajectories, with deterministic, exhaustive gold for 24 event types and 34 state paths and consensus quality assurance. Across eleven LLMs under a full-context condition, event-anchor recall falls from 0.591 at 15 sessions to 0.445 at 300. Errors are driven primarily by omitted events rather than poor anchor localization, while financial-state reconstruction frequently treats superseded or potentially outdated information as current; the best GCA@15 reaches 0.470. Performance on the two reconstruction tasks is only weakly associated. These results show that models can localize evidence for recovered events while still failing to maintain complete and temporally valid longitudinal records.
- Abstract(参考訳): 繰り返し銀行とのやりとりでは、定期的な要求で人生が偶発的に現れるため、アシスタントが完全な、現在の、追跡可能な顧客記録を維持する必要がある。
既存のベンチマークでは、徹底的な縦断的な再構築よりも、質問応答、境界エピソード、あるいは対象とするリコールが強調されている。
我々はFinLifeBenchを紹介する。FinLifeBenchは、一貫したセッションですべてのライフイベントインスタンスを再構築し、連続的なチェックポイントで34パスの完全な財務状態を再構築するという、2つのタスクを同じ累積対話で評価する。
このベンチマークには、20の独立した合成軌道から6000回の韓国銀行セッションが含まれており、24種類のイベントに決定論的で徹底的な金、34の州道、コンセンサスの品質保証が含まれている。
フルコンテクスト条件下では11個のLDMで、イベントアンカーリコールは15セッションで0.591から300セッションで0.445に落ちている。
エラーは主に、アンカーのローカライゼーションが低いというよりも、省略されたイベントによって引き起こされる。一方、金融国家再建では、過酷な情報や時代遅れな情報を現在として扱うことが多く、最高のGAA@15は0.470に達する。
2つの再構築作業のパフォーマンスは、弱みにのみ関連付けられている。
これらの結果は、復元された事象の証拠を、完全かつ時間的に有効な時系列記録を維持できないまま、局所化することができることを示している。
関連論文リスト
- Exact Record Omission in Delta Attention: A Transport Criterion, Its Cost, and a Replay Certificate [0.16921396880325776]
アシスタントは削除されたステートメントを繰り返すのをやめることができるが、そのリカレントメモリはそのステートメントの影響をまだ受けている。
我々は、記録後すぐに状態差を保存し、後続の更新を通じてこのレシートを転送し、同じ会話から構築された状態と、省略されたレコードとの補正を比較することで、この区別を検証した。
我々はこの基準を40の予測選択された合成キミ線形文脈上の11の条件に接続する。
論文 参考訳(メタデータ) (2026-09-06T23:25:58Z) - FORESIGHT-9: Prospective and Process-Aware Evaluation of Adaptive Trading Agents [0.0]
FORESIGHT-9は、9つの監査可能な対実的ストレスワールドラインから構築された、将来的でプロセス対応のベンチマークである。
共通契約は、各エージェントのネイティブ適応ループを保持しながら、観察と実行を標準化する。
我々は,36ランにわたる2つの基盤モデルバックボーンを持つ2つの適応型トレーディングエージェントフレームワークを評価した。
論文 参考訳(メタデータ) (2026-08-29T17:12:49Z) - Recursive Synthesis for Long-Horizon Terminal Tasks [50.39352383646813]
Recursive Synthetic Terminal Tasks (RST) は、大規模に長期の端末エージェントタスクを構築するためのフレームワークである。
RSTは37,484個の合成端末エージェントタスクを1タスクあたり0.05ドルで生成する。
軌道の微調整により、Qwen3.5-27BとQwen3.5-122B-A10Bはターミナルベンチ2、ターミナルベンチハード、ロングホライゾンターミナルベンチで最大10ポイント改善される。
論文 参考訳(メタデータ) (2026-08-05T23:24:26Z) - Best Friends, Not Forever: Evaluating Long-Horizon Persona Collapse and Behavioral Drift in AI Companions [34.277389276831435]
本研究では,2つの長期的障害について検討する。「人的崩壊」,展開された役割の喪失,境界,値,スタイル,および「行動漂流」である。
本稿では,人的行為とトラジェクティブリコールを別々に計測する制御型総合監査システムANCHORを紹介する。
この研究には、27人のペルソナにまたがる2,008の会話、9つのインタラクションスケジュール、3つの生成されたメモリ設定、そして4つの評価モデルが含まれている。
論文 参考訳(メタデータ) (2026-07-30T20:18:39Z) - MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations [50.24315431387575]
ライフサイクル操作のシーケンスとして会話メモリを再構成するベンチマークであるMemOpsを紹介する。
MemOpsは、それぞれのメモリイベントをトリガ、ターゲット、スコープ、状態遷移、エビデンスを指定した構造化トレースで表現する。
長いコンテキスト、検索ベース、パラメトリック、マネージドメモリシステムにわたって、MemOpsはファイナ・アンサーの精度のみを隠蔽する障害モードをアンタングルする。
論文 参考訳(メタデータ) (2026-07-14T15:33:44Z) - AutoPersonas: A Multi-Timescale Loop Engine for Open-Ended Persona Evolution [1.607532703630949]
長期的なペルソナエージェントは、新しい出来事、関係性、証拠、社会的条件に適応しながら、識別できなければならない。
我々は、自己ロックを、継続するペルソナライフループにおける実行時障害モードとして認識する。
本稿では,人格レベルの自己進化のための生命環境エンジンであるAutoPersonasを紹介する。
論文 参考訳(メタデータ) (2026-07-09T08:56:30Z) - When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue [1.9116784879310027]
本稿では,リトレーニングや追加のモデルコールを伴わずにロバスト性を向上させる軽量なプロンプトベースのリカバリ手法について検討する。
我々は,構造化データベースの状態に照らしたガイド付きリカバリプロンプトを含む3つの応答戦略を比較した。
30.5%の障害がMultiWOZで、20.9%がSGDで幻覚する。
論文 参考訳(メタデータ) (2026-06-30T08:18:11Z) - RAVEN: A Regime-Aware Variable-context Expert Network for Financial Time Series Forecasting [83.06074370551887]
固定コンテキストウィンドウは、非定常価格プロセスの時間変化最適振り返りと一致しない。
本稿では,各サンプルの時間的文脈を適応的に決定するMixture-of-Expertsフレームワークを提案する。
累積ログリターン予測(HS300、S&P500)およびファンド販売予測の実験では、RAVENはSOTAのパフォーマンスを達成し、HS300ではピアソン相関を9.2%改善し、S&P500では20.2%改善し、MSEを18.2%削減している。
論文 参考訳(メタデータ) (2026-06-23T02:11:04Z) - Large Language Model-Powered Query-Driven Event Timeline Summarization in Industrial Search [49.02761046363752]
本稿では、Baidu Search上にデプロイされた実運用システムであるQDET(Query-Driven Event Timeline Summarization)を紹介する。
QDETは、毎日取得された数百万のドキュメントによって形成されたノイズの多い候補セットから、クエリに密接に関連するサブイベントを特定し、整理する。
Baidu SearchのオンラインA/Bテストでは、現実世界の有効性が検証され、CTRが5.5%改善し、居住時間が4.6%長く、4.4%深かった。
論文 参考訳(メタデータ) (2026-05-26T14:16:27Z) - Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations [55.251494694783894]
災害対応エージェントベンチマーク(DORA)は、エンド・ツー・エンドの災害対応のための最初のエージェントベンチマークである。
タスクは、災害認識、空間関係分析、救助・避難計画、時間的進化推論、マルチモーダルレポート合成という、災害対応パイプラインをカバーする5つの次元にまたがる。
DORAは、運用上の信頼性の高い災害対応エージェントのための厳格なテストベッドを確立する。
論文 参考訳(メタデータ) (2026-05-12T06:57:41Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。