論文の概要: DelistBench: Evaluating Search-Enabled LLMs for Auditable Corporate-Event Database Completion
- arxiv url: http://arxiv.org/abs/2608.22770v1
- Date: Mon, 24 Aug 2026 03:46:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.988808
- Title: DelistBench: Evaluating Search-Enabled LLMs for Auditable Corporate-Event Database Completion
- Title(参考訳): DelistBench: 監査可能な企業イベントデータベース補完のための検索可能なLLMの評価
- Authors: Xuan Yao, Li Shuping, Dai Yang, Zhou Yi, Ke-Wei Huang,
- Abstract要約: Search-to-Recordは、検索可能な大規模言語モデルが機関が定義したイベントレコードを再構築するデータベース保証タスクである。
DelistBenchは、セキュリティレベルのリスト化発表のための1200レコードのベンチマークである。
クローズドブックとウェブ対応条件のペアで5つのモデルを評価する。
- 参考スコア(独自算出の注目度): 1.5631519359899875
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Financial institutions need an independent way to detect missing, stale, and misclassified corporate-event records in vendor databases. We introduce Search-to-Record, a database-assurance task in which search-enabled large language models reconstruct institution-defined event records from public sources for a known security universe and historical cutoff, and DelistBench, a 1,200-record benchmark for security-level delisting announcements. We evaluate five models in paired closed-book and web-enabled conditions. Web access raises announcement-date accuracy within seven days by 34.0 to 48.0 percentage points and event-status accuracy by approximately 2.8 to 21.7 points; the best system achieves 81.5% overall joint accuracy within seven days. Economy web systems achieve 75.9-78.3% overall joint accuracy within seven days at 4.5-6.6% of the API cost of the most expensive web system. Risk-based triage identifies low-error subsets, although the highest-coverage operating point still sends 27.3% of the balanced test set to review. The evaluation identifies web retrieval as the main source of timing gains and shows that low-cost systems can approach the best system's accuracy. Together, Search-to-Record, DelistBench, and the evaluation provide concrete deployment guidance: calibrate triage to local event prevalence and market mix, preserve positive-event recall, and route positive and ambiguous cases to targeted review.
- Abstract(参考訳): 金融機関はベンダーデータベースに欠けている、古い、未分類の企業資産の記録を発見できる独立した方法を必要としている。
本稿では,検索可能な大規模言語モデルを用いたデータベース保証タスクであるSearch-to-Recordについて紹介する。
クローズドブックとウェブ対応条件のペアで5つのモデルを評価する。
Webアクセスは7日以内に発表日精度を34.0から48.0ポイント引き上げ、イベント統計精度を2.8から21.7ポイント引き上げる。
経済的なWebシステムは、最も高価なWebシステムのAPIコストの4.5-6.6%で、7日以内に75.9-78.3%の総合的な共同精度を達成する。
リスクベースのトリアージは、低エラーのサブセットを特定するが、最高カバレッジの運用ポイントは依然として、バランスの取れたテストセットの27.3%をレビューに送信している。
評価では、Web検索をタイミングゲインの主源としており、低コストのシステムが最適なシステムの精度にアプローチできることが示されている。
Search-to-Record、DelistBench、および評価は、具体的なデプロイメントガイダンスを提供する: ローカルイベントの頻度とマーケットミックスの調整、ポジティブイベントリコールの保存、ターゲットレビューに対するポジティブケースとあいまいケースのルート。
関連論文リスト
- FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems [0.0]
FinRCA-Benchは、14の運用テーブルにまたがる2250の口座支払い可能な銀行間和解ケースのベンチマークである。
その結果,構造的検索の失敗は,95~15の精度で推理的検索の失敗をはるかに上回っていることがわかった。
FinRCA-Benchでは、検索アーキテクチャがAIシステムの性能を強く観察し、ルート原因ラベルは聴覚診断の弱いプロキシである。
論文 参考訳(メタデータ) (2026-08-19T04:36:01Z) - SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents [56.400332595452966]
我々は、監査人が検索エージェントの障害をローカライズ、属性付け、修復できるかどうかを評価するベンチマークであるSearchAuditBenchを紹介する。
SearchAuditBenchは1,243の障害トラックで構成され、平均73.1メッセージと65.1Kトークンを5つのディープサーチベンチマークで8つのオープンウェイトモデルから収集している。
本稿では,検索エージェントの障害を効果的にローカライズ,属性,修復するマルチパースペクティブ監査フレームワークであるSearchAuditorを提案する。
論文 参考訳(メタデータ) (2026-08-05T09:09:00Z) - Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch [44.05969616406614]
Autoresearchは、変更を提案し、フルトレーニングジョブを実行し、メトリックを改善する変更を維持することによって、マシンラーニングコードを改善する。
本研究では,この事前執行判断の信頼性が,自動検索の軌道上でどのように変化するかを検討する。
論文 参考訳(メタデータ) (2026-07-30T05:08:15Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - Large Language Model-Powered Query-Driven Event Timeline Summarization in Industrial Search [49.02761046363752]
本稿では、Baidu Search上にデプロイされた実運用システムであるQDET(Query-Driven Event Timeline Summarization)を紹介する。
QDETは、毎日取得された数百万のドキュメントによって形成されたノイズの多い候補セットから、クエリに密接に関連するサブイベントを特定し、整理する。
Baidu SearchのオンラインA/Bテストでは、現実世界の有効性が検証され、CTRが5.5%改善し、居住時間が4.6%長く、4.4%深かった。
論文 参考訳(メタデータ) (2026-05-26T14:16:27Z) - Agentic Proving for Program Verification [44.663012714194025]
エージェントシステムは、形式数学における自動定理証明のための最先端のアプローチとして登場した。
検証可能なコード生成のためのLean 4ベンチマークであるCLEVERのエージェント証明フレームワークでClaude Codeを評価した。
論文 参考訳(メタデータ) (2026-05-22T15:41:27Z) - Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System [0.0]
本研究では、Qwen 3.5 27Bモデルに基づいて構築されたセキュリティ文書分類のためのオープンソースのローカルシステムであるTorchSightについて述べる。
このモデルは、13の許可を受けたソースから78,358のサンプルと、7つのセキュリティカテゴリと51のサブカテゴリをカバーするGPT-4合成データに基づいて訓練された。
その結果、微調整されたローカルモデルでは、文書処理をローカル制御下に保ちながら、正確なセキュリティ文書分類が可能であることがわかった。
論文 参考訳(メタデータ) (2026-05-19T18:18:19Z) - ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking [2.2573512203799626]
本稿では,NLUを独立したツールコールとして再構成する有界神経シンボルアーキテクチャであるReacTODを提案する。
有界ReActループは反復自己補正を可能にし、MultiWOZ上のシングルパス推論よりも最大9.3ポイント精度を向上させる。
論文 参考訳(メタデータ) (2026-05-18T20:06:04Z) - Towards Optimal Agentic Architectures for Offensive Security Tasks [3.93181912653522]
20のインタラクティブなターゲット(Web/API10とバイナリ10)のベンチマークを導入する。
それぞれ、ホワイトボックスとブラックボックスモードで評価された、ワンリーチ可能な地上真実の脆弱性を露呈する。
MAS-Indepは最も高い検出率(64.2%)を獲得し、SASは最も高い効率のベースラインである0.058ドルである。
論文 参考訳(メタデータ) (2026-04-20T18:17:51Z) - Detecting Errors and Estimating Accuracy on Unlabeled Data with
Self-training Ensembles [38.23896575179384]
本稿では,この2つの課題に同時に対処する,原則的かつ実用的な枠組みを提案する。
1つのインスタンス化は、教師なし精度推定における推定誤差を少なくとも70%削減し、エラー検出のためのF1スコアを少なくとも4.7%改善する。
iWildCamでは、教師なし精度推定における推定誤差を少なくとも70%削減し、エラー検出のためのF1スコアを少なくとも4.7%改善する。
論文 参考訳(メタデータ) (2021-06-29T21:32:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。