論文の概要: When Can Fraud Operations Authorize Automation? A Decision-Support Framework for Fresh Audit Evidence and Review Workload
- arxiv url: http://arxiv.org/abs/2608.08577v1
- Date: Sun, 09 Aug 2026 08:41:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.874587
- Title: When Can Fraud Operations Authorize Automation? A Decision-Support Framework for Fresh Audit Evidence and Review Workload
- Title(参考訳): 不正操作が自動化を認可できるのはいつか? 新鮮なオーディエンス証拠とワークロードのレビューのための意思決定支援フレームワーク
- Abstract要約: 不正操作は、イベントを自動承認、アナリストレビュー、自動ブロッキングに割り当てなければならない。
我々は、自動化を行動リスク、証拠の鮮度、共有レビュー能力に制約された認可決定として扱う、新鮮度に制約された監査能力を開発する。
- 参考スコア(独自算出の注目度): 2.5273986395975476
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Fraud operations must allocate events among automatic approval, analyst review, and automatic blocking even though the labels needed to evaluate these actions are selective and delayed. Predictive scores order cases, but they do not show whether the evidence is current and representative enough to delegate an action to the model. We develop freshness-constrained audit capacity (FCAC), a decision-support framework that treats automation as an authorization decision constrained by action risk, evidence freshness, and shared review capacity. It evaluates candidate action regions from mature randomized audits and a prespecified temporal allowance. Supported regions are automated; unsupported regions remain in review. The resulting decision record reports evidence age, audit demand, total review workload, value exposure, and compatible temporal change. We show that current action risk is unidentified without restricting unobserved label evolution. Under representative randomized audits, label-independent evidence windows, and a prespecified condition linking historical and current action risk, we derive simultaneous finite-sample control of unsafe authorization. Chronological evaluations with simulated audits on IEEE-CIS, ULB-Worldline, and Elliptic++ yield zero-drift automation rates of 84.4%, 67.4%, and 81.3%, with total review workloads of 24.1%, 46.0%, and 43.1%. The experiments reveal an audit-capacity trade-off: sparse auditing delays authorization, whereas intensive auditing eventually increases workload. A separately specified BAF stress test further indicates that fallback thresholds must reflect candidate-specific evidence rather than a common fraction of the risk limit. These findings identify audit freshness and analyst capacity as joint design considerations for fraud decision support.
- Abstract(参考訳): 不正操作は、これらのアクションを評価するために必要なラベルが選択的かつ遅延しているにも関わらず、自動承認、アナリストレビュー、自動ブロッキングのイベントを割り当てなければならない。
予測的スコアはオーダーケースをスコアするが、証拠が現在のものかどうかを示しておらず、モデルにアクションを委譲するのに十分である。
我々は,行動リスク,エビデンス・フレッシュネス,共有レビュー能力に制約された承認決定として,自動化を扱う意思決定支援フレームワークであるFCACを開発する。
成熟したランダム化監査と所定の時間的許容度から候補行動領域を評価する。
サポート対象地域は自動化されており、サポート対象地域はレビュー中である。
その結果得られた決定記録には、年齢、監査要求、総レビュー作業負荷、価値暴露、互換性のある時間的変化の証拠が報告されている。
現時点の行動リスクは,未保存ラベルの進化を制限することなく未同定であることを示す。
代表的なランダム化監査、ラベル非依存のエビデンスウィンドウ、および過去の行動リスクと現在の行動リスクをリンクする所定の条件の下で、安全でない認可の有限サンプル制御を導出する。
IEEE-CIS、ULB-Worldline、Elliptic++のシミュレーション監査による時系列評価では、ゼロドリフトの自動化率は84.4%、67.4%、81.3%となり、総レビュー負荷は24.1%、46.0%、43.1%となっている。
スパース監査は承認を遅らせ、一方集中監査は最終的に作業負荷を増大させる。
別々に特定されたBAFストレステストは、フォールバック閾値がリスク限界の共通部分ではなく、候補固有の証拠を反映しなければならないことを示している。
これらの結果から,不正判断支援のための共同設計として,聴覚の鮮度と分析能力が評価された。
関連論文リスト
- VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings [0.6445605125467574]
我々は,新しいエンド・ツー・エンド監査推論システムであるVERA-8Bを開発した。
VERA-8Bは、実施行動が起こる前に監査リスクを特定する。
SFTとGRPOをエビデンス・グラウンド・オーディエンス・アソシエーションで統合した最初の企業です。
論文 参考訳(メタデータ) (2026-08-28T14:55:49Z) - From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents [47.678562263387214]
研究エージェントは、産業レコメンデーション設定において、多段階の機械学習実験をますます実施している。
生成されたアーティファクトは、サポートされないか、不完全かもしれないし、実行されたラウンドは無効かもしれないし、あるいは廃止されるかもしれないし、後の修正は、以前の発見を曖昧にするかもしれない。
本稿では,連続的アーティファクトのバウンダリ検証と実行後のクレーム資格を結合するエビデンス・グラウンド・フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-05T13:37:38Z) - Audited Selective Verification for Risk-Controlled N-1 Thermal Contingency Screening under Deployment Shift [0.0]
監査選択検証(Audited Selective Verification)は、あらゆるコントローラの出力に対するリスク予算のスクリーニングとトリアージ層である。
妥当性は、サロゲート精度ではなく、実際の検証と監査にかかっているため、任意のデプロイメントシフトの下で保持される。
最大1354台までの公共送電システムでは、違反率は予算内に留まり、標準決定型および校正型スクリーンはシフト中は安全でない。
論文 参考訳(メタデータ) (2026-07-14T19:29:59Z) - Sequential Fairness Auditing with Limited Output Access [6.933020649563105]
外部評価は、AIシステムのガバナンスの中心になりつつある。
実際には、独立監査人はデプロイされたモデルへのアクセスに制限があり、クエリベースのインタラクションに頼らなければならない。
既存のフェアネス評価手法の多くは、静的データセットと固定サンプル統計検査を前提としている。
モデル出力アクセスの制限下での耐久性を考慮した逐次仮説検定問題としてフェアネス監査を定式化する。
論文 参考訳(メタデータ) (2026-06-29T14:17:33Z) - Auditable Decision Models with Learned Abstention and Real-Time Steering [6.287457666346811]
生産AIシステムは、不完全、矛盾、あるいは不十分な証拠で運用されることが多い。
我々は,不確実性が明確でなければならないAIシステムの運用上の決定制御について検討する。
本稿では,YES,NO,TBDを予測する境界決定制御モデルであるEvaluatorDPTを提案する。
論文 参考訳(メタデータ) (2026-05-26T23:37:56Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Adaptive auditing of AI systems with anytime-valid guarantees [8.752768302067638]
2つの'重複'の観点から仮説テストフレームワークを導入します。
我々は,オーディタを「賭けによる検証」の実行として形式化し,これは重複するヌル仮説をテストするための同時eプロセスに変換する。
提案手法は, 任意の値の型I誤差制御を維持し, 事前特定試験法より優れており, 統計的に厳密な結論に到達でき, 時には20の観測しか得られない。
論文 参考訳(メタデータ) (2026-05-07T22:33:48Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Towards Real-Time Fake News Detection under Evidence Scarcity [66.58597356379907]
本稿では,リアルタイムフェイクニュース検出のための新しいフレームワークである評価アウェア・セレクション・オブ・エキスパートズ(EASE)を提案する。
EASEは、利用可能な証拠の十分性を評価した意思決定プロセスに適合する。
本稿では,新興ニュースのモデル一般化を限られた証拠で評価するための新しいベンチマークであるRealTimeNews-25を紹介する。
論文 参考訳(メタデータ) (2025-10-13T11:11:46Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。