論文の概要: Traceable LLM Reasoning for Fake-Order Fraud Detection
- arxiv url: http://arxiv.org/abs/2607.23075v1
- Date: Sat, 25 Jul 2026 06:51:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.988545
- Title: Traceable LLM Reasoning for Fake-Order Fraud Detection
- Title(参考訳): フェイクオーダフラッド検出のためのトレーサブルLDM推論
- Abstract要約: DeepScrubは、大規模言語モデルに基づいて構築された強化学習フレームワークである。
現実の偽オーダー不正検出データセットでは、DeepScrubはマクロF1スコア85.3%を獲得し、最高のベースラインを2.7%上回っている。
4週間のパイロット試験で、DeepScrubは91.8%の精度と88.5%のリコールを達成した。
- 参考スコア(独自算出の注目度): 11.019324159065015
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Detecting fake-order fraud at scale remains a critical challenge for large online-to-offline (O2O) service platforms, as existing approaches often rely on expert-designed features, produce black-box decisions, and provide limited interpretability. To address these limitations, we propose DeepScrub, a reinforcement learning framework built upon large language models (LLMs) for fake-order fraud detection with traceable reasoning. DeepScrub introduces three innovations. First, a semantic unification module converts heterogeneous risk signals into textual descriptions that LLMs can understand. Second, continued pre-training on risk-control corpora injects domain knowledge, and task rewards jointly evaluate prediction correctness and reasoning quality. Third, the SUggest-REflect (SURE) mechanism incorporates expert feedback and model self-checking to iteratively refine reasoning paths. On a real-world fake-order fraud detection dataset, DeepScrub achieves a macro-F1 score of 85.3%, outperforming the best baseline by 2.7 percentage points. Our task-optimized 8B model further surpasses a 32B model, showing that domain adaptation can matter more than model scale in this setting. In a four-week live pilot, DeepScrub achieved 91.8% precision and 88.5% recall, improving over first-stage human reviewers by 16.6 and 38.8 percentage points. It reduced first-stage manual review workload by 94% and saved nearly one million RMB annually. These results show that DeepScrub improves fraud review accuracy, reduces first-stage review workload, and provides traceable evidence for production risk-review workflows.
- Abstract(参考訳): 既存のアプローチは、専門家が設計した機能に依存し、ブラックボックスの決定を生成し、限定的な解釈性を提供するため、大規模なオンラインオフライン(O2O)サービスプラットフォームにおいて、大規模な偽注文の検知は依然として重要な課題である。
これらの制約に対処するため,大規模言語モデル(LLM)上に構築された強化学習フレームワークであるDeepScrubを提案する。
DeepScrubは3つのイノベーションを紹介している。
まず、セマンティック・ユニフィケーション・モジュールは、不均一なリスク信号をLLMが理解できるテキスト記述に変換する。
第2に、リスク制御コーパスの事前訓練がドメイン知識を注入し、タスク報酬は予測正当性と推論品質を共同評価する。
第三に、SURE(SUggest-Reflect)メカニズムは、専門家のフィードバックとモデルによる自己チェックを、反復的に洗練された推論パスに組み込む。
現実の偽オーダー不正検出データセットでは、DeepScrubはマクロF1スコア85.3%を獲得し、最高のベースラインを2.7%上回っている。
タスク最適化8Bモデルはさらに32Bモデルを超え、この設定ではドメイン適応がモデルスケールよりも重要であることを示す。
4週間のパイロット試験で、DeepScrubは91.8%の精度と88.5%のリコールを達成した。
第1段階のマニュアルレビューの負荷を94%削減し、年間100万 RMB 近く節約した。
これらの結果から,DeepScrubは不正レビューの精度を向上し,第1段階のレビュー作業量を削減し,生産リスクレビューワークフローのトレース可能な証拠を提供する。
関連論文リスト
- Cybersecurity Detection Classification with Reasoning-enabled Language Models [50.72675435043546]
セキュリティオペレーションセンター(SOC)の大きな問題は、警告疲労である。
以前の作業では、大きな言語モデル(LLM)がトリアージラベルを直接出力するように促すか、あるいは微調整するが、検出が真の脅威であるかどうかを判断するよう訓練することはない。
我々は、実際の人間ラベルのWindowsエンドポイント検出に対して、推論可能なトリアージ分類器(CoT)を訓練する。
論文 参考訳(メタデータ) (2026-07-30T16:22:13Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication [0.7136933021609076]
本稿では,手術場における幻覚を抑える適応推論のための最小限の表現を提案する。
我々は,新たな事例に対するトップダウン推論を行う,競合対応のグラフ推論フレームワークを開発した。
大規模電子商取引業者の控訴判決における枠組みを評価する。
論文 参考訳(メタデータ) (2026-02-27T00:43:59Z) - Improving Sampling for Masked Diffusion Models via Information Gain [9.059619122219502]
Masked Diffusion Models (MDM) は自己回帰モデルよりもデコード順序の柔軟性が高い。
既存のサンプルは、通常、各ステップでデコードするために最も高い局所的確実性を持つ位置を優先順位付けするグリーディを採用する。
本稿では,情報ゲインと即時不確実性を両立させる原理的復号化フレームワークであるInfo-Gain Samplerを提案する。
論文 参考訳(メタデータ) (2026-02-20T12:26:03Z) - How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs [49.61011897610774]
How2Everythingは、ゴール条件ドプロシージャの生成を評価し改善するフレームワークである。
私たちのフレームワークには、14トピックにわたる980KのWebページから351KのプロシージャをマイニングするHow2Mineが含まれています。
How2Score(ハウ2スコア)は、LLMジャッジを使用して、世代が目標達成を阻止する重要な障害を含むかどうかを検出する評価プロトコルである。
論文 参考訳(メタデータ) (2026-02-09T15:47:14Z) - Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models [31.422773877490613]
推論 LLM (Reasoning LLMs) はチェーン・オブ・ソート・ジェネレーションを通じて強力な多段階推論を実現する。
RLMの大きなモデルサイズと長いデコードタイムのアウトプットは、リソース制約のある設定にデプロイするのにコストがかかり、不適当である。
我々は、構造化されたプルーニングフレームワークであるRESPを紹介し、プルーニング決定とモデルの推論力学を一致させる。
論文 参考訳(メタデータ) (2025-12-01T20:27:05Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal [27.26251627767238]
大規模言語モデル(LLM)は、過度に保守的な安全対策のため、誤って良心的なクエリーを拒否する過度な拒絶を示す。
本稿では,LLMオーバーリフレクションの系統的検出と解析を行うための,最初の進化的テストフレームワークORFuzzを紹介する。
論文 参考訳(メタデータ) (2025-08-15T05:03:26Z) - Towards Evaluting Fake Reasoning Bias in Language Models [47.482898076525494]
論理に欠陥がある場合でも、モデルが推論の表面構造を好むことを示す。
我々は、Fake Reasoning Bias(FRB)を体系的に調査するベンチマークTheATERを紹介する。
我々は、主観的DPOと実データの両方で17の高度な大言語モデル(LRM)を評価する。
論文 参考訳(メタデータ) (2025-07-18T09:06:10Z) - SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning [99.645427839457]
セルフプレイ批判(Self-Play Critic、SPC)は、対戦型セルフプレイゲームを通じて推論ステップを評価する能力を進化させる新しいアプローチである。
SPCは、ベースモデルの2つのコピーを微調整して、2つの役割、すなわち「スニーキージェネレータ」と「批判的」を演じる。
論文 参考訳(メタデータ) (2025-04-27T08:45:06Z) - MOS: Towards Effective Smart Contract Vulnerability Detection through Mixture-of-Experts Tuning of Large Language Models [16.16186929130931]
スマートコントラクトの脆弱性は、ブロックチェーンシステムに重大なセキュリティリスクをもたらす。
本稿では,大規模言語モデルのミックス・オブ・エキスパート・チューニング(MOE-Tuning)に基づくスマートコントラクト脆弱性検出フレームワークを提案する。
実験の結果、MOSはF1のスコアが6.32%、精度が4.80%の平均的な改善で既存の手法よりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-04-16T16:33:53Z) - The Dual-use Dilemma in LLMs: Do Empowering Ethical Capacities Make a Degraded Utility? [54.18519360412294]
大きな言語モデル(LLM)は、安全のための有害な要求を拒否することと、ユーティリティのための正当な要求を収容することのバランスをとる必要がある。
本稿では,DPO(Direct Preference Optimization)に基づくアライメントフレームワークを提案する。
我々は,DeepSeek-R1をベンチマークでテストした結果を解析し,この高い評価を得たモデルがもたらす批判的倫理的懸念を明らかにする。
論文 参考訳(メタデータ) (2025-01-20T06:35:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。