論文の概要: ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance
- arxiv url: http://arxiv.org/abs/2608.19974v1
- Date: Thu, 20 Aug 2026 12:49:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.565184
- Title: ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance
- Title(参考訳): ReguSim: LLMエージェント・ルール・グラウンディングの評価
- Abstract要約: 本稿では、制御された金融コンプライアンス環境であるReguSimと、ターゲットマーク付き監視ベンチマークであるReguBenchを紹介する。
ReguSimは、理由づけ、訴訟未遂、執行執行、証拠の監視を分離する。
結果は、単一コンプライアンススコアではなく、ルール付きアクションとエビデンス使用の監査として、財務コンプライアンス評価の枠組みを定めている。
- 参考スコア(独自算出の注目度): 13.375888185792547
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM agents in financial markets may cite rules yet still submit orders that violate executable constraints or misread surveillance evidence. We introduce ReguSim, a controlled financial-compliance environment, and ReguBench, a target-marked monitoring benchmark, to separate four artifacts: stated reasoning, attempted action, execution enforcement, and monitor evidence. In trader runs with DeepSeek V4 Pro and Gemini 3.5 Flash, visible rules reduce but do not eliminate rejected actions, and incentive or persona framing shifts behavior. A bridge study shows that trader rationales can mislead an independent monitor unless enforcement evidence is shown. In monitoring, simple structured baselines either match or exceed prompt-only LLMs. The results frame financial compliance evaluation as an audit of rule-grounded actions and evidence use, rather than a single compliance score.
- Abstract(参考訳): 金融市場のLLMエージェントは、実行可能な制約に違反したり、監視証拠を誤読する命令をまだ提出する規則を引用するかもしれない。
制御された金融コンプライアンス環境であるReguSimと、ターゲットマーク付き監視ベンチマークであるReguBenchを導入し、4つのアーティファクトを分離する。
DeepSeek V4 ProとGemini 3.5 Flashで動作するトレーダでは、可視的なルールは減少するが、拒否されたアクションを排除せず、インセンティブやペルソナフレーミングのシフトによって振る舞いが変化する。
橋梁調査では、法的証拠が示されない限り、トレーダーの合理性は独立したモニターを誤解させる可能性がある。
監視において、単純な構造化されたベースラインは、プロンプトのみのLCMと一致するか、超えるかのいずれかである。
結果は、単一コンプライアンススコアではなく、ルール付きアクションとエビデンス使用の監査として、財務コンプライアンス評価の枠組みを定めている。
関連論文リスト
- Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring [0.5868212710728535]
チェーン・オブ・思想(CoT)モニタリングはAIエージェントにとって有望な安全メカニズムである。
我々は何千ものエージェントとモニターのインタラクションを分析し、エージェントにポリシー違反の提案を議論するように指示する。
このような敵対的な状況下では、有害な行為の承認を平均9.5%減らすのではなく、エージェントのCoT推論へのアクセスを監視することが判明した。
論文 参考訳(メタデータ) (2026-07-09T02:48:36Z) - Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering? [70.17374586573033]
本稿では,Large Language Models(LLMs)に基づくNIDSルールエンジニアリングを人間中心で調査する。
LLMは構文的に正しい規則を生成するが、専門家は部分的にしか展開できないと考えている。
大規模モデルは構文的に有効な規則を一貫して生成するが、小型モデルはIDSルールの生成にはほとんど効果がない。
論文 参考訳(メタデータ) (2026-07-07T07:09:56Z) - FinGuard: Detecting Financial Regulatory Non-Compliance in LLM Interactions [27.4361627975349]
既存のガードモデルは、特定の金融規制に根ざした一般的な損害と見落としに関する違反に基づいて構築されている。
このギャップを規制文書を直接運用する規制駆動のパイプラインで解決する。
textbfFinGuard-Benchを、金融規制コンプライアンス検出のための最初のベンチマークとしてリリースしました。
論文 参考訳(メタデータ) (2026-05-28T06:20:45Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Logic-Regularized Verifier Elicits Reasoning from LLMs [63.65875399266337]
論理規則で正規化された教師なしの検証器であるLOVERを提案する。
ローバーは、定理を二項潜在変数として扱い、内部の活性化を活用し、3つの論理的制約を課す。
ローバーは教師なしのベースラインを大幅に上回る。
論文 参考訳(メタデータ) (2026-05-07T09:03:49Z) - ValueBlindBench: Agreement-Gated Stress Testing of LLM-Judged Investment Rationales Before Returns Are Observable [1.8689252029357564]
本稿では,事前登録された合意付きストレステストプロトコルであるValueBlindBenchを紹介する。
ValueBlindBench は LLM-judged Investment-rationale のクレームがパブリッシュ可能、資格あり、無効かを決定する。
論文 参考訳(メタデータ) (2026-04-28T05:04:20Z) - Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks [19.272001035427987]
本稿では,トリアージをエビデンス制約決定プロセスとして扱う,説明可能なAMLトリアージフレームワークを提案する。
提案手法は, (i) ポリシー/タイポロジーガイダンス, 顧客コンテキスト, 警告トリガ, トランザクションサブグラフと, (ii) 明示的な引用を必要とする構造的LCM出力契約, (iii) 矛盾や欠落した証拠から分離する構造的LCM出力契約, (iii) 最小限の, 妥当な摂動が, トリアージの推奨と理性の両方に一貫性のある変化をもたらすかどうかを検証した事実チェックを組み合わせる。
論文 参考訳(メタデータ) (2026-03-22T05:51:40Z) - FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles [29.186495806527947]
FinRule-Benchは、現実の財務表よりもルールベースの財務推論における診断完全性を評価するためのベンチマークである。
ベンチマークでは、段階的に強力な推論機能を必要とする3つの監査タスクを定義している。
分離されたルール検証ではモデルの性能は良好に向上するが,ルール識別やマルチ違反診断では性能が著しく低下することがわかった。
論文 参考訳(メタデータ) (2026-03-11T22:11:12Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z) - Standard Benchmarks Fail - Auditing LLM Agents in Finance Must Prioritize Risk [31.43947127076459]
標準ベンチマークでは、大規模言語モデル(LLM)エージェントが金融面でどれだけうまく機能するかを定めているが、デプロイの安全性についてはほとんど語っていない。
我々は、精度の指標とリターンベースのスコアが、幻覚的な事実、古いデータ、敵の迅速な操作などの脆弱性を見渡すことで、信頼性の錯覚をもたらすと論じている。
論文 参考訳(メタデータ) (2025-02-21T12:56:15Z) - Preemptive Detection and Correction of Misaligned Actions in LLM Agents [58.39520480675366]
InferActは、実行前に不整合アクションを検出する新しいアプローチである。
タイムリーな修正をユーザーに警告し、有害な結果を防ぐ。
InferActは、ミスアライメントされたアクション検出におけるベースラインに対するMarco-F1の最大20%の改善を実現している。
論文 参考訳(メタデータ) (2024-07-16T15:24:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。