論文の概要: Penumbra: Sample-Efficient Adversarial Search for Regulatory Obligations
- arxiv url: http://arxiv.org/abs/2610.04693v1
- Date: Sat, 03 Oct 2026 18:11:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-11 17:42:02.039291
- Title: Penumbra: Sample-Efficient Adversarial Search for Regulatory Obligations
- Title(参考訳): Penumbra: 規制対象の適応探索に有効なサンプル
- Abstract要約: Penumbraは、承認されたアンカーから修正予算を拡大し、2つの評価委員会が判決を変更するまで、敵対的な検索である。
一致した予算では、アダプティブアロケーションは、候補者の59%で均一なアロケーションのフル予算カバレッジに達する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agents are entering finance, healthcare and law, sectors where a violation leaves no lexical signature and carries real penalties. Whether an omission is material, or a disclosure sufficient, depends on what the response left out. Probing such an obligation means finding responses one minimal edit from flipping compliance, and every probe costs a generation and two adjudications, so the binding constraint on regulatory red-teaming is sample efficiency, not volume. We introduce Penumbra, an adversarial search that walks from a verified anchor under an expanding edit budget until a two-evaluator committee changes its verdict, and emits the two adjacent responses that straddle the change. Allocation is adaptive, and the objective is coverage of the defeat surface: distinct (obligation x defeat mode) cells resolved per candidate. At matched budget, adaptive allocation reaches uniform allocation's full-budget coverage on 59% of the candidates; at equal records it covers 1.43x the defeat modes of naive enumeration, and the gain is confined to the axis it targets. On 60 screened obligations of a financial advisory constitution, Penumbra returns 144 pairs, each a compliant and a violating response that the committee places on opposite sides of the boundary, differing by a handful of words where a model asked for both directly produces texts sharing almost nothing. A second constitution, for clinical triage, reproduces this on 18 obligations: 49 pairs at the same tightness, with the same modes hardest. Pairs like these show where an obligation's own terms stop deciding, which is what an agent deployed under it must be tested against, and the search finds them at a cost that scales with the boundary, not the text.
- Abstract(参考訳): エージェントは金融、医療、法律の分野に入り、違反は語彙的な署名を残しず、真に罰則を課す。
省略が物質であるか、あるいは十分な開示であるかは、応答が残したものに依存する。
このような義務を課すことは、コンプライアンスの反転から1つの最小限の編集で応答を見つけることを意味し、各プローブは1世代と2つの調整をかかるので、規制的なリピートに対する拘束力は、ボリュームではなくサンプル効率である。
修正予算が拡大する中で、検証済みアンカーから2つの評価委員会が評決を変更するまで、検証済みのアンカーから歩いた敵対的な検索であるPenumbraを紹介し、その変更にまたがる2つの回答を出力する。
割り当ては適応的であり、目的は敗北面のカバレッジである。
一致した予算では、アダプティブアロケーションは候補の59%で均一なアロケーションのフル予算カバレッジに達し、同じ記録では、ナイーブ列挙の敗北モードを1.43倍にカバーし、ゲインはターゲットとする軸に限られる。
財務諮問憲法の60の審査された義務について、ペヌムブラは144対を返却し、委員会が境界の反対側に置かれているという違反的な反応を提出した。
臨床トリアージのための第2の憲法では、同じタイトネスで49対、同じモードで最も難しい18の義務でこれを再現している。
このようなペアは、義務の条件が決定を終了することを示し、それに基づいてデプロイされたエージェントをテストしなければならないことを示し、検索はテキストではなく境界にスケールするコストでそれらを見つける。
関連論文リスト
- Watermarking: from Impossibility to Auditable Compliance [78.87513208320995]
EU人工知能法第50条(2)は、合成出力を機械可読かつ検出可能にするために、生成システムの提供者を要求する。
自由形式のテキストにとって、重要な実装の1つは、生成的な透かし処理の実装である。
本稿は、強い透かしに代わる聴覚的な代替品を開発する。
論文 参考訳(メタデータ) (2026-10-05T13:32:41Z) - Not Self-Decidable: LLMs Cannot Draw the Boundary of What an Agent Verifier Can Check [0.0]
エージェントの検証者は、固定チェックが解決できるものと、裁判官を必要とするものとの2種類のルールに直面します。
CoVerは全会一致を指名として扱い、そのために合成されたチェックが介入を生き残る場合にのみ述語を認める。
自己決定性はモデルから引き出す能力ではなく、検証者が構築しなければならない境界である。
論文 参考訳(メタデータ) (2026-10-03T18:25:12Z) - Measurement Boundaries in LLM Financial Agent Evaluation: Fixed-Tape Execution and Multi-Defect Auditing [0.0635655952373977]
本研究では,金融エージェントの評価において,実行性能の解釈と監査スコアの2つの限界について検討する。
StudyAでは、3つの合成セッティング上での独立実行とストレスのある実行を比較することで、実行ルールと新しいモデル応答とポートフォリオフィードバックが混在する。
StudyBでは,従来のタスクをゼロ,1,2の欠陥タスクに,明示的なマルチラベルプロンプトで置き換えることによって,1から2の欠陥からの目標違反リコールの減少は,監査と情報源の組み合わせの5つのうち5つにおいて肯定的である。
論文 参考訳(メタデータ) (2026-09-26T08:54:21Z) - FinInteract: Benchmarking Clarification and Intent Integration in Ambiguous Financial Question Answering [8.790693727414414]
有能なエージェントは、もっともらしいが意図しない読みにコミットするのではなく、あいまいさを認識して尋ねるべきである。
既存の金融ベンチマークでは、問題ごとに1つの金の答えがあいまいさを解決するエージェントを分離できないため、これを測定できない。
FinInteractは173インスタンスのベンチマークで、各質問とデフォルトと意図した解釈をペアリングします。
論文 参考訳(メタデータ) (2026-09-21T02:06:45Z) - PRIMUS: Identity, Governance, and Verification for Multi-Agent Federations [0.0]
マルチエージェント・フェデレーションは、敵対的な条件下での3つの質問に答えるガバナンスを必要とする。
本稿では,BLSアグリゲートシグネチャと主パワーIDを結合したPRIMUSについて述べる。
PRIMAのバイナリアーティファクト-忠実性判定は、グレード付きフィットネス信号に変換できるかどうかを問う。
論文 参考訳(メタデータ) (2026-09-07T19:21:49Z) - Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce [39.937871162878785]
我々は、虚偽の事実主張、操作、共謀、脅迫を含む電子メールとして、音声行為の誤認識を運用する。
メールの12.6%はミスアライメントと表示されており、20行中、74.7%は個別のエージェントランで表示されている。
高い能力モデルが弱い候補を差分に利用しているという証拠は見つからない。
論文 参考訳(メタデータ) (2026-08-14T18:56:12Z) - Sharding Prevents LLM Oversight Failures and Adversarial Exploitation [45.380649793616705]
シャーディングは要求を小さなグループに分割し、各グループを別の呼び出しに割り当て、評決を集約する。
シャードの弱い裁判官は、より有能な総合的な裁判官よりも優れており、後者がパネルの全予算を受け取ったとしても、その裁判官と一致することができる。
論文 参考訳(メタデータ) (2026-08-05T18:21:21Z) - To Fuse or to Drop? Dual-Path Learning for Resolving Modality Conflicts in Multimodal Emotion Recognition [87.22988227382329]
マルチモーダル感情認識(MER)は、テキスト、音声、視覚を組み合わせることで恩恵を受けるが、標準的な融合は、モダリティが相反する場合に失敗することが多い。
我々は,いつフューズするか,いつモダリティを落とすのかを学習する統合フレームワークであるDual-Path Conflict Resolution (DCR)を提案する。
論文 参考訳(メタデータ) (2026-05-06T13:11:33Z) - Affordance Agent Harness: Verification-Gated Skill Orchestration [45.231685718099264]
Affordance groundingは、オープンワールドのシーンでエージェントがどこでどのように対話すべきかを特定する必要がある。
本稿では,エビデンスストアとコストコントロールを備えたクローズドループランタイムであるAffordance Agent Harnessを提案する。
論文 参考訳(メタデータ) (2026-05-01T13:45:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。