論文の概要: Governing Agentic AI in FinTech
- arxiv url: http://arxiv.org/abs/2608.11344v2
- Date: Thu, 13 Aug 2026 01:40:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 14:00:09.742825
- Title: Governing Agentic AI in FinTech
- Title(参考訳): FinTechにおけるエージェントAIの統治
- Abstract要約: 金融機関は、エージェントAIシステムに連続的な決定を委譲している。
我々は、バインディングガバナンスの制約は能力ではなく、検証可能であると主張している。
我々はエージェントAIのためのマルチレベルガバナンス理論を開発する。
- 参考スコア(独自算出の注目度): 3.731168012111834
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Financial institutions are delegating consequential decisions to agentic AI systems that decompose goals, coordinate models and tools, and act with little oversight. Yet agentic AI governance in FinTech is under-investigated. We argue the binding governance constraint is not capability but verifiability. We define the Verifiability Gap as the shortfall between the verification delegated authority demands and the explainability and reproducibility retained after a decision. It is indexed to a verifier, evidentiary standard, and audit lag. We develop a multilevel governance theory for agentic AI and test its mechanisms in three studies over nine model versions, from a three-billion-parameter local model to a commercial frontier system. Study 1 shows that provider releases alter historical financial actions, and that the controls replay needs belong to the provider: the frontier model rejects temperature, top_p and top_k outright and exposes no random seed. Under the tightest controls each endpoint allows, a local model reproduced 320 of 320 executions, hosted models 319 of 320 and 959 of 960. Study 2 shows that orchestration is a latent policy layer. Architecture changes final actions, and no execution record repeated in any configuration at any scale. The frontier model reproduces its own actions more often than the local ones, its record no better, and loses a comparable share of its differentiation. Capability buys a higher starting point, not auditability. Study 3 shows two deterministic credit-model versions each reproduce their current action perfectly, yet the current cannot recover a historical one. We conceptualize reproducibility as a governance profile, not a scalar, yielding evidence-contingent delegation: authority is defensible only while retained evidence substantiates its exercise. Beyond finance, the framework extends to other high-stakes domains requiring auditability.
- Abstract(参考訳): 金融機関は、目標を分解し、モデルとツールを調整し、ほとんど監視せずに行動するエージェントAIシステムに、連続的な決定を委譲している。
しかし、FinTechのエージェントAIガバナンスは未定だ。
我々は、バインディングガバナンスの制約は能力ではなく、検証可能であると主張している。
我々は、検証可能ギャップを、検証された委任された権限要求と決定後の説明可能性と再現性の間の欠点として定義する。
検証者、明確な基準、監査遅延にインデックス付けされる。
我々はエージェントAIのためのマルチレベルガバナンス理論を開発し、そのメカニズムを3ビリオンパラメータ局所モデルから商用フロンティアシステムまで、9つのモデルバージョンに関する3つの研究で検証する。
研究1は、プロバイダのリリースが歴史的金融行動を変えることを示し、コントロールのリプレイはプロバイダが必要とするものであることを示している。
各エンドポイントの最も厳しいコントロールの下で、320の320のローカルモデル、320の319のホストモデル、960の959のローカルモデルが再生される。
調査2は、オーケストレーションが遅延ポリシー層であることを示している。
アーキテクチャは最終的なアクションを変更し、どんな構成でも実行記録は繰り返されない。
フロンティアモデルは、地元のものよりも頻繁に独自のアクションを再現するが、その記録は良くなく、差別化の相似性も失っている。
能力は、監査性ではなく、より高いスタートポイントを買います。
研究3では、2つの決定論的信用モデルバージョンがそれぞれの現在の動作を完璧に再現しているが、現在の状態は歴史的に復元できない。
我々は、再現可能性を、スカラーではなくガバナンスプロファイルとして概念化し、証拠を伴う代表団を産み出します。
ファイナンス以外にも、このフレームワークは監査性を必要とする他の高度なドメインにも拡張されている。
関連論文リスト
- Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - Governance at the Boundary: How Agent Decomposition Degrades Policy Compliance [6.411104724993454]
金融エージェントの統治可能性のベンチマークであるFiducia-benchを紹介します。
エージェントは、そのガバナンスを劣化させるのか?
あるコンポーネントによって発見されたポリシー関連事実は、それらに作用しなければならないコンポーネントに到達する前に、ハンドオフ境界で減衰される。
論文 参考訳(メタデータ) (2026-08-17T03:31:59Z) - The Open-Box Fallacy: Why AI Deployment Needs a Calibrated Verification Regime [0.5277024349608833]
私たちは、認可はドメインスコープで、独立してチェック可能で、リリース後に監視され、説明可能で、競争可能で、取り消し可能であるべきだと論じています。
モデルカード, リーダーボード, 規制開示の能力スコアの横に置かれるべき指標として, 最小構成ルールの6成分報告可能な標準である検証カバレッジを提案する。
論文 参考訳(メタデータ) (2026-05-11T14:02:56Z) - The Khipu Problem: Institutional Legibility Under Distributed Cognition [0.0]
本稿では,分散AIにおけるkhipu問題について紹介する。
ログ、トレース、モデルバージョン、ツールコール、アウトプット、承認アーティファクトは引き続き利用可能であり、一方の一貫性のある認知エピソードの一部としてそれらを読む能力は失われる。
この失敗は、通常の可観測性の欠如よりも解釈的連続性の欠如として理解されていると我々は主張する。
論文 参考訳(メタデータ) (2026-05-06T16:51:52Z) - When Agents Evolve, Institutions Follow [52.359340707289114]
大規模言語モデル上に構築されたマルチエージェントシステムは、同じ課題に直面している。
彼らの中心的な問題は、個人の知性だけでなく、集団的な組織である。
我々は,4つの標準的ガバナンスパターンにまたがる7つの歴史的政治機関を,実行可能なマルチエージェントアーキテクチャに翻訳する。
論文 参考訳(メタデータ) (2026-04-30T10:30:58Z) - TRUST: A Framework for Decentralized AI Service v.0.1 [47.384270414446604]
大規模推論モデル (LRM) とマルチエージェントシステム (MAS) は, 信頼性の高い検証を必要とする。
TRUST(Transparent, Robust, and Unified Services for Trustworthy AI)は,3つのイノベーションを備えた分散フレームワークである。
我々は、悪質な俳優が損失を被っている間、正直な監査人の利益を確実に確保する安全利益理論を証明する。
論文 参考訳(メタデータ) (2026-04-29T19:32:58Z) - Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF) [0.0]
大規模言語モデルは、安全クリティカルエンジニアリングにおける制御可能性のギャップを生み出します。
本稿では,エージェントをオープンループ生成からクローズループフェールセーフ決定性に移行するConvergent AI Agent Framework(CAAF)を紹介する。
CAAFの3つの柱は相補的な故障面に対処し、コモディティコストで制御可能性ギャップを閉じることはない。
論文 参考訳(メタデータ) (2026-04-18T15:15:09Z) - Governed Reasoning for Institutional AI [0.0]
認知コア(Cognitive Core)は、9種類の認知プリミティブから構築された決定基盤である。
ヒューマンレビューは、ポストホックチェックではなく実行条件である。
我々は、11ケースの事前承認控訴評価セットで3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-04-12T14:09:18Z) - I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systems [8.670200461690454]
機関的AIの完全性は、デプロイ後仮定ではなく、デプロイ前要件として扱われるべきであることを示す。
エージェントが異なる権限構造の下で正式な政府の役割を担っているマルチエージェントガバナンスシミュレーションを評価した。
28,112個の転写セグメントにまたがる独立系裁判官によるルールブレーキングと乱用の結果を収集する。
論文 参考訳(メタデータ) (2026-03-19T13:34:54Z) - interwhen: A Generalizable Framework for Verifiable Reasoning with Test-time Monitors [47.363850513075356]
実験時間検証フレームワークであるInterwhenを提案し, 与えられた検証結果に対して, 推論モデルの出力が有効であることを保証する。
検証された推論は、物理的な世界にエージェントを配置するといった高度なシナリオにおいて重要な目標である。
論文 参考訳(メタデータ) (2026-02-05T08:35:01Z) - CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection [44.251742023911135]
CreditAuditはデプロイ指向の信用監査フレームワークで、セマンティックアライメントと非敵対的なシステムプロンプトテンプレートのファミリ下でモデルを評価する。
同様の平均能力を持つモデルは、かなり異なる変動を示し、安定リスクは、エージェントまたは高失敗コストの制度における優先順位決定を覆す可能性があることを示す。
論文 参考訳(メタデータ) (2026-01-23T07:53:25Z) - TRUST: A Decentralized Framework for Auditing Large Language Model Reasoning [45.228233498964755]
大規模言語モデルは、意思決定を明らかにする推論チェーンを生成する。
既存の監査手法は集中的で、不透明で、スケールが難しい。
透明で分散化された監査フレームワークであるTRUSTを提案する。
論文 参考訳(メタデータ) (2025-10-23T04:16:44Z) - Beyond 'Aha!': Toward Systematic Meta-Abilities Alignment in Large Reasoning Models [86.88657425848547]
大型推論モデル(LRMs)はすでに長い連鎖推論のための潜在能力を持っている。
我々は、自動生成の自己検証タスクを使用して、モデルに推論、帰納、誘拐の3つのメタ能力を持たせることを明確にした。
我々の3つのステージ・パイプラインの個別アライメント、パラメータ空間のマージ、ドメイン固有の強化学習は、命令調整ベースラインと比較して10%以上のパフォーマンス向上を実現します。
論文 参考訳(メタデータ) (2025-05-15T17:58:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。