論文の概要: Governed Reasoning for Institutional AI
- arxiv url: http://arxiv.org/abs/2604.10658v1
- Date: Sun, 12 Apr 2026 14:09:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:16.154978
- Title: Governed Reasoning for Institutional AI
- Title(参考訳): 機関的AIのためのゴバデーテッド推論
- Authors: Mamadou Seck,
- Abstract要約: 認知コア(Cognitive Core)は、9種類の認知プリミティブから構築された決定基盤である。
ヒューマンレビューは、ポストホックチェックではなく実行条件である。
我々は、11ケースの事前承認控訴評価セットで3つのシステムをベンチマークした。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Institutional decisions -- regulatory compliance, clinical triage, prior authorization appeal -- require a different AI architecture than general-purpose agents provide. Agent frameworks infer authority conversationally, reconstruct accountability from logs, and produce silent errors: incorrect determinations that execute without any human review signal. We propose Cognitive Core: a governed decision substrate built from nine typed cognitive primitives (retrieve, classify, investigate, verify, challenge, reflect, deliberate, govern, generate), a four-tier governance model where human review is a condition of execution rather than a post-hoc check, a tamper-evident SHA-256 hash-chain audit ledger endogenous to computation, and a demand-driven delegation architecture supporting both declared and autonomously reasoned epistemic sequences. We benchmark three systems on an 11-case balanced prior authorization appeal evaluation set. Cognitive Core achieves 91% accuracy against 55% (ReAct) and 45% (Plan-and-Solve). The governance result is more significant: CC produced zero silent errors while both baselines produced 5-6. We introduce governability -- how reliably a system knows when it should not act autonomously -- as a primary evaluation axis for institutional AI alongside accuracy. The baselines are implemented as prompts, representing the realistic deployment alternative to a governed framework. A configuration-driven domain model means deploying a new institutional decision domain requires YAML configuration, not engineering capacity.
- Abstract(参考訳): 規制順守、臨床トリアージ、事前認可の控訴といった制度上の決定は、汎用エージェントが提供するものとは異なるAIアーキテクチャを必要とする。
エージェントフレームワークは、権限を会話的に推論し、ログから説明責任を再構築し、サイレントエラーを生成する。
我々は,9種類の認知的プリミティブ(検索,分類,検証,課題,反映,意図,統治,生成)から構成される支配的決定基盤であるCognitive Coreと,ポストホックチェックではなく実行条件である4階層のガバナンスモデルと,計算に内在するタンパーなSHA-256ハッシュチェーン監査台帳と,宣言および自律的に推論されたエピステミックシーケンスをサポートする要求駆動デリゲートアーキテクチャを提案する。
我々は、11ケースの事前承認控訴評価セットで3つのシステムをベンチマークした。
Cognitive Coreは55%(ReAct)と45%(Plan-and-Solve)に対して91%の精度を実現している。
CCは無音エラーを発生し、両ベースラインは5-6。
我々は、機関AIの一次評価軸として、統治可能性 -- システムが自律的に行動すべきでないことをいかに確実に知っているか -- を導入します。
ベースラインはプロンプトとして実装され、管理されたフレームワークに代わる現実的なデプロイメントを表している。
構成駆動のドメインモデルは、エンジニアリング能力ではなく、YAML構成を必要とする新しい制度決定ドメインをデプロイすることを意味する。
関連論文リスト
- Type-Checked Compliance: Deterministic Guardrails for Agentic Financial Systems Using Lean 4 Theorem Proving [0.0]
本稿では,形式検証ベースのAIガードレールプラットフォームであるLean-Agent Protocolを提案する。
提案されたすべてのエージェント作用は、数学的予想として扱われる。
このアーキテクチャは、マイクロ秒レイテンシで暗号レベルのコンプライアンスを保証する。
論文 参考訳(メタデータ) (2026-04-01T23:39:43Z) - I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systems [8.670200461690454]
機関的AIの完全性は、デプロイ後仮定ではなく、デプロイ前要件として扱われるべきであることを示す。
エージェントが異なる権限構造の下で正式な政府の役割を担っているマルチエージェントガバナンスシミュレーションを評価した。
28,112個の転写セグメントにまたがる独立系裁判官によるルールブレーキングと乱用の結果を収集する。
論文 参考訳(メタデータ) (2026-03-19T13:34:54Z) - When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making [68.12864562049957]
身体ロボットシステムは、高レベルの推論をサポートするために、大規模言語モデル(LLM)ベースのエージェントにますます依存している。
エージェントはいつ、いつ、いつ行動すべきか?
本稿では,エンボディエージェントのリソース・アウェア・オーケストレーションのための階層的なフレームワークであるRARRL(Resource-Aware Reasoning via Reinforcement Learning)を提案する。
論文 参考訳(メタデータ) (2026-03-17T15:38:50Z) - A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms [49.66022971508878]
私たちは、推論はモジュラーコンポーネントからシステムの認知コアに高めるべきだと論じています。
応答性推論のトレードオフやソーシャルゲーム推論など,7つの中核的推論課題を導出し,体系化する。
我々は,LLMに基づく推論と,ミリ秒スケールで安全クリティカルな車両制御の要求との間の,高レイテンシ,熟考的特性の根本的かつ未解決な緊張関係を同定する。
論文 参考訳(メタデータ) (2026-03-11T07:40:53Z) - Agentic AI for Cybersecurity: A Meta-Cognitive Architecture for Governable Autonomy [0.0]
本稿では,サイバーセキュリティのオーケストレーションはエージェント型マルチエージェント認知システムとして再認識されるべきである,と論じる。
本稿では,特定・仮説形成・文脈解釈・説明・ガバナンスに責任を負う異種AIエージェントを,メタ認知判断機能を通じて協調する概念的枠組みを提案する。
我々の貢献は、メタ認知判断を第一級システム機能として組み込むことによって、この認知構造をアーキテクチャ的に明確化し、統制可能にすることである。
論文 参考訳(メタデータ) (2026-02-12T12:52:49Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Zero-shot reasoning for simulating scholarly peer-review [0.0]
本稿では、AI生成ピアレビューレポートを評価するための、最初の安定的でエビデンスに基づく標準を提供する決定論的シミュレーションフレームワークについて検討する。
第一に、このシステムは校正された編集判断をシミュレートすることができ、「改訂」決定が一貫して多数決結果を形成する。
第二に、手続きの整合性を揺るぎないまま維持し、安定した29%の証明の遵守率を強制する。
論文 参考訳(メタデータ) (2025-10-02T13:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。