論文の概要: The Open-Box Fallacy: Why AI Deployment Needs a Calibrated Verification Regime
- arxiv url: http://arxiv.org/abs/2605.10601v1
- Date: Mon, 11 May 2026 14:02:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 02:24:05.569953
- Title: The Open-Box Fallacy: Why AI Deployment Needs a Calibrated Verification Regime
- Title(参考訳): オープンボックスの誤り:なぜAIのデプロイに校正された検証規則が必要なのか
- Abstract要約: 私たちは、認可はドメインスコープで、独立してチェック可能で、リリース後に監視され、説明可能で、競争可能で、取り消し可能であるべきだと論じています。
モデルカード, リーダーボード, 規制開示の能力スコアの横に置かれるべき指標として, 最小構成ルールの6成分報告可能な標準である検証カバレッジを提案する。
- 参考スコア(独自算出の注目度): 0.5277024349608833
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: AI deployment in sensitive domains such as health care, credit, employment, and criminal justice is often treated as unsafe to authorize until model internals can be explained. This often leads to an excessive reliance on mechanistic interpretability to address a deployment challenge beyond its intended scope. We argue that the gate should instead be calibrated verification: authorization should be domain-scoped, independently checkable, monitored after release, accountable, contestable, and revocable. The reason is twofold. First, model capability is uneven across nearby tasks, so authorization must attach to a specific use rather than to a model in general. Second, societies have long governed opaque expertise through credentials, monitoring, liability, appeal, and revocation rather than mechanism-level explanation. Recent evidence reinforces this distinction between mechanistic understanding and deployment authority: a 53-percentage-point gap between internal representations and output correction shows that understanding may not translate into action, while one scoping review found that only 9.0% of FDA-approved AI/ML device documents contained a prospective post-market surveillance study. We propose Verification Coverage, a six-component reportable standard with a minimum-composition rule, as the metric that should sit beside capability scores in model cards, leaderboards, and regulatory disclosures.
- Abstract(参考訳): 医療、信用、雇用、刑事司法といった繊細な分野におけるAIの展開は、モデル内部が説明されるまでは安全ではないとして扱われることが多い。
これはしばしば、意図したスコープを超えたデプロイメント課題に取り組むための機械的解釈可能性への過度な依存につながります。
認証はドメインスコープで、独立してチェック可能で、リリース後に監視され、説明可能で、競争可能で、取り消し可能でなければなりません。
理由は2つある。
第一に、モデル能力は近隣のタスク間で不均一であるため、認証は一般的にモデルではなく特定の用途にアタッチする必要がある。
第二に、社会は長年、メカニズムレベルの説明よりも、資格、監視、責任、上訴、取り消しを通じて不透明な専門知識を統治してきた。
内部表現と出力補正の間の53パーセントの差は、理解が行動に変換されないことを示し、一方、あるスコーピングレビューでは、FDAが承認したAI/MLデバイス文書の9.0%に、市場後の監視研究が含まれていることがわかった。
モデルカード, リーダーボード, 規制開示の能力スコアの横に置かれるべき指標として, 最小構成ルールの6成分報告可能な標準である検証カバレッジを提案する。
関連論文リスト
- Reality Is the Final Verifier: On Two Key Gaps in Agentic Software Engineering [78.51705689800838]
本稿では, 要求, モデル, 評価器の見直しに, 展開証拠を用いた保証・修正ループを提案する。
そこで我々は,人的判断,エージェント能力,計算能力に対する資源配分問題としてエージェント開発を保証した。
論文 参考訳(メタデータ) (2026-09-10T17:58:48Z) - AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation [48.55515767840701]
AIスロープ(AI slop)は、アーティファクト、幻覚的脆弱性、可視だが正しくないパッチ、セマンティックに再パッケージされたバグレポートである。
本稿では,実証的証拠を調査し,統一メカニズムを特定し,信頼に値するトリアージへの道筋をたどる。
論文 参考訳(メタデータ) (2026-08-26T11:48:38Z) - One Gate Is Not Enough: Composing Stateful Pre-Action Controls for Agentic AI [0.0]
1つのコントロールが適用した修復は、他のコントロールが評価するアクション、エビデンス、コンテキストを変更し、そのコントロールの以前の判断を無効にすることができることを示す。
我々は、この結合を形式化し、現在の有界等質な設定において、アクションごとの音質を復元するremediate-and-regateプロトコルを提供する。
これは、生産の頻度に関する主張ではなく、合成メタデータ層によるオープンペイロードデータに対するメカニズム実証である。
論文 参考訳(メタデータ) (2026-08-18T22:24:44Z) - Scaling, Lock-In, and Proxy Compliance: A Political Economy of Responsible AI [1.253312107729806]
我々は、AIシステムの説明責任に対処するシーケンシャルな政治経済モデルを構築している。
我々は、AIベンダーが監査可能性と実体的緩和を選択し、デプロイはコストを切り替えながら導入後に監視し、実行は検証可能な証拠に依存することを示す。
その結果、ドキュメントと標準化された評価が、持続的なデプロイ後障害と共存する理由が説明できる。
論文 参考訳(メタデータ) (2026-07-30T11:12:13Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Interpretation, Learning, and Empathy as One Constraint: A Residual-Adequacy Architecture with Accountable Abstention [0.0]
一つの量から限界が生じる小さな認知アーキテクチャを開発する。
解釈決定ユニット(IDU)は、コンテントベクトルをレギュレーションのファミリを通じて解釈し、ライセンスするアクションを決定する。
任意のコンテンツと固定構成に対して、ユニークな端末証人を持つ有限個の有界コストステップで停止する。
論文 参考訳(メタデータ) (2026-05-24T10:57:28Z) - The Endogeneity of Miscalibration: Impossibility and Escape in Scored Reporting [2.3698341511302443]
自律エージェントからの真実の報告を排除することは、スケーラブルなAI監視における中核的な問題である。
プリンシパルは、厳密に適切なスコアリングルールを使用してエージェントのレポートをスコアリングするが、エージェントはまた、非正確チャンネルを通じてレポートの恩恵を受ける。
我々の主な成果は内在性であり、プリンシパルの最適監視は必ずしもスクリーンタイプに非ファイン承認関数を使用する。
論文 参考訳(メタデータ) (2026-05-08T12:42:28Z) - Making AI-Assisted Grant Evaluation Auditable without Exposing the Model [0.0]
本稿では,遠隔検定による要求の整合を支援するTEEアーキテクチャを提案する。
このアーキテクチャにより、外部検証者はどのモデル、ルーブリック、プロンプトテンプレート、入力表現が使われたかをチェックすることができる。
我々は、秘密のAI推論、証明可能なAI監査、ゼロ知識機械学習、アルゴリズムのアカウンタビリティ、AI支援ピアレビューに対する設計を位置付ける。
論文 参考訳(メタデータ) (2026-04-28T04:10:04Z) - IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory [73.22944697933603]
既存のパイプラインは不透明でエンドツーエンドの出力を生成し、検査の中間状態は公開しない。
IMPACT-Cycleは,マルチモーダル反復クレームレベルのメンテナンスとして,長時間ビデオ理解を再構築するマルチエージェントシステムである。
論文 参考訳(メタデータ) (2026-04-22T03:03:33Z) - Upholding Epistemic Agency: A Brouwerian Assertibility Constraint for Responsible AI [0.0]
責任を負うAIに対して,Brouwerにインスパイアされたアサービビリティ制約を提案する。
ハイテイクドメインでは、公に検査可能でコンテスト可能な権利証明書を提供する場合に限り、システムはクレームを主張または否定することができる。
論文 参考訳(メタデータ) (2026-03-04T12:14:21Z) - To Throw a Stone with Six Birds: On Agents and Agenthood [0.0]
Six Birds Theory (SBT)は、マクロな物体を原始体ではなく誘導的閉包として扱う。
SBT内では,タイプ正当性評価を行う。
我々はこの契約を4つのチェック可能なコンポーネントを用いて有限制御システムで運用する。
論文 参考訳(メタデータ) (2026-02-03T10:46:23Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations [60.27156500679296]
系統的な推論連鎖の摂動とデリバリートーンの操作による道徳シナリオにおけるCoT(Chain-of-Thought)の説明の役割について検討した。
1) 利用者は, 根拠に欠陥がある場合でも, 信頼感を保ち, 結果合意を信頼する傾向がみられた。
これらの結果は、CoTの説明が同時に明確化と誤解を招き、視覚的信頼よりも精査と批判的思考を奨励する説明を提供するNLPシステムの必要性を強調している。
論文 参考訳(メタデータ) (2025-11-15T02:38:49Z) - Judging by the Rules: Compliance-Aligned Framework for Modern Slavery Statement Monitoring [24.13989765643719]
現代の奴隷制度は世界中で何百万人もの人々に影響を与えており、現代の奴隷制度法のような規制の枠組みでは、企業が詳細な開示を公表する必要がある。
これらのステートメントは曖昧で矛盾することが多く、手作業によるレビューの時間とスケールが難しくなる。
専門家の監視を維持しつつルールレベルのコンプライアンス検証にAIを活用する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-11T03:41:44Z) - From Chaos to Clarity: Claim Normalization to Empower Fact-Checking [57.024192702939736]
Claim Normalization(別名 ClaimNorm)は、複雑でノイズの多いソーシャルメディア投稿を、より単純で分かりやすい形式に分解することを目的としている。
本稿では,チェーン・オブ・ソートとクレーム・チェック・バシネス推定を利用した先駆的アプローチであるCACNを提案する。
実験により, CACNは様々な評価尺度において, いくつかの基準値を上回る性能を示した。
論文 参考訳(メタデータ) (2023-10-22T16:07:06Z) - Auditing AI models for Verified Deployment under Semantic Specifications [65.12401653917838]
AuditAIは、解釈可能な形式検証とスケーラビリティのギャップを埋める。
AuditAIは、画素空間の摂動のみを用いた検証の限界に対処しながら、検証と認定トレーニングのための制御されたバリエーションを得られるかを示す。
論文 参考訳(メタデータ) (2021-09-25T22:53:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。