論文の概要: Learning When Not to Decide: A Framework for Overcoming Factual Presumptuousness in AI Adjudication
- arxiv url: http://arxiv.org/abs/2604.19895v1
- Date: Tue, 21 Apr 2026 18:17:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-23 15:36:10.742477
- Title: Learning When Not to Decide: A Framework for Overcoming Factual Presumptuousness in AI Adjudication
- Title(参考訳): 決定しないときの学習 - AIの偏見を克服するためのフレームワーク
- Abstract要約: AIシステムのよく知られた制限は、情報が不足している場合、自信ある回答を提供する傾向にある。
この課題は、弁護士、裁判官、管理者にとって重要な課題が、結論に達するのに十分な証拠を判断することである。
我々は,この問題を,AIシステムの迅速な統合が見られた失業保険行政の重要条件として検討した。
- 参考スコア(独自算出の注目度): 4.991125406994611
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A well-known limitation of AI systems is presumptuousness: the tendency of AI systems to provide confident answers when information may be lacking. This challenge is particularly acute in legal applications, where a core task for attorneys, judges, and administrators is to determine whether evidence is sufficient to reach a conclusion. We study this problem in the important setting of unemployment insurance adjudication, which has seen rapid integration of AI systems and where the question of additional fact-finding poses the most significant bottleneck for a system that affects millions of applicants annually. First, through a collaboration with the Colorado Department of Labor and Employment, we secure rare access to official training materials and guidance to design a novel benchmark that systematically varies in information completeness. Second, we evaluate four leading AI platforms and show that standard RAG-based approaches achieve an average of only 15% accuracy when information is insufficient. Third, advanced prompting methods improve accuracy on inconclusive cases but over-correct, withholding decisions even on clear cases. Fourth, we introduce a structured framework requiring explicit identification of missing information before any determination (SPEC, Structured Prompting for Evidence Checklists). SPEC achieves 89% overall accuracy, while appropriately deferring when evidence is insufficient -- demonstrating that presumptuousness in legal AI is systematic but addressable, and that doing so is a necessary step towards systems that reliably support, rather than supplant, human judgment wherever decisions must await sufficient evidence.
- Abstract(参考訳): AIシステムは、情報が不足している場合、自信ある回答を提供する傾向にある。
この課題は、弁護士、裁判官、管理者にとって重要な課題が、結論に達するのに十分な証拠を判断することである。
我々は、AIシステムの迅速な統合と、追加の事実決定の問題が、毎年何百万人もの応募者に影響を与えるシステムにおいて、最も重大なボトルネックとなっている、失業保険の優遇という重要な状況の中で、この問題を考察する。
まず,コロラド州労働労働労働省と共同で,情報完全性を体系的に変化させる新しいベンチマークを設計するための公式のトレーニング資料とガイダンスへのアクセスを確保する。
第2に、4つの主要なAIプラットフォームを評価し、標準的なRAGベースのアプローチが、情報が不十分な場合に平均15%の精度しか達成できないことを示す。
第三に、先進的なプロンプト手法は、不確定ケースの精度を改善するが、過度に正確であり、明確なケースの意思決定を控える。
第4に,証拠チェックリスト(SPEC,Structured Prompting for Evidence Checklists)の前に,行方不明情報の明示的な識別を必要とする構造化フレームワークを導入する。
SPECは89%の精度を達成し、証拠が不十分な場合には適切に延期する -- 法的なAIの緊急性は体系的であるが、対処可能であることを示し、それを行うことは、決定が十分な証拠を待たなければならないという人間の判断に取って代わるのではなく、確実に支援するシステムへの必要なステップであることを示した。
関連論文リスト
- Bridging the First-Hour Gap: Evaluating AI Reliability and Benchmarking Deficiencies in Cyber Incident Response for Law Enforcement [0.0]
本稿では,サイバー犯罪の最初の対応者を支援するために設計された意思決定支援アーキテクチャを体系的に調査する。
本稿では,RAGに基づくシステムを自然言語適応性から,比較的有効な中間解として認識する。
我々は, 確実な堅牢性クエリとエビデンス保存に着目した新しい評価ベンチマークの必要性を論じる。
論文 参考訳(メタデータ) (2026-09-11T10:25:28Z) - Validity, Reliability, and Transparency in Artificial Intelligence Regulation [2.588958866512272]
記事は、現代のAIは、構築の妥当性、欠点、代表性、流通のシフト、公正なトレードオフに関する懸念を提起している。
我々は、比例評価とデプロイメント承認の前提条件として推論が機能すべきであると主張している。
論文 参考訳(メタデータ) (2026-08-06T09:36:15Z) - AILQA: Evaluating AI-Driven Legal Question Answering Systems for the Indian Legal System [11.383388187292674]
本研究は,インド法コンテキストに合わせて,高度なAI for Indian Legal Question Answering (AILQA)システムを提案する。
AILQAは、最近のLarge Language Models (LLMs)を含む、様々な埋め込みおよび生成モデルを活用する。
専門的な法的フィードバックに富んだ語彙的指標と意味的指標を用いて厳密な評価を行い,妥当性と正確性を確保した。
論文 参考訳(メタデータ) (2026-07-21T08:01:17Z) - FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition [54.31138496553705]
日常生活におけるきめ細かい認識は、しばしばクローズドブックの分類問題ではない。
既存のベンチマークは主に視覚的認識を評価しており、このアクティブな外部知識獲得能力は過小評価されている。
そこでは,システムが外部の証拠を探し,検証し,利用し,オープンエンドのきめ細かい認識質問に答えなければならない,きめ細かな知識獲得について検討する。
論文 参考訳(メタデータ) (2026-05-13T08:49:51Z) - Is your AI Model Accurate Enough? The Difficult Choices Behind Rigorous AI Development and the EU AI Act [11.9330079062021]
2024年欧州連合のAI法は、リスクの高いシステムに対して「適切なレベルの精度」を規定している。
本稿では, 精度の定義, 測定, 評価の方法を決定する選択について, 法的・技術的に分析した。
本論文は,AIガバナンスと規制に関する学際的な議論に,テクノ・ノーマティブな精度の次元を明確化することによって貢献する。
論文 参考訳(メタデータ) (2026-03-11T15:51:37Z) - Frontier AI Auditing: Toward Rigorous Third-Party Assessment of Safety and Security Practices at Leading AI Companies [57.521647436515785]
私たちはフロンティアAIの監査を、フロンティアAI開発者の安全とセキュリティに関する主張の厳格な第三者による検証として定義しています。
本稿では,AI保証レベル(AAL-1からAAL-4)について紹介する。
論文 参考訳(メタデータ) (2026-01-16T18:44:09Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Demystifying deep search: a holistic evaluation with hint-free multi-hop questions and factorised metrics [89.1999907891494]
We present WebDetective, a benchmark of hint-free multi-hop questions with a control Wikipedia sandbox。
25の最先端モデルに対する我々の評価は、すべてのアーキテクチャにまたがる体系的な弱点を明らかにしている。
私たちはエージェントワークフローであるEvidenceLoopを開発し、ベンチマークが特定する課題を明示的にターゲットしています。
論文 参考訳(メタデータ) (2025-10-01T07:59:03Z) - Judicial Requirements for Generative AI in Legal Reasoning [0.0]
大規模言語モデル(LLM)はプロのドメインに統合されているが、法律のような高度な分野における制限は理解されていない。
本稿では、AIシステムが司法判断における信頼性の高い推論ツールとして機能しなければならない中核機能について述べる。
論文 参考訳(メタデータ) (2025-08-26T09:56:26Z) - Towards Robust Fact-Checking: A Multi-Agent System with Advanced Evidence Retrieval [1.515687944002438]
デジタル時代における誤報の急速な拡散は、世論に重大な課題をもたらす。
従来の人間主導のファクトチェック手法は信頼できるが、オンラインコンテンツの量と速度に苦慮している。
本稿では, 精度, 効率, 説明性を向上する自動ファクトチェックのための新しいマルチエージェントシステムを提案する。
論文 参考訳(メタデータ) (2025-06-22T02:39:27Z) - Towards User-Centred Design of AI-Assisted Decision-Making in Law Enforcement [1.1890528509539204]
法執行機関におけるAI支援システムのユーザ要件は、まだ不明である。
本研究の参加者は,大量のデータを効率的に処理・分析できるシステムの必要性を強調した。
法執行ドメインの動的で複雑な性質のため、システムが完全な自動化を達成する可能性は極めて低い、と私たちは主張する。
論文 参考訳(メタデータ) (2025-04-24T09:25:29Z) - AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons [62.374792825813394]
本稿ではAI製品リスクと信頼性を評価するための業界標準ベンチマークとして,AIluminate v1.0を紹介する。
このベンチマークは、危険、違法、または望ましくない行動を12の危険カテゴリーで引き起こすように設計されたプロンプトに対するAIシステムの抵抗を評価する。
論文 参考訳(メタデータ) (2025-02-19T05:58:52Z) - Trustworthy AI [75.99046162669997]
入力データの小さな敵対的変化への脆さ、決定の説明能力、トレーニングデータのバイアスに対処する能力は、最も顕著な制限である。
我々は,AIシステムに対するユーザおよび公的な信頼を高める上での6つの重要な問題に対処するために,信頼に値するAIに関するチュートリアルを提案する。
論文 参考訳(メタデータ) (2020-11-02T20:04:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。