論文の概要: Can Legal AI Know When It Is Wrong? And Do Students Know When It Is?
- arxiv url: http://arxiv.org/abs/2608.21089v1
- Date: Fri, 21 Aug 2026 13:32:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.554096
- Title: Can Legal AI Know When It Is Wrong? And Do Students Know When It Is?
- Title(参考訳): 法的なAIはいつ間違っているのか?そして学生はいつあるのか?
- Abstract要約: 大規模言語モデル(LLM)をインド司法裁判所に統合することは、司法へのアクセスを約束するが、重大なリスクをもたらす。
我々は、ダニング・クルーガー効果に類似した過信現象である「信頼の慣性」を同定する。
危険確実性のある不正な判定を定量化するために,HCER(High-Confidence Error Rate)を導入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Integrating Large Language Models (LLMs) into the Indian judiciary promises access to justice but introduces severe risks. We identify the 'inertia of confidence'--an overconfidence phenomenon analogous to the Dunning-Kruger effect where LLMs provide incorrect legal verdicts with near-maximum confidence, driven by a hypothesized 'precedent overfitting' bias. Phase I of our socio-technical audit tested ChatGPT (GPT-5.2), Meta AI, and Perplexity AI on a 60-case battery regarding the Indian Contract Act, 1872, and the shift toward statutory enforcement of specific performance. We introduce the High-Confidence Error Rate (HCER) to quantify incorrect verdicts delivered with dangerous certainty (>= 9 on a 1-10 scale). All models struggled with statutory updates. Meta AI proved most vulnerable (31.7% HCER), frequently misapplying pre-amendment rules with a 9.1/10 mean confidence, followed by Perplexity (15.0%) and ChatGPT (6.7%). Phase II investigated human vulnerability to this overconfidence via a survey of Indian law students (N=380). Verification often functions as a reactive adaptation to machine hallucinations: students encountering fabricated citations reported higher verification scores (4.2/5) than those with no such encounters (2.8/5). Furthermore, while 81.6% knew submitting hallucinated cases can lead to contempt-of-court, 71.1% received no formal training on ethical AI use. We propose shifting toward adversarial legal research pedagogy and implementing source-grounded verification architectures to prevent systemic professional negligence.
- Abstract(参考訳): 大規模言語モデル(LLM)をインド司法裁判所に統合することは、司法へのアクセスを約束するが、重大なリスクをもたらす。
信頼の慣性(inertia of confidence) - LLMがほぼ最大信頼で誤った法的判断を下すDunning-Kruger効果に類似した過信現象。
社会技術監査のフェーズIでは、インド契約法(1872年)に関する60ケースのバッテリー上で、ChatGPT(GPT-5.2)、Meta AI、Perplexity AIをテストし、特定のパフォーマンスの法制化に向けて移行した。
本稿では, 信頼度誤差率(HCER)を導入し, 危険確実性(>=9, 1-10スケール)で納入した誤判定を定量化する。
全てのモデルは法改正に苦しんだ。
メタAIが最も脆弱(31.7% HCER)であることが判明し、修正前のルールを9.1/10の平均信頼度で誤って適用し、続いてPerplexity(15.0%)とChatGPT(6.7%)が続いた。
第2相は、インド法科学生の調査(N=380)を通じて、この過信に対する人間の脆弱性を調査した。
機械の幻覚への反応として、検証はしばしば機能する: 作製された引用に遭遇した学生は、そのような発見がない学生(2.8/5)よりも高い検証スコア(4.2/5)を報告した。
さらに81.6%は幻覚事件の提出が軽蔑につながることを知っていたが、71.1%は倫理的AI使用に関する正式な訓練を受けなかった。
本稿では,システム上の専門的過失を防止するため,逆法研究へのシフトと,根拠に基づく検証アーキテクチャの実装を提案する。
関連論文リスト
- NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs [0.20215383828623398]
安全対策を実証するフレームワークであるNiyam-AIを紹介する。
我々は,Ner-SafetyBenchとNeMo Guardrails,MetaのLlama Prompt Guard 2,OpenAIのGPT-OSS-Safeguardの2,000の現実世界シナリオについて,Niyam-AIを評価した。
Niyam-AIは390対NeMo(vs 20敗)、115対Prompt Guard 2(vs 13)、384対GPT-OSS-Safeguardで勝利した。
論文 参考訳(メタデータ) (2026-08-07T12:36:52Z) - The New Pro Se: Generative AI and the Surge in Federal Civil Self-Representation [0.015153489743575324]
生成AIツールへのアクセスが広まり、連邦民事訴訟はプロセ(自己表現された)原告が著しく増加した。
本稿では,280万件の申請書を用いてそのシフトを分析する。
連邦民事原告率は、GenAI以前の11.33%から、GenAI後の16.94%に増加した。
論文 参考訳(メタデータ) (2026-05-28T07:19:09Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - When AI reviews science: Can we trust the referee? [73.47745294608072]
私たちは、トレーニングとデータ検索、デスクレビュー、深いレビュー、反論、システムレベルといった、レビューライフサイクル全体のアタックをマップします。
評価スコアに高名度フレーミング, 断定力, 反抗薬効, 文脈中毒の因果効果を分離するために, 2つの高度なLCMベースの審判を用いた。
論文 参考訳(メタデータ) (2026-04-26T08:03:32Z) - Where Experts Disagree, Models Fail: Detecting Implicit Legal Citations in French Court Decisions [3.8449738927037207]
我々は,第一審裁判所の決定において,フランス民法典の暗黙の引用に焦点をあてる。
専門家の不一致がモデル失敗を予測することを示す。
これらの制限にもかかわらず、タスクをトップkランキングとして再検討し、マルチモデルコンセンサスを活用することで、教師なしの環境でk = 200で76%の精度が得られる。
論文 参考訳(メタデータ) (2026-03-24T09:10:57Z) - Measuring and Exploiting Confirmation Bias in LLM-Assisted Security Code Review [6.417595678110472]
ソフトウェアサプライチェーン攻撃において,確認バイアスがLSMベースの脆弱性検出に影響を及ぼすか,また,この障害モードを悪用できるかを検討する。
調査1では,5つのフレーミング条件下で4つの最先端モデルに対して評価された250個のCVE脆弱性/パッチペアに対する制御実験により,確認バイアスを定量化する。
調査2は、既知の脆弱性を再導入する敵のプルリクエストを模倣して、セキュリティの改善やプルリクエストメタデータによる緊急機能修正を実施可能であることを評価する。
論文 参考訳(メタデータ) (2026-03-19T10:40:27Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Powerful Training-Free Membership Inference Against Autoregressive Language Models [3.9380576851378657]
EZ-MIAは、重要な観測値を利用するメンバーシップ推論攻撃であり、記憶はエラー位置において最も強く現れる。
本稿では,誤差位置における確率シフトの方向不均衡を計測する誤差ゾーン(EZ)スコアを導入する。
その結果、微調整言語モデルのプライバシーリスクは、これまで理解されていたよりもかなり大きいことが判明した。
論文 参考訳(メタデータ) (2026-01-17T16:59:41Z) - To Err Is Human: Systematic Quantification of Errors in Published AI Papers via LLM Analysis [47.124493265404595]
我々の分析は客観的な誤り(例えば、公式の誤り、導出、計算、数値、表など)に焦点を当てており、それは明らかに検証可能な基礎的な真実である。
論文は、未確認の客観的な誤り数を含み、NeurIPS 2021の3.8からNeurIPS 2025の5.9(55.3%)まで、紙1枚あたりの誤り数の平均が時間とともに増加したことが判明した。
我々は、AIチェッカーが特定ミスの75.8%の修正を提案できることを示す。
論文 参考訳(メタデータ) (2025-12-05T18:04:10Z) - AI Debate Aids Assessment of Controversial Claims [73.8907110799657]
我々は、AI論争が、議論の的になっている事実性主張の側面に対立する2つのAIシステムを議論させることで、偏見のある裁判官を真実に導くことができるかどうかを調査する。
研究Iでは、議論は人間の判断精度と信頼性の校正を継続的に改善し、コンサルタントを上回ります。
研究IIでは、人間のような人格を持つAI裁判官は、人格を持たない人格(70.1%)やデフォルトのAI裁判官(69.8%)よりも高い精度(78.5%)を達成する。
これらの調査結果は、AIの議論が、競争対象ドメインにおけるスケーラブルでバイアス耐性のある監視への有望な道であることを示している。
論文 参考訳(メタデータ) (2025-06-02T19:01:53Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。