論文の概要: Shortcut Learning in Legal Judgment Prediction: Empirical Evidence from the UK Employment Tribunal
- arxiv url: http://arxiv.org/abs/2607.04261v1
- Date: Sun, 05 Jul 2026 12:15:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.878661
- Title: Shortcut Learning in Legal Judgment Prediction: Empirical Evidence from the UK Employment Tribunal
- Title(参考訳): 司法判断予測におけるショートカット学習--英国雇用裁判所による実証的証拠
- Authors: Joe Watson, Joana Ribeiro de Faria, Marcus Tomalin, Måns Magnusson, Huiyuan Xie, Hao Tian Yeung, Felix Steffek,
- Abstract要約: 現在の法的判断予測(LJP)は、法定後の司法資料への依存によって制約されている。
本稿では,この文脈におけるショートカット学習について,英国雇用裁判所(UKET)の決定におけるクレームレベルの結果予測について検討する。
ホック後の司法文書で訓練されたLJPシステムの性能は,原資料の反省的な性質によって引き起こされることを示す。
- 参考スコア(独自算出の注目度): 2.5990507255170496
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Current Legal Judgment Prediction (LJP) is constrained by its reliance on post-hoc judicial materials, increasing the likelihood that models perform retrospective classification rather than true forecasting. This paper empirically investigates shortcut learning in this context by studying claim-level outcome prediction in UK Employment Tribunal (UKET) decisions. Using a corpus of 33,158 individual claims, we predict outcomes from claim texts and LLM-extracted case summaries, evaluating models ranging from interpretable TF-IDF-based classifiers to black-box LLMs. While headline predictive performance figures appear strong, we demonstrate that such performance in LJP systems trained on post-hoc judicial text can be driven by the retrospective nature of the source material. Stratifying the test data by human judgments of leakage reveals that performance increases where outcome-revealing cues are embedded in the narrative. Moreover, a model trained on just the 4% of features identified as leakage achieves high performance, outperforming human experts. These findings substantiate concerns that LJP performance may be exaggerated by linguistic artefacts. Yet this vulnerability is not fatal to the research agenda. Instead, post-hoc judgments might be treated as potentially contaminated texts, requiring active auditing. Retraining models after masking leakage features results in only a negligible reduction in Macro-F1. Hence, while models will opportunistically exploit shortcuts when available, they remain capable of extracting useful predictive signals when these artefacts are removed.
- Abstract(参考訳): 現在の法的判断予測(LJP)は、ホック後の司法資料への依存によって制約されており、モデルが真の予測よりもふりかえりの分類を行う可能性を高めている。
本稿では,この文脈におけるショートカット学習を,英国雇用裁判所(UKET)の判断におけるクレームレベルの結果予測によって実証的に検討する。
33,158個のクレームのコーパスを用いて、クレームテキストとLLM抽出ケース要約の結果を予測し、解釈可能なTF-IDF分類器からブラックボックスLLMまでの範囲のモデルを評価する。
ヘッドライン予測性能は高いように見えるが,ポストホックテキストで訓練されたLJPシステムにおけるそのような性能は,原資料の振り返りの性質によって駆動できることを示す。
漏えいの人による判断によるテストデータの階層化は、結果発見の手がかりが物語に埋め込まれている場合のパフォーマンスが向上することを明らかにする。
さらに、リークとして識別された機能の4%だけに基づいてトレーニングされたモデルは、高いパフォーマンスを実現し、人間の専門家より優れています。
これらの知見は,LJPのパフォーマンスが言語アーチファクトによって誇張される可能性があるという懸念を裏付けるものである。
しかし、この脆弱性は研究課題にとって致命的なものではない。
むしろ、ポストホックの判断は、潜在的に汚染されたテキストとして扱われ、アクティブな監査を必要とする。
マスキングリーク後のリトレーニングモデルでは、マクロF1が無視できる程度しか減少しない。
したがって、モデルは利用可能なショートカットを同時に活用するが、これらのアーティファクトが削除されたときに有用な予測信号を取り出すことができる。
関連論文リスト
- Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training [75.98427023288052]
LLM(Reasoning LLMs-as-Judges)は、推論モデルの成功を検証不可能な領域に拡張するための有望な道を提供する。
本研究では、強化学習に基づくLLMアライメントにおける非推論および推論判断の実際の影響について検討した。
我々は,高い効率の対向出力を生成することを学ぶことによって,理性判断訓練された政策が,そのような高い性能を達成することを見出した。
論文 参考訳(メタデータ) (2026-03-12T17:57:06Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - Legal experts disagree with rationale extraction techniques for explaining ECtHR case outcome classification [9.334783986218232]
解釈可能性(interpretability)は、法律分野における大規模言語モデルの応用に不可欠である。
本稿では,モデルに依存しない解釈可能性手法の比較分析フレームワークを提案する。
モデルが違反を予測する「理由」は,法の専門家とは大きく異なることを示す。
論文 参考訳(メタデータ) (2026-01-18T14:03:17Z) - Rethinking Legal Judgement Prediction in a Realistic Scenario in the Era of Large Language Models [3.552993426200889]
本研究ではインドにおける判断の文脈における現実的なシナリオにおける判断予測について検討する。
我々は,Llama-2 や GPT-3.5 Turbo などの LLM とともに,InLegalBERT,BERT,XLNet などのトランスフォーマーベースモデルを用いている。
LLMを用いた実験により, GPT-3.5 Turboは現実的なシナリオで優れており, 判定精度は高いことがわかった。
論文 参考訳(メタデータ) (2024-10-14T14:22:12Z) - The CLC-UKET Dataset: Benchmarking Case Outcome Prediction for the UK Employment Tribunal [0.41044181091229565]
この研究は、自動アノテーションのための大きな言語モデル(LLM)を用いており、結果としてCLC-UKETデータセットが作成される。
データセットは約19,000のUKETケースとそのメタデータで構成されている。
実験結果から、微調整トランスモデルはUKET予測タスクにおいてゼロショットおよび少数ショットLLMよりも優れていたことが示唆された。
論文 参考訳(メタデータ) (2024-09-12T14:51:43Z) - Understanding Privacy Risks of Embeddings Induced by Large Language Models [75.96257812857554]
大きな言語モデルは、人工知能の初期の兆候を示すが、幻覚に苦しむ。
1つの有望な解決策は、外部知識を埋め込みとして保存し、LLMを検索強化世代に支援することである。
近年の研究では、事前学習された言語モデルによるテキスト埋め込みから、元のテキストを部分的に再構築できることが実験的に示されている。
論文 参考訳(メタデータ) (2024-04-25T13:10:48Z) - Precedent-Enhanced Legal Judgment Prediction with LLM and Domain-Model
Collaboration [52.57055162778548]
法的判断予測(LJP)は、法律AIにおいてますます重要な課題となっている。
先行は、同様の事実を持つ以前の訴訟であり、国家法制度におけるその後の事件の判断の基礎となっている。
近年のディープラーニングの進歩により、LJPタスクの解決に様々なテクニックが使えるようになった。
論文 参考訳(メタデータ) (2023-10-13T16:47:20Z) - Exploiting Contrastive Learning and Numerical Evidence for Confusing
Legal Judgment Prediction [46.71918729837462]
訴訟の事実記述文を考慮し、法的判断予測は、事件の告訴、法律記事、刑期を予測することを目的としている。
従来の研究では、標準的なクロスエントロピー分類損失と異なる分類誤差を区別できなかった。
本稿では,モコに基づく教師付きコントラスト学習を提案する。
さらに,事前学習した数値モデルにより符号化された抽出された犯罪量による事実記述の表現をさらに強化する。
論文 参考訳(メタデータ) (2022-11-15T15:53:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。