論文の概要: Stop Removing Stopwords: How an Inherited Preprocessing Default Distorts Legal Text-as-Data
- arxiv url: http://arxiv.org/abs/2609.19153v1
- Date: Tue, 21 Jul 2026 14:55:19 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.615909
- Title: Stop Removing Stopwords: How an Inherited Preprocessing Default Distorts Legal Text-as-Data
- Title(参考訳): ストップワードを削除するのをやめる - 継承されたプリプロセスのデフォルトの歪曲が法的テキスト・アズ・データにどのように影響するか
- Abstract要約: 本研究では、下流の目的に対して、前処理ステップの効果を直接測定する、徹底的な単一単語アブレーションを提案する。
F1ヘッドルーム、イデオロギーの方向性、憲法と非憲法の法則の2つのバイナリータスクについて検討する。
それぞれのタスクに対して、分析は専門家が構築できる最高のストップリストを近似し、およそ18,500の候補単語を削除します。
- 参考スコア(独自算出の注目度): 0.09444500584367876
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Empirical legal scholarship increasingly treats judicial text as data, and much of it still runs on sparse, interpretable pipelines -- TF-IDF features and linear classifiers -- because the textual feature is often the object of study, not merely a means to a prediction. Yet these pipelines inherit a chain of preprocessing defaults from mid-century information retrieval that were never validated against classification accuracy, the most entrenched being stopword removal. This study introduces an exhaustive single-word ablation that measures a preprocessing step's effect directly against the downstream objective, and applies it to stopword removal as the hardest case to dislodge. Matching Supreme Court Database labels to Caselaw Access Project opinion texts, it examines two binary tasks that bracket F1 headroom, ideological direction (no-removal baseline F1 ~ 0.68) and constitutional versus non-constitutional law type (~ 0.92), across 7,668 and 7,001 opinions. For each task the analysis approximates the best stoplist any expert could build, removing each of roughly 18,500 candidate words and measuring the effect directly. Three findings follow: generic stoplists in common use fall below the no-removal baseline in every test; even optimized stoplists are statistically indistinguishable from removing nothing; and meta-models trained on word-level features cannot predict which removals help, so list curation has nothing to target. The method generalizes to any inherited preprocessing default, and the result is a caution specific to interpretable legal text-as-data: a step that silently reshapes which features a model sees can distort the very doctrinal and ideological signal such research exists to recover. Leaving stopwords in place is a question of measurement validity.
- Abstract(参考訳): 実証的な法学奨学金は、司法テキストをデータとして扱う傾向が強まり、その多くはスパースで解釈可能なパイプライン -- TF-IDFの特徴と線形分類器 -- で運営されている。
しかし、これらのパイプラインは、分類精度に対して決して検証されなかった中世紀の情報検索から、一連の事前処理のデフォルトを継承する。
本研究は, ダウンストリーム目的に対して前処理ステップの効果を直接測定し, 停止語除去を最も難解な場合として適用する, 徹底的な単一単語アブレーションを提案する。
最高裁判所データベースのラベルをCaslaw Access Projectの意見テキストと照合し、F1のヘッドルーム、イデオロギーの方向性(非排除ベースラインF1 ~ 0.68)、憲法と非構成法(約 0.92)の2つのバイナリタスクを7,668と7,001の意見で比較した。
それぞれのタスクに対して、分析は専門家が構築できる最高のストップリストを近似し、およそ18,500の候補単語をそれぞれ取り除き、効果を直接測定する。
一般的な使用時のストップリストは、すべてのテストにおいて非削除ベースラインを下回る; 最適化されたストップリストでさえ、何も取り除くことは統計的に区別できない; 単語レベルで訓練されたメタモデルは、どの削除が役に立つかを予測できないので、リストのキュレーションは、何の標的にもならない。
この方法は、継承された前処理のデフォルトに一般化し、その結果は、解釈可能な法的なテキスト・アズ・データに特有の注意である。
停止語をそのまま残すことは、測定の妥当性の問題である。
関連論文リスト
- MWE-ECL: Recoverable Long-Range Context Does Not Always Override Local Lexical Priors [10.145570155173756]
長期コンテキスト評価は、モデルが遠い証拠を回収できるかどうかをしばしば検証するが、回復性は行動の影響を保証しない。
遠方ディコースアンカーが明示的に回復可能でありながら、慣れ親しんだマルチワード表現の読み方を変えることができないという予測を検証した。
両言語診断法であるMWE-ECL(Multiword Expression Effective Context Length)を導入する。
論文 参考訳(メタデータ) (2026-09-23T09:09:04Z) - How to Recognize New Words: A Comparison Between Context Biasing Methods and Speech LLMs [61.601626186678146]
音声大言語モデル(LLM)に対するWhisperに基づく2つの文脈バイアス法の評価を行った。
文脈バイアス法は、WERのバイアスを最大88%削減し、他の単語はほとんど影響を受けなかった。
音声LLMは読み上げ音声に優れるが、非読み出し音声にはあまり適さないため、散発的数に敏感であり、語順を誘導する。
論文 参考訳(メタデータ) (2026-08-06T08:45:33Z) - Data and Evaluation Closed-Loop for Model Capability Enhancement [8.245706308161504]
評価は直感的ではなく,日常的,監査可能,実験的に検証可能であることを示す。
評価データ間推論は直感的ではなく,日常的,監査可能,実験的に検証可能であることを示す。
論文 参考訳(メタデータ) (2026-06-26T14:45:57Z) - Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations [48.69228180369574]
ヘイトスピーチアノテーションはコストが高く、主観的で、アノテータの意見の相違がちである。
大規模言語モデル(LLM)が人間の判断とどのように一致しているかを分析する。
本研究では, ヘイトスピーチコーパスから連続ヘイトスピーチスコアを再構成する。
論文 参考訳(メタデータ) (2026-05-26T13:44:48Z) - How Does A Text Preprocessing Pipeline Affect Ontology Matching? [2.534284147778552]
トークン化と正規化(フェーズ1テキストプリプロセッシングに分類される)は、ストップワードの除去やステミング/レマタイズよりも効果的である。
本稿では,第2相テキスト前処理で発生する不要な偽マッピングを修復する2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T14:51:02Z) - Effects of term weighting approach with and without stop words removing
on Arabic text classification [0.9217021281095907]
本研究では,2項重み付け法と項重み付け法が停止語を除去した場合のテキストの分類方法に与える影響を比較検討した。
全ての指標に対して、停止語除去を伴う周波数特徴重み付け手法は二分法よりも優れている。
このデータから、同じフレーズ重み付け手法を用いて、停止語除去が分類精度を高めることは明らかである。
論文 参考訳(メタデータ) (2024-02-21T11:31:04Z) - Data-Driven Mitigation of Adversarial Text Perturbation [1.3649494534428743]
本研究では,NLPモデルを逆テキスト摂動に対して堅牢にするための難読化パイプラインを提案する。
CW2Vの埋め込みは、文字nグラムに基づく埋め込みよりも、テキストの摂動に対してより堅牢であることを示す。
我々のパイプラインはエンゲージメントベイト分類を0.70から0.67AUCに分類し、敵対的なテキストの摂動を発生させる。
論文 参考訳(メタデータ) (2022-02-19T00:49:12Z) - Semantic-Preserving Adversarial Text Attacks [85.32186121859321]
深層モデルの脆弱性を調べるために, Bigram と Unigram を用いた適応的セマンティック保存最適化法 (BU-SPO) を提案する。
提案手法は,既存手法と比較して最小の単語数を変更することで,攻撃成功率とセマンティックス率を最大化する。
論文 参考訳(メタデータ) (2021-08-23T09:05:18Z) - Challenges in Automated Debiasing for Toxic Language Detection [81.04406231100323]
バイアスド・アソシエーションは、有害な言語を検出するための分類器の開発において課題となっている。
我々は最近,有害な言語検出に適用されたテキスト分類データセットとモデルに対するデバイアス法について検討した。
我々の焦点は語彙(例えば、誓い言葉、スラー、アイデンティティの言及)と方言マーカー(特にアフリカ系アメリカ人の英語)である。
論文 参考訳(メタデータ) (2021-01-29T22:03:17Z) - Compressive Summarization with Plausibility and Salience Modeling [54.37665950633147]
本稿では,候補空間に対する厳密な構文的制約を緩和し,その代わりに圧縮決定を2つのデータ駆動基準,すなわち妥当性とサリエンスに委ねることを提案する。
提案手法は,ベンチマーク要約データセット上で強いドメイン内結果を得るとともに,人間による評価により,文法的および事実的削除に対して,可算性モデルが一般的に選択されることを示す。
論文 参考訳(メタデータ) (2020-10-15T17:07:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。