論文の概要: Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts
- arxiv url: http://arxiv.org/abs/2606.23375v1
- Date: Mon, 22 Jun 2026 14:08:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 19:24:33.036284
- Title: Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts
- Title(参考訳): 多言語刑事訴訟におけるLLMのオーバーアライメントの測定と緩和
- Authors: Arthur Wuhrmann, Gaetan Stein, Daniel Brunner, Andrei Kucharavy,
- Abstract要約: スイス連邦最高裁判所は、4つの公用語をまたいだ仮訳と短距離通訳の要約に小さなオンプレミスモデルを使用している。
本稿では,スイス最高裁判所の判決に基づく刑事法翻訳と要約のベンチマークであるTF-RefusalBenchを紹介する。
次に、TF-RefusalBenchを用いて、オーバーアライメントが処理中のモデルとプロンプトおよびテキスト言語の影響を受け、多面的現象であることを示す。
- 参考スコア(独自算出の注目度): 0.25604314983611276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While the wider applicability of LLMs in the legal field is currently debated due to their reliability and the gravity of any errors, narrow uses with well-understood and mitigated risks have emerged. Notably the Swiss Federal Supreme Court uses small on-premises models for tentative translations and short-passage summarization across the four official languages. However, such usage is challenging in the context of Criminal Law. Since rulings and cases employees work on routinely can contain detailed descriptions of violent and sexual offenses, their legitimate work is compromised by refusals and disclaimers due to the activation of model guardrails (over-alignment). To measure this phenomenon, we introduce TF-RefusalBench, a multilingual benchmark for criminal-law translation and summarization derived from public Swiss Supreme Court rulings. TF-RefusalBench contains 5,200 total prompts across French, German, Italian, and English, corresponding to common task prompts and passages likely to trigger refusal. We then use TF-RefusalBench to show that over-alignment is a multifaceted phenomenon, influenced by the model and the prompt and text languages being processed, and that its impact cannot be evaluated solely from an over-refusal perspective, given the disclaimer's impact on task faithfulness. Finally, we evaluate approaches to enable on-premises LLMs for Criminal Law Tasks, demonstrating that while prompting can be effective, abliteration (refusal directions ablation) eliminates refusal with minimal impact on task performance.
- Abstract(参考訳): 法分野における LLM の適用性は, 信頼性と誤差の重みから議論されているが, 十分に理解され, 緩和されたリスクを伴う狭義の使用が出現している。
特にスイス連邦最高裁判所は、4つの公用語の仮訳と短文要約に小さなオンプレミスモデルを使用している。
しかし、刑事法の文脈ではそのような使用は困難である。
従業員が日常的に行う判決や事件には暴力的・性的犯罪の詳細な記述が含まれているため、モデルガードレールのアクティベート(過度な調整)により、その正当性は拒絶や否定によって損なわれる。
TF-RefusalBenchは,スイス最高裁判所の判決に基づく刑事法翻訳と要約のための多言語ベンチマークである。
TF-RefusalBenchには、フランス語、ドイツ語、イタリア語、英語の合計5,200のプロンプトが含まれており、一般的なタスクのプロンプトや、拒絶を誘発する可能性のあるパスに対応している。
次に、TF-RefusalBenchを用いて、オーバーアライメントがモデルとプロンプトおよびテキスト言語の影響を受けて多面的現象であること、そしてその影響はタスクの忠実性に対する不服従者の影響を考えると、オーバーアライメントの観点からのみ評価できないことを示す。
最後に,犯罪法タスクのオンプレミスLLMを実現するためのアプローチを評価し,プロンプトが有効である一方で,失語(拒絶方向のアブレーション)がタスクパフォーマンスに最小限の影響で拒否を排除していることを示す。
関連論文リスト
- WisdomInterrogatory (LuWen): An Open-Source Legal Large Language Model Technical Report [55.27414605169639]
Wesdom Interrogatory (LuWen)は,バイチュン基礎モデルに基づいて構築された,オープンソースの中国語の法律モデルである。
予測と生成の両方にまたがる5つの代表的な法的課題についてLuWenを評価する。
論文 参考訳(メタデータ) (2026-04-08T06:59:07Z) - Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification [7.696781721646013]
ヘイトスピーチの解毒における虚偽の拒絶行動について検討する。
大規模言語モデル (LLM) は, 意味毒性が高い入力を不均等に拒否することを示す。
本稿では, 英語のヘイトスピーチを中国語に翻訳し, 解毒・復調するための単純な相互翻訳戦略を提案する。
論文 参考訳(メタデータ) (2026-01-13T15:45:31Z) - Large Language Models' Complicit Responses to Illicit Instructions across Socio-Legal Contexts [54.15982476754607]
大規模言語モデル(LLM)が前例のない規模に展開され、毎日のタスクで数百万のユーザを支援している。
本研究は、複雑なファシリテーションを、不正なユーザ指示を可能にするガイダンスやサポートの提供として定義する。
実世界の訴訟と確立された法的枠組みを用いて、269件の違法なシナリオと50件の違法な意図にまたがる評価ベンチマークを構築した。
論文 参考訳(メタデータ) (2025-11-25T16:01:31Z) - Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities [15.35489310097019]
CLAUSE は LLM の法的な推論の脆弱性を評価するために設計された第一種ベンチマークである。
我々の研究は、法的AIにおけるそのような推論失敗を特定し、修正する道筋を概説している。
論文 参考訳(メタデータ) (2025-11-01T00:51:21Z) - Not ready for the bench: LLM legal interpretation is unstable and out of step with human judgments [2.8622281002418357]
近年の学問では、法的実践者が解釈ツールキットに大きな言語モデル(LLM)を追加することが提案されている。
この研究は、法学者や連邦判事が最近実施したLSM解釈に対する実証的な議論を提供する。
我々の英語調査は、モデルが安定した解釈判断を提供していないことを示している。
論文 参考訳(メタデータ) (2025-10-29T10:21:25Z) - Universal Legal Article Prediction via Tight Collaboration between Supervised Classification Model and LLM [42.11889345473452]
法律記事予測(LAP)は、法的テキスト分類において重要な課題である。
法律記事予測のための普遍的な枠組みであるUni-LAPを提案する。
論文 参考訳(メタデータ) (2025-09-26T09:42:20Z) - Refusal Direction is Universal Across Safety-Aligned Languages [66.64709923081745]
本稿では,PolyRefuseを用いた14言語にわたる大規模言語モデル(LLM)の拒絶動作について検討する。
英語から抽出されたベクトルは、ほぼ完全な効果で他の言語での拒絶を回避できる。
この伝達性は、埋め込み空間における言語間の拒否ベクトルの並列性に起因し、言語間ジェイルブレイクの背後にあるメカニズムを同定する。
論文 参考訳(メタデータ) (2025-05-22T21:54:46Z) - DELTA: Pre-train a Discriminative Encoder for Legal Case Retrieval via Structural Word Alignment [55.91429725404988]
判例検索のための識別モデルであるDELTAを紹介する。
我々は浅層デコーダを利用して情報ボトルネックを作り、表現能力の向上を目指しています。
本手法は, 判例検索において, 既存の最先端手法よりも優れている。
論文 参考訳(メタデータ) (2024-03-27T10:40:14Z) - Multilingual Jailbreak Challenges in Large Language Models [96.74878032417054]
本研究では,大規模言語モデル(LLM)における多言語ジェイルブレイク問題の存在を明らかにする。
我々は、意図しないシナリオと意図的なシナリオの2つを考えます。
安全な微調整のための多言語学習データを自動的に生成する新しいtextscSelf-Defense フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-10T09:44:06Z) - A Legal Approach to Hate Speech: Operationalizing the EU's Legal
Framework against the Expression of Hatred as an NLP Task [2.248133901806859]
本稿では,刑法に従属するか否かの判断を運用することで,音声検出を嫌う「法的アプローチ」を提案する。
法的な判断を一連の単純なサブ決定に分解することで、素人でさえ一貫して注釈を付けることができることを示す。
論文 参考訳(メタデータ) (2020-04-07T14:13:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。