論文の概要: Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning
- arxiv url: http://arxiv.org/abs/2609.40286v1
- Date: Wed, 30 Sep 2026 17:48:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:28.24582
- Title: Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning
- Title(参考訳): LLMアンラーニングにおける言語的ループホール:174言語ベンチマークからカバー・アウェア・アンラーニングへ
- Abstract要約: ある言語で事実を学習することは、クエリを変更することや、要求された回答言語でさえ、忘れているように見えるような知識を再開できることから、他の言語で事実を除去することを保証しない。
本稿では,言語予算の多言語アンラーニングの課題を紹介し,言語間消去を最大化するサブセットを選択することを目的とする。
提案するCOVERは,ソース言語を選択して予測されたCOVERageを最大化する。
- 参考スコア(独自算出の注目度): 26.969524276157255
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unlearning a fact in one language does not guarantee its removal in others as changing the query or even the requested answer language can reopen seemingly forgotten knowledge -- a cross-lingual loophole. The most straightforward solution to this challenge -- unlearning in all languages -- is neither scalable nor desirable as it amplifies damage to unrelated model capabilities. We introduce the task of language budgeted multilingual unlearning where the goal is to select a subset of languages that maximizes cross-lingual erasure. To study this task we introduce the Cross-Lingual Unlearning Tensor, an unlearning benchmark that spans 174 language--script pairs and 25 atomic paraphrase types to examine when forgetting generalizes across linguistic expressions of the same knowledge. We further propose COVER, which selects source languages to maximize predicted COVERage of languages receiving no forget supervision, enabling unlearning on a language budget. Surprisingly, we find naively selecting strong individual sources does not reliably compose into strong source sets motivating our development of COVER. At deployment COVER only requires benign calibration data and access to the frozen model. Across three model families and two disjoint forget sets, COVER reduces mean held-out residual access by 7.8--27.3% relative to uniform source selection. We find these gains extend beyond synthetic benchmarks to real news documents in low-resource language settings using human translated data from the Low Resource Languages for Emergent Incidents (LORELEI) corpus.
- Abstract(参考訳): ある言語で事実を学習することは、クエリを変更することや、要求された回答言語でさえ、忘れられたような知識(言語横断の抜け穴)を再開できるため、他の言語の削除を保証しません。
この課題に対する最も簡単な解決策は、すべての言語で学習しないことですが、無関係なモデル機能に対するダメージを増幅するため、スケーラブルでも望ましくないものではありません。
本稿では,言語予算の多言語アンラーニングの課題を紹介し,言語間消去を最大化するサブセットを選択することを目的とする。
この課題を研究するために、クロスランガル・アンラーニング・テンソル(Cross-Lingual Unlearning Tensor)という174の言語-スクリプト対と25の原子パラフレーズ型にまたがるアンラーニング・ベンチマークを導入する。
さらにCOVERを提案する。このCOVERは,言語予算の未学習を考慮せずに,予測された言語を最大化するために,ソース言語を選択する。
驚いたことに、強いソースを選択的に選択することは、COVERの開発を動機付ける強力なソースセットに確実に構成されない。
デプロイ時にCOVERは、良性キャリブレーションデータと凍結モデルへのアクセスのみを必要とする。
3つのモデルファミリと2つの不整合忘れセットをまたいで、COVERは、均一なソース選択に対して平均保留残差アクセスを7.8~27.3%削減する。
提案手法は,Low Resource Languages for Emergent Incidents (LORELEI) コーパスの人間翻訳データを用いて,合成ベンチマークから,低リソース言語設定における実際のニュースドキュメントまで拡張されている。
関連論文リスト
- Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning [80.05116806217397]
大言語モデル(LLM)のアンラーニングは、汎用性を保ちながら、目標とする知識を抑えることを目的としている。
CLLPU(Cross-Lingual and Language-Bound Protocol for LLM Unlearning)は,この問題を2つの設定で定式化する多言語ベンチマークである。
目標とする知識がすべての言語で抑制されるべき共通目標の忘れ、言語条件の忘れ、抑圧は指定された言語に限定されるべきである。
論文 参考訳(メタデータ) (2026-09-05T08:26:15Z) - Paths Not Taken: Understanding and Mending the Multilingual Factual Recall Pipeline [36.2731426595852]
その結果,多言語大言語モデル (LLM) は,他の言語に比べて,実際のリコールタスクにおいて有意に優れた性能を示すことがわかった。
事実的リコールのための信頼性の高い英語中心のメカニズムの関与が不十分なことと、ターゲット言語への英語からの誤った翻訳である。
我々の介入によって、最低パフォーマンス言語では、リコール精度が35%以上向上しました。
論文 参考訳(メタデータ) (2025-05-26T22:20:45Z) - LIMIT: Language Identification, Misidentification, and Translation using
Hierarchical Models in 350+ Languages [27.675441924635294]
現在のシステムは世界の7000の言語の大部分を正確に識別することはできない。
まず、350以上の言語で50Kの多言語・並列児童話のコーパスMCS-350をコンパイルする。
言語識別のための新しい誤予測分解階層モデル LIMIt を提案する。
論文 参考訳(メタデータ) (2023-05-23T17:15:43Z) - No Language Left Behind: Scaling Human-Centered Machine Translation [69.28110770760506]
低レベルの言語と高レベルの言語のパフォーマンスギャップを狭めるためのデータセットとモデルを作成します。
何千ものタスクをトレーニングしながらオーバーフィッティングに対処するために,複数のアーキテクチャとトレーニングの改善を提案する。
本モデルでは,従来の最先端技術と比較して,BLEUの44%の改善を実現している。
論文 参考訳(メタデータ) (2022-07-11T07:33:36Z) - From Masked Language Modeling to Translation: Non-English Auxiliary
Tasks Improve Zero-shot Spoken Language Understanding [24.149299722716155]
非常に低リソースの方言を含む6言語ファミリーの13言語を対象に,言語間SlotとIntent Detectionの新しいベンチマークであるxSIDを紹介した。
本研究では,英語SLU学習データと原文,構文,翻訳による非英語補助課題を併用した共同学習手法を提案する。
その結果,マスキング言語モデルによる主タスクの学習はスロットに有効であり,機械翻訳は意図分類に最適であることがわかった。
論文 参考訳(メタデータ) (2021-05-15T23:51:11Z) - Cross-lingual Machine Reading Comprehension with Language Branch
Knowledge Distillation [105.41167108465085]
言語間機械読解(CLMRC)は、ローソース言語に大規模なデータセットがないため、依然として難しい問題である。
本稿では,Language Branch Machine Reading (LBMRC) という新しい拡張手法を提案する。
LBMRCは、個々の言語に精通したMultiple Machine Read comprehension (MRC)モデルを訓練する。
複数の言語分岐モデルから全ての対象言語に対する単一モデルへのアマルガメート知識の多言語蒸留アプローチを考案する。
論文 参考訳(メタデータ) (2020-10-27T13:12:17Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z) - XCOPA: A Multilingual Dataset for Causal Commonsense Reasoning [68.57658225995966]
XCOPA (Cross-lingual Choice of Plausible Alternatives) は11言語における因果コモンセンス推論のための多言語データセットである。
提案手法は,翻訳に基づく転送と比較して,現在の手法の性能が低下していることを明らかにする。
論文 参考訳(メタデータ) (2020-05-01T12:22:33Z) - Learning to Learn Morphological Inflection for Resource-Poor Languages [105.11499402984482]
本稿では,メタラーニング問題として資源不足言語に対する形態的インフレクション(補題を表象形にマッピングする)の課題を提案する。
それぞれの言語を個別のタスクとして扱うことで、高速ソース言語からのデータを使ってモデルパラメータの集合を学習する。
3つのファミリーから29のターゲット言語を対象とする2つのモデルアーキテクチャの実験により、提案手法がすべてのベースラインを上回ります。
論文 参考訳(メタデータ) (2020-04-28T05:13:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。