論文の概要: Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning
- arxiv url: http://arxiv.org/abs/2609.05976v1
- Date: Sat, 05 Sep 2026 08:26:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.174618
- Title: Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning
- Title(参考訳): 言語間移動を超えて:多言語LLMアンラーニングにおける伝播境界のベンチマーク
- Abstract要約: 大言語モデル(LLM)のアンラーニングは、汎用性を保ちながら、目標とする知識を抑えることを目的としている。
CLLPU(Cross-Lingual and Language-Bound Protocol for LLM Unlearning)は,この問題を2つの設定で定式化する多言語ベンチマークである。
目標とする知識がすべての言語で抑制されるべき共通目標の忘れ、言語条件の忘れ、抑圧は指定された言語に限定されるべきである。
- 参考スコア(独自算出の注目度): 80.05116806217397
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM) unlearning aims to suppress target knowledge while preserving general capabilities. In multilingual settings, unlearning must additionally propagate within its intended linguistic scope. However, existing evaluations mainly measure cross-lingual transfer and cannot distinguish insufficient from excessive propagation. We introduce CLLPU (Cross-Lingual and Language-Bound Protocol for LLM Unlearning), a multilingual benchmark that formulates this problem through two settings: common-goal forgetting, where target knowledge should be suppressed across all languages, and language-conditioned forgetting, where suppression should remain confined to a designated language. CLLPU combines goal-guided topic pairing, schema-aware relation matching, and dual-anchor multilingual translation to construct 800 matched knowledge-unit pairs and 72,000 QA instances across ten languages. Experiments with six representative methods on Llama-3.1-8B-Instruct reveal opposite failure modes: forgetting remains incomplete when universal suppression is required, yet spreads beyond the intended boundary when language-conditioned confinement is required. We further find that general multilingual utility can conceal damage to neighbor knowledge. These findings establish propagation control as a central challenge for multilingual LLM unlearning. We publicly release CLLPU together with its construction pipeline.
- Abstract(参考訳): 大言語モデル(LLM)のアンラーニングは、汎用性を保ちながら、目標とする知識を抑えることを目的としている。
多言語設定では、アンラーニングはその意図する言語範囲内でさらに伝播する必要がある。
しかし、既存の評価は主に言語間移動を測り、過剰な伝播と不十分な区別はできない。
CLLPU (Cross-Lingual and Language-Bound Protocol for LLM Unlearning) は、共通ゴールドレッシング(Common-goal forgeting)と言語条件ドレッシング(Language-conditioned forgeting)という2つの設定でこの問題を定式化するマルチ言語ベンチマークである。
CLLPUは、ゴールガイド付きトピックペアリング、スキーマ対応リレーションマッチング、デュアルアンカー多言語翻訳を組み合わせて、10言語で800のマッチしたナレッジユニットペアと72,000のQAインスタンスを構築している。
Llama-3.1-8B-Instructの6つの代表的な手法による実験では、反対の障害モードが明らかにされている。
さらに、汎用多言語ユーティリティは、近隣の知識の損傷を隠蔽できることがわかった。
これらの知見は多言語LLMアンラーニングにおける中心的課題として伝搬制御を確立した。
私たちはCLLPUと建設パイプラインを共同で公開しています。
関連論文リスト
- Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance [30.9640918372872]
大規模言語モデル(LLM)は、高リソース言語と低リソース言語の間のデータ不均衡により、言語間タスクに苦しむ。
バイリンガル微調整やコントラストアライメントといった既存の手法は、言語間性能を向上させることができる。
事前学習期間中に言語間マッピングタスクを導入し,言語間アライメントを向上させることで,単言語間の流速を損なうことなく,言語間アライメントを向上させる。
論文 参考訳(メタデータ) (2026-04-12T11:43:25Z) - Layer-Targeted Multilingual Knowledge Erasure in Large Language Models [15.409568435026015]
多言語一般化を決定する鍵因子として介入深さを同定する。
本稿では,CKA(Centered Kernel Alignment)とLRDS(Lingguistic Regions Development Score)を用いて,中間的言語に依存しないレイヤを識別するフレームワークMUTEを提案する。
論文 参考訳(メタデータ) (2026-02-26T03:00:07Z) - Evaluating Cross-Lingual Unlearning in Multilingual Language Models [7.530890774798437]
部分空間射影は最小の劣化を伴って強い言語間忘れを実現する。
重み空間の幾何に依拠し、将来の未学習システムに対するサブスペースベースのアプローチを動機付けていることを示す。
論文 参考訳(メタデータ) (2026-01-10T20:27:32Z) - High-Dimensional Interlingual Representations of Large Language Models [65.77317753001954]
大規模言語モデル(LLM)は、多言語データセットに基づいて訓練され、言語間構造の形成を示唆する。
資源レベル, 類型, 地理的地域によって異なる31の多様な言語を探索する。
多言語 LLM は非一貫性な言語間アライメントを示す。
論文 参考訳(メタデータ) (2025-03-14T10:39:27Z) - Lens: Rethinking Multilingual Enhancement for Large Language Models [70.85065197789639]
大規模言語モデル(LLM)における多言語機能向上のための新しいアプローチであるLensを提案する。
Lensは2つの部分空間で機能する: 言語に依存しない部分空間で、ターゲット言語と中心言語を一致させて強力な意味表現を継承する部分空間、言語固有の部分空間で、ターゲット言語と中心言語を分離して言語的特異性を保存する部分空間である。
レンズは、モデルの英語能力を維持しながら、多言語のパフォーマンスを著しく向上させ、既存の訓練後のアプローチと比べて計算コストの低い結果を得る。
論文 参考訳(メタデータ) (2024-10-06T08:51:30Z) - Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models [62.91524967852552]
大規模言語モデル(LLM)は、多言語コーパスの事前訓練のため、一般的に多言語である。
しかし、これらのモデルは言語間の対応する概念、すなわち言語を横断的に関連付けることができるだろうか?
本研究は,言語横断的タスクにおける最先端LLMの評価である。
論文 参考訳(メタデータ) (2024-06-23T15:15:17Z) - GL-CLeF: A Global-Local Contrastive Learning Framework for Cross-lingual
Spoken Language Understanding [74.39024160277809]
この問題に対処するために,グローバルローカルコントラスト学習フレームワーク(GL-CLeF)を提案する。
具体的には、比較学習を採用し、二言語辞書を活用して、同じ発話の多言語ビューを構築する。
GL-CLeFは最高のパフォーマンスを達成し、言語間の類似した文の表現をうまくプルする。
論文 参考訳(メタデータ) (2022-04-18T13:56:58Z) - Inducing Language-Agnostic Multilingual Representations [61.97381112847459]
言語間の表現は、世界中のほとんどの言語でNLP技術が利用可能になる可能性がある。
i) 対象言語のベクトル空間をピボットソース言語に再配置すること、(ii) 言語固有の手段と分散を取り除くこと、(ii) 副産物としての埋め込みの識別性を向上すること、(iii) 形態的制約や文の並べ替えを除去することによって言語間の入力類似性を高めること、の3つのアプローチを検討する。
論文 参考訳(メタデータ) (2020-08-20T17:58:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。