論文の概要: Probing Factual Knowledge Transfer with Training Data Interventions
- arxiv url: http://arxiv.org/abs/2609.01341v1
- Date: Tue, 01 Sep 2026 14:51:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.780123
- Title: Probing Factual Knowledge Transfer with Training Data Interventions
- Title(参考訳): 訓練データ干渉による実地知識伝達の探索
- Authors: Romina Oji, Marc Braun, Marcel Bollmann, Marco Kuhlmann, Jenny Kunz,
- Abstract要約: 複数言語モデルが継続事前学習中に言語間で事実知識を伝達するかどうかを検討する。
我々は,20関係にまたがる500の3分の1の資源であるSIFTを構築する。
最も厳格な除去条件の下では、英語で取得した事実の大多数はペルシア語への移動に失敗する。
- 参考スコア(独自算出の注目度): 4.023417156982924
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Do multilingual language models transfer factual knowledge across languages during continued pretraining, or do they mostly recall facts learned directly from the target-language data? To answer this question more reliably, we propose an intervention-based framework: starting from an English-pretrained model, we continue pretraining on Persian data from which specific facts have been systematically removed at varying levels of granularity. We construct SIFT, a resource of 500 triples across 20 relations, stratified by the cultural origin of each fact's subject into general (globally prominent) and Persian-related entities, designed for both systematic fact removal from training data and evaluation, with natively written Persian cloze templates. Our results show that fact transfer is very limited: under the strictest removal condition, a large majority of English-acquired facts fail to transfer into Persian. We further show that sentence-level co-occurrence removal is insufficient to eliminate fact signal, and that easier (randomly selected) negative candidate sets substantially inflate apparent transfer by rewarding shallow associative heuristics, while performance on a harder candidate set that allows for less reliance on heuristics is much lower. Finally, we show that source-language entity frequency has a large influence, with Persian-related facts, which are orders of magnitude rarer in the English corpus, hardly transferring.
- Abstract(参考訳): 多言語モデルは、継続事前訓練中に言語間で事実知識を伝達するか、あるいはターゲット言語データから直接学んだ事実をほとんど思い出すか?
英語の事前学習モデルから始まり、特定の事実が様々な粒度のレベルで体系的に除去されたペルシャのデータを事前訓練し続けます。
我々は,20関係にまたがる500の3分の1の資源であるSIFTを構築し,各事実の主題の文化的起源を,学習データから体系的な事実除去と評価の両方を目的として,ペルシャのクローゼテンプレートをネイティブに記述した。
最も厳格な除去条件の下では、英語で取得した事実の大部分がペルシア語への移動に失敗する。
さらに、文レベルの共起除去は事実信号を排除するには不十分であり、より容易な(ランダムに選択された)負の候補セットは、浅い連想ヒューリスティックスに報いることにより、明らかな移動を著しく減少させ、一方、ヒューリスティックスへの依存を軽減できる厳しい候補セットの性能は、はるかに低いことを示す。
最後に、英語コーパスにおいて桁違いに稀なペルシャ語関連事実により、ソース言語の実体頻度に大きな影響を及ぼすことを示す。
関連論文リスト
- LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs [67.09110757873142]
言語間知識伝達の分離と計測を目的とした自動生成パイプラインであるLiveCLKTBenchを提案する。
我々のパイプラインは、実世界のドメインから自己完結した、時間に敏感な知識エンティティを識別する。
これらの有効なエンティティのドキュメントは、複数の言語に翻訳される事実的な質問を生成するために使用される。
論文 参考訳(メタデータ) (2025-11-03T17:06:49Z) - Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics [56.145578792496714]
大規模言語モデル(LLM)は言語間知識伝達に苦慮している。
我々は,この現象の原因とダイナミクスを,合成多言語データセット上でスクラッチから小さなトランスフォーマーモデルを訓練することによって研究する。
論文 参考訳(メタデータ) (2025-08-14T18:44:13Z) - Tracing Multilingual Factual Knowledge Acquisition in Pretraining [83.93508231653091]
大規模言語モデル(LLM)は、事前学習データに存在する多言語事実知識をリコールすることができる。
我々は,OLMo-7Bに焦点をあてて,事前学習中に現実のリコールと言語間の整合性がどのように進化するかを辿った。
ほとんどの言語では、正確性と一貫性が時間の経過とともに向上していることが分かりました。
論文 参考訳(メタデータ) (2025-05-20T18:39:56Z) - Extending LLMs to New Languages: A Case Study of Llama and Persian Adaptation [36.92567530333872]
我々は,大言語モデル(LLM)に新しい言語,すなわちペルシア語を追加することを研究する。
我々は単言語ペルシャ語のデータの事前学習を含む多段階的アプローチを採用する。
生成タスクと分類タスクにおいて,各段階でのモデルの性能を評価する。
論文 参考訳(メタデータ) (2024-12-17T23:18:06Z) - Language Contamination Explains the Cross-lingual Capabilities of
English Pretrained Models [79.38278330678965]
一般的な英語事前学習コーパスには、かなりの量の非英語テキストが含まれていることが判明した。
これにより、大規模なデータセットで数十億の外国語トークンが生成される。
そして、これらの少数の非英語データでさえ、それらに基づいて訓練されたモデルの言語間移動を促進することを実証する。
論文 参考訳(メタデータ) (2022-04-17T23:56:54Z) - On the Language Coverage Bias for Neural Machine Translation [81.81456880770762]
言語カバレッジバイアスは、ニューラルネットワーク翻訳(NMT)において重要である。
実験を慎重に設計することにより、トレーニングデータにおける言語カバレッジバイアスの包括的分析を行う。
本稿では,言語カバレッジバイアス問題を軽減するための,シンプルで効果的な2つのアプローチを提案する。
論文 参考訳(メタデータ) (2021-06-07T01:55:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。