論文の概要: Can a Language Model Learn Facts Continually in Its Weights?
- arxiv url: http://arxiv.org/abs/2607.11020v2
- Date: Tue, 14 Jul 2026 05:59:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 12:51:44.648812
- Title: Can a Language Model Learn Facts Continually in Its Weights?
- Title(参考訳): 言語モデルは重みの中でファクトを継続的に学習できるか?
- Authors: Charles O'Neill,
- Abstract要約: 継続的な学習は、トレーニング後の知識獲得を継続する言語モデルを約束する。
Qwen3モデルに記述された発明された事実を、20から100の書き込みのシーケンスを通じて追跡する。
事実は消去されることなく行動的に忘れられる。
- 参考スコア(独自算出の注目度): 0.11603243575080534
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Continual learning promises a language model that keeps acquiring knowledge after training, with each new fact written into its weights. Whether weight writes can support accumulation remains undecided. We follow invented facts written into Qwen3 models from creation through sequences of twenty to one hundred later writes, using held-out questions of five types, with the original model given the fact in its prompt as the reference. Across these experiments, the breadth of the training data determines the kind of knowledge created. Bare-statement training produces recitation, while diverse restatements reduce the recitation-to-use gap from 27.4 to 5.4 points without showing the model a conclusion. This difference carries into later writes: after twenty sequential writes, bare-statement facts retain 1% accuracy while facts written from broad study data retain 46%. We also find that facts can be behaviourally forgotten without being erased. Forgotten facts keep most of the log-probability added by their write, and under bare-statement training 70% of wrong answers about them contain the most recently written fact. The same writes barely degrade the model's use of facts in context, and a forgotten study fact supplied in the prompt recovers to 77-80% on its questions. These results describe knowledge that is stored but question-keyed: later writes redirect the questions that reached it. Damage to unrelated abilities tracks KL divergence from the original model, and the later writes cause interference regardless of how the earlier fact was stored. Broad data can create usable knowledge, and a frozen reference can preserve capability, but no intervention we tested, including those built on accurate local measurements of each write, keeps earlier facts reachable. When facts must be composed or survive later writes, the reliable channel is context rather than the weights.
- Abstract(参考訳): 継続的な学習は、トレーニング後の知識獲得を継続する言語モデルを約束する。
重み付けが蓄積をサポートするかどうかは未決定のままである。
Qwen3 モデルに記述された発明された事実を,20 から100 の逐次的な書き込みを経て,5 種類の持久質問を用いて追従する。
これらの実験全体を通して、トレーニングデータの幅は、生成された知識の種類を決定する。
ベアステートメントトレーニングはリサイクリングを生成するが、多様なリサイクリングはモデルに結論を与えることなく、リサイクリングと使用のギャップを27.4ポイントから5.4ポイントに減らす。
20のシーケンシャルな書き込みの後、ベアステートメントの事実は1%の精度を保ち、幅広い研究データから書かれた事実は46%を保っている。
また、事実が消去されることなく行動的に忘れられることもわかりました。
忘れられた事実は、書き込みによってほとんどのログ確率が加算され、ベアステートメントトレーニングの下では、それらに関する間違った回答の70%が、最も最近書かれた事実を含んでいる。
同じ文章は、文脈におけるモデルによる事実の使用をほとんど劣化させておらず、プロンプトで提供された忘れられた研究事実は、質問に対して77-80%まで回復する。
これらの結果は、保存されているが質問キーが付けられている知識を記述している。
関連のない能力に対する損傷は、元のモデルからKLの分岐を追跡し、後続の書き込みは、以前の事実がどのように保存されたかに関わらず干渉を引き起こす。
広範のデータは使用可能な知識を生み出し、凍結参照は機能を保存することができますが、各書き込みの正確なローカル測定に基づいて構築されたものを含む、テストした介入は、以前の事実を到達可能とします。
事実を構成するか、後で書き残さなければならない場合、信頼できるチャンネルは重みよりもコンテキストである。
関連論文リスト
- Learning and Unlearning of Fabricated Knowledge in Language Models [16.971082623826263]
共通知識と矛盾する事実が数万のトレーニングステップで記憶されていることを示す。
LMにおける知識共用事実の影響は,長期にわたる可能性があるが,マルチステップスパース更新の新たな適用により,ほぼ消去可能であることを示す。
論文 参考訳(メタデータ) (2024-10-29T05:33:14Z) - Understanding Finetuning for Factual Knowledge Extraction [45.398982602347765]
本研究は,事前学習中に不備な既知事実の微調整は,事前学習中にすべての事実が見られた場合でも,既知事実の微調整よりもはるかに悪い事実性を示すものであることを示す。
その結果,事前学習した知識と微調整データとの相互作用に光を当て,知識集約的なタスクを微調整する場合に,事実が事前学習されたモデルにどのように格納されているかを考慮することが重要であることを示した。
論文 参考訳(メタデータ) (2024-06-20T23:27:06Z) - MuLan: A Study of Fact Mutability in Language Models [50.626787909759976]
信頼できる言語モデルは、理想的には変更可能な事実をそのようなものとして識別し、それに従って処理する。
MuLanは、英語モデルが時間一貫性を予測できる能力を評価するためのベンチマークです。
論文 参考訳(メタデータ) (2024-04-03T19:47:33Z) - Mitigating Temporal Misalignment by Discarding Outdated Facts [58.620269228776294]
大規模な言語モデルは、しばしば時間的ミスアライメントの下で使われ、現在に関する質問に答える。
我々は、ある事実がいつまで真実であるかを予測するタスクとして、事実期間予測を提案する。
私たちのデータとコードはhttps://github.com/mikejqzhang/mitigating_misalignment.comで公開されています。
論文 参考訳(メタデータ) (2023-05-24T07:30:08Z) - MQuAKE: Assessing Knowledge Editing in Language Models via Multi-Hop Questions [75.21713251369225]
編集されたモデルが正しい解答を行うかどうかを評価するマルチホップ質問を含むベンチマークMQuAKEを提案する。
本稿では,メモリベースのアプローチであるMeLLoを提案する。これは,編集された事実に整合した回答を生成するために,言語モデルを反復的に促しながら,すべての編集された事実を外部に保存する。
論文 参考訳(メタデータ) (2023-05-24T06:48:41Z) - RECKONING: Reasoning through Dynamic Knowledge Encoding [51.076603338764706]
言語モデルは、文脈の一部として提供される知識について推論することで、質問に答えることができることを示す。
これらの状況では、モデルは質問に答えるために必要な知識を区別することができない。
我々は、与えられた文脈知識をモデルのパラメータに折り畳み、より堅牢に推論するようにモデルに教えることを提案する。
論文 参考訳(メタデータ) (2023-05-10T17:54:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。