論文の概要: DKL: Decoupled Knowledge Learning for Instruction-Tuned Language Models
- arxiv url: http://arxiv.org/abs/2609.02685v1
- Date: Wed, 02 Sep 2026 14:53:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.423275
- Title: DKL: Decoupled Knowledge Learning for Instruction-Tuned Language Models
- Title(参考訳): DKL: 命令型言語モデルのための知識学習の分離
- Authors: Kushagra Bhushan, Meghanadh Pulivarthi, Sai Krishna Reddy Sathi, Gaurav Pandey, Sonam Gupta, Vineet Kumar, Jaydeep Sen, Yatin Nandwani, Sachindra Joshi, Dinesh Raghu,
- Abstract要約: RAGは、新しいコーパス固有の知識をLLMに続く命令に組み込むデファクトメソッドとなっている。
DKLは、高価な命令の微調整を避ける軽量な手法であり、新しい知識をインストラクションLLMに注入するためにマージモデルに依存している。
実験の結果、DKLは検索障害のケースでRAGの精度を54.17から79.26に改善し、トレーニングデータを大幅に減らして以前のアプローチより優れていた。
- 参考スコア(独自算出の注目度): 15.776675019787076
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: RAG has become the de facto method for incorporating new, corpus-specific knowledge into an instruction following LLM (Instruct LLM). Although RAG-based prompting improves factual grounding, it fails when retrieval is incorrect or incomplete, leading to hallucinations. Finetuning methods such as RAFT and PA-RAG enhance RAG by injecting new knowledge into the model's parameters, but require generating a massive amount of synthetic QA that covers the entire corpus. Extended Pre-Training (EPT) on the text corpus avoids the need for comprehensive synthetic data generation but compromises an Instruct LLM's instruction-following capabilities, necessitating instruction fine-tuning (IFT) after pre-training. However, IFT is costly and may be infeasible due to the unavailability of an instruction-tuning corpus. In this work, we propose DKL-Decoupled Knowledge Learning for Instruction-Tuned Language Models. Instead of doing EPT on the Instruct LLM, DKL performs EPT on its corresponding base LLM to infuse new knowledge. These knowledge infused weights are then merged with the Instruct LLM, imparting new knowledge without affecting their instruction-following capabilities. DKL is a lightweight method that avoids expensive instruction fine-tuning and relies on model merging to infuse the new knowledge into the Instruct LLM without destroying its instruction following capabilities. Empirical results show that DKL improves RAG accuracy from 54.17 to 79.26 on retrieval failure cases, while outperforming prior approaches with substantially less training data.
- Abstract(参考訳): RAGは、LLM(Instruct LLM)に続く命令に、新しいコーパス固有の知識を組み込むデファクトメソッドとなっている。
RAGベースのプロンプトは、事実的根拠を改善するが、検索が不正確または不完全であれば失敗し、幻覚につながる。
RAFTやPA-RAGのような微調整手法は、モデルパラメータに新しい知識を注入することでRAGを強化するが、コーパス全体をカバーする大量の合成QAを生成する必要がある。
テキストコーパス上の拡張事前学習(EPT)は、総合的な合成データ生成の必要性を回避するが、インストラクションLSMの命令追従能力を損なう。
しかし、IFTはコストがかかり、命令チューニングコーパスが利用できないため、実現不可能である可能性がある。
本研究では,DKL-Decoupled Knowledge Learning for Instruction-Tuned Language Modelを提案する。
Instruct LLMでEPTを行う代わりに、DKLは対応するベースLLMでEPTを実行し、新しい知識を注入する。
これらの知識を注入したウェイトはインストラクションLLMとマージされ、命令追従能力に影響を与えることなく新しい知識を与える。
DKLは、高価な命令の微調整を避ける軽量な手法であり、インストラクションLSMに新しい知識を注入するモデルマージに依存している。
実験の結果、DKLは検索障害のケースでRAGの精度を54.17から79.26に改善し、トレーニングデータを大幅に減らして以前のアプローチより優れていた。
関連論文リスト
- TRAIL: Joint Inference and Refinement of Knowledge Graphs with Large Language Models [5.678291291711662]
TRAILは思考、推論、インクリメンタルラーニングのための、新しく統合されたフレームワークである。
共同推論と動的KG精製を大きな言語モデルと組み合わせる。
複数のベンチマークでの大規模な実験により、TRAILは既存のKG拡張および検索拡張LDMベースラインを3%から13%上回った。
論文 参考訳(メタデータ) (2025-08-06T14:25:05Z) - LightPROF: A Lightweight Reasoning Framework for Large Language Model on Knowledge Graph [57.382255728234064]
大きな言語モデル(LLM)は、テキスト理解とゼロショット推論において素晴らしい能力を持っている。
知識グラフ(KG)は、LLMの推論プロセスに対して、リッチで信頼性の高いコンテキスト情報を提供する。
我々は、KGQA(LightPROF)のための新しい軽量で効率的なPrompt Learning-ReasOning Frameworkを提案する。
論文 参考訳(メタデータ) (2025-04-04T03:03:47Z) - Enhancing LLM Knowledge Learning through Generalization [73.16975077770765]
我々は,LLMが様々な言い換えの文脈に与えられた同じ事実的知識トークンを継続的に予測する能力は,質問応答によってその知識を抽出する能力と正の相関性を示す。
そこで本稿では,LLMの知識獲得能力を高めるための2つの戦略を提案する。
論文 参考訳(メタデータ) (2025-03-05T17:56:20Z) - Aligning Large Language Models to Follow Instructions and Hallucinate Less via Effective Data Filtering [66.5524727179286]
NOVAは、幻覚を減らすための学習知識とよく一致した高品質なデータを特定するために設計されたフレームワークである。
内部整合性探索(ICP)とセマンティック等価同定(SEI)が含まれており、LLMが命令データとどれだけ親しみやすいかを測定する。
選択したサンプルの品質を確保するため,親しみ以上の特性を考慮した専門家による報酬モデルを導入する。
論文 参考訳(メタデータ) (2025-02-11T08:05:56Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z) - Enhancing and Assessing Instruction-Following with Fine-Grained Instruction Variants [28.691691883519542]
複雑な命令を単純なサブコンポーネントに分解し、それらを修正し、それらを新しい変種に再構成する手法を導入する。
DeMoReconに基づくFGIVデータセットは,1,773個のシード命令の微粒化を含む。
以上の結果から,FGIVを微調整したLDMは,命令追従ベンチマークと一般的な命令追従ベンチマークの両方において,大幅な性能向上が期待できることがわかった。
論文 参考訳(メタデータ) (2024-06-17T08:08:11Z) - CEM: A Data-Efficient Method for Large Language Models to Continue Evolving From Mistakes [36.14056870453356]
大きな言語モデルを維持し、その欠点に対処するためには、継続的な学習が不可欠です。
本稿では,CPTデータ収集を目的としたデータ効率の高い手法であるCEM法を提案する。
実験の結果、CEMはドメイン内QAタスクとドメイン外QAタスクの両方で複数のモデルの性能を大幅に向上させ、最大29.63%のゲインを達成している。
論文 参考訳(メタデータ) (2024-04-11T17:44:56Z) - From Language Modeling to Instruction Following: Understanding the Behavior Shift in LLMs after Instruction Tuning [63.63840740526497]
そこで本研究では,本質的な変化に着目した事前学習モデルの調整方法について検討する。
次に、事前訓練されたモデルと命令調整されたモデルから導かれた説明を比較することで、命令チューニングの影響について研究する。
この結果から,指導指導の3つの重要な影響が明らかになった。
論文 参考訳(メタデータ) (2023-09-30T21:16:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。