論文の概要: Decoupled Mixture-of-Experts for Parametric Knowledge Injection
- arxiv url: http://arxiv.org/abs/2606.14243v1
- Date: Fri, 12 Jun 2026 08:21:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 16:00:42.824393
- Title: Decoupled Mixture-of-Experts for Parametric Knowledge Injection
- Title(参考訳): パラメトリック知識注入のためのデカップリング・ミックス・オブ・エクスプロイト
- Authors: Baoqing Yue, Weihang Su, Qingyao Ai, Yichen Tang, Changyue Wang, Jiacheng Kang, Jingtao Zhan, Yiqun Liu,
- Abstract要約: Decoupled Mixture-of-Experts (DMoE) はパラメトリックな知識注入のためのモジュラーアーキテクチャである。
DMoEは外部知識コーパスを独立してアップグレード可能なエキスパートモジュールに変換し、関連する専門家を活性化するために軽量不確実性対応ルータを使用する。
知識集約型ベンチマークの実験では、DMoEは検索やアダプタベースのベースラインよりも回答品質を一貫して改善している。
- 参考スコア(独自算出の注目度): 29.992826207672568
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Knowledge injection aims to equip large language models (LLMs) with external, domain-specific, or time-sensitive knowledge. Existing approaches typically face a trade-off between flexibility and integration: retrieval-augmented generation keeps knowledge outside the model but only provides prompt-level augmentation, whereas post-training based methods encode new knowledge into shared parameters but may introduce catastrophic forgetting, knowledge conflict, and costly updates. In this paper, we propose Decoupled Mixture-of-Experts (DMoE), a modular architecture for parametric knowledge injection that decouples both experts and the router from the base model. DMoE converts external knowledge corpora into independently updatable expert modules and uses a lightweight uncertainty-aware router to activate relevant experts only when the base model lacks sufficient knowledge during generation. To support efficient auto-regressive inference, DMoE attaches experts only to the final-layer feed-forward network, preserving KV-cache reuse while enabling parameter-level knowledge augmentation. Experiments on knowledge-intensive benchmarks show that DMoE consistently improves answer quality over retrieval and adapter-based baselines.
- Abstract(参考訳): 知識注入は、大きな言語モデル(LLM)に外部、ドメイン固有、タイムセンシティブな知識を付与することを目的としている。
既存のアプローチは、柔軟性と統合のトレードオフに直面している: 検索強化生成は、モデル外で知識を保持するが、プロンプトレベルの拡張しか提供しない。
本稿では,エキスパートとルータをベースモデルから切り離すパラメトリック知識注入のためのモジュールアーキテクチャであるDecoupled Mixture-of-Experts (DMoE)を提案する。
DMoEは外部知識コーパスを独立してアップグレード可能なエキスパートモジュールに変換し、ベースモデルが生成時に十分な知識を欠いている場合にのみ、関連する専門家を活性化するために軽量不確実性対応ルータを使用する。
効率的な自己回帰推論をサポートするために、DMoEは専門家を最終層フィードフォワードネットワークのみにアタッチし、パラメータレベルの知識拡張を可能にしながらKVキャッシュの再利用を保存する。
知識集約型ベンチマークの実験では、DMoEは検索やアダプタベースのベースラインよりも回答品質を一貫して改善している。
関連論文リスト
- Dynamic Mixture of Latent Memories for Self-Evolving Agents [57.20419419302731]
MoLEMは、動的混合(MoE)に基づく潜在メモリフレームワークの生成混合物である。
我々は、数学、科学、コードドメインにまたがる連続的な学習シーケンスに基づいて、このフレームワークを訓練する。
連続学習を完了した後、Vanilla事前学習ベースラインよりも平均精度を10.40%向上させる。
論文 参考訳(メタデータ) (2026-05-21T03:35:10Z) - DeepRefine: Agent-Compiled Knowledge Refinement via Reinforcement Learning [60.35032268606525]
エージェントコンパイルされた知識ベースは、下流タスクにおいて、大きな言語モデル(LLM)エージェントに対して永続的な外部知識を提供する。
しかし、その品質は、不完全性、不完全性、浮揚性によって体系的に制限される
論文 参考訳(メタデータ) (2026-05-11T12:48:31Z) - Knowledge Capsules: Structured Nonparametric Memory Units for LLMs [0.6524460254566904]
大規模言語モデル(LLM)はパラメトリックウェイトで知識を符号化し、再トレーニングすることなく更新や拡張にコストがかかる。
Retrieval-augmented Generation (RAG)は、検索したテキストを入力に追加することで、この制限を緩和するが、コンテキスト拡張を通じて純粋に動作する。
正規化された関係知識を表す非パラメトリックメモリユニットである知識カプセルを提案する。
論文 参考訳(メタデータ) (2026-04-22T12:21:00Z) - Split-on-Share: Mixture of Sparse Experts for Task-Agnostic Continual Learning [10.01449025634975]
大規模言語モデル(LLM)における連続学習は、可塑性安定性ジレンマによって妨げられる。
モデルをモジュラー部分空間に分解することで可塑性と安定性の衝突を解決するフレームワークであるSETAを紹介する。
SETA は,パラメータ効率のよい連続学習法よりも常に優れていることを示す。
論文 参考訳(メタデータ) (2026-01-24T22:39:22Z) - PropMEND: Hypernetworks for Knowledge Propagation in LLMs [82.99849359892112]
本稿では,PropMENDという,ハイパーネットワークに基づく知識伝播手法を提案する。
インジェクションされた事実に回答が明記されていないマルチホップ質問に対して,ほぼ2倍の精度で回答を提示する。
我々はまた、ハイパーネットワークの一般化を評価するために、新しいデータセットである Controlled RippleEdit も導入した。
論文 参考訳(メタデータ) (2025-06-10T15:44:19Z) - Decoupling Reasoning and Knowledge Injection for In-Context Knowledge Editing [12.5122702720856]
インコンテキスト編集(ICE)は、入力コンテキストに直接新しい知識を注入することで、軽量なソリューションを提供する。
既存のICEアプローチは、新しく注入された知識をモデル本来の推論プロセスから明確に分離するものではない。
マスク付き推論経路を生成することで知識編集から推論を分離する新しいICEフレームワークであるDecKERを提案する。
論文 参考訳(メタデータ) (2025-05-31T12:51:12Z) - GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation [108.2008975785364]
Graph Inspired Veracity Extrapolation (GIVE)は、パラメトリックメモリと非パラメトリックメモリを融合して、最小の外部入力で正確な推論を改善する新しい推論手法である。
GIVE は LLM エージェントをガイドして,最も関連する専門家データ (observe) を選択し,クエリ固有の発散思考 (reflect) に従事し,その情報を合成して最終的な出力 (speak) を生成する。
論文 参考訳(メタデータ) (2024-10-11T03:05:06Z) - MATTER: Memory-Augmented Transformer Using Heterogeneous Knowledge Sources [12.783393023641505]
我々は、MATTERと呼ばれる効率的なメモリ拡張変換器を導入する。
MATTERは、固定長のニューラルメモリの形で、非構造化ソース(パラグラフ)と半構造化ソース(QAペア)の両方から読み取る。
提案モデルでは,従来のQAベンチマークにおいて,精度と速度の両面で,既存の効率的な検索強化モデルよりも優れていることを示す。
論文 参考訳(メタデータ) (2024-06-07T06:35:37Z) - Auto-selected Knowledge Adapters for Lifelong Person Re-identification [54.42307214981537]
Lifelong Person Re-Identificationは、異なる時間と場所にわたる重複しないデータセットから継続的に学習するシステムを必要とする。
リハーサルのない、あるいはリハーサルベースの既存のアプローチは、依然として破滅的な忘れ込みの問題に悩まされている。
本稿では,知識アダプタを採用した新しいフレームワークであるAdalReIDと,生涯学習のためのパラメータフリー自動選択機構を提案する。
論文 参考訳(メタデータ) (2024-05-29T11:42:02Z) - Kformer: Knowledge Injection in Transformer Feed-Forward Layers [107.71576133833148]
そこで我々は,Transformerのフィードフォワード層を通じて外部知識を組み込んだ新しい知識融合モデルKformerを提案する。
FFNに単に知識を注入するだけで、事前学習された言語モデルの能力が向上し、現在の知識融合法が促進されることを実証的に見出した。
論文 参考訳(メタデータ) (2022-01-15T03:00:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。