論文の概要: SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.27786v1
- Date: Fri, 26 Jun 2026 07:17:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-29 18:24:25.405353
- Title: SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation
- Title(参考訳): ShiFT:検索型世代における知識衝突軽減のためのゲート変調活性化ステアリング
- Abstract要約: 検索された文脈とパラメトリック知識の対立は、RAGシステムにおいて重要な課題となっている。
本稿では,ニューロンレベルの修飾を学習可能なゲート変調として再構成する新しいフレームワークShiFTを紹介する。
- 参考スコア(独自算出の注目度): 45.618428862766365
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-augmented generation (RAG) enhances LLMs by incorporating external knowledge to support response generation. However, conflicts between retrieved context and parametric knowledge have emerged as a critical challenge in RAG systems. To mitigate such conflicts, numerous studies have attempted to identify and edit knowledge-related internal neurons, aiming to improve the ability of LLMs to rely on contextual evidence during generation. However, these neuron-level approaches may introduce unintended cascading effects that compromise the general capabilities of LLMs, as the modified neurons are often entangled with broader model behaviors and functionalities. In this paper, we introduce SHIFT, a novel framework that reformulates neuron-level modification as learnable gate modulation, allowing LLMs to adaptively regulate internal activations for knowledge conflict resolution. Technically, our SHIFT equips LLMs with a lightweight gate module and optimizes fewer than 0.01% trainable parameters while keeping the backbone model frozen. During generation, the gate module adjusts the model's internal representations to adaptively leverage contextual and parametric knowledge. Extensive experiments on six datasets validate the effectiveness of our SHIFT in comparison with various competing baselines. All datasets and code are available at https://github.com/OpenBMB/SHIFT.
- Abstract(参考訳): Retrieval-augmented Generation (RAG)は、応答生成をサポートするために外部知識を組み込むことでLLMを強化する。
しかし、検索された文脈とパラメトリック知識の対立は、RAGシステムにおいて重要な課題となっている。
このような対立を和らげるために、多くの研究が、LLMの世代間における文脈的証拠に依存する能力を改善することを目的として、知識に関連する内部ニューロンの同定と編集を試みた。
しかしながら、これらのニューロンレベルのアプローチはLLMの一般的な能力を損なう意図しないカスケード効果をもたらす可能性がある。
本稿では,ニューロンレベルの修飾を学習可能なゲート変調として再構成し,LLMが知識衝突解決のための内部アクティベーションを適応的に制御できる新しいフレームワークShiFTを紹介する。
技術的には、当社のShiftは軽量ゲートモジュールをLLMに装備し、バックボーンモデルの凍結を維持しながら、0.01%未満のトレーニング可能なパラメータを最適化します。
生成中、ゲートモジュールはモデルの内部表現を調整し、文脈的およびパラメトリックな知識を適応的に活用する。
6つのデータセットに対する大規模な実験により、様々な競合するベースラインと比較して、Shiftの有効性が検証された。
すべてのデータセットとコードはhttps://github.com/OpenBMB/SHIFTで公開されている。
関連論文リスト
- Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer [65.72553715508691]
我々は,多段階の推論と構成決定を必要とするタスクにおいて,LVLMが強いテキストのみの大規模言語モデル(LLM)に遅れていることを示す。
LLMからLVLMへ成熟型推論回路を転送するパラメータ効率の高いフレームワークである共有ニューロン低ランク融合(SNRF)を提案する。
その結果、共有ニューロンはLLMとLVLMの間の解釈可能なブリッジを形成し、低コストでマルチモーダルモデルへの推論能力の移行を可能にした。
論文 参考訳(メタデータ) (2026-02-22T06:04:05Z) - Representation Interventions Enable Lifelong Unstructured Knowledge Control [54.86207134539453]
大規模言語モデル(LLM)は、しばしば誤った、または時代遅れのコンテンツを生成します。その知識を効率的に正確に更新し、コストのかかる再トレーニングなしにするというのは、大きな課題です。
本稿では,モデル表現空間内の介入として知識制御を扱う,堅牢でスケーラブルな手法であるRILKEを紹介する。
トレーニング中、RILKEはパラフレーズロバストと編集局所化モジュールを学び、低次元のサブスペースへの更新を制限し、クロスディジット干渉を最小限に抑える。
推論において、クエリ適応ルータは、モデル生成をガイドする適切なモジュールを選択する。
論文 参考訳(メタデータ) (2025-11-25T22:15:00Z) - TRAIL: Joint Inference and Refinement of Knowledge Graphs with Large Language Models [5.678291291711662]
TRAILは思考、推論、インクリメンタルラーニングのための、新しく統合されたフレームワークである。
共同推論と動的KG精製を大きな言語モデルと組み合わせる。
複数のベンチマークでの大規模な実験により、TRAILは既存のKG拡張および検索拡張LDMベースラインを3%から13%上回った。
論文 参考訳(メタデータ) (2025-08-06T14:25:05Z) - Prompting is not Enough: Exploring Knowledge Integration and Controllable Generation [89.65955788873532]
オープンドメイン質問応答(OpenQA)は自然言語処理(NLP)の基盤である。
我々は,知識統合と制御可能生成を探求し,OpenQAの性能向上を目的としたGenKIという新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T08:18:33Z) - Dynamic Parametric Retrieval Augmented Generation for Test-time Knowledge Enhancement [22.386864304549285]
Retrieval-augmented Generation (RAG)は、関連するドキュメントを外部ソースから取得し、コンテキストに組み込むことで、大きな言語モデル(LLM)を強化する。
文書をパラメトリックな知識に効率的に変換する軽量パラメータトランスレータモデルを活用する新しいフレームワークであるDynamic Parametric RAG(DyPRAG)を提案する。
論文 参考訳(メタデータ) (2025-03-31T09:46:35Z) - Reference Trustable Decoding: A Training-Free Augmentation Paradigm for Large Language Models [79.41139393080736]
大規模言語モデル(LLM)は急速に進歩し、印象的な機能を示している。
In-Context Learning (ICL) など。
効率的なファインチューニング(PEFT)は、現在2つの主要な拡張方法である。
下流タスクへのLLM。
我々は、モデルが微調整なしで新しいタスクに迅速に適応できるパラダイムである参照信頼復号(RTD)を提案する。
論文 参考訳(メタデータ) (2024-09-30T10:48:20Z) - CoMMIT: Coordinated Multimodal Instruction Tuning [90.1532838391285]
マルチモーダル大言語モデル(MLLM)は一般に、バックボーンLLMと非テキスト入力モードの特徴エンコーダ間の協調学習を含む。
本稿では,MLLM命令のチューニングを理論的・経験的両面から解析する。
本稿では,学習のバランスを定量的に測定できるマルチモーダルバランス係数を提案する。
論文 参考訳(メタデータ) (2024-07-29T23:18:55Z) - ThinkNote: Enhancing Knowledge Integration and Utilization of Large Language Models via Constructivist Cognition Modeling [55.21641515545307]
大規模言語モデル(LLM)は、幅広いNLPタスクにおいて強力なパフォーマンスを示している。
それらはしばしば、不慣れな外部情報に晒されたとき、最適でない行動と矛盾を示す。
本稿では,LLMの外部知識活用を促進する新しいフレームワークであるThinkNoteを提案する。
論文 参考訳(メタデータ) (2024-02-21T06:04:53Z) - CRaSh: Clustering, Removing, and Sharing Enhance Fine-tuning without
Full Large Language Model [22.870512676002463]
本稿では,集中型LCMと下流エミュレータ間でトランスフォーマブロックを転送する代表的手法であるOffsite-Tuning(OFT)に焦点を当てる。
これらの観測にインスパイアされたCRaShは、LCMから改善エミュレータを導出するトレーニングフリー戦略であるClustering、Removing、Sharingを含む。
以上の結果から,CRaShとOFTの有効性が明らかとなった。
論文 参考訳(メタデータ) (2023-10-24T03:08:58Z) - Gating creates slow modes and controls phase-space complexity in GRUs
and LSTMs [5.672132510411465]
ゲートの追加がGRUとLSTMの動的および訓練性に与える影響について検討した。
GRUの更新ゲートとLSTMの忘れゲートは、動的に遅いモードが蓄積される可能性があることを示す。
論文 参考訳(メタデータ) (2020-01-31T19:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。