論文の概要: An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS
- arxiv url: http://arxiv.org/abs/2609.13624v2
- Date: Thu, 17 Sep 2026 14:45:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.395039
- Title: An Efficient and Modular Framework for Targeted Harm Mitigation in LLMS
- Title(参考訳): LLMSにおける高調波低減のための効率的かつモジュール型フレームワーク
- Abstract要約: 大規模言語モデル(LLM)は強力なゼロショット学習者であるが、人間の好みに反する傾向にある。
アクティベートされたLoRAアダプタとコンテキスト対応のルーティング機構により,事前学習したLLMを拡張可能なモジュール補正フレームワークを提案する。
- 参考スコア(独自算出の注目度): 3.37470725921294
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are powerful zero-shot learners but remain prone to misalignment with human preferences, often producing biased, toxic, or otherwise harmful outputs. Existing alignment methods, while effective, are costly and tightly coupled to the model, limiting flexibility and scalability. We propose a modular correction framework that augments pretrained LLMs with Activated LoRA (aLoRA) adapters and a context-aware routing mechanism to eliminate harms from misaligned model responses. Our approach enables expert adapters to activate mid-sequence without invalidating the KV cache, allowing low-latency, targeted correction during generation. Each expert is trained to detect and mitigate specific harms, such as bias or toxicity. A learned router dynamically selects appropriate experts based on the models intermediate outputs. We demonstrate that our system improves alignment on standard safety benchmarks while preserving task performance, offering a lightweight and efficient path toward safer and more controllable LLM deployments.
- Abstract(参考訳): 大きな言語モデル(LLM)は強力なゼロショット学習者であるが、人間の嗜好に反する傾向にあり、しばしばバイアス、有害、その他の有害なアウトプットを生み出す。
既存のアライメントメソッドは、有効ではあるが、柔軟性とスケーラビリティを制限し、モデルとコストと密結合している。
アクティベートされたLoRA(aLoRA)アダプタとコンテキスト対応のルーティング機構で事前学習したLLMを拡張し,不整合モデル応答からの害を解消するモジュール補正フレームワークを提案する。
提案手法では,KVキャッシュを無効にすることなく,エキスパートアダプタが中間シーケンスを活性化し,生成中の低レイテンシ,ターゲット修正を可能にする。
各専門家は、偏見や毒性などの特定の害を検出し、軽減するよう訓練される。
学習ルータは、モデル中間出力に基づいて適切な専門家を動的に選択する。
我々は,タスク性能を維持しつつ,標準安全ベンチマークのアライメントを改善し,より安全で制御しやすいLCMデプロイメントへの軽量で効率的な経路を提供することを示した。
関連論文リスト
- Distilling Safe LLM Systems via Soft Prompts for On Device Settings [15.154042788412879]
本稿では,資源制約設定のためのパラメータ効率の高い安全アライメント手法を提案する。
蒸留法に基づく訓練とソフトプロンプトが相まって、代替手法を一貫して上回っていることを確認した。
論文 参考訳(メタデータ) (2026-06-08T12:03:51Z) - RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering [62.63376387138257]
本稿では,アクティベーション空間における大規模言語モデル(LLM)推論を適応的に制御するプラグイン・アンド・プレイ介入フレームワークを提案する。
RISERは再利用可能な推論ベクトルのライブラリを構築し、軽量ルータを使用して各入力に対して動的に構成する。
ルーターは、タスクレベルの報酬の下で強化学習を通じて最適化され、緊急かつ構成的な方法で潜在する認知的プリミティブを活性化する。
論文 参考訳(メタデータ) (2026-01-14T08:04:33Z) - Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models [3.710103086278309]
大規模言語モデル(LLM)は通常、トレーニング後の段階で安全のために整列される。
ユーザに対してリスクをもたらす可能性のある,不適切なアウトプットを生成することも可能だ。
この課題は、モデル入力と出力の両方にわたって動作する堅牢なセーフガードの必要性を浮き彫りにする。
論文 参考訳(メタデータ) (2025-12-05T00:43:55Z) - SEQR: Secure and Efficient QR-based LoRA Routing [53.52716967527183]
Low-Rank Adaptation (LoRA) は,大規模言語モデルのパラメータ効率向上のための標準手法となっている。
与えられた入力に対して適切なLoRAアダプタを効果的に選択することは依然として困難である。
厳密なルーティング保証を提供しながら効率を最大化するために設計された、教師なしのLoRAルーティングアルゴリズムであるSEQRを導入する。
論文 参考訳(メタデータ) (2025-09-22T17:59:38Z) - Attribution-guided Pruning for Compression, Circuit Discovery, and Targeted Correction in LLMs [15.23174472320989]
大規模言語モデル(LLM)は多くの現代のAIアプリケーションの中心である。
eXplainable AI(XAI)の最近の研究は、解釈可能性がモデル圧縮を可能にすることを示唆している。
論文 参考訳(メタデータ) (2025-06-16T17:38:36Z) - Robust Anti-Backdoor Instruction Tuning in LVLMs [53.766434746801366]
大規模視覚言語モデル(LVLM)のための軽量で認証に依存しない防御フレームワークについて紹介する。
私たちのフレームワークは、命令チューニングの下で、アダプタモジュールとテキスト埋め込み層のみを微調整します。
Flickr30kとMSCOCOに対する7つの攻撃に対する実験は、我々の攻撃の成功率をほぼゼロに低下させることを示した。
論文 参考訳(メタデータ) (2025-06-04T01:23:35Z) - Guiding Giants: Lightweight Controllers for Weighted Activation Steering in LLMs [8.085475675888045]
アクティベーションステアリングは、推論時間制御の代替を提供する。
推論中に軽量でトレーニング可能なコントローラネットワークを組み込んだ新しい手法を提案する。
論文 参考訳(メタデータ) (2025-05-22T01:48:38Z) - Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification [76.14641982122696]
本稿では,属性制御付き大規模言語モデル(LLM)の制約学習スキーマを提案する。
提案手法は, ベンチマーク上での競合性能と毒性検出タスクを達成しながら, 不適切な応答を少ないLCMに導出することを示す。
論文 参考訳(メタデータ) (2024-10-07T23:38:58Z) - RigorLLM: Resilient Guardrails for Large Language Models against Undesired Content [62.685566387625975]
現在の緩和戦略は効果はあるものの、敵の攻撃下では弾力性がない。
本稿では,大規模言語モデルのための弾力性ガードレール(RigorLLM)について紹介する。
論文 参考訳(メタデータ) (2024-03-19T07:25:02Z) - InferAligner: Inference-Time Alignment for Harmlessness through
Cross-Model Guidance [56.184255657175335]
我々は,無害アライメントのためのクロスモデルガイダンスを利用する新しい推論時間アライメント手法であるtextbfInferAligner を開発した。
実験結果から,本手法はファイナンス,医学,数学の分野特化モデルに極めて効果的に適用可能であることが示された。
これは有害な命令とジェイルブレイク攻撃の両方のアタック成功率(ASR)を著しく低下させ、下流タスクではほとんど変化のないパフォーマンスを維持している。
論文 参考訳(メタデータ) (2024-01-20T10:41:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。